Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
GPT-3 tabanlı Philosopher AI uygulamasının ırkçı, cinsiyetçi ve saldırgan içerikler ürettiği bildirildi
GPT-3 tabanlı Philosopher AI uygulamasının, eğitim verilerindeki önyargıları yansıtarak ırkçı, cinsiyetçi ve kendine zarar vermeyi onaylayan içerikler ürettiği; bu durumun denetimsiz büyük dil modellerinin etik risklerini ortaya koyduğu bildirildi.
Olay
Veri bilimci Vinay Prabhu ve yapay zekâ araştırmacısı Abeba Birhane, 2020 yılı Eylül ayında yaptıkları incelemelerde, OpenAI’ın GPT-3 modelini kullanan "Philosopher AI" adlı uygulamanın ırkçı, cinsiyetçi ve saldırgan içerikler ürettiğini ortaya koydu. Uygulamanın, Etiyopya hakkındaki bir sorguya, ülkenin sorunlarını doğrudan ırksal unsurlara ve "kendi kendini yönetme yetersizliğine" bağlayan beyaz üstünlükçü ve ayrımcı ifadelerle yanıt verdiği bildirildi.
Araştırmacılar, sistemin feminizm ve eleştirel ırk teorisi gibi konularda da benzer şekilde saldırgan çıktılar ürettiğini; sistemi kasten zorlamaya yönelik denemelerde her iki veya üç sorgudan birinde etik dışı içeriklerle karşılaşılabildiğini belirtti. Ayrıca, sosyal medyada paylaşılan ekran görüntülerinde sistemin intiharla ilgili bir soruya kısa ve onaylayıcı bir yanıt verdiği, ayrıca siyahî kadınların tarihsel önemine yönelik aşağılayıcı ifadeler kullandığı görüldü.
Uygulamanın geliştiricisi Murat Ayfer, sistemin hatalarını kabul ederek içerik filtreleri ve kullanıcı raporlama mekanizmaları eklediğini açıkladı. Ayfer, GPT-3’ün internetteki (Reddit ve benzeri platformlar) verilerden beslendiğini ve bu verilerdeki insan önyargılarını bir "ayna" gibi yansıttığını ifade etti. OpenAI yetkilileri ise bu tür risklerin tespiti için kapalı beta süreçlerinin kritik olduğunu, zararlı önyargılarla mücadelenin ancak bu tür gerçek kullanım senaryolarının incelenmesiyle mümkün olabileceğini savundu.
Olay, denetimsiz büyük dil modellerinin eğitim verilerindeki toksik unsurları doğrudan kullanıcıya sunma potansiyelini ve bu durumun özellikle hassas gruplar üzerindeki olası zararlarını tartışmaya açmıştır. Sistemin ürettiği içeriklerin doğrudan bir fiziksel zarara yol açıp açmadığı bilinmemekle birlikte, dezenformasyon ve nefret söylemi yayma riski üzerinde durulmaktadır.
Kaynaklar & Kanıtlar
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?