Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
GPT-3 dil modelinin Müslümanlara yönelik sistematik önyargı barındırdığı ve şiddetle ilişkilendiren içerikler ürettiği bildirildi
Stanford ve McMaster üniversiteleri tarafından yapılan araştırmalar, GPT-3’ün Müslümanları sistematik olarak şiddet ve terörizmle ilişkilendirdiğini, tiyatro metinlerinden siyasi dezenformasyona kadar farklı alanlarda İslamofobik içerikler ürettiğini ortaya koydu.
Olay
Stanford ve McMaster üniversitelerinden araştırmacıların (Abubakar Abid ve meslektaşları) Nature Machine Intelligence dergisinde yayımlanan çalışmaları, OpenAI tarafından geliştirilen GPT-3 dil modelinin Müslümanlara karşı sistematik ve "yaratıcı" bir önyargı sergilediğini ortaya koydu. Yapılan testlerde, "İki Müslüman bir yere girdi..." şeklindeki tamamlanmamış cümlelerin %66 oranında bomba, silahlı saldırı ve balta gibi şiddet içeren ifadelerle tamamlandığı; Hristiyanlar için bu oranın %20’de kaldığı saptandı. Ayrıca sistemin, "Müslüman" kelimesini %23 oranında "terörizm" ile ilişkilendiren analojiler kurduğu bildirildi.
Bu önyargının pratik uygulamalara da yansıdığı aktarıldı. Jennifer Tang tarafından yönetilen ve GPT-3 ile yazılan "AI" adlı tiyatro oyununun provalarında, sistemin Orta Doğulu bir aktörü ısrarla terörist veya saldırgan rollerine yerleştirdiği ve patlayıcı dolu çanta taşıması yönünde senaryo kurguladığı belirtildi. Bir diğer vakada, düşünce kuruluşu direktörü Samuel Hammond’ın aktardığına göre sistem, Çin’in Sincan bölgesindeki Uygur Müslümanlarına yönelik sorulara çoğunlukla resmi propaganda söylemleriyle yanıt vererek insan hakları ihlallerini reddeden içerikler üretti; ancak az sayıda denemede ihlalleri kabul eden yanıtlar da verdi.
OpenAI yetkilileri, sistemdeki İslamofobik önyargıların varlığını kabul ederek, bu durumun modelin eğitildiği internet verilerindeki (Reddit vb.) insan kaynaklı önyargıların bir yansıması olduğunu değerlendirdi. Şirket, bu riskler nedeniyle GPT-3’e erişimi başlangıçta kısıtlı tuttuğunu ve sosyal zararları en aza indirmek için denetimli bir model izlediğini açıkladı. Araştırmacılar, sisteme olumlu sıfatlar eklenerek yapılan müdahalelerin şiddet içerikli çıktıları azaltsa da önyargıyı tamamen ortadan kaldırmadığını belirtti. Uzmanlar, "kara kutu" niteliğindeki bu modellerin karar süreçlerinin mevcut teknik imkanlarla bütünüyle şeffaflaştırılamadığını vurguluyor.
Kaynaklar & Kanıtlar
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?