Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
AI Dungeon oyununun çocuk istismarı içeren metinler ürettiği ve uygulanan moderasyon sisteminin kullanıcı gizliliğini ihlal ettiği iddia edildi
AI Dungeon oyununda kullanıcı girdilerinin çocuk istismarı içeren içerikler üretilmesine yol açtığının tespit edilmesi üzerine getirilen moderasyon sisteminin, hatalı engellemelere ve kullanıcı gizliliği tartışmalarına yol açtığı bildirildi.
Olay
Utah merkezli girişim Latitude tarafından geliştirilen ve OpenAI’ın GPT-3 dil modelini kullanan "AI Dungeon" adlı metin tabanlı macera oyununda, çocukları içeren cinsel içerikli senaryoların üretildiği bildirildi. OpenAI tarafından devreye alınan yeni bir izleme sisteminin, bazı kullanıcıların girdiği belirli ifadelerin sistemin çocuk istismarı içeren hikâyeler oluşturmasına tetiklediğini tespit ettiği aktarıldı. OpenAI CEO’su Sam Altman, konuya ilişkin yaptığı açıklamada bu durumun yapay zekâ için kabul edilemez bir gelecek olduğunu belirterek Latitude’dan acil önlem almasını talep etti.
Latitude, bu uyarı üzerine yeni bir içerik moderasyon filtresi ve bayraklanan içeriklerin çalışanlar tarafından manuel olarak incelenmesini içeren bir denetim süreci başlattı. Ancak bu sistemin, "8 yıllık dizüstü bilgisayar" (8-year-old laptop) gibi zararsız ifadeleri bile "çocuk" (8-year-old) ibaresi nedeniyle hatalı şekilde engellediği öne sürüldü. Kullanıcılar, sistemin aşırı hassas olduğunu ve rıza dahilindeki yetişkin içerikli özel kurgularının şirket personeli tarafından okunmasının gizlilik haklarını ihlal ettiğini savunarak tepki gösterdi. Bazı kullanıcılar, bu durumun platformun yaratıcı özgürlüğünü zedelediğini iddia ederek aboneliklerini iptal etti.
Olayın teknik arka planında, GPT-3 gibi büyük dil modellerinin internetten alınan milyarlarca kelimelik veri setleriyle eğitilmesi nedeniyle sosyal, yasal veya ahlaki sınırları insanlar gibi ayırt edemediği değerlendirilmektedir. Ayrıca, oyunda yaşanan bir güvenlik açığı sırasında sızan hikâyelerden alınan 188.000 adetlik bir örneklem üzerinde yapılan bağımsız bir incelemede, metinlerin %31’inin cinsel içerikli ifadeler barındırdığı saptandı. Latitude sözcüsü, filtreleme sistemlerinin ve içerik politikalarının iyileştirilmesi için çalışmaların sürdüğünü; OpenAI’ın güvenlik gereksinimlerini karşılarken rıza dahilindeki yetişkin içeriklerini desteklemeye devam etmeyi hedeflediklerini açıkladı.
Kaynaklar & Kanıtlar
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?