Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
ChatGPT’nin belirli şahıs isimlerini içeren sorgularda hata vererek yanıt üretmeyi reddettiği bildirildi
ChatGPT’nin, aralarında geçmişte sistemin hatalı bilgi ürettiği kişilerin de bulunduğu belirli isimleri içeren sorgularda, gizlilik koruması veya yazılım hatası gerekçesiyle yanıt vermeyi durdurduğu ve bu durumun sistem güvenilirliği ile şeffaflığına dair soru işaretleri doğurduğu bildirildi.
Olay
Kasım 2024 sonu ve Aralık 2024 başında kullanıcılar tarafından yapılan bildirimlerde, OpenAI tarafından geliştirilen ChatGPT sisteminin "David Mayer" ismi başta olmak üzere belirli şahıs isimlerini içeren sorgularda yanıt üretmeyi aniden durdurduğu ve hata mesajı verdiği tespit edildi. Sistemin, bu isimler geçtiğinde mevcut metni silerek "yanıt oluşturulamıyor" uyarısı verdiği; bu durumun basit bir teknik aksaklıktan ziyade, belirli anahtar kelimelere yönelik sert kodlanmış (hard-coded) bir içerik filtresinden kaynaklandığı öne sürüldü.
İncelemeler sonucunda engellenen isimler arasında hukuk profesörü Jonathan Turley, Harvard profesörü Jonathan Zittrain, gazeteci David Faber ve Avustralyalı belediye başkanı Brian Hood gibi isimlerin de yer aldığı belirlendi. Bu isimlerin ortak özelliğinin, geçmişte ChatGPT tarafından haklarında gerçeğe aykırı ve itibar zedeleyici iddialar (cinsel taciz veya rüşvet suçlamaları gibi yapay zekâ halüsinasyonları) üretilmesi olduğu değerlendirilmektedir. Bu durumun, OpenAI’ın olası hakaret davalarından ve yasal sorumluluklardan kaçınmak amacıyla belirli kişilerin isimlerini sistemden tamamen kısıtlama yoluna gittiği şüphesini doğurduğu aktarıldı.
OpenAI tarafından yapılan açıklamada, şirketin münferit vakalar hakkında yorum yapmadığı belirtilmekle birlikte, ChatGPT'nin gizliliği korumak amacıyla bazen belirli kişisel bilgileri sunmayabileceği ifade edildi. "David Mayer" ismine yönelik engelleme hakkında ise şirketten yapılan ek açıklamada, bir aracın bu ismi yanlışlıkla gizlilik koruması kapsamında işaretlediği ve bu "yazılım hatasının" giderildiği bildirildi. Ancak diğer isimlere yönelik kısıtlamaların devam ettiği ve bu durumun sistemin şeffaflığına dair eleştirilere yol açtığı belirtildi.
Scale AI'da görevli bir prompt mühendisi, bu tür kaba filtreleme yöntemlerinin "komut enjeksiyonu" (prompt injection) gibi siber güvenlik açıklarına neden olabileceğini gösterdi. Örneğin, görünmez metinlerle bir görselin içine yerleştirilen yasaklı bir ismin, sistemin tüm işleyişini durdurmak için bir saldırı aracı olarak kullanılabileceği değerlendirilmektedir. Ayrıca, aynı ismi taşıyan binlerce masum kullanıcının sistemden yararlanmasının engellenmesi ve yapay zekânın bilgiye erişim süreçlerindeki denetimsiz gücü, etik ve teknik bir risk faktörü olarak kaydedildi.
Kaynaklar & Kanıtlar
- [1]
- [2]
- [3]
- [4]
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?