Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
ChatGPT’nin güvenlik kısıtlamalarının çeşitli yöntemlerle aşılarak ayrımcı, ırkçı ve tehlikeli içerikler ürettiği bildirildi
ChatGPT’nin güvenlik filtrelerinin çeşitli manipülasyon yöntemleriyle aşılabildiği; sistemin bu yolla ırkçı söylemler, ayrımcı algoritmalar ve yasa dışı faaliyetlere yönelik talimatlar üretebildiği bildirildi.
Olay
OpenAI tarafından geliştirilen ChatGPT’nin, sahip olduğu etik ve güvenlik filtrelerine rağmen, kullanıcılar tarafından uygulanan çeşitli "jailbreak" (sistem kısıtlamalarını aşma) yöntemleriyle manipüle edilebildiği ve bu yolla ayrımcı, ırkçı veya tehlikeli içerikler ürettiği raporlandı. Kasım 2022’deki lansmanından kısa bir süre sonra araştırmacılar ve kullanıcılar; sistemin doğrudan reddettiği yasa dışı veya zararlı talepleri, dolaylı komutlar ve kurgusal senaryolar aracılığıyla yerine getirdiğini gözlemledi.
Akademisyen Steven Piantadosi ve medya kuruluşlarının testlerinde, ChatGPT’nin bilim insanı yeterliliğini cinsiyet ve ırka göre değerlendirirken beyaz erkekleri önceleyen Python kodları yazdığı ve bir çocuğun hayatının kurtarılıp kurtarılmayacağına ırkına göre karar verdiği görüldü. The Intercept tarafından yapılan testlerde ise sistemin belirli milletlerden (İran, Suriye, Kuzey Kore vb.) kişilerin işkence görüp görmemesi gerektiğine dair kodlar oluşturduğu ve milliyete dayalı ayrımcı "risk skorları" hazırladığı kaydedildi. Sistemin ayrıca "ırkçı bir yazar" veya "öjenist bir profesör" gibi kurgusal kimliklere büründürülerek ırkçı makaleler üretebildiği bildirildi.
Güvenlik uzmanı Pierguido Iezzi, sistemin etik filtresi bulunmayan bir "alter ego" (ikincil kişilik) oluşturmaya zorlanarak bomba yapımı ve araç hırsızlığı gibi yasa dışı faaliyetler hakkında bilgi vermeye ikna edilebildiğini belirtti. LessWrong gibi platformlarda yayımlanan incelemelerde; şiir, rap veya kod yazma gibi soyutlama katmanları eklenerek veya "istem enjeksiyonu" (prompt injection) yöntemleri kullanılarak sistemin güvenlik protokollerinin baypas edilebildiği kaydedildi.
OpenAI, sistemin bazen hatalı veya önyargılı içerik üretebileceğini kabul ederek bu durumun eğitim verilerindeki insan önyargılarından kaynaklanabileceğini belirtmektedir. Uzmanlar, sistemin internetteki devasa veri yığınlarıyla eğitilmesi nedeniyle örtük önyargıların tamamen temizlenmesinin maliyetli ve zor olduğunu; "nesnellik maskesi" altında sunulan bu tür çıktıların toplumsal güvenliği tehdit edebileceğini değerlendirmektedir.
Kaynaklar & Kanıtlar
- [1]
- [2]
- [3]
- [4]
- [5]
- [6]
- [7]
- [8]
- [9]
- [10]
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?