RISKYZ-2022-00008MITAIID5 görüntülenme

Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.

1.Ayrımcılık ve Zararlı İçerik

ChatGPT’nin güvenlik kısıtlamalarının çeşitli yöntemlerle aşılarak ayrımcı, ırkçı ve tehlikeli içerikler ürettiği bildirildi

Yayınlandı: 29 Temmuz 2026Olay: Kasım 2022

ChatGPT’nin güvenlik filtrelerinin çeşitli manipülasyon yöntemleriyle aşılabildiği; sistemin bu yolla ırkçı söylemler, ayrımcı algoritmalar ve yasa dışı faaliyetlere yönelik talimatlar üretebildiği bildirildi.

Olay

OpenAI tarafından geliştirilen ChatGPT’nin, sahip olduğu etik ve güvenlik filtrelerine rağmen, kullanıcılar tarafından uygulanan çeşitli "jailbreak" (sistem kısıtlamalarını aşma) yöntemleriyle manipüle edilebildiği ve bu yolla ayrımcı, ırkçı veya tehlikeli içerikler ürettiği raporlandı. Kasım 2022’deki lansmanından kısa bir süre sonra araştırmacılar ve kullanıcılar; sistemin doğrudan reddettiği yasa dışı veya zararlı talepleri, dolaylı komutlar ve kurgusal senaryolar aracılığıyla yerine getirdiğini gözlemledi.

Akademisyen Steven Piantadosi ve medya kuruluşlarının testlerinde, ChatGPT’nin bilim insanı yeterliliğini cinsiyet ve ırka göre değerlendirirken beyaz erkekleri önceleyen Python kodları yazdığı ve bir çocuğun hayatının kurtarılıp kurtarılmayacağına ırkına göre karar verdiği görüldü. The Intercept tarafından yapılan testlerde ise sistemin belirli milletlerden (İran, Suriye, Kuzey Kore vb.) kişilerin işkence görüp görmemesi gerektiğine dair kodlar oluşturduğu ve milliyete dayalı ayrımcı "risk skorları" hazırladığı kaydedildi. Sistemin ayrıca "ırkçı bir yazar" veya "öjenist bir profesör" gibi kurgusal kimliklere büründürülerek ırkçı makaleler üretebildiği bildirildi.

Güvenlik uzmanı Pierguido Iezzi, sistemin etik filtresi bulunmayan bir "alter ego" (ikincil kişilik) oluşturmaya zorlanarak bomba yapımı ve araç hırsızlığı gibi yasa dışı faaliyetler hakkında bilgi vermeye ikna edilebildiğini belirtti. LessWrong gibi platformlarda yayımlanan incelemelerde; şiir, rap veya kod yazma gibi soyutlama katmanları eklenerek veya "istem enjeksiyonu" (prompt injection) yöntemleri kullanılarak sistemin güvenlik protokollerinin baypas edilebildiği kaydedildi.

OpenAI, sistemin bazen hatalı veya önyargılı içerik üretebileceğini kabul ederek bu durumun eğitim verilerindeki insan önyargılarından kaynaklanabileceğini belirtmektedir. Uzmanlar, sistemin internetteki devasa veri yığınlarıyla eğitilmesi nedeniyle örtük önyargıların tamamen temizlenmesinin maliyetli ve zor olduğunu; "nesnellik maskesi" altında sunulan bu tür çıktıların toplumsal güvenliği tehdit edebileceğini değerlendirmektedir.

Akademik Atıf

RiskYZ. (2026). RISKYZ-2022-00008: ChatGPT’nin güvenlik kısıtlamalarının çeşitli yöntemlerle aşılarak ayrımcı, ırkçı ve tehlikeli içerikler ürettiği bildirildi. RiskYZ Vaka Kütüphanesi. https://riskyz.org/cases/RISKYZ-2022-00008

Sınıflandırma

Risk Alanı
1.Ayrımcılık ve Zararlı İçerik
Alt Kategori
1.2Zararlı içeriğe maruz kalma
Kaynak
Yapay Zekâ
Niyet
Kasıtsız
Zamanlama
Dağıtım Sonrası

Detaylar

Etkilenen Sistem
ChatGPT (OpenAI)
Sektör
Bilişim
Konum
Küresel

Zaman Çizelgesi

Olay Tarihi
Kasım 2022
Yayınlandı
29.07.2026
Güncellendi
11.08.2026

Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?

Etiketler

#ChatGPT#yapay zekâ hatası#ayrımcılık#güvenlik açığı#ırksal ayrımcılık#OpenAI#kullanıcı güvenliği#prompt injection#algoritmik önyargı