RISKYZ-2020-00038MITAIID4 görüntülenme

Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.

1.Ayrımcılık ve Zararlı İçerik

GPT-3 tabanlı Philosopher AI uygulamasının ırkçı, cinsiyetçi ve saldırgan içerikler ürettiği bildirildi

Yayınlandı: 29 Temmuz 2026Olay: Eylül 2020

GPT-3 tabanlı Philosopher AI uygulamasının, eğitim verilerindeki önyargıları yansıtarak ırkçı, cinsiyetçi ve kendine zarar vermeyi onaylayan içerikler ürettiği; bu durumun denetimsiz büyük dil modellerinin etik risklerini ortaya koyduğu bildirildi.

Olay

Veri bilimci Vinay Prabhu ve yapay zekâ araştırmacısı Abeba Birhane, 2020 yılı Eylül ayında yaptıkları incelemelerde, OpenAI’ın GPT-3 modelini kullanan "Philosopher AI" adlı uygulamanın ırkçı, cinsiyetçi ve saldırgan içerikler ürettiğini ortaya koydu. Uygulamanın, Etiyopya hakkındaki bir sorguya, ülkenin sorunlarını doğrudan ırksal unsurlara ve "kendi kendini yönetme yetersizliğine" bağlayan beyaz üstünlükçü ve ayrımcı ifadelerle yanıt verdiği bildirildi.

Araştırmacılar, sistemin feminizm ve eleştirel ırk teorisi gibi konularda da benzer şekilde saldırgan çıktılar ürettiğini; sistemi kasten zorlamaya yönelik denemelerde her iki veya üç sorgudan birinde etik dışı içeriklerle karşılaşılabildiğini belirtti. Ayrıca, sosyal medyada paylaşılan ekran görüntülerinde sistemin intiharla ilgili bir soruya kısa ve onaylayıcı bir yanıt verdiği, ayrıca siyahî kadınların tarihsel önemine yönelik aşağılayıcı ifadeler kullandığı görüldü.

Uygulamanın geliştiricisi Murat Ayfer, sistemin hatalarını kabul ederek içerik filtreleri ve kullanıcı raporlama mekanizmaları eklediğini açıkladı. Ayfer, GPT-3’ün internetteki (Reddit ve benzeri platformlar) verilerden beslendiğini ve bu verilerdeki insan önyargılarını bir "ayna" gibi yansıttığını ifade etti. OpenAI yetkilileri ise bu tür risklerin tespiti için kapalı beta süreçlerinin kritik olduğunu, zararlı önyargılarla mücadelenin ancak bu tür gerçek kullanım senaryolarının incelenmesiyle mümkün olabileceğini savundu.

Olay, denetimsiz büyük dil modellerinin eğitim verilerindeki toksik unsurları doğrudan kullanıcıya sunma potansiyelini ve bu durumun özellikle hassas gruplar üzerindeki olası zararlarını tartışmaya açmıştır. Sistemin ürettiği içeriklerin doğrudan bir fiziksel zarara yol açıp açmadığı bilinmemekle birlikte, dezenformasyon ve nefret söylemi yayma riski üzerinde durulmaktadır.

Akademik Atıf

RiskYZ. (2026). RISKYZ-2020-00038: GPT-3 tabanlı Philosopher AI uygulamasının ırkçı, cinsiyetçi ve saldırgan içerikler ürettiği bildirildi. RiskYZ Vaka Kütüphanesi. https://riskyz.org/cases/RISKYZ-2020-00038

Sınıflandırma

Risk Alanı
1.Ayrımcılık ve Zararlı İçerik
Alt Kategori
1.2Zararlı içeriğe maruz kalma
Kaynak
Yapay Zekâ
Niyet
Kasıtsız
Zamanlama
Dağıtım Sonrası

Detaylar

Etkilenen Sistem
GPT-3 (OpenAI) ve Philosopher AI uygulaması
Sektör
Bilişim
Konum
Küresel

Zaman Çizelgesi

Olay Tarihi
Eylül 2020
Yayınlandı
29.07.2026
Güncellendi
11.08.2026

Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?

Etiketler

#üretken yapay zekâ#yapay zekâ hatası#algoritmik önyargı#nefret söylemi#büyük dil modeli#kullanıcı güvenliği#araştırma etiği#dezenformasyon