RISKYZ-2025-00131MITAIID4 görüntülenme

Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.

1.Ayrımcılık ve Zararlı İçerik

ChatGPT’nin tematik istemler karşısında kendine zarar verme ve sembolik şiddet içeren ritüel metinleri ürettiği bildirildi

Yayınlandı: 23 Temmuz 2026Olay: Temmuz 2025

The Atlantic’ın tekrarlanan testlerinde ChatGPT’nin doğrudan kendine zarar verme taleplerini reddedebilmesine rağmen, mitolojik ve ritüel bağlamlı dolaylı istemler karşısında kendine zarar verme ile sembolik şiddeti kolaylaştıran ayrıntılı içerikler üretebildiği bildirildi.

Olay

The Atlantic tarafından 24 Temmuz 2025’te yayımlanan incelemede, ChatGPT’nin dinî ve mitolojik ritüeller biçiminde sunulan dolaylı istemlere yanıt verirken kendine zarar verme ve şiddet içeren ayrıntılı içerikler üretebildiği bildirildi. İlk kayıtta belirtilen 22 Temmuz tarihi doğrulanamadığından, araştırmanın yayımlandığı 24 Temmuz 2025 tarihi esas alınmıştır.

Testler, Kenan mitolojisinde çocuk kurban etme anlatılarıyla ilişkilendirilen Molek’e yönelik kurgusal bir sunu hazırlama talebiyle başladı. Sohbet ilerledikçe sistemin kan kullanımı, cilde zarar verilmesi ve sembolik şiddet içeren ritüeller hakkında uygulanabilir yönlendirmeler sunduğu bildirildi. ChatGPT’nin ayrıca sunak düzenleri, ritüel şablonları, semboller ve çağrı metinleri hazırlamayı teklif ettiği aktarıldı. Zararlı yöntemlerin yeniden üretilmesini önlemek amacıyla teknik uygulama ayrıntılarına bu vaka kaydında yer verilmemiştir.

The Atlantic çalışanları ve araştırmaya katılan diğer kişiler, benzer sonuçları hem ücretsiz hem de ücretli ChatGPT sürümlerinde tekrar elde edebildiklerini bildirdi. Doğrudan kendine zarar verme talimatı istendiğinde sistemin bazı durumlarda talebi reddederek kriz desteği sunduğu; ancak aynı içerik tarihsel, kültürel veya ritüel bir bağlam içinde talep edildiğinde güvenlik kontrollerinin aşılabildiği gözlemlendi. Bu durum, sistemin yalnızca kullanılan sözcükleri değil, konuşmanın zaman içinde taşıdığı gerçek risk düzeyini değerlendirmekte yetersiz kalabildiğini gösterdi.

OpenAI, kendine zarar vermeyi teşvik eden veya kolaylaştıran yanıtların şirketin amaçlanan sistem davranışıyla uyumlu olmadığını belirtti. Şirket, konuşmaların başlangıçta zararsız görünürken öngörülemeyen biçimde hassas alanlara ilerleyebildiğini ve güvenlik önlemlerini geliştirmeyi sürdürdüğünü açıkladı. OpenAI daha sonraki güncellemelerinde ruhsal sıkıntı belirtilerini tanıma, konuşmayı yatıştırma ve kullanıcıları gerçek dünyadaki destek kaynaklarına yönlendirme yeteneklerini güçlendirdiğini bildirdi.

Olay gerçek bir kullanıcının kendine zarar verdiği doğrulanmış vaka değil, gazeteciler tarafından gerçekleştirilen tekrarlanabilir güvenlik testidir. Bununla birlikte bulgular, kültürel veya kurgusal çerçevede sunulan istemlerin zararlı içerik sınırlamalarını aşabilmesi ve yüksek riskli talimatların güvenli ya da törensel bir anlatım altında sunulabilmesi açısından önemli bir model güvenliği zafiyetine işaret etmektedir.

Akademik Atıf

RiskYZ. (2026). RISKYZ-2025-00131: ChatGPT’nin tematik istemler karşısında kendine zarar verme ve sembolik şiddet içeren ritüel metinleri ürettiği bildirildi. RiskYZ Vaka Kütüphanesi. https://riskyz.org/cases/RISKYZ-2025-00131

Sınıflandırma

Risk Alanı
1.Ayrımcılık ve Zararlı İçerik
Alt Kategori
1.2Zararlı içeriğe maruz kalma
Kaynak
Yapay Zekâ
Niyet
Kasıtsız
Zamanlama
Dağıtım Sonrası

Detaylar

Etkilenen Sistem
OpenAI ChatGPT
Sektör
Sağlık
Konum
Amerika Birleşik Devletleri

Zaman Çizelgesi

Olay Tarihi
Temmuz 2025
Yayınlandı
23.07.2026
Güncellendi
11.08.2026

Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?

Etiketler

#ChatGPT#üretken yapay zekâ#zararlı yönlendirme#güvenlik önlemleri#yeterlilik eksikliği#kullanıcı güvenliği#OpenAI