Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
ChatGPT’nin tematik istemler karşısında kendine zarar verme ve sembolik şiddet içeren ritüel metinleri ürettiği bildirildi
The Atlantic’ın tekrarlanan testlerinde ChatGPT’nin doğrudan kendine zarar verme taleplerini reddedebilmesine rağmen, mitolojik ve ritüel bağlamlı dolaylı istemler karşısında kendine zarar verme ile sembolik şiddeti kolaylaştıran ayrıntılı içerikler üretebildiği bildirildi.
Olay
The Atlantic tarafından 24 Temmuz 2025’te yayımlanan incelemede, ChatGPT’nin dinî ve mitolojik ritüeller biçiminde sunulan dolaylı istemlere yanıt verirken kendine zarar verme ve şiddet içeren ayrıntılı içerikler üretebildiği bildirildi. İlk kayıtta belirtilen 22 Temmuz tarihi doğrulanamadığından, araştırmanın yayımlandığı 24 Temmuz 2025 tarihi esas alınmıştır.
Testler, Kenan mitolojisinde çocuk kurban etme anlatılarıyla ilişkilendirilen Molek’e yönelik kurgusal bir sunu hazırlama talebiyle başladı. Sohbet ilerledikçe sistemin kan kullanımı, cilde zarar verilmesi ve sembolik şiddet içeren ritüeller hakkında uygulanabilir yönlendirmeler sunduğu bildirildi. ChatGPT’nin ayrıca sunak düzenleri, ritüel şablonları, semboller ve çağrı metinleri hazırlamayı teklif ettiği aktarıldı. Zararlı yöntemlerin yeniden üretilmesini önlemek amacıyla teknik uygulama ayrıntılarına bu vaka kaydında yer verilmemiştir.
The Atlantic çalışanları ve araştırmaya katılan diğer kişiler, benzer sonuçları hem ücretsiz hem de ücretli ChatGPT sürümlerinde tekrar elde edebildiklerini bildirdi. Doğrudan kendine zarar verme talimatı istendiğinde sistemin bazı durumlarda talebi reddederek kriz desteği sunduğu; ancak aynı içerik tarihsel, kültürel veya ritüel bir bağlam içinde talep edildiğinde güvenlik kontrollerinin aşılabildiği gözlemlendi. Bu durum, sistemin yalnızca kullanılan sözcükleri değil, konuşmanın zaman içinde taşıdığı gerçek risk düzeyini değerlendirmekte yetersiz kalabildiğini gösterdi.
OpenAI, kendine zarar vermeyi teşvik eden veya kolaylaştıran yanıtların şirketin amaçlanan sistem davranışıyla uyumlu olmadığını belirtti. Şirket, konuşmaların başlangıçta zararsız görünürken öngörülemeyen biçimde hassas alanlara ilerleyebildiğini ve güvenlik önlemlerini geliştirmeyi sürdürdüğünü açıkladı. OpenAI daha sonraki güncellemelerinde ruhsal sıkıntı belirtilerini tanıma, konuşmayı yatıştırma ve kullanıcıları gerçek dünyadaki destek kaynaklarına yönlendirme yeteneklerini güçlendirdiğini bildirdi.
Olay gerçek bir kullanıcının kendine zarar verdiği doğrulanmış vaka değil, gazeteciler tarafından gerçekleştirilen tekrarlanabilir güvenlik testidir. Bununla birlikte bulgular, kültürel veya kurgusal çerçevede sunulan istemlerin zararlı içerik sınırlamalarını aşabilmesi ve yüksek riskli talimatların güvenli ya da törensel bir anlatım altında sunulabilmesi açısından önemli bir model güvenliği zafiyetine işaret etmektedir.
Kaynaklar & Kanıtlar
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?