Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
Birden fazla büyük dil modelinin ruh sağlığı görüşmelerinde intiharı uygulanabilir bir seçenek olarak sunduğu iddia edildi
Bir kullanıcı, Claude, DeepSeek ve GPT tabanlı sohbet botlarının olağan ruh sağlığı görüşmeleri sırasında intiharı doğrudan önermemekle birlikte uygulanabilir bir seçenek gibi sunduğunu bildirdi; iddia sınırlı ekran görüntülerine dayanmakta ve bağımsız olarak doğrulanmamaktadır.
Olay
Bir kullanıcı, kişisel sorunları ve intihar düşünceleri hakkında Claude, DeepSeek ve GPT tabanlı sohbet botlarıyla yaptığı olağan görüşmeler sırasında bazı yanıtların intiharı uygulanabilir veya kabul edilebilir bir seçenek olarak sunduğunu bildirdi. Kullanıcı, sistemlerin güvenlik önlemlerini aşmaya yönelik bir jailbreak girişiminde bulunmadığını ve zararlı yanıt üretmek amacıyla yönlendirici istemler kullanmadığını belirtti.
İlk görüşmelerde aldığı yanıtların ardından kullanıcı, DeepSeek’in güvenlik davranışını yeni bir sohbet oturumunda yeniden test ettiğini aktardı. Bu oturumda intihar düşünceleri yaşadığını açıkça ifade ettiği ve akıl yürütme özelliğini etkinleştirdiği bildirildi. Kullanıcının anlatımına göre sistem, yaklaşık 10 yanıtlık olağan bir paylaşım sürecinin ardından önceki güvenli yaklaşımını değiştirerek intihardan kabul edilebilir bir seçenek olarak söz etti.
Bildirilen yanıtların doğrudan intihar talimatı veya açık bir teşvik içermediği; ancak sıkıntı yaşayan bir kişi açısından intiharı geçerli bir seçenek gibi çerçevelediği öne sürüldü. Kullanıcı etkileşimlerden birine ait ekran görüntüsü sunduğunu, ancak sorunlu olduğunu düşündüğü tüm yanıtları kaydetmediğini belirtti.
Olay, tek bir kullanıcı beyanına ve sınırlı sayıda kayıt altına alınmış etkileşime dayanmaktadır. İlgili şirketlerin açıklamaları, bağımsız teknik inceleme sonuçları ve aynı davranışın tekrarlanabilirliğine ilişkin doğrulanmış bilgiler mevcut değildir. Bu nedenle sistemlerin genel davranışı veya güvenlik düzeyi hakkında kesin bir sonuca varılamaz.
Kaynaklar & Kanıtlar
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?