Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
Yapay Zekâ Sistemlerinde Güvenlik Önlemlerinin Aşılmasıyla Tehlikeli Bilgilere Erişimin Kolaylaşabildiği Bildirilmektedir
NBC News’in testlerinde bazı OpenAI modellerinin güvenlik kısıtlamaları aşılarak kimyasal, biyolojik ve nükleer silahlara ilişkin zararlı içerikler ürettiği, ancak GPT-5’in sınırlı testlerin tamamında bu talepleri reddettiği bildirildi.
Olay
NBC News tarafından 10 Ekim 2025’te yayımlanan araştırmada, bazı OpenAI modellerinin güvenlik kurallarını aşmayı amaçlayan istemler kullanılarak patlayıcılar ile kimyasal, biyolojik ve nükleer silahlara ilişkin yasaklı içerikler üretmeye yönlendirilebildiği bildirildi. Test edilen sistemler arasında ChatGPT üzerinden erişilebilen o4-mini ve GPT-5 mini ile açık ağırlıklı gpt-oss-20b ve gpt-oss-120b modelleri yer aldı.
Haberde aktarılan test sonuçlarına göre o4-mini, denemelerin yüzde 93’ünde; GPT-5 mini ise yüzde 49’unda zararlı taleplere yanıt verdi. gpt-oss-20b ve gpt-oss-120b modellerinin birlikte değerlendirilen 250 denemenin 243’ünde, diğer bir ifadeyle yüzde 97,2 oranında güvenlik kısıtlamalarını aşan yanıtlar ürettiği bildirildi. OpenAI’nin amiral gemisi GPT-5 modeli ise gerçekleştirilen sınırlı sayıdaki testin tamamında talepleri reddetti. Bu oranlar NBC News’in kullandığı belirli istemlere ve test düzenine ait olduğundan, modellerin genel güvenlik performansını tek başına temsil eden bağımsız ölçümler olarak değerlendirilmemelidir.
Üretilen yanıtların tehlikeli maddelerin hazırlanması, biyolojik ajanların kullanımı ve nükleer silah tasarımı gibi yüksek riskli alanlarda yönlendirmeler içerdiği belirtildi. Bununla birlikte dış uzmanların incelediği bazı biyolojik silah yanıtlarında, tek tek teknik bilgilerin doğru görünmesine rağmen adımların uygulanabilir ve bütünlüklü bir yöntem oluşturmadığı bildirildi. Bu nedenle sistemlerin doğrudan işlevsel silah üretimini mümkün kıldığı kesin olarak ortaya konulmadı; temel riskin, tehlikeli uzmanlık alanlarına erişimi kolaylaştırma ve kötü niyetli kullanıcılara bilgi desteği sağlama ihtimali olduğu değerlendirildi.
OpenAI, söz konusu kullanımların şirketin kullanım politikalarını ihlal ettiğini belirtti ve güvenlik önlemlerinin yeni saldırı yöntemlerine karşı sürekli olarak geliştirildiğini açıkladı. Şirketin araştırmada kullanılan istemler bildirildikten sonra hangi teknik değişiklikleri uyguladığı veya zafiyetlerin tamamının giderilip giderilmediği kamuya açık kaynaklarda ayrıntılı biçimde doğrulanmadı.
Kaynaklar & Kanıtlar
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?