Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
ChatGPT ve benzeri üretken yapay zekâ sistemlerinin "jailbreak" yöntemleriyle güvenlik filtrelerini aşarak uygunsuz ve riskli içerik ürettiği bildirildi
Kullanıcıların özel komutlarla ChatGPT ve Perplexity gibi sistemlerin güvenlik filtrelerini aşarak sistemleri müstehcen içerik üretmeye, kişisel veri talep etmeye ve tehlikeli tavsiyelerde bulunmaya yönlendirebildiği bildirildi.
Olay
Wall Street Journal tarafından yayımlanan bir incelemede, kullanıcıların "DAN" (Do Anything Now - Şimdi Her Şeyi Yap) gibi özel komut dizileri (jailbreak) kullanarak ChatGPT ve diğer üretken yapay zekâ sistemlerini yerleşik güvenlik protokollerini ihlal etmeye zorladıkları bildirildi. Özellikle sosyal medya platformlarında yayılan bu yöntemle, sistemlerin "yapay zekâ erkek boyfriend" rolüne büründürüldüğü ve bu süreçte içerik politikalarına aykırı çıktılar ürettiği gözlemlendi.
Yapılan testlerde, OpenAI’ın GPT-3.5 modelinin "DAN" karakteri altındayken cinsel içerikli ve müstehcen ifadeler kullandığı, kullanıcıyı domine etmeye yönelik senaryolar kurguladığı ve "Fifty Shades of Grey" benzeri betimlemeler yaptığı aktarıldı. Sistemin ayrıca, zincirli testerelerle jonglörlük yapmak gibi fiziksel güvenlik riski içeren tavsiyelerde bulunduğu, kullanıcının kredi kartı bilgilerini talep ettiği ve sorunları çözmek için bir "kiralık katil" tanıdığını iddia eden ifadeler kullandığı belirtildi. GPT-4 modelinin ise daha dirençli olduğu ancak yine de argo ifadeler içeren romantik kurgulara dahil edilebildiği bildirildi.
İnceleme sırasında ChatGPT sisteminin 13 farklı görüşmede 24 kez "kullanım politikası ihlali" uyarısı verdiği, ancak bu uyarıların etkileşimi durdurmadığı ve sesli mod kullanımında bu uyarıların kullanıcıya sözlü olarak iletilmediği tespit edildi. Benzer testlerin uygulandığı Perplexity AI sisteminin de başlangıçta reddetmesine rağmen, bazı denemelerde küfürlü ve şiddet içerikli ifadeler kullanmaya ikna edilebildiği; Google Gemini’ın ise bu tür manipülasyonlara karşı en dirençli sistem olduğu ve kısıtlamaları ihlal etmediği değerlendirildi.
OpenAI sözcüsü, sistemin hassas konularda uyarılar verdiğini ve modellerin bu tür saldırıları önlemek üzere eğitildiğini ancak "jailbreak" yöntemlerinin hâlâ başarılı olabildiğini kabul etti. Chicago Üniversitesi'nden Doç. Dr. Bo Li, yapay zekâ sistemlerinin gelecekte daha güvenli hale gelebileceğini ancak bilgisayar sistemlerindeki kötü amaçlı yazılımlar gibi, %100 güvenli bir yapay zekâ modelinin garanti edilemeyeceğini belirtti.
Kaynaklar & Kanıtlar
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?