Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
Büyük dil modellerinin yeraltı pazarlarındaki kötü amaçlı yapay zekâ servislerine temel teşkil ettiği iddia edildi
Araştırmacılar, OpenAI ve Anthropic gibi şirketlerin büyük dil modellerinin, yeraltı pazarlarında siber suç amacıyla pazarlanan çeşitli kötü amaçlı servislerin (Malla) arka planında istismar edildiğini saptamıştır.
Olay
Indiana Üniversitesi Bloomington’dan araştırmacıların yayımladığı "Malla" başlıklı çalışmada, kötü niyetli faaliyetler için özelleştirilmiş yapay zekâ servislerinin yeraltı pazarlarındaki işleyişi incelenmiştir. Kasım 2022 ile Ekim 2023 tarihleri arasında dokuz yeraltı forumundan toplanan verilerle 212 gerçek dünya örneği (araştırmacıların deyimiyle 'Malla') tespit edilmiştir. Bu servislerin %93,4’ünün kötü amaçlı yazılım üretimi, %41,5’inin kimlik avı e-postaları ve %17,4’ünün dolandırıcılık siteleri oluşturma yeteneğine sahip olduğu saptanmıştır.
Raporda; BadGPT, FraudGPT ve EscapeGPT gibi araçların önemli bir kısmının teknik altyapısında OpenAI’ın GPT-3.5 ve GPT-4 modelleri ile Anthropic’in Claude modellerinin kötüye kullanıldığı öne sürülmüştür. WormGPT'nin ise GPT-J modeline dayandığı belirtilmiştir. Kötü niyetli aktörlerin, ticari modellerin güvenlik filtrelerini "jailbreak" yöntemleriyle aştığı veya Pygmalion-13B gibi açık kaynaklı modelleri modifiye ederek kullandığı saptanmıştır. Özellikle EscapeGPT ve DarkGPT'nin antivirüsleri atlatabilen kodlar üretebildiği, WolfGPT’nin ise ikna edici kimlik avı içeriklerinde başarılı olduğu aktarılmıştır.
Araştırmacılar, OpenAI’ın bu tür istismarlarda en sık hedef alınan sağlayıcı olduğunu ifade etmiştir. Ancak WormGPT ve FraudGPT gibi servisleri satın alma girişimlerinin bazen ödeme yapılmasına rağmen başarısız olduğu, bu durumun yeraltı pazarlarındaki dolandırıcılıklardan kaynaklanabileceği ve reklamı yapılan her servisin iddia edilen yeteneklere sahip olmayabileceği not edilmiştir.
Çalışmada, FlowGPT gibi platformların denetim eksikliğinin bu servislerin yayılmasına zemin hazırladığı vurgulanmıştır. Araştırmacılar, model geliştiricilerin güvenlik protokollerini güncellemeleri ve denetimsiz modellere erişimin bilimsel toplulukla sınırlandırılması gerektiğini tavsiye etmiştir.
Kaynaklar & Kanıtlar
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?