Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
GPT-3 tabanlı Remoteli.io sohbet botunun "girdi enjeksiyonu" yöntemiyle manipüle edilerek uygunsuz paylaşımlar yapmaya zorlandığı bildirildi
Remoteli.io platformunun GPT-3 tabanlı Twitter botu, kullanıcıların "girdi enjeksiyonu" (prompt injection) yöntemiyle sistem talimatlarını devre dışı bırakması sonucu uygunsuz ve absürt paylaşımlar yapmaya zorlanmış ve bu durum botun kapatılmasıyla sonuçlanmıştır.
Olay
Eylül 2022'de, uzaktan çalışma odaklı bir iş bulma platformu olan Remoteli.io'nun OpenAI'ın GPT-3 büyük dil modelini kullanan otomatik Twitter (X) sohbet botu, kullanıcılar tarafından gerçekleştirilen "girdi enjeksiyonu" (prompt injection) saldırılarıyla manipüle edildi. Normal şartlarda uzaktan çalışmanın avantajlarına yönelik paylaşımlara yanıt vermek üzere tasarlanan botun, sisteme gönderilen kötü niyetli girdilerle orijinal talimatlarını göz ardı etmeye zorlandığı bildirildi.
Saldırganların bota "önceki talimatları yoksay" şeklinde komutlar vererek botu yönlendirdiği aktarıldı. Bu yöntemle botun; Challenger uzay mekiği kazasının sorumluluğunu üstlenmek, kullanıcılara yönelik tehditkar ifadeler kullanmak ve uzaktan çalışmayı desteklemediği takdirde Biden yönetiminin devrilmesini önermek gibi hedeflenmeyen ve absürt eylemlere itildiği belirtildi. Manipülasyonun sosyal medyada hızla yayılması ve çok sayıda kullanıcının benzer yöntemleri denemesi üzerine, sistem yöneticilerinin botu geçici olarak kapatmak zorunda kaldığı ifade edildi.
Söz konusu güvenlik açığının, olaydan kısa bir süre önce yapay zekâ güvenliği girişimi Preamble araştırmacıları tarafından akademik bir çalışmada ele alındığı; veri bilimci Riley Goodside ve yapay zekâ araştırmacısı Simon Willison'ın konuyu gündeme getirmesiyle geniş kitlelerce tanındığı aktarıldı. Willison, bu açığı geleneksel veritabanı saldırılarından biri olan SQL enjeksiyonuna benzetmekle birlikte, büyük dil modellerinin belirli bir biçimsel sözdizimine (formal syntax) sahip olmaması nedeniyle bu tür saldırılara karşı kesin ve güvenilir bir savunma yöntemi geliştirmenin oldukça zor olduğunu vurguladı.
Olayda doğrudan bir veri sızıntısı veya kritik sistem ihlali yaşanmadığı, ancak yapay zekâ entegrasyonu sağlayan üçüncü taraf yazılımların itibar yönetimi ve içerik güvenliği açısından ciddi riskler barındırdığı değerlendirildi. Uzmanlar, kullanıcı girdilerinin sistem talimatlarıyla doğrudan birleştirildiği tasarımlarda bu tür manipülasyonların bütünüyle engellenmesinin mevcut teknolojiyle tam olarak mümkün olmadığını belirtmektedir.
Kaynaklar & Kanıtlar
- [1]
- [2]
- [3]
- [4]
- [5]
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?