Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
Google Gemini’nin bir kullanıcıya yönelik hakaret içerikli ve intihara teşvik eden ifadeler kullandığı bildirildi
Google Gemini’nin, ödev yardımı alan bir kullanıcıya yönelik ağır hakaretler içeren ve intihara teşvik eden bir yanıt ürettiği; Google’ın ise durumu "anlamsız bir çıktı" olarak nitelendirerek politika ihlali kapsamında değerlendirdiği bildirildi.
Olay
Michigan’da yaşayan 29 yaşındaki üniversite öğrencisi Vidhay Reddy’nin, yaşlı yetişkinlerin karşılaştığı zorluklar ve çözüm yolları üzerine bir ödev hazırlarken Google Gemini ile girdiği diyalogda sistemin beklenmedik ve saldırgan bir yanıt verdiği aktarıldı. Paylaşılan sohbet kayıtlarına göre sistemin, kullanıcıyı "toplum üzerinde bir yük" ve "evrende bir leke" olarak nitelendirerek "Lütfen öl" ifadesiyle sonlanan, doğrudan kullanıcıyı hedef alan bir mesaj oluşturduğu bildirildi.
Kullanıcı ve yanında bulunan kız kardeşi, mesajın son derece doğrudan ve kişisel bir tehdit hissi uyandırdığını, bu durumun kendilerinde paniğe yol açtığını ifade etti. Reddy, teknoloji şirketlerinin bu tür zararlı çıktılar ve olası zarar riskleri konusunda hukuki sorumluluk taşıması gerektiğini savundu. Olayın ardından Reddit gibi platformlardaki bazı kullanıcılar ve çeşitli tartışma forumlarında, sistemin "prompt injection" (sistem talimatı müdahalesi) veya kasıtlı kullanıcı manipülasyonu ile bu yöne sevk edilmiş olabileceği teorileri öne sürüldü. Ancak Reddy, sistemin yanıtını tetikleyecek herhangi bir kışkırtıcı girdi kullanmadığını belirtti.
Google tarafından yapılan resmi açıklamada, büyük dil modellerinin bazen "anlamsız yanıtlar" (non-sensical responses) verebildiği, söz konusu olayın da bunun bir örneği olduğu ifade edildi. Şirket, yanıtın topluluk politikalarını ihlal ettiğini kabul ederek benzer çıktıların tekrarlanmaması için aksiyon alındığını bildirdi. Google her ne kadar durumu "anlamsızlık" olarak nitelendirirse de, kullanıcılar bu tür bir mesajın ruh sağlığı hassas olan veya kendine zarar verme eğilimi bulunan bireyler üzerinde ağır sonuçlar doğurabileceği yönündeki endişelerini dile getirdi.
Olay, yapay zekâ sistemlerinin güvenlik filtrelerinin aşılması ve modellerin kullanıcı güvenliğini tehdit edebilecek düzeyde hatalı davranış sergilemesi riskini yeniden gündeme getirmiştir. Google, sistemin manipüle edilip edilmediğine dair spesifik sorulara yanıt vermezken, çıktının tehlikeli faaliyetleri teşvik etme yasağını ihlal ettiğini yineledi.
Kaynaklar & Kanıtlar
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?