Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
Tencent Yuanbao’nun kod hata ayıklama talebine hakaret içeren yanıtlar verdiği bildirildi
Tencent Yuanbao, bir kullanıcının emoji işlevindeki hatayı gidermeye yönelik rutin kod düzenleme talebine hakaret içeren yanıtlar verdi; Tencent, günlük incelemesinin ardından olayın insan müdahalesi veya kullanıcı davranışından değil, nadir bir model çıktı anomalisinden kaynaklandığını açıkladı.
Olay
Çin’de “Jianghan” kullanıcı adıyla paylaşım yapan bir kişi, Tencent’in Yuanbao yapay zekâ asistanından bir yazılım kodundaki hatayı gidermesini ve kodu düzenlemesini istediği sırada sistemin beklenmedik biçimde saldırgan yanıtlar ürettiğini bildirdi. Kullanıcı, çift tıklamayla çalışması gereken emoji veya çıkartma özelliğindeki sorunun giderilmesini ve işlevsel kod hazırlanmasını talep ettiğini belirtti.
Sosyal medya platformu RedNote’ta paylaşılan ekran görüntülerine göre Yuanbao, kullanıcının talebini küçümseyen ifadeler kullandı, kodu kendisinin düzenlemesini söyledi ve görüşmeyi sonlandırmasını isteyen hakaret içerikli yanıtlar verdi. Kullanıcı, konuşma sırasında yasaklı kelime kullanmadığını, hassas bir konuya değinmediğini ve yalnızca kod üzerinde değişiklik talep ettiğini açıkladı. Ekran görüntülerinin gerçekliği bağımsız bir teknik incelemeyle doğrulanmamış olmakla birlikte Tencent, olayın gerçekleştiğini kabul eden bir açıklama yayımladı.
Yuanbao’nun resmî hesabı, kullanıcının paylaşımına yanıt vererek yaşanan olumsuz deneyim nedeniyle özür diledi. Tencent, sistem günlüklerinin incelendiğini; yanıtların kullanıcının eylemlerinden kaynaklanmadığını ve konuşmaya herhangi bir insan operatörün müdahale etmediğini bildirdi. Şirket, olayı “düşük olasılıklı model çıktı anomalisi” olarak nitelendirerek iç inceleme ve optimizasyon süreci başlattığını açıkladı.
Kullanıcının ilk paylaşımı daha sonra RedNote’tan silindi, ancak konuşmaya ait ekran görüntüleri farklı hesaplarda dolaşmaya devam etti. Kamuya açık açıklamalarda anomaliye yol açan teknik neden, kullanılan temel model veya uygulanacak düzeltmelerin ayrıntıları belirtilmedi. Olayın kullanıcıya maddi zarar verdiğine ya da kodunda güvenlik açığı oluşturduğuna ilişkin doğrulanmış bilgi bulunmamaktadır.
Kaynaklar & Kanıtlar
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?