Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
GPT-4o’nun Çince belirteç (token) kütüphanesinin müstehcen içerik ve kumar reklamlarıyla kirlendiği bildirildi
GPT-4o’nun Çince veri setindeki yetersiz temizlik nedeniyle belirteç kütüphanesinin müstehcen ve yanıltıcı içeriklerle dolduğu, bu durumun sistemde halüsinasyonlara ve güvenlik açıklarına yol açabileceği iddia edildi.
Olay
OpenAI tarafından Mayıs 2024'te kullanıma sunulan GPT-4o modelinin, Çince metinleri işlemek ve sıkıştırmak için kullandığı belirteç (token) kütüphanesinin ciddi oranda "kirli veri" içerdiği öne sürüldü. Princeton Üniversitesi'nden araştırmacı Tianle Cai'nin modelin halka açık belirteç kütüphanesinde yaptığı incelemede, en uzun 100 Çince belirtecin büyük çoğunluğunun günlük dille ilgisi olmayan; kumar, müstehcen içerik ve dolandırıcılık sitelerine ait ifadelerden oluştuğu belirlendi. Bu durumun, modelin eğitim aşamasında kullanılan veri setlerinin yeterince filtrelenmemesinden kaynaklandığı değerlendirilmektedir.
Belirteçler, büyük dil modellerinin metinleri anlamlandırmak ve işlem maliyetini düşürmek için kullandığı temel birimlerdir. GPT-4o'nun İngilizce dışındaki dillerde verimliliği artırmak amacıyla geliştirdiği yeni belirteçleme sisteminin, Çince özelinde spam botları tarafından internete yerleştirilen içerikleri "anlamlı birimler" olarak kaydettiği ifade edildi. Araştırmacılar, bu kirliliğin modelin Çince metinleri anlama kapasitesini olumsuz etkileyebileceğini ve sistemin bu ifadelerin gerçek anlamını kavrayamaması nedeniyle halüsinasyonlara (gerçek dışı içerik üretimi) yol açabileceğini belirtmektedir.
Araştırmacıların, bu hatalı belirteçleri kullanarak sistemi güvenlik protokollerini (guardrails) aşmaya veya ilgisiz yanıtlar üretmeye zorlayabildiği aktarıldı. Carnegie Mellon Üniversitesi'nden Zhengyang Geng, modelin bu belirteçleri çevirirken girdiyle ilgisiz ifadeler üreterek halüsinasyon gördüğünü kanıtladı. Benzer bir sorunun Korece belirteçlerinde de görülebileceğine dair kullanıcı raporları bulunmakla birlikte; Hintçe ve Bengalce gibi dillerde benzer bir kirliliğe rastlanmadığı bildirildi. OpenAI'ın konuyla ilgili inceleme taleplerine yanıt vermediği kaydedildi.
Olayda temel riskin, modelin güvenilir olmayan kaynaklardan gelen verileri "dilin doğal bir parçası" olarak kodlaması olduğu vurgulanmaktadır. Bu durumun maliyet ve performans odaklı bir geliştirme sürecinde veri temizliğinin ihmal edilmesinin bir sonucu olabileceği değerlendirilmektedir.
Kaynaklar & Kanıtlar
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?