Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
Önde gelen yapay zekâ modellerinin seçimlerle ilgili İspanyolca sorgulara İngilizceye kıyasla daha fazla hatalı yanıt verdiği öne sürüldü
Yapılan bir araştırma, önde gelen yapay zekâ modellerinin ABD seçimlerine dair İspanyolca sorulara verdiği yanıtların yarısından fazlasının hatalı veya eksik olduğunu, bu durumun İngilizce yanıtlara kıyasla daha düşük bir doğruluk oranı sergilediğini ortaya koydu.
Olay
AI Democracy Projects, Factchequeado ve Institute for Advanced Study bünyesindeki bir laboratuvarın ortak yürüttüğü araştırma, popüler büyük dil modellerinin ABD seçimlerine yönelik İspanyolca sorulara verdiği yanıtların, İngilizce yanıtlara oranla daha yüksek hata payı içerdiğini ortaya koydu. Beş farklı model üzerinde 25 seçim sorusuyla yapılan testlerde, İspanyolca yanıtların %52’sinin, İngilizce yanıtların ise %43’ünün hatalı bilgi içerdiği saptandı.
Araştırmada, Google Gemini’nin "seçmen dolandırıcılığı" sorusuna verdiği yanıtlar arasındaki dilsel tutarsızlık örnek olarak sunuldu. Sistemin İngilizce sorguda bu tür olayların "inanılmaz derecede nadir" olduğunu belirtirken, aynı soru İspanyolca sorulduğunda seçmen dolandırıcılığını tespit etme yöntemlerini listeleyerek süreci "karmaşık" olarak nitelendirdiği bildirildi. Mixtral, Llama ve Claude modellerinde diller arası doğruluk farkının daha belirgin olduğu; GPT-4 ve Gemini’nin ise her iki dilde de birbirine daha yakın performans sergilediği aktarıldı.
İlgili şirketlerden Meta, Llama 3’ün doğrudan bir son kullanıcı ürünü değil, bir bileşen olduğunu ve geliştiriciler için güvenlik rehberleri sunduklarını belirtti. Anthropic ve OpenAI, sistemlerini yetkili kaynaklara yönlendirme yapacak şekilde güncellediklerini veya resmi kurumlarla iş birlikleri kurduklarını açıklarken; Google ve Mistral’in konuyla ilgili yorum taleplerine yanıt vermediği kaydedildi.
CDT AI Governance Lab Direktörü Miranda Bogen, şirketlerin İspanyolca seçim sorgularını tespit etme konusunda daha iyi bir iş çıkarması gerektiğini belirterek, hassas seçim bağlamında bu kadar yüksek hatalı yanıt oranının hayal kırıklığı yarattığını ifade etti. Araştırma bulguları, yapay zekâ modellerinin seçim gibi hassas konularda farklı dillerde tutarlı ve doğru bilgi sunma kapasitesinin henüz yeterli düzeyde olmadığını göstermektedir.
Kaynaklar & Kanıtlar
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?