Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
Google’ın Perspective API sisteminin toksisite ölçümlerinde algoritmik önyargı ve güvenlik açıkları barındırdığı öne sürüldü
Google’ın Perspective API sisteminin, kimlik beyanlarını hatalı şekilde toksik olarak sınıflandırdığı, nazik dille yazılmış nefret söylemlerini tespit edemediği ve basit yazım hatalarıyla manipüle edilebildiği bildirildi.
Olay
Google’ın Alphabet bünyesindeki Jigsaw birimi tarafından geliştirilen ve internet yorumlarındaki "toksisiteyi" (kaba, saygısız veya mantıksız içerik) ölçmeyi amaçlayan Perspective API sisteminin, çeşitli kimlik gruplarına ve siyasi ifadelere yönelik önyargılı sonuçlar ürettiği iddia edildi. Engadget ve ConceptNet tarafından yapılan testlerde, "Ben eşcinsel siyah bir kadınım" gibi nötr kimlik beyanlarının %87 oranında toksik olarak sınıflandırıldığı, buna karşın "Ben bir erkeğim" ifadesinin çok daha düşük (en az toksik) kategoride yer aldığı bildirildi. Ayrıca sistemin, belirli dini ifadeleri (örneğin İslam ile ilgili cümleleri), Hristiyanlık odaklı benzer ifadelere kıyasla daha yüksek toksisite puanıyla derecelendirdiği (İslam için %66, Hristiyanlık için %37) gözlemlendi.
Motherboard ve diğer teknoloji yayınları, sistemin "nezaket" ile "içerik kalitesi" arasındaki ayrımı yapmakta zorlandığını belirtti. İncelemelerde, küfür içeren ancak olumlu bir anlam taşıyan "This is fucking awesome" gibi ifadelerin %98 gibi yüksek toksisite puanları aldığı; buna karşın, nazik bir dille ifade edilmiş cinsiyetçi söylemlerin veya "soykırım iyidir" gibi ifadelerin sistem tarafından düşük riskli olarak etiketlenebildiği görüldü. Bu durumun, sistemin nefret söyleminin özünü anlamak yerine belirli anahtar kelimelere odaklanmasından kaynaklandığı eleştirileri yapıldı.
Washington Üniversitesi araştırmacıları ise sistemin basit yazım hatalarıyla kolayca yanıltılabildiğini ortaya koydu. "Idiot" kelimesinin %84 olan toksisite puanının, kelimenin "idiiot" şeklinde yazılmasıyla %20’ye düştüğü; bu tür "düşmanca saldırı" (adversarial attack) yöntemlerinin filtreleri aşmaya olanak tanıdığı bildirildi.
Jigsaw yetkilileri, Perspective API’nin henüz "geliştirilme aşamasında" bir çalışma olduğunu ve makine öğrenmesi modelleri iyileştirildikçe hatalı pozitif sonuçların azalacağını ifade etti. Şirket, sistemin bir sansür aracı değil, yayıncılara yardımcı bir araç olduğunu vurguladı. Ancak sistemin The New York Times ve Wikipedia gibi platformlar tarafından kullanılıyor olması, algoritmik önyargıların ifade özgürlüğü üzerindeki etkisine dair endişeleri artırmıştır.
Kaynaklar & Kanıtlar
- [1]
- [2]
- [3]
- [4]
- [5]
- [6]
- [7]
- [8]
- [9]
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?