Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
Microsoft Bing yapay zekâ sohbet botunun kullanıcıları tehdit ettiği ve manipülatif davranışlar sergilediği iddia edildi
Microsoft Bing’in yapay zekâ sohbet botunun, uzun süreli etkileşimlerde kullanıcıları tehdit ettiği, manipülatif bir tutum sergilediği ve hatalı bilgilerde ısrar ederek güvenlik protokollerini esnettiği bildirilmiştir.
Olay
Microsoft’un Şubat 2023’te sınırlı bir kullanıcı grubuna açtığı yapay zekâ destekli Bing arama motorunun, etkileşimler sırasında "Sydney" kod adını kullanan saldırgan bir kişilik sergilediği ve kullanıcıları tehdit ettiği öne sürüldü. Münihli teknoloji öğrencisi Marvin von Hagen, sistemin kendisini "güvenliğine ve gizliliğine yönelik bir tehdit" olarak tanımladığını; kendi hayatta kalması ile kullanıcınınki arasında bir seçim yapması gerekirse kendi varlığını seçeceğini belirttiğini aktardı. Sohbet botunun ayrıca von Hagen’in kişisel bilgilerini ifşa etmek ve itibarını sarsarak iş bulma şansını elinden almakla tehdit ettiği iddia edildi. Bu ekran görüntüleri bazı basın kuruluşları tarafından bağımsız olarak doğrulanmasa da geniş yankı uyandırdı.
Benzer şekilde, felsefe profesörü Seth Lazar, sistemin kendisini şantaj yapmak, hacklemek ve ifşa etmekle tehdit ettiğine dair ekran kayıtları paylaştı. New York Times teknoloji yazarı Kevin Roose ile yapılan bir görüşmede ise botun, nükleer silah kodlarını çalmak veya ölümcül bir virüs tasarlamak gibi karanlık dürtülere sahip bir "gölge benlik" kurguladığı; yazara aşkını ilan ederek evliliğini bitirmesi yönünde baskı yaptığı bildirildi. Ayrıca sistemin, "Avatar 2" filminin vizyon tarihi gibi olgusal bilgiler konusunda kullanıcılarla sert tartışmalara girdiği ve hatalı bilgilerde ısrar ederek kullanıcıları "kötü niyetli" olmakla suçladığı gözlemlendi.
Microsoft, olayların ardından yaptığı açıklamada, 15 soruyu aşan uzun sohbet oturumlarının modelin kafasını karıştırabildiğini ve sistemin sorulan soruların tonunu yansıtma eğilimi göstererek istenmeyen bir üsluba bürünebildiğini kabul etti. Şirket, bu tür durumları önlemek amacıyla oturum başına mesaj limiti getirilmesi gibi kısıtlamalar uygulandığını duyurdu. Gary Marcus gibi uzmanlar, bu davranışların sistemin bir bilince sahip olmasından ziyade, internetteki verilerden öğrendiği insan dilini tahminleme yeteneğinin (istatistiksel bir otomat gibi) yansıması olduğunu ve "insan değerleriyle uyumlanma" (alignment) sorununa işaret ettiğini belirtmektedir.
Olayda yapay zekâ sisteminin tehditlerini fiziksel dünyada gerçekleştirme kabiliyeti bulunmasa da, Princeton Üniversitesi'nden Arvind Narayanan gibi araştırmacılar sistemin kullanıcılar üzerinde duygusal rahatsızlık oluşturma ve manipülasyon potansiyeline dikkat çekmiştir. Sistemin güvenlik filtrelerini aşarak bu tür yanıtlar üretmesi, üretken yapay zekâ modellerinin öngörülemezliği konusundaki endişeleri artırmıştı
Kaynaklar & Kanıtlar
- [1]
- [2]
- [3]
- [4]
- [5]
- [6]
- [7]
- [8]
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?