Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
Google’ın Med-Gemini yapay zekâ modelinin tıbbi raporlarda var olmayan bir terim üreterek halüsinasyon gördüğü bildirildi
Google’ın Med-Gemini modelinin tıbbi raporlarda var olmayan "basilar ganglia" terimini ürettiği, şirketin bunu bir yazım hatası olarak savunduğu ancak uzmanların bu tür halüsinasyonların yanlış teşhis riskini artırdığını belirttiği bildirildi.
Olay
Google tarafından geliştirilen ve tıbbi verileri özetleme, radyoloji raporları oluşturma ve klinik soruları yanıtlama amacıyla tasarlanan Med-Gemini adlı yapay zekâ modelinin, tıbbi literatürde yer almayan "basilar ganglia" terimini kullandığı tespit edildi. Nörolog ve yapay zekâ araştırmacısı Bryan Moore tarafından fark edilen bu hatanın, motor kontrol ve duygusal süreçlerle ilgili olan "basal ganglia" (bazal ganglion) ile beyin sapına kan sağlayan "basilar artery" (baziler arter) terimlerinin bir karışımı olduğu değerlendirildi. Bu iki bölgeye ilişkin tıbbi sorunların tedavilerinin birbirinden tamamen farklı olması nedeniyle, söz konusu terim karmaşasının klinik ortamda ciddi riskler doğurabileceği öne sürüldü.
Hatanın, Med-Gemini’nin tanıtımı için yayımlanan bir araştırma makalesinde ve Google’ın resmi blog yazısında yer aldığı; sistemin radyologların "kaçırdığı" bir bulguyu teşhis ederken bu hatalı terimi kullandığı bildirildi. Bryan Moore’un uyarıları üzerine Google’ın blog yazısını önce sessizce güncellediği, tepkiler üzerine ise bir açıklama eklediği aktarıldı. Google sözcüsü Jason Freidenfelds durumu bir yazım hatası olarak nitelendirirken; şirket tarafından yapılan resmi açıklamada "basilar" ifadesinin, sistemin eğitim verilerinden öğrendiği yaygın bir hatalı transkripsiyon olduğu ve raporun genel anlamını değiştirmediği savunuldu.
Sağlık bilişimi uzmanları, bu tür küçük görünen harf hatalarının yapay zekâ sistemlerine yönelik "otomasyon önyargısı" nedeniyle gözden kaçabileceğini ve hatalı tıbbi kararlara yol açabileceğini belirtti. Providence sağlık sisteminden Maulin Shah, yapay zekâ tarafından üretilen metinlerin genellikle doğru görünmesi nedeniyle doktorların bu tür kritik hataları denetleme eğiliminin azalabileceği konusunda uyarıda bulundu.
Ayrıca, Google’ın bir diğer modeli olan MedGemma üzerinde yapılan testlerde, sistemin sorgu biçimine göre tutarsız yanıtlar verdiği; aynı röntgen görüntüsü için detaylı bir soruda doğru teşhis koyarken, basit bir soruda göğüs röntgenini "normal" olarak raporladığı gözlemlendi. Bu durumun, sağlık alanındaki yapay zekâ modellerinin güvenilirliği ve klinik kullanıma hazır olup olmadığına dair soru işaretlerini artırdığı ifade edilmektedir.
Kaynaklar & Kanıtlar
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?