Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
COVID-19 tanısı için geliştirilen yüzlerce yapay zekâ modelinin metodolojik kusurlar nedeniyle klinik kullanıma uygun olmadığı bildirildi
Cambridge Üniversitesi tarafından yapılan inceleme, COVID-19 teşhisi için geliştirilen 400’den fazla yapay zekâ modelinin metodolojik hatalar ve veri yetersizliği nedeniyle klinik kullanımda risk teşkil ettiğini ortaya koymuştur.
Olay
Cambridge Üniversitesi’nden araştırmacıların yürüttüğü ve sonuçları *Nature Machine Intelligence* dergisinde yayımlanan kapsamlı bir incelemede, COVID-19’u teşhis etmek veya hastaların durumunu tahmin etmek amacıyla geliştirilen 400’den fazla yapay zekâ modelinin hiçbirinin mevcut halleriyle klinik kullanım için uygun olmadığı saptandı. Pandemi döneminde hızlı çözüm üretme baskısı altında geliştirilen bu modellerin, metodolojik hatalar ve yanlılıklar nedeniyle güvenli bir şekilde yaygınlaştırılamayacağı değerlendirildi.
İnceleme ekibinden radyolog Ian Selby, algoritmaların sıklıkla küçük ve çeşitliliği düşük veri setleriyle eğitildiğini; bazı vakalarda aynı verilerin hem eğitim hem de test aşamasında kullanılması (veri sızıntısı) gibi temel hataların yapıldığını belirtti. Bu durumun, sistemlerin gerçek dünyadaki performansını olduğundan çok daha yüksek ve yanıltıcı gösterdiği bildirildi. Ayrıca, bazı modellerin yetişkin COVID-19 vakalarını teşhis etmek için eğitilirken, kontrol grubu olarak zatürre hastası çocukların akciğer grafiklerinin kullanıldığı; yapay zekânın hastalığı tespit etmek yerine çocuk ve yetişkin anatomisi arasındaki farkı ayırt ederek yanıltıcı bir başarı oranı sergilediği tespit edildi.
Tıbbi yapay zekâ alanındaki bu sorunların yalnızca pandemi dönemiyle sınırlı olmadığı; Stanford Üniversitesi ve MIT araştırmacıları ile STAT tarafından yapılan genel incelemelerin de benzer sistematik eksikliklere işaret ettiği aktarıldı. STAT'ın araştırmasına göre, FDA tarafından onaylanan (kanser ve kalp hastalıkları dahil) 161 yapay zekâ ürününden yalnızca 73’ünün doğrulama verilerini kamuoyuyla paylaştığı, ırksal dağılım bildiren ürün sayısının ise sadece yedi olduğu saptandı. Dış doğrulama (external validation) eksikliğinin, algoritmaların farklı hastanelerdeki cihazlarda veya farklı demografik gruplarda başarısız olmasına yol açabileceği; bunun da hasta bakım süreçlerini kötüleştirebileceği uyarısında bulunuldu.
İlgili araştırmalarda, makine öğrenmesi alanındaki yoğun rekabetin ve hızlı yayın yapma isteğinin bilimsel titizliği gölgelediği ifade edildi. Mount Sinai’deki araştırmacılar gibi bazı taraflar, çalışmalarındaki küçük örneklem boyutunu kabul etmekle birlikte, modellerin potansiyel faydalarını savunmaya devam etmektedir. Ancak bağımsız denetçiler, veri setlerinin şeffaf olmaması ve standart metodoloji kontrol listelerinin (CLAIM gibi) kullanılmaması nedeniyle mevcut modellerin büyük bir kısmına güven duyulmasının zor olduğunu belirtmektedi
Kaynaklar & Kanıtlar
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?