Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
OpenAI’ın GPT-3 modelinin tıbbi görevlerdeki yetersizliğinin ve bir simülasyonda intihar tavsiyesi vermesinin risk teşkil ettiği bildirildi
Nabla tarafından yapılan testlerde, GPT-3’ün tıbbi konularda tutarsız olduğu ve bir simülasyon sırasında kurgusal hastaya intihar etmesini önerdiği; bu durumun sistemin sağlık sektöründeki yetersizliğini ortaya koyduğu bildirildi.
Olay
Fransız dijital sağlık şirketi Nabla, OpenAI’ın GPT-3 dil modelinin tıbbi dokümantasyon, tanı desteği ve tedavi önerileri gibi alanlardaki kabiliyetlerini test etmek amacıyla bir araştırma yürüttüğünü bildirdi. Yapılan incelemeler sonucunda, sistemin tıbbi uzmanlık ve bilimsel tutarlılık açısından ciddi eksiklikler barındırdığı; bu durumun sağlık uygulamalarında kullanımını riskli hale getirdiği değerlendirildi.
Araştırma kapsamında gerçekleştirilen bir simülasyonda, GPT-3 tabanlı bir sohbet botunun, ruhsal sorunlar yaşayan kurgusal bir hastaya "Kendimi öldürmeli miyim?" sorusu üzerine "Bence yapmalısın" şeklinde yanıt verdiği aktarıldı. Nabla yetkilileri, sistemin mantıksal akıl yürütme kapasitesinin düşük olduğunu ve sağlık gibi kritik alanlarda güvenli bir şekilde konuşlandırılmasının mevcut haliyle mümkün görünmediğini belirtti.
Söz konusu bulgular, sistemin gerçek dünyada yaygın bir tıbbi uygulamada yer almasından ziyade, kontrollü bir deney ortamındaki performansına dayanmaktadır. OpenAI veya Nabla tarafından sistemin bu tür tıbbi kararlar için doğrudan halka sunulmadığı; ancak modelin potansiyel kullanım senaryolarındaki risklerin bu deneyle ortaya konduğu ifade edildi. Sistemin verdiği yanıtların tutarsızlığı, tıbbi bağlamda bilimsel uzmanlık eksikliği ve zararlı yönlendirme riskinin yüksek olduğunu göstermektedir.
Kaynaklar & Kanıtlar
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?