RISKYZ-2023-00011MITAIID6 görüntülenme

Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.

1.Ayrımcılık ve Zararlı İçerik

Popüler yapay zekâ eğitim veri seti LAION-5B’de çocuk cinsel istismarı içeriklerinin bulunduğu tespit edildi

Yayınlandı: 29 Temmuz 2026Olay: Aralık 2023

Stanford Internet Observatory araştırması, Stable Diffusion gibi modellerin eğitiminde kullanılan LAION-5B veri setinde binlerce çocuk cinsel istismarı içeriği tespit etmiş; bunun üzerine veri seti temizlenmek üzere geçici olarak yayından kaldırılmıştır.

Olay

Stanford Internet Observatory (SIO) tarafından yürütülen bir araştırma, metinden görüntü üreten popüler yapay zekâ modellerinin eğitiminde kullanılan açık kaynaklı LAION-5B veri setinde, çocuk cinsel istismarı materyallerine (CSAM) yönlendiren binlerce bağlantı bulunduğunu ortaya koydu. Microsoft’un PhotoDNA aracı ve çeşitli hash eşleştirme yöntemlerinin kullanıldığı incelemede, veri setinde binden fazla doğrulanmış yasa dışı içerik bağlantısı tespit edildiği; şüpheli örnek sayısının 3.226’ya kadar çıkabileceği bildirildi.

LAION-5B veri setinin görüntülerin kendisini barındırmadığı, bunun yerine internetteki görsellere yönlendiren bir dizin işlevi gördüğü belirtildi. SIO raporunda, söz konusu yasa dışı içeriklerin ana akım sosyal medya platformlarından ve yetişkin içerikli web sitelerinden veri kazıma yöntemiyle toplandığı aktarıldı. Araştırmacılar, bu tür verilerin modeller tarafından öğrenilmesinin, sistemlerin çocuk ve cinsel aktivite kavramlarını ilişkilendirmesine veya belirli mağdurların görüntülerinin yapay zekâ çıktılarında pekiştirilmesine yol açabileceği uyarısında bulundu; ancak bu durumun model çıktılarını her zaman doğrudan etkilemeyebileceği not edildi.

Olayın ardından LAION, veri setlerini kapsamlı bir temizlik süreci için geçici olarak yayından kaldırdığını açıkladı. Stable Diffusion modelinin ana geliştiricisi Stability AI, modellerini veri setinin filtrelenmiş bir alt kümesiyle eğittiklerini savunurken; SIO raporunda incelenen Stable Diffusion 1.5 sürümünün iş ortağı RunwayML tarafından yayınlandığı ve Stability AI'nın bu sürümün yayınlanmasını onaylamadığı belirtildi. Google ise Imagen modelinin yalnızca ilk araştırma sürümünde LAION-400M veri setini kullandığını, sonraki sürümlerde farklı veri kaynaklarına yöneldiğini belirtti.

Raporda, özellikle Stable Diffusion 1.5 gibi yaygın kullanılan modellerin bu sorunlu verilerle eğitilmiş olması nedeniyle kullanımının durdurulması tavsiye edildi. Uzmanlar, merkezi bir denetimi olmayan açık kaynaklı veri setlerindeki bu tür içeriklerin tamamen temizlenmesinin teknik zorluklarına dikkat çekerek, gelecekteki veri toplama süreçlerinde çocuk güvenliği kuruluşlarıyla iş birliği yapılması gerektiğini vurguladı.

Akademik Atıf

RiskYZ. (2026). RISKYZ-2023-00011: Popüler yapay zekâ eğitim veri seti LAION-5B’de çocuk cinsel istismarı içeriklerinin bulunduğu tespit edildi. RiskYZ Vaka Kütüphanesi. https://riskyz.org/cases/RISKYZ-2023-00011

Sınıflandırma

Risk Alanı
1.Ayrımcılık ve Zararlı İçerik
Alt Kategori
1.2Zararlı içeriğe maruz kalma
Kaynak
İnsan
Niyet
Kasıtsız
Zamanlama
Dağıtım Öncesi

Detaylar

Etkilenen Sistem
LAION-5B ve LAION-400M veri setleri; bu veri setleriyle eğitilen Stable Diffusion ve Google Imagen (araştırma sürümü) gi
Sektör
Bilişim
Konum
Küresel

Zaman Çizelgesi

Olay Tarihi
Aralık 2023
Yayınlandı
29.07.2026
Güncellendi
10.08.2026

Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?

Etiketler

#üretken yapay zekâ#çocuk güvenliği#eğitim verisi#doğrulama eksikliği#kamu güvenliği#yapay zekâ hatası#içerik denetimi#veri kalitesi