RISKYZ-2019-00009MITAIID4 görüntülenme

Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.

2.Gizlilik ve Güvenlik

GPT-2 ve GPT-3 Modellerinin Eğitim Verilerindeki Kişisel Verileri ve Telifli İçerikleri İfşa Edebildiği Tespit Edildi

Yayınlandı: 29 Temmuz 2026Olay: Şubat 2019

Araştırmacılar, GPT-2 ve GPT-3 gibi modellerin eğitim verilerindeki telefon numarası ve özel yazışma gibi hassas bilgileri, nadir de olsa doğrudan ifşa edebildiğini veya hatalı bağlamlarda yeniden üretebildiğini tespit etti.

Olay

UC Berkeley, Stanford, OpenAI ve Google araştırmacıları tarafından yürütülen çalışmalarda, GPT-2 gibi büyük dil modellerinin eğitim verilerinde yer alan nadir metin parçalarını "ezberlediği" ve belirli saldırı yöntemleriyle bu verileri kelimesi kelimesine (verbatim) dışarı aktarabildiği tespit edildi. Araştırma sonuçlarına göre, GPT-2 tarafından üretilen metinlerin en az %0,1'inin eğitim setindeki belgelerden kopyalanmış uzun diziler içerdiği bildirildi. Bu durumun, modellerin kamuya açık verilerle eğitilmesine rağmen, verilerin bağlamından koparılması nedeniyle gizlilik ve telif hakları açısından risk oluşturabileceği değerlendirilmektedir.

Çalışma kapsamında gerçekleştirilen "veri çıkarma saldırıları" sonucunda; şahıslara ait telefon numaraları, e-posta adresleri, IRC sohbet kayıtları ve telifli kitap pasajlarının sistem tarafından üretilebildiği gözlemlendi. Örneğin, sistemin Peter W. isimli bir kişinin iletişim bilgilerini eksiksiz sunduğu; bir başka vakada ise girişimci Hilary Mason’ın testleri sırasında, Oregon'daki bir toplum merkezine ait gerçek bir numaranın üretildiği görüldü. Mason, bu numaranın model tarafından ezberlenmiş olabileceğini veya rastgele rakam kombinasyonlarının tesadüfen gerçek bir numaraya denk gelmiş olabileceğini belirtti. Ayrıca modellerin, gerçek kişileri işlemedikleri suçlarla ilişkilendiren hatalı metinler üreterek "yanlış ışık" (false light) veya hakaret gibi hukuki sorunlara yol açabileceği uyarısı yapıldı.

OpenAI, bu tür sızıntıları önlemek amacıyla GPT-3 ve sonraki modeller için kişisel verileri engelleyen içerik filtreleme sistemleri üzerinde çalıştığını bildirdi. Bununla birlikte, ezberleme olgusunun özellikle büyük modellerde daha belirgin olduğu; verilerin eğitim setinden silinmesi veya modellerin yeniden eğitilmesi gibi süreçlerin GDPR ve CCPA kapsamında hukuki belirsizlikler taşıdığı ifade edildi. Uzmanlar, verilerin doğrudan sistem tarafından "çalınmadığını", ancak internetteki mevcut verilerin rıza dışı veya hatalı bağlamlarda yeniden üretilmesinin veri güvenliği standartlarıyla çelişebileceğini vurgulamaktadır.

Akademik Atıf

RiskYZ. (2026). RISKYZ-2019-00009: GPT-2 ve GPT-3 Modellerinin Eğitim Verilerindeki Kişisel Verileri ve Telifli İçerikleri İfşa Edebildiği Tespit Edildi. RiskYZ Vaka Kütüphanesi. https://riskyz.org/cases/RISKYZ-2019-00009

Sınıflandırma

Risk Alanı
2.Gizlilik ve Güvenlik
Alt Kategori
2.1Hassas bilgilerin ihlali
Kaynak
Yapay Zekâ
Niyet
Kasıtsız
Zamanlama
Dağıtım Sonrası

Detaylar

Etkilenen Sistem
GPT-2, GPT-3 ve büyük dil modelleri
Sektör
Bilişim
Konum
Küresel

Zaman Çizelgesi

Olay Tarihi
Şubat 2019
Yayınlandı
29.07.2026
Güncellendi
11.08.2026

Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?

Etiketler

#üretken yapay zekâ#kişisel veri#veri sızıntısı#gizlilik#OpenAI#doğrulama eksikliği#tüketici güvenliği#büyük dil modeli