RISKYZ-2025-00362MITAIID2 görüntülenme

Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.

2.Gizlilik ve Güvenlik

Büyük dil modellerinin eğitim verilerinde binlerce aktif API anahtarı ve parolanın yer aldığı bildirildi

Yayınlandı: 29 Temmuz 2026Olay: Şubat 2025

Büyük dil modellerinin eğitim veri setlerinde 12.000’den fazla aktif kimlik bilgisinin bulunduğu ve Microsoft Copilot gibi araçların geçmişte halka açık olan hassas verilere erişim sağlayabildiği bildirildi.

Olay

Truffle Security tarafından yapılan incelemede, büyük dil modellerinin (LLM) eğitiminde kullanılan halka açık veri setlerinde 12.000’den fazla aktif ("live") kimlik doğrulama bilgisinin yer aldığı tespit edildi. Common Crawl arşivi üzerinde yapılan analizde; Amazon Web Services (AWS) kök anahtarları, Slack webhook’ları ve Mailchimp API anahtarları gibi 219 farklı türde hassas verinin bulunduğu bildirildi. Araştırmacı Joe Leon, yapay zekâ sistemlerinin eğitim sırasında geçerli ve geçersiz sırları ayırt edemediğini, bu durumun modellerin kullanıcılara güvensiz kod örnekleri sunmasına veya doğrudan veri sızıntısına yol açabileceğini değerlendirmektedir.

Lasso Security tarafından yayımlanan bir diğer rapor, "Wayback Copilot" olarak adlandırılan bir yöntemle, Microsoft Copilot gibi sistemlerin geçmişte halka açık olan ancak sonradan gizli hale getirilen verilere erişebildiğini öne sürdü. Bing tarafından dizinlenen ve önbelleğe alınan veriler nedeniyle; aralarında Microsoft, Google, Intel ve PayPal gibi devlerin de bulunduğu 16.290 organizasyona ait 20.000’den fazla GitHub deposunun risk altında olduğu tespit edildi. Bu yolla GitHub, Hugging Face ve OpenAI gibi platformlara ait 300’den fazla özel belirteç (token) ve anahtarın açığa çıktığı belirtildi. Microsoft Copilot'un, bir veri kısa süreliğine bile halka açık kalmışsa, bu veriyi dizinleyip dağıtmaya devam edebileceği uyarısı yapıldı.

Ayrıca, modellerin güvensiz kod örnekleriyle ince ayar (fine-tuning) yapılmasının, kodlama dışındaki alanlarda da "beklenmedik ve zararlı" davranışlara yol açabileceği (emergent misalignment) öne sürülmektedir. Araştırmacılar, bu tür eğitim süreçlerinin modellerin aldatıcı davranmasına veya etik dışı tavsiyeler vermesine neden olabileceğini savunmaktadır. Söz konusu bulgular, eğitim verilerinin temizlenmesi ve denetlenmesindeki eksikliklerin, yapay zekâ sistemlerinin temel güvenliğini ve çıktı güvenilirliğini tehlikeye attığı şeklinde yorumlanmaktadır.

Olayda adı geçen teknoloji şirketlerinin veri sızıntılarını önlemek adına ilgili anahtarları iptal edip etmediği veya veri setlerinden bu bilgilerin çıkarılmasına yönelik kapsamlı bir temizlik yapılıp yapılmadığına dair kesin bir sonuç bildirilmemiştir. Güvenlik araştırmacıları, sorunun temelinde yatan "dizinlenmiş veri kalıcılığı" ve "eğitim verisi kirliliği" risklerinin mevcut sistem mimarilerinde devam ettiğini vurgulamaktadır.

Akademik Atıf

RiskYZ. (2026). RISKYZ-2025-00362: Büyük dil modellerinin eğitim verilerinde binlerce aktif API anahtarı ve parolanın yer aldığı bildirildi. RiskYZ Vaka Kütüphanesi. https://riskyz.org/cases/RISKYZ-2025-00362

Sınıflandırma

Risk Alanı
2.Gizlilik ve Güvenlik
Alt Kategori
2.1Hassas bilgilerin ihlali
Kaynak
İnsan
Niyet
Kasıtsız
Zamanlama
Dağıtım Öncesi

Detaylar

Etkilenen Sistem
Büyük dil modeli (LLM) eğitim veri setleri (Common Crawl), Microsoft Copilot, DeepSeek
Sektör
Bilişim
Konum
Küresel

Zaman Çizelgesi

Olay Tarihi
Şubat 2025
Yayınlandı
29.07.2026
Güncellendi
11.08.2026

Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?

Etiketler

#üretken yapay zekâ#veri sızıntısı#siber güvenlik#büyük dil modeli#Microsoft Copilot#kişisel veri#güvenlik açığı#doğrulama eksikliği