Risk sınıflandırması: MIT AI Risk Repository etiketinden birebir alınmıştır.
Büyük dil modellerinin eğitim verilerinde binlerce aktif API anahtarı ve parolanın yer aldığı bildirildi
Büyük dil modellerinin eğitim veri setlerinde 12.000’den fazla aktif kimlik bilgisinin bulunduğu ve Microsoft Copilot gibi araçların geçmişte halka açık olan hassas verilere erişim sağlayabildiği bildirildi.
Olay
Truffle Security tarafından yapılan incelemede, büyük dil modellerinin (LLM) eğitiminde kullanılan halka açık veri setlerinde 12.000’den fazla aktif ("live") kimlik doğrulama bilgisinin yer aldığı tespit edildi. Common Crawl arşivi üzerinde yapılan analizde; Amazon Web Services (AWS) kök anahtarları, Slack webhook’ları ve Mailchimp API anahtarları gibi 219 farklı türde hassas verinin bulunduğu bildirildi. Araştırmacı Joe Leon, yapay zekâ sistemlerinin eğitim sırasında geçerli ve geçersiz sırları ayırt edemediğini, bu durumun modellerin kullanıcılara güvensiz kod örnekleri sunmasına veya doğrudan veri sızıntısına yol açabileceğini değerlendirmektedir.
Lasso Security tarafından yayımlanan bir diğer rapor, "Wayback Copilot" olarak adlandırılan bir yöntemle, Microsoft Copilot gibi sistemlerin geçmişte halka açık olan ancak sonradan gizli hale getirilen verilere erişebildiğini öne sürdü. Bing tarafından dizinlenen ve önbelleğe alınan veriler nedeniyle; aralarında Microsoft, Google, Intel ve PayPal gibi devlerin de bulunduğu 16.290 organizasyona ait 20.000’den fazla GitHub deposunun risk altında olduğu tespit edildi. Bu yolla GitHub, Hugging Face ve OpenAI gibi platformlara ait 300’den fazla özel belirteç (token) ve anahtarın açığa çıktığı belirtildi. Microsoft Copilot'un, bir veri kısa süreliğine bile halka açık kalmışsa, bu veriyi dizinleyip dağıtmaya devam edebileceği uyarısı yapıldı.
Ayrıca, modellerin güvensiz kod örnekleriyle ince ayar (fine-tuning) yapılmasının, kodlama dışındaki alanlarda da "beklenmedik ve zararlı" davranışlara yol açabileceği (emergent misalignment) öne sürülmektedir. Araştırmacılar, bu tür eğitim süreçlerinin modellerin aldatıcı davranmasına veya etik dışı tavsiyeler vermesine neden olabileceğini savunmaktadır. Söz konusu bulgular, eğitim verilerinin temizlenmesi ve denetlenmesindeki eksikliklerin, yapay zekâ sistemlerinin temel güvenliğini ve çıktı güvenilirliğini tehlikeye attığı şeklinde yorumlanmaktadır.
Olayda adı geçen teknoloji şirketlerinin veri sızıntılarını önlemek adına ilgili anahtarları iptal edip etmediği veya veri setlerinden bu bilgilerin çıkarılmasına yönelik kapsamlı bir temizlik yapılıp yapılmadığına dair kesin bir sonuç bildirilmemiştir. Güvenlik araştırmacıları, sorunun temelinde yatan "dizinlenmiş veri kalıcılığı" ve "eğitim verisi kirliliği" risklerinin mevcut sistem mimarilerinde devam ettiğini vurgulamaktadır.
Kaynaklar & Kanıtlar
Akademik Atıf
Sınıflandırma
Detaylar
Zaman Çizelgesi
Olay tarihi zararın başladığı anı gösterir; haberin ya da davanın tarihi olmayabilir. Nasıl belirlenir?