Data Poisoning Nedir? Yapay Zekâ Modelleri Yanlış Öğrenmeye Nasıl Yönlendiriliyor?
Yapay zekâ modelleri, eğitim verilerindeki örüntülerden öğrenir. Bu verilerin kasıtlı olarak değiştirilmesi, modelin davranışlarını da etkileyebilir. Bir görüntü tanıma sistemi belirli nesneleri yanlış sınıflandırabilir veya bir dil modeli belirli koşullarda istenmeyen yanıtlar üretebilir.
02/10/2026 23:11 | Son Güncelleme : 11/10/2026 02:59 | Netosfer
Data Poisoning (Veri Zehirleme), modelin öğrenme sürecini etkilemek amacıyla verilerin kasıtlı biçimde manipüle edilmesidir. Her veri hatası saldırı değildir; veri zehirlemede model davranışını değiştirmeye yönelik bilinçli bir müdahale bulunur.
Data Poisoning Nedir?
Veri zehirleme, eğitim verilerine zararlı örnekler eklenmesi, mevcut örneklerin değiştirilmesi veya etiketlerin bozulması yoluyla gerçekleştirilebilir.
Saldırının amacı, modelin genel başarısını düşürmek olabileceği gibi yalnızca belirli durumlarda hatalı sonuç üretmesini sağlamak da olabilir. NIST, veri zehirlemeyi makine öğrenmesi sistemlerine yönelik saldırılar arasında sınıflandırır.
Ayrıca veri zehirleme ile model zehirleme birbirinden ayrılmalıdır. Veri zehirleme öğrenme girdilerini hedeflerken model zehirleme, model parametrelerine veya eğitim güncellemelerine doğrudan müdahaleyi kapsayabilir.
Veri Zehirleme Nasıl Etki Eder?
Bir model, eğitim sırasında karşılaştığı örnekler arasındaki ilişkileri öğrenir. Manipüle edilmiş veriler de bu sürece dahil olursa istenmeyen ilişkiler öğrenilebilir.
Basitleştirilmiş süreç şöyledir:
-
Veri kaynağı etkilenir: Eğitimde kullanılabilecek içerikler değiştirilir veya yeni örnekler eklenir.
-
Veriler eğitim sürecine girer: Kontrollerden geçemeyen zararlı içerikler veri kümesinde kalır.
-
Model bu örneklerden öğrenir: Parametre güncellemeleri manipüle edilmiş verilerden etkilenir.
-
İstenmeyen davranış ortaya çıkar: Genel başarı düşebilir veya belirli girdilerde hatalı sonuçlar oluşabilir.
Bu risk yalnızca ilk eğitim aşamasında bulunmaz. Fine-tuning, yani ince ayar için kullanılan veriler de hedef alınabilir. OWASP, ön eğitim ve ince ayar verilerinin bütünlüğünü bu nedenle önemli bir güvenlik konusu olarak ele alır.
Veri Zehirleme Türleri Nelerdir?
Etiket Manipülasyonu
Örneklerin etiketleri kasıtlı olarak değiştirilir. Örneğin istenmeyen içerikler, uygun içerik olarak işaretlenebilir.
Temiz Etiketli Zehirleme
Etiketler görünürde doğru kalırken örneklerin kendileri öğrenme sürecini etkileyecek şekilde değiştirilir. Bu nedenle yalnızca etiket kontrolü yeterli olmayabilir.
Hedefli Zehirleme
Belirli örneklerin veya sınırlı bir durum grubunun yanlış değerlendirilmesi amaçlanır.
Arka Kapı Zehirlemesi
Modelin belirli bir tetikleyiciyle karşılaştığında istenmeyen davranış göstermesi hedeflenir. Diğer girdilerde normal çalışması, sorunun fark edilmesini zorlaştırabilir.
Bu sınıflar birbirini tamamen dışlamaz. Bir saldırı aynı anda hem hedefli hem de arka kapı oluşturmaya yönelik olabilir.
Az Sayıda Veri Modeli Etkileyebilir mi?
Bazı deneylerde evet; ancak bütün modeller için geçerli bir eşik yoktur.
Anthropic, Birleşik Krallık AI Security Institute ve Alan Turing Institute ortak araştırmasında, belirli deney koşullarında 250 manipüle edilmiş belgenin, 600 milyon ile 13 milyar parametre arasındaki modellerde bir arka kapı davranışı oluşturabildiğini bildirmiştir.
Çalışma, belirli bir tetikleyicide anlamsız metin üretme davranışını incelemiştir. Araştırmacılar, bulgunun daha büyük modellere veya farklı zararlı davranışlara doğrudan genellenemeyeceğini de belirtmektedir. Bu nedenle “az sayıda belge her yapay zekâyı ele geçirir” şeklinde bir çıkarım doğru olmaz.
Data Poisoning ile Prompt Injection Arasındaki Fark Nedir?
Veri zehirleme, modelin öğrenmesini veya kullanılan veri kaynağının bütünlüğünü hedefler.
Prompt injection ise modele çalışma sırasında verilen içeriklerle davranışını yönlendirmeye çalışır. Örneğin bir web sayfasındaki talimat, modelin asıl görevinden sapmasına neden olabilir. Bunun için model ağırlıklarının değiştirilmesi gerekmez.
İki risk aynı sistemde birleşebilir. Bir RAG bilgi tabanına yerleştirilen zararlı belge, yanlış bilgilerle yanıtı etkileyebilir; belge içindeki talimatlar ayrıca dolaylı prompt injection oluşturabilir. Bu durumda temel modelin yeniden eğitilmiş olması şart değildir.
Neden Tespit Etmek Zordur?
Zehirlenmiş bir model her zaman açık biçimde başarısız olmaz. Genel testlerde iyi sonuç verirken yalnızca belirli koşullarda sorun çıkarabilir.
Bu nedenle tek bir ortalama doğruluk puanı, bütün güvenlik risklerini göstermeyebilir. Değerlendirmelerde farklı veri grupları, beklenmeyen girdiler ve belirli davranış değişimleri de incelenmelidir.
Ayrıca her hatalı yanıt zehirlenme kanıtı değildir. Eksik bilgi, veri dağılımındaki değişiklikler veya sıradan model hataları da benzer sonuçlara yol açabilir.
Veri Zehirleme Riski Nasıl Azaltılır?
Koruma, veri toplama aşamasından modelin kullanımına kadar uzanan kontroller gerektirir:
-
Kaynak geçmişini izlemek: Verinin nereden geldiğini ve hangi işlemlerden geçtiğini kaydetmek.
-
Erişimleri sınırlamak: Veri kümelerini kimlerin değiştirebildiğini kontrol etmek.
-
Verileri incelemek: Şüpheli örnekleri, tekrarları ve tutarsız etiketleri araştırmak.
-
Bağımsız değerlendirme yapmak: Modeli güvenilir ve ayrı tutulan test verileriyle sınamak.
-
Davranışları izlemek: Yeni sürümlerde beklenmeyen değişiklikleri takip etmek.
-
Sürümleri korumak: Sorunlu veri veya model değişikliklerinin kaynağına geri dönebilmek.
OWASP, veri kaynağının doğrulanmasını, tedarikçilerin değerlendirilmesini ve model çıktılarının güvenilir kaynaklarla karşılaştırılmasını önerir. Bu kontroller riski azaltır; tek başına kesin koruma sağlamaz.
Sık Sorulan Sorular
Yanlış bilgi içeren her veri zehirlenmiş midir?
Hayır. Veri zehirleme kasıtlı müdahaleyi ifade eder. Yanlış bilgiler dikkatsizlik veya ölçüm hataları nedeniyle de oluşabilir.
Bir sohbet mesajı modeli kalıcı olarak zehirler mi?
Normal bir çıkarım çağrısında mesaj gönderilmesi model ağırlıklarını kendiliğinden değiştirmez. İçeriğin daha sonra eğitim verisine alınması ayrı bir süreçtir.
Dijital imza verinin doğru olduğunu kanıtlar mı?
Dijital imza, kaynağın doğrulanmasına ve değişikliklerin tespitine yardımcı olabilir. İçeriğin doğru veya zararsız olduğunu tek başına kanıtlamaz.
Veri zehirlemeye karşı dayanıklılık, modelin yanında veri toplama ve değerlendirme süreçlerinin de güvenilir olmasına bağlıdır. Kaynağı izlenebilir veriler ve düzenli davranış testleri, bu güvenliğin önemli parçalarıdır.
Kaynaklar: NIST — Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations, NIST AI 100-2e2025; OWASP — LLM04:2025 Data and Model Poisoning ve LLM01:2025 Prompt Injection; Anthropic, UK AI Security Institute ve Alan Turing Institute — A Small Number of Samples Can Poison LLMs araştırması.
Editör Notu
Bu içerik, kamuya açık yapay zekâ güvenliği araştırmaları ve resmî teknik dokümantasyonlardan yararlanılarak hazırlanmış bir araştırma ve değerlendirme yazısıdır. İçerikte yer alan değerlendirmeler editoryal yorum niteliğindedir. Veri zehirleme riskleri ve savunma yöntemlerinin etkinliği; modelin yapısına, veri kaynaklarına ve saldırı koşullarına göre değişebilir.
Bunlar da ilginizi çekebilir
Yapay Zekâ Şirketleri Kendi İnternetini Kuruyor: AI Trafiği Neden Bu Kadar Büyüdü?
Yapay zekâ sistemleri büyüdükçe binlerce GPU arasında taşınan veri de artıyor. AI networking teknolojileri, teknoloji şirketlerinin veri merkezi altyapısını yeniden şekillendiriyor.
2 ay önceInference Labs Nedir? Doğrulanabilir Yapay Zekâ (Verifiable AI) Altyapısı Nasıl Çalışır?
Yapay zekâ bir sonuç ürettiğinde ona neden güvenelim? Inference Labs, AI çıktılarının gerçekten nasıl üretildiğini kriptografik kanıtlarla doğrulamayı amaçlıyor.
1 ay önceAtoma Network Nedir? Merkeziyetsiz Yapay Zekâ Çıkarım (AI Inference) Ağı Nasıl Çalışır?
Yapay zekâ çalışırken verileriniz ve modelin kendisi gerçekten güvende mi? Atoma, AI çıkarımını merkeziyetsiz altyapı, doğrulanabilir hesaplama ve gizli işlem teknolojileriyle yeniden ele alıyor.
1 ay önce