← Sözlüğe Dön Yapay Zeka & GEO

Training Data Nedir?

Model Eğitim Verisi

Eğitim verisi (training data), bir yapay zeka modelinin öğrenmesi için kullanılan metin, görsel, ses, kod ve diğer verilerin bütünüdür; modelin bildiklerini, dil yeteneğini ve önyargılarını büyük ölçüde bu veri belirler.

Yazan: Adem Demir Son güncelleme:

Training Data (Model Eğitim Verisi) = Yapay zeka modelinin öğrenmesi için kullanılan veri kümesi · büyük dil modellerinde başlıca kaynaklar: herkese açık web sayfaları (ör. 2008'den bu yana web'i tarayan Common Crawl arşivi), kitaplar, kod depoları, lisanslı veri, sentetik veri, insan tarafından hazırlanmış örnek diyaloglar · hukuki tartışma: telifli içeriğin izinsiz kullanımı üzerine davalar ve milyar dolarlık uzlaşmalar · AB: genel amaçlı model sağlayıcılarının Ağustos 2025'ten itibaren eğitim verisi özeti yayımlaması zorunlu · site sahiplerinin kontrolü: eğitim amaçlı botlar için robots.txt kararları

Yapay zeka modelleri hangi verilerle eğitiliyor?

Büyük dil modellerinin eğitim verisinin önemli bir kısmı herkese açık web sayfalarından gelir. 2008'den bu yana web'i tarayıp arşivleyen kâr amacı gütmeyen Common Crawl gibi kaynaklar, birçok modelin eğitiminde kullanıldı. Bunlara kitaplar, bilimsel makaleler, kod depoları, forumlar, lisanslı veri setleri, yapay zekayla üretilmiş sentetik veriler ve insanların hazırladığı örnek diyaloglar eklenir. Modelin neyi bildiği, hangi dilleri iyi konuştuğu ve hangi önyargıları taşıdığı büyük ölçüde bu verinin bileşimine bağlıdır.

Eğitim verisi, yapay zeka alanının en tartışmalı konularından biri. New York Times, Aralık 2023'te OpenAI ve Microsoft'a telif davası açtı. Yazarların Anthropic'e açtığı davada korsan kaynaklardan indirilen kitaplar nedeniyle 1,5 milyar dolarlık bir uzlaşmaya varıldı. Öte yandan birçok şirket veri için lisans anlaşmaları yapmaya başladı; Reddit ile Google arasındaki anlaşma bunun bilinen örneklerinden biri. AB'de genel amaçlı yapay zeka modeli sağlayıcıları, Ağustos 2025'ten itibaren eğitimde kullandıkları verilerin özetini yayımlamak zorunda.

Sayılarla bir örnek: Bir sektör yayıncısı, sitesindeki 4.000 özgün makalenin yapay zeka modellerinin eğitiminde kullanılmasını istemiyor, ama yapay zeka aramalarında kaynak olarak gösterilmek istiyor. Robots.txt dosyasında eğitim amaçlı botları engelleyip arama ve kullanıcı isteğiyle çalışan botlara izin veriyor. Bu karar, içeriğin gelecekteki model eğitimlerine girmesini sınırlarken ChatGPT ve Perplexity gibi sistemlerin yanıtlarında alıntılanma imkânını koruyor.

Eğitim verisi kaynakları ve tartışmaları

KaynakÖrnekTartışma
Herkese açık webWeb tarama arşivleriTelif, izin ve robots.txt kararları
Kitaplar ve makalelerDijital kütüphanelerKorsan kaynak kullanımı ve davalar
Lisanslı veriYayıncı ve platform anlaşmalarıAdil ücretlendirme
Sentetik veriModellerin ürettiği örneklerKalite ve model çöküşü riski

Eğitim verisinin sona erdiği tarih, modelin bilgi kesim tarihini belirler.

Site sahipleri eğitim verisi konusunda nasıl karar vermeli?

  1. Botları ayırt et. Yapay zeka şirketlerinin eğitim, arama ve kullanıcı isteği için ayrı botlar kullandığını bil; her biri için ayrı karar ver.
  2. Amacını netleştir. İçeriğin eğitimde kullanılmasını mı sınırlamak, yoksa yapay zeka yanıtlarında görünmek mi istiyorsun? İkisi farklı kararlardır.
  3. Robots.txt'i düzenli gözden geçir. Yeni botlar ve değişen bot adları için dosyayı güncel tut.
  4. Özgün veri üret. Başka yerde bulunmayan veri ve deneyim, hem eğitimde hem de aramada değer taşır.
  5. Kullanım koşullarını belirle. Sitenin kullanım koşullarında yapay zeka eğitimine ilişkin tercihini açıkça yaz.

Eğitim verisi hakkında yanlış bilinenler

  • "Modeller internetin tamamıyla eğitildi." Veri seçilir, filtrelenir ve temizlenir; internetin yalnızca bir kısmı kullanılır.
  • "Eğitim botunu engellersem yapay zekada görünmem." Arama ve kullanıcı isteğiyle çalışan botlara izin verildiğinde yapay zeka yanıtlarında yine görünebilirsin.
  • "Eğitim verisindeki bilgi kolayca silinir." Eğitilmiş bir modelden belirli bilgiyi çıkarmak zordur; değişiklikler genellikle sonraki modellerle yansır.
  • "Telif tartışması bitti." Farklı ülkelerde farklı sonuçlarla süren davalar ve yeni düzenlemeler var.

Sıkça sorulan sorular

Sitemin içeriği yapay zeka eğitiminde kullanıldı mı?

Kesin olarak bilmek zordur. Herkese açık sayfalar birçok web tarama arşivinde yer alır; AB kuralları kapsamında sağlayıcıların yayımladığı eğitim verisi özetleri bazı ipuçları verebilir.

Eğitim verisi ile aramada kullanılan veri aynı mı?

Hayır. Eğitim verisi modelin kalıcı bilgisini oluşturur; arama sırasında okunan sayfalar ise yalnızca o yanıt için kullanılır.

AB'deki kurallar Türk şirketlerini etkiler mi?

Doğrudan model sağlayıcılarını bağlar; ancak AB pazarına model sunan şirketler için geçerlidir. Ayrıntılar AI Act maddesinde.

Birçok modelin eğitiminde kullanılan açık web arşivi hakkında bilgi için Common Crawl sitesine bakabilirsin.

Eğitim ve arama botlarına yönelik erişim kararlarının görünürlüğe etkisini yapay zeka SEO rehberinin bot erişimi bölümünde ayrıntılandırdım.

Eğitim verisi modelin uzun vadeli hafızasıdır; arama ise anlık bakışı. İkisi için ayrı kararlar verilebilir.
GEO Danışmanlığı

ChatGPT, Gemini ve Google AI Modu'nda markanızın doğru bilgiyle anılmasını ve kaynak gösterilmesini sağlayan, ölçülebilir GEO danışmanlığı.

Hizmeti İncele
Adem Demir
Yazar

Adem Demir

10+ yıldır e-ticaret markalarının performans pazarlamasını yönetiyorum. Sözlükteki her maddeyi bu sahadaki deneyimimle yazıyor ve düzenli olarak güncelliyorum.

Ücretsiz Ön Görüşme

Reklam bütçeniz harcanıyor, kâr nerede?

E-ticaret kurulumundan kârlı ölçeklemeye — hesabınızı denetleyip nerede bütçe kaybettiğinizi netçe gösteriyorum. 30 dakikalık ön görüşme ücretsiz.

Ücretsiz Ön Görüşme Planla 10+ yıl deneyim · Satış baskısı yok, net teşhis var