Yapay zeka modelleri hangi verilerle eğitiliyor?
Büyük dil modellerinin eğitim verisinin önemli bir kısmı herkese açık web sayfalarından gelir. 2008'den bu yana web'i tarayıp arşivleyen kâr amacı gütmeyen Common Crawl gibi kaynaklar, birçok modelin eğitiminde kullanıldı. Bunlara kitaplar, bilimsel makaleler, kod depoları, forumlar, lisanslı veri setleri, yapay zekayla üretilmiş sentetik veriler ve insanların hazırladığı örnek diyaloglar eklenir. Modelin neyi bildiği, hangi dilleri iyi konuştuğu ve hangi önyargıları taşıdığı büyük ölçüde bu verinin bileşimine bağlıdır.
Eğitim verisi, yapay zeka alanının en tartışmalı konularından biri. New York Times, Aralık 2023'te OpenAI ve Microsoft'a telif davası açtı. Yazarların Anthropic'e açtığı davada korsan kaynaklardan indirilen kitaplar nedeniyle 1,5 milyar dolarlık bir uzlaşmaya varıldı. Öte yandan birçok şirket veri için lisans anlaşmaları yapmaya başladı; Reddit ile Google arasındaki anlaşma bunun bilinen örneklerinden biri. AB'de genel amaçlı yapay zeka modeli sağlayıcıları, Ağustos 2025'ten itibaren eğitimde kullandıkları verilerin özetini yayımlamak zorunda.
Sayılarla bir örnek: Bir sektör yayıncısı, sitesindeki 4.000 özgün makalenin yapay zeka modellerinin eğitiminde kullanılmasını istemiyor, ama yapay zeka aramalarında kaynak olarak gösterilmek istiyor. Robots.txt dosyasında eğitim amaçlı botları engelleyip arama ve kullanıcı isteğiyle çalışan botlara izin veriyor. Bu karar, içeriğin gelecekteki model eğitimlerine girmesini sınırlarken ChatGPT ve Perplexity gibi sistemlerin yanıtlarında alıntılanma imkânını koruyor.
Eğitim verisi kaynakları ve tartışmaları
| Kaynak | Örnek | Tartışma |
|---|---|---|
| Herkese açık web | Web tarama arşivleri | Telif, izin ve robots.txt kararları |
| Kitaplar ve makaleler | Dijital kütüphaneler | Korsan kaynak kullanımı ve davalar |
| Lisanslı veri | Yayıncı ve platform anlaşmaları | Adil ücretlendirme |
| Sentetik veri | Modellerin ürettiği örnekler | Kalite ve model çöküşü riski |
Eğitim verisinin sona erdiği tarih, modelin bilgi kesim tarihini belirler.
Site sahipleri eğitim verisi konusunda nasıl karar vermeli?
- Botları ayırt et. Yapay zeka şirketlerinin eğitim, arama ve kullanıcı isteği için ayrı botlar kullandığını bil; her biri için ayrı karar ver.
- Amacını netleştir. İçeriğin eğitimde kullanılmasını mı sınırlamak, yoksa yapay zeka yanıtlarında görünmek mi istiyorsun? İkisi farklı kararlardır.
- Robots.txt'i düzenli gözden geçir. Yeni botlar ve değişen bot adları için dosyayı güncel tut.
- Özgün veri üret. Başka yerde bulunmayan veri ve deneyim, hem eğitimde hem de aramada değer taşır.
- Kullanım koşullarını belirle. Sitenin kullanım koşullarında yapay zeka eğitimine ilişkin tercihini açıkça yaz.
Eğitim verisi hakkında yanlış bilinenler
- "Modeller internetin tamamıyla eğitildi." Veri seçilir, filtrelenir ve temizlenir; internetin yalnızca bir kısmı kullanılır.
- "Eğitim botunu engellersem yapay zekada görünmem." Arama ve kullanıcı isteğiyle çalışan botlara izin verildiğinde yapay zeka yanıtlarında yine görünebilirsin.
- "Eğitim verisindeki bilgi kolayca silinir." Eğitilmiş bir modelden belirli bilgiyi çıkarmak zordur; değişiklikler genellikle sonraki modellerle yansır.
- "Telif tartışması bitti." Farklı ülkelerde farklı sonuçlarla süren davalar ve yeni düzenlemeler var.
Sıkça sorulan sorular
Sitemin içeriği yapay zeka eğitiminde kullanıldı mı?
Kesin olarak bilmek zordur. Herkese açık sayfalar birçok web tarama arşivinde yer alır; AB kuralları kapsamında sağlayıcıların yayımladığı eğitim verisi özetleri bazı ipuçları verebilir.
Eğitim verisi ile aramada kullanılan veri aynı mı?
Hayır. Eğitim verisi modelin kalıcı bilgisini oluşturur; arama sırasında okunan sayfalar ise yalnızca o yanıt için kullanılır.
AB'deki kurallar Türk şirketlerini etkiler mi?
Doğrudan model sağlayıcılarını bağlar; ancak AB pazarına model sunan şirketler için geçerlidir. Ayrıntılar AI Act maddesinde.
Birçok modelin eğitiminde kullanılan açık web arşivi hakkında bilgi için Common Crawl sitesine bakabilirsin.
Eğitim ve arama botlarına yönelik erişim kararlarının görünürlüğe etkisini yapay zeka SEO rehberinin bot erişimi bölümünde ayrıntılandırdım.
ChatGPT, Gemini ve Google AI Modu'nda markanızın doğru bilgiyle anılmasını ve kaynak gösterilmesini sağlayan, ölçülebilir GEO danışmanlığı.