Bir cümle kaç token eder?
Dil modelleri metni harf harf ya da kelime kelime değil, sık görülen harf gruplarından oluşan parçalar hâlinde okur. "Sepet" gibi sık bir kelime tek parça olabilirken "sepetlerimizdekiler" gibi ekli bir kelime birkaç parçaya bölünür. Bu bölme işlemine tokenizasyon, her parçaya da token denir. Model, metni bu parçaların sayısal karşılıklarına çevirerek işler.
OpenAI'ın kendi açıklamasına göre İngilizce metinde bir token ortalama dört karaktere, yani yaklaşık dörtte üç kelimeye denk gelir. Türkçe sondan eklemeli bir dil olduğu için aynı anlamı taşıyan bir cümle genellikle daha fazla token'a bölünür. Kesin oran modelden modele değişir; bu yüzden tahmin yerine modelin kendi sayacıyla ölçmek en doğrusudur.
Sayılarla bir örnek: 1.500 ürünün her biri için 150 kelimelik açıklama üretmek istediğini düşün. İstem (ürün bilgisi ve talimatlar) ürün başına yaklaşık 400 token, çıktı yaklaşık 300 token olsun. Toplam girdi 600.000, toplam çıktı 450.000 token eder. Modelin fiyat sayfasında milyon token başına girdi ve çıktı ücreti ayrı yazar; bu iki sayıyı çarpıp topladığında işin maliyetini daha başlamadan bilirsin.
Token, kelime ve karakter arasındaki fark
| Birim | Ne sayar? | Nerede kullanılır? |
|---|---|---|
| Karakter | Harf, rakam, boşluk | Meta açıklama ve reklam metni sınırları |
| Kelime | Boşlukla ayrılan birimler | İçerik uzunluğu planlaması |
| Token | Modelin metni böldüğü parçalar | Bağlam penceresi, API ücreti, yanıt sınırı |
Token hesabı, bir modelin cevap üretirken harcadığı işlem gücüyle de doğrudan ilişkilidir; bu aşamaya çıkarım denir ve maliyetin büyük kısmı burada oluşur.
Token kullanımını azaltmanın yolları
- Talimatı sabitle, veriyi değiştir. Her istekte uzun açıklamalar yazmak yerine kısa ve net bir talimat şablonu kullan.
- Gereksiz bağlamı çıkar. Modele tüm kataloğu değil, yalnızca ilgili ürünün bilgisini ver.
- Çıktı uzunluğunu sınırla. "En fazla 120 kelime" gibi bir sınır hem maliyeti hem düzenleme süresini düşürür.
- Göreve uygun model seç. Basit sınıflandırma işlerinde küçük ve ucuz modeller çoğu zaman yeterlidir.
- Önbellekten yararlan. Bazı sağlayıcılar tekrar eden istem başlangıçlarını daha düşük ücretle işler; sağlayıcının belgelerine bak.
Token hesabında yapılan hatalar
- Kelimeyi token sanmak: Türkçe metinlerde token sayısı kelime sayısından belirgin biçimde fazla çıkabilir.
- Yalnızca girdiyi hesaplamak: Çıktı token'ları çoğu modelde daha pahalıdır.
- Gizli token'ları unutmak: Sistem talimatları, sohbet geçmişi ve bazı modellerde düşünme adımları da token harcar.
- Tek modelin oranını genellemek: Her modelin tokenizasyon yöntemi farklıdır; aynı metin iki modelde farklı sayıda token eder.
Sıkça sorulan sorular
Token sayısını nasıl öğrenebilirim?
Model sağlayıcılarının çoğu, metni yapıştırıp token sayısını gösteren bir sayaç ya da API yanıtında kullanım bilgisi sunar. Tahmin yerine bu sayacı kullan.
Türkçe metinler neden daha çok token harcar?
Tokenizasyon sözlükleri ağırlıklı olarak İngilizce veriyle oluşturulduğu için Türkçenin ekli kelimeleri daha fazla parçaya bölünür. Bu, metni işleyen doğal dil işleme sistemlerinin genel bir özelliğidir.
Token'ın web sitemle ilgisi var mı?
Dolaylı olarak var. Yapay zeka sistemleri sayfanı okurken de metni token'lara böler; gereksiz tekrar ve dolgu içerik, asıl bilginin bağlam içinde yer kaplamasını zorlaştırır. Transformer tabanlı modellerin çalışma biçimi bu sınırı belirler.
Token'ın resmi açıklaması ve sayma yöntemleri için OpenAI: What are tokens and how to count them sayfasına bakabilirsin.
Yapay zeka sistemlerinin sayfaları hangi parçalarıyla okuduğunu ve alıntıladığını GEO rehberinde içerik yapısı başlığı altında işledim.
ChatGPT, Gemini ve Google AI Modu'nda markanızın doğru bilgiyle anılmasını ve kaynak gösterilmesini sağlayan, ölçülebilir GEO danışmanlığı.