← Sözlüğe Dön Yapay Zeka & GEO

Multimodal AI Nedir?

Çok Modlu Yapay Zeka

Çok modlu yapay zeka (multimodal AI), metin, görsel, ses ve video gibi farklı veri türlerini aynı anda anlayabilen, bunlar arasında bağlantı kurabilen ve farklı türlerde çıktı üretebilen yapay zeka sistemidir.

Yazan: Adem Demir Son güncelleme:

Multimodal AI (Çok Modlu Yapay Zeka) = Metin, görsel, ses ve video gibi birden fazla veri türünü aynı model içinde işleyen ve bunlar arasında anlam bağı kuran yapay zeka · girdi örnekleri: fotoğraf + soru, ses kaydı, ekran görüntüsü, video · çıktı örnekleri: metin açıklama, görsel, sesli yanıt · tanınmış örnekler: GPT-4o, Gemini ailesi, Claude'un görsel okuma özelliği · aramadaki karşılığı: kamerayla arama, görsel üzerinden soru sorma · işletmeye etkisi: ürün görselleri ve videolar da yapay zekanın okuduğu içerik hâline gelir

Çok modlu yapay zeka neyi farklı yapar?

İlk nesil dil modelleri yalnızca metin okuyup metin yazabiliyordu. Çok modlu modeller ise bir fotoğrafa bakıp içindekileri tarif edebilir, bir grafiği yorumlayabilir, bir ses kaydını anlayıp sesli yanıt verebilir. Kullanıcı bir elbisenin fotoğrafını çekip "Bunu hangi ayakkabıyla kombinlerim?" diye sorduğunda model, görseldeki rengi, kumaşı ve kesimi metin sorusuyla birlikte değerlendirir.

Bu yetenek 2023 ve 2024'te hızla yaygınlaştı. Google, Gemini ailesini baştan çok modlu olarak tasarladığını açıkladı; OpenAI 2024'te metin, görsel ve sesi tek modelde birleştiren GPT-4o'yu tanıttı. Bugün büyük yapay zeka asistanlarının çoğu görsel yükleme ve sesli konuşma özelliği sunuyor.

Sayılarla bir örnek: 3.000 ürünlü bir ev tekstili mağazasında ürünlerin yüzde 40'ının açıklamasında renk ve desen bilgisi eksik olsun. Çok modlu bir model, ürün fotoğraflarından "bej zemin üzerine lacivert geometrik desen" gibi açıklamalar çıkararak bu 1.200 ürünün eksik alanlarını taslak olarak doldurabilir. Editör yalnızca modelin emin olmadığını belirttiği ürünleri kontrol eder.

Tek modlu ve çok modlu yapay zeka karşılaştırması

ÖzellikTek modlu modelÇok modlu model
GirdiYalnızca metin (ya da yalnızca görsel)Metin, görsel, ses, video birlikte
E-ticaret kullanımıÜrün açıklaması yazmaFotoğraftan özellik çıkarma, görsel arama
Arama kullanımıYazılı sorguKamerayla arama, ekran görüntüsünden soru
İçerik üretimiMetinMetin, ses ve difüzyon modelleriyle görsel

Çok modlu modellerin görsel ve sesi anlayabilmesi, çok katmanlı derin öğrenme yapılarının farklı veri türlerini ortak bir anlam alanında temsil edebilmesine dayanır.

Görsel içeriği çok modlu aramaya hazırlamak

  1. Net ve bilgilendirici görseller kullan. Ürünün her önemli detayını gösteren, sade arka planlı çekimler yapay zekanın ürünü doğru tanımasını kolaylaştırır.
  2. Görseli metinle destekle. Alternatif metin, dosya adı ve görsel çevresindeki açıklama, görselin ne anlattığını netleştirir. Bu adımlar görsel optimizasyonunun da temelidir.
  3. Metin ile görsel tutarlı olsun. Açıklamada "lacivert" yazan ürün fotoğrafta siyah görünüyorsa model iki bilgi arasında kararsız kalır.
  4. Videolara altyazı ve özet ekle. Konuşulan içeriğin yazılı karşılığı, videonun anlaşılmasını ve alıntılanmasını kolaylaştırır.
  5. Ürün verisini eksiksiz tut. Renk, malzeme ve ölçü alanları yapılandırılmış veride de yer almalı.

Çok modlu yapay zekada dikkat edilecekler

  • Görsel yanılgılar: Model ışık ya da açı yüzünden rengi, malzemeyi veya ölçüyü yanlış tahmin edebilir.
  • Görseldeki yazılar: Etiket ve ambalaj yazıları okunabilir; hatalı bir etiket, hatalı bir bilgiye dönüşebilir.
  • Kişisel veri: İnsan yüzü, belge ya da ekran görüntüsü içeren dosyaları yüklerken gizlilik kurallarına dikkat et.
  • Telif: Başkasına ait görselleri modelle işlemek ya da benzerlerini üretmek hukuki risk taşıyabilir.

Sıkça sorulan sorular

Çok modlu yapay zeka e-ticarette ne işe yarar?

Ürün fotoğraflarından özellik çıkarma, görselle benzer ürün bulma, videolardan içerik özeti oluşturma ve müşterinin fotoğrafla sorduğu sorulara yanıt verme gibi işlerde kullanılır. Ürün görseli optimizasyonu bu yüzden yalnızca dönüşüm için değil, yapay zeka görünürlüğü için de önemlidir.

Çok modlu model ile görsel üretim modeli aynı mı?

Her zaman değil. Bazı modeller görseli yalnızca anlar, bazıları üretir, bazıları ikisini birden yapar.

Google aramada çok modlu yapay zeka kullanılıyor mu?

Evet. Kamerayla arama ve görsel üzerinden soru sorma özellikleri çok modlu modellere dayanır; AI Overviews gibi yapay zeka yanıtları da bu tür sorgularda görünebilir.

Çok modlu yapay zekanın kullanım alanları için Google Cloud: Multimodal AI sayfası iyi bir özet sunar.

Ürün görsellerinin ve videoların yapay zeka yanıtlarında nasıl kullanıldığını GEO rehberinin e-ticaret bölümünde örneklerle anlattım.

Çok modlu yapay zeka çağında görsel de bir metindir: ne kadar net ve tutarlıysa o kadar iyi okunur.
GEO Danışmanlığı

ChatGPT, Gemini ve Google AI Modu'nda markanızın doğru bilgiyle anılmasını ve kaynak gösterilmesini sağlayan, ölçülebilir GEO danışmanlığı.

Hizmeti İncele
Adem Demir
Yazar

Adem Demir

10+ yıldır e-ticaret markalarının performans pazarlamasını yönetiyorum. Sözlükteki her maddeyi bu sahadaki deneyimimle yazıyor ve düzenli olarak güncelliyorum.

Ücretsiz Ön Görüşme

Reklam bütçeniz harcanıyor, kâr nerede?

E-ticaret kurulumundan kârlı ölçeklemeye — hesabınızı denetleyip nerede bütçe kaybettiğinizi netçe gösteriyorum. 30 dakikalık ön görüşme ücretsiz.

Ücretsiz Ön Görüşme Planla 10+ yıl deneyim · Satış baskısı yok, net teşhis var