Multi-Modal Model
Çok modlu modellerin metin, görüntü ve sesi nasıl entegre ettiğini keşfet. Ultralytics YOLO26 gibi mimariler hakkında bilgi edin ve Ultralytics Platform üzerinde görüntü AI'sını dağıt.
Çok modlu model, aynı anda birden fazla farklı veri türündeki veya "modalitedeki" bilgileri işleyebilen, yorumlayabilen ve bütünleştirebilen gelişmiş bir yapay zekâ (AI) sistemi türüdür. Metin için Doğal Dil İşleme (NLP) veya görüntüler için Bilgisayarlı Görü (CV) gibi tek bir alanda uzmanlaşan geleneksel tek modlu sistemlerin aksine, çok modlu modeller görsel, işitsel ve dilsel ipuçlarını birlikte sentezleyerek insan algısını taklit etmeyi amaçlar. Bu birleşim, modelin dünya hakkında kapsamlı bir anlayış geliştirmesini ve görsel bir sahne ile sözlü bir açıklama arasında karmaşık ilişkiler kurmasını sağlar. Bu yetenekler, Yapay Genel Zekâ'ya (AGI) ulaşma yolunda temel adımlar olarak kabul edilir.
Temel Mekanizmalar ve Mimari#
Çok modlu bir modelin etkinliği, farklı veri türlerini ortak bir anlamsal uzaya eşleme becerisine dayanır. Bu süreç genellikle, girdi verilerinin temel anlamını yakalayan sayısal temsiller olan gömme vektörlerinin oluşturulmasıyla başlar. Model, altyazılı videolar gibi eşleştirilmiş örneklerden oluşan dev veri kümeleriyle eğitilerek bir "kedi" görüntüsünün vektör temsilini "kedi" kelimesinin metin gömmesiyle hizalamayı öğrenir.
Bu entegrasyonu mümkün kılan birkaç temel mimari kavram vardır:
- Transformer Mimarisi: Çok modlu sistemlerin çoğu, farklı girdi bölümlerinin önemini dinamik olarak ağırlıklandırmak için dikkat mekanizmalarını kullanan Transformer'ları kullanır. Bu sayede model, bir metin istemindeki ilgili kelimelere karşılık gelen belirli görüntü bölgelerine odaklanabilir. Bu kavram, çığır açan "İhtiyacın Olan Tek Şey Dikkat" araştırma makalesinde ayrıntılı olarak ele alınmıştır.
- Veri Füzyonu: Bu, farklı kaynaklardan gelen bilgileri birleştirme stratejisidir. Sensör füzyonu, ham verilerin birleştirilmesiyle erken aşamada veya ayrı alt modellerin kararlarının birleştirilmesiyle geç aşamada gerçekleştirilebilir. PyTorch gibi modern çerçeveler, bu karmaşık işlem hatlarını oluşturmak için gereken esnekliği sağlar.
- Kontrastif Öğrenme: OpenAI's CLIP gibi modellerin kullandığı teknikler, vektör uzayında eşleşen metin-görüntü çiftleri arasındaki mesafeyi azaltırken eşleşmeyen çiftler arasındaki mesafeyi artırmak üzere sistemi eğitir.
Gerçek Dünya Uygulamaları#
Çok modlu modeller, daha önce tek modlu sistemlerin gerçekleştirmesinin mümkün olmadığı yeteneklerin önünü açmıştır.
- Görsel Soru Yanıtlama (VQA): Bu sistemler, kullanıcıların bir görüntü hakkında doğal dilde sorular sormasını sağlar. Örneğin görme engelli bir kullanıcı, kilerin fotoğrafını yükleyip "Üst rafta bir kutu çorba var mı?" diye sorabilir. Model, öğeleri belirlemek için nesne algılamayı, sorguyu anlamak içinse NLP'yi kullanarak yararlı bir yanıt verir.
- Otonom Araçlar: Sürücüsüz otomobiller, gerçek zamanlı çok modlu aracılar olarak çalışır. Kameralardan gelen görsel akışları, LiDAR'dan gelen derinlik bilgilerini ve radardan gelen hız verilerini birleştirirler. Bu yedeklilik, sensörlerden biri hava koşulları nedeniyle engellendiğinde diğerlerinin yol güvenliğini sürdürmesini sağlar.
- Açık Kelime Dağarcıklı Algılama: Ultralytics YOLO-World gibi modeller, sabit bir sınıf listesi yerine rastgele metin istemlerini kullanarak nesneleri algılamana olanak tanır. Bu, dilsel komutlarla görsel tanıma arasındaki boşluğu kapatır.
Örnek: Açık Kelime Dağarcıklı Algılama#
Aşağıdaki örnek, modelin bir görüntüdeki nesneleri belirlemek için metin istemlerini yorumladığı açık kelime dağarcıklı algılamayı gerçekleştirmek üzere ultralytics kitaplığının nasıl kullanılacağını gösterir:
from ultralytics import YOLOWorld
# Load a pre-trained YOLO-World model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes using natural language text prompts
model.set_classes(["person wearing a hat", "blue backpack"])
# Run inference: The model aligns text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Visualize the detection results
results[0].show()İlgili Terimlerden Farkları#
"Çok Modlu Model" ile AI sözlüğündeki ilgili kavramları birbirinden ayırmak yararlıdır:
- Çok Modlu Öğrenme: Bu terim, bu sistemleri eğitmek için kullanılan süreci ve makine öğrenmesi (ML) tekniklerini ifade eder. Çok modlu model, bu öğrenme sürecinin ortaya çıkardığı yapıt veya yazılım ürünüdür.
- Büyük Dil Modelleri (LLMs): Geleneksel LLM'ler yalnızca metin işler. Birçoğu Görü-Dil Modellerine (VLMs) dönüşüyor olsa da standart bir LLM tek modludur.
- Temel Modeller: Bu, birçok alt göreve uyarlanabilen büyük ölçekli modelleri tanımlayan daha geniş bir kategoridir. Çok modlu bir model çoğu zaman temel model olsa da her temel model birden fazla modaliteyi işleyemez.
Çok Modlu AI'ın Geleceği#
Alan, sürekli ses, video ve metin akışlarını gerçek zamanlı olarak işleyebilen sistemlere doğru hızla ilerliyor. Google DeepMind gibi kuruluşların araştırmaları, makine algısının sınırlarını zorlamaya devam ediyor. Ultralytics olarak bu ekosistemi, YOLO26 gibi yüksek performanslı görsel omurgalarla destekliyoruz. 2026'da kullanıma sunulan YOLO26, örnek segmentasyonu gibi görevlerde üstün hız ve doğruluk sunarak daha büyük çok modlu işlem hatlarında verimli bir görsel bileşen görevi görür. Geliştiriciler, bu karmaşık iş akışlarının verilerini, eğitimini ve dağıtımını birleşik Ultralytics Platformu kullanarak yönetebilir.









