Multi-Modal Model
Çok modlu modellerin metin, görüntü ve sesi nasıl entegre ettiğini keşfet. Ultralytics YOLO26 gibi mimariler hakkında bilgi edin ve Ultralytics Platformunda görüntü yapay zekasını dağıt.
Çok modlu model, birden fazla farklı veri türünden veya "modaliteden" gelen bilgileri aynı anda işleme, yorumlama ve entegre etme yeteneğine sahip gelişmiş bir yapay zeka (AI) sistemi türüdür. Geleneksel tek modlu sistemler metin için Doğal Dil İşleme (NLP) veya görseller için Bilgisayarlı Görü (CV) gibi tek bir alanda uzmanlaşırken; çok modlu modeller görsel, işitsel ve dilsel ipuçlarını birlikte sentezleyerek insan algısını taklit etmeyi amaçlar. Bu yakınsama, modelin dünya hakkında kapsamlı bir anlayış geliştirmesini sağlayarak görsel bir sahne ile sözlü bir açıklama arasında karmaşık korelasyonlar kurmasına olanak tanır. Bu yetenekler, Yapay Genel Zeka (AGI) elde etme yolunda temel adımlar olarak kabul edilir.
Temel Mekanizmalar ve Mimari#
Çok modlu bir modelin etkinliği, çeşitli veri türlerini ortak bir anlamsal uzaya eşleme yeteneğine dayanır. Bu süreç genellikle, gird verilerinin temel anlamını yakalayan sayısal temsiller olan gömdürmelerin (embeddings) oluşturulmasıyla başlar. Model, altyazılı videolar gibi eşleştirilmiş örneklerden oluşan devasa veri kümeleri üzerinde eğitim alarak, bir "kedi" görselinin vektör temsilini "kedi" kelimesinin metin gömdürmesiyle hizalamayı öğrenir.
Bu entegrasyonu mümkün kılan birkaç temel mimari kavram şunlardır:
- Transformer Mimarisi: Birçok çok modlu sistem, farklı girdi kısımlarının önemini dinamik olarak tartmak için dikkat mekanizmalarını kullanan transformer'lardan yararlanır. Bu, çığır açan araştırma makalesi "Attention Is All You Need" içinde detaylandırıldığı gibi, bir modelin metin komutundaki ilgili kelimelere karşılık gelen belirli görsel bölgelerine odaklanmasını sağlar.
- Veri Füzyonu: Bu, farklı kaynaklardaki bilgileri birleştirme stratejisini ifade eder. Sensör füzyonu, hammaddeleri erken bir aşamada birleştirerek veya ayrı alt modellerin kararlarını geç bir aşamada birleştirerek gerçekleşebilir. PyTorch gibi modern çerçeveler, bu karmaşık işlem hatlarını (pipeline) oluşturmak için gereken esnekliği sağlar.
- Karşıtsal Öğrenme: OpenAI'nin CLIP gibi modeller tarafından kullanılan teknikler, sistemin vektör uzayında eşleşen metin-görsel çiftleri arasındaki mesafeyi en aza indirmesini ve eşleşmeyen çiftler arasındaki mesafeyi en üst düzeye çıkarmasını sağlar.
Gerçek Dünya Uygulamaları#
Çok modlu modeller, tek modlu sistemlerin daha önce elde etmesinin imkansız olduğu yeteneklerin kilidini açmıştır.
- Görsel Soru Cevaplama (VQA): Bu sistemler, kullanıcıların bir görsel hakkında doğal dilde sorular sormasına olanak tanır. Örneğin, görme engelli bir kullanıcı kiler fotoğrafı yükleyip "En üst rafta bir kutu çorba var mı?" diye sorabilir. Model, öğeleri tanımlamak için nesne algılamayı ve sorguyu anlamak için NLP'yi kullanarak yararlı bir yanıt sağlar.
- Otonom Araçlar: Kendi kendine giden arabalar gerçek zamanlı çok modlu aracılar olarak işlev görür. Kameralardan gelen görsel akışları, LiDAR'dan gelen derinlik bilgilerini ve radardan gelen hız verilerini birleştirirler. Bu yedeklilik, bir sensör hava koşulları nedeniyle engellendiğinde diğerlerinin yol güvenliğini koruyabilmesini sağlar.
- Açık Sözcük Dağarcığı Algılama (Open-Vocabulary Detection): Ultralytics YOLO-World gibi modeller, kullanıcıların sabit bir sınıf listesi yerine rastgele metin komutları kullanarak nesneleri algılamasına olanak tanır. Bu, dilsel komutlar ile görsel tanıma arasındaki boşluğu doldurur.
Örnek: Açık Sözlüklü Algılama#
Aşağıdaki örnek, modelin bir görseldeki nesneleri tanımlamak için metin komutlarını yorumladığı açık sözcük dağarcığı algılamasını gerçekleştirmek üzere ultralytics kütüphanesinin nasıl kullanılacağını göstermektedir:
from ultralytics import YOLOWorld
# Load a pre-trained YOLO-World model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes using natural language text prompts
model.set_classes(["person wearing a hat", "blue backpack"])
# Run inference: The model aligns text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Visualize the detection results
results[0].show()İlgili Terimlerden Farklar#
"Çok Modlu Model" kavramını YZ sözlüğündeki ilgili terimlerden ayırmak faydalıdır:
- Çok Modlu Öğrenme: Bu, bu sistemleri eğitmek için kullanılan süreci ve makine öğrenimi (ML) tekniklerini ifade eder. Çok modlu model ise bu öğrenme sürecinin ortaya çıkardığı çıktı veya yazılım ürünüdür.
- Büyük Dil Modelleri (LLM'ler): Geleneksel LLM'ler yalnızca metin işler. Birçoğu Görme-Dil Modellerine (VLM) evrilmekte olsa da standart bir LLM tek modludur.
- Temel Modeller (Foundation Models): Bu, birçok alt göreve uyarlanabilen büyük ölçekli modelleri tanımlayan daha geniş bir kategoridir. Çok modlu bir model genellikle temel bir model olsa da tüm temel modeller birden fazla modaliteyi işlemez.
Çok Modlu YZ'nin Geleceği#
Alan, gerçek zamanlı olarak sürekli ses, video ve metin akışlarını işleyebilen sistemlere doğru hızla ilerlemektedir. Google DeepMind gibi kuruluşlardan gelen araştırmalar makine algısının sınırlarını zorlamaya devam ediyor. Ultralytics olarak, YOLO26 gibi yüksek performanslı görü tabanlarıyla bu ekosistemi destekliyoruz. 2026 yılında yayınlanan YOLO26, daha büyük çok modlu işlem hatlarında verimli bir görsel bileşen olarak görev yaparak örnek segmentasyonu gibi görevler için üstün hız ve doğruluk sunar. Geliştiriciler, birleştirilmiş Ultralytics Platform kullanarak bu karmaşık iş akışlarının verilerini, eğitimini ve dağıtımını yönetebilir.






