Multimodal AI
Multimodal AI'yı ve bağlam farkındalığına sahip anlayış için metin ile görüntüyü nasıl entegre ettiğini keşfet. Ultralytics YOLO26'yı ve açık kelime dağarcıklı modelleri bugün kullanmayı öğren.
Çok modlu yapay zeka, aynı anda birden fazla farklı veri türünden veya "modaliteden" bilgi işlemek, yorumlamak ve sentezlemek üzere tasarlanmış gelişmiş bir yapay zeka (AI) sistemleri sınıfını ifade eder. Metin için Doğal Dil İşleme (NLP) veya görüntüler için Bilgisayarlı Görü (CV) gibi tek bir girdi kaynağında uzmanlaşan geleneksel tek modlu sistemlerin aksine, çok modlu yapay zeka çeşitli veri akışlarını entegre ederek insan algısını taklit eder. Bu entegrasyon; görsel verilerin (görüntüler, video), dilsel verilerle (metin, konuşma sesi) ve duyusal bilgilerle (LiDAR, radar, termal veriler) birleştirilmesini içerebilir. Bu modeller, bu birleşik girdilerden yararlanarak karmaşık gerçek dünya senaryolarını daha derin ve bağlamı daha iyi dikkate alan bir anlayışla ele alır ve Genel Yapay Zeka (AGI) sistemlerinin geniş yeteneklerine yaklaşır.
Çok Modlu Sistemler Nasıl Çalışır#
Çok modlu yapay zekanın temel gücü, farklı veri türlerini karşılaştırılabilecekleri ve birleştirilebilecekleri ortak bir matematiksel uzaya eşleme becerisinde yatar. Bu süreç genellikle üç temel aşamayı içerir: kodlama, hizalama ve füzyon.
-
Özellik Çıkarma: Uzmanlaşmış sinir ağları, temel örüntüleri belirlemek için her modaliteyi bağımsız olarak işler. Örneğin, bir Evrişimli Sinir Ağı (CNN) bir fotoğraftan görsel özellikleri çıkarırken, bir Transformer fotoğrafa eşlik eden açıklamayı işleyebilir.
-
Hizalama ve Gömme Vektörleri: Çıkarılan özellikler, yüksek boyutlu sayısal vektörlere dönüştürülür. Model, anlamsal olarak benzer kavramların (örneğin bir kedi görüntüsü ile "kedi" metin sözcüğünün) vektör uzayında birbirine yakın konumlanması için bu vektörleri hizalamayı öğrenir. Bu işlem genellikle karşılaştırmalı öğrenme gibi tekniklerle gerçekleştirilir; bu yöntem OpenAI's CLIP gibi modellerde yaygın olarak kullanılmıştır.
-
Veri Füzyonu: Sistem, hizalanmış verileri gelişmiş füzyon tekniklerini kullanarak birleştirir. Modern mimariler, bağlama bağlı olarak bir modalitenin diğerine göre önemini dinamik biçimde ağırlıklandırmak için dikkat mekanizmalarını kullanır. Böylece model, görüntü belirsiz olduğunda metne veya bunun tersine odaklanabilir.
Gerçek Dünya Uygulamaları#
Çok modlu yapay zeka, daha önce tek modlu sistemlerle mümkün olmayan yeteneklerin önünü açarak çeşitli sektörlerde yeniliği hızlandırdı.
- Görsel Soru Yanıtlama (VQA): Bu uygulamada kullanıcı, bir görüntüyü yapay zekaya sunabilir ve görüntü hakkında doğal dilde sorular sorabilir. Örneğin görme engelli bir kullanıcı kilerinin fotoğrafını yükleyip "Hâlâ makarnam kaldı mı?" diye sorabilir. Model, belirli bir yanıt sağlamak için görsel içeriği ve metin sorgusunu işler.
- Otonom Araçlar: Sürücüsüz araçlar, güvenli biçimde yol almak için kameralardan, LiDAR nokta bulutlarından ve radardan gelen verileri birleştirerek çok modlu girdilere büyük ölçüde dayanır. Bu yedeklilik, bir sensör arızalansa bile (örneğin güneş parlaması nedeniyle kameranın görüntüsü engellense) diğer sensörlerin Otomotiv Mühendisleri Derneği (SAE) tarafından tanımlanan güvenlik standartlarını koruyabilmesini sağlar.
- Sağlık Hizmetlerinde Tanı: Gelişmiş tıbbi yapay zeka sistemleri, yapılandırılmamış metin biçimindeki hasta geçmişi ve genetik verilerle birlikte tıbbi görüntü analizini (örneğin MRI veya X-ray) inceler. Bu kapsamlı bakış, doktorların daha doğru tanılar koymasına yardımcı olur ve Nature Digital Medicine dergisinde sıkça ele alınan bir konudur.
- Üretken Yapay Zekâ: Metin istemlerinden görüntüler oluşturan Stable Diffusion gibi araçlar, tamamen modelin dilsel açıklamalar ile görsel dokular arasındaki ilişkiyi anlama becerisine dayanır.
Ultralytics ile Açık Kelime Dağarcığı Tespiti#
Standart nesne dedektörleri önceden tanımlanmış kategori listelerine dayanırken YOLO-World gibi çok modlu yaklaşımlar, kullanıcıların açık kelime dağarcığı metin istemlerini kullanarak nesneleri tespit etmesine olanak tanır. Bu yaklaşım, Ultralytics ekosisteminde dilsel komutlarla görsel tanıma arasındaki boşluğu kapatır.
Aşağıdaki örnek, modelin özel metin girdilerine göre nesneleri tespit ettiği açık kelime dağarcığı tespitini gerçekleştirmek için ultralytics kitaplığının nasıl kullanılacağını gösterir:
from ultralytics import YOLOWorld
# Load a pretrained YOLO-World model (Multimodal: Text + Vision)
model = YOLOWorld("yolov8s-world.pt")
# Define custom text prompts (modalities) for the model to identify
model.set_classes(["person wearing a red hat", "blue backpack"])
# Run inference: The model aligns the text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show the results
results[0].show()İlişkili Terimleri Ayırt Etme#
Modern makine öğreniminin kapsamını anlamak için "Çok Modlu Yapay Zeka"yı ilgili kavramlardan ayırmak yararlıdır:
- Çok Modlu Öğrenme: Bu ifade, algoritmaları karma veri türleri üzerinde eğitme konusundaki akademik disiplini ve metodolojiyi ifade eder. "Çok Modlu Yapay Zeka" ise genellikle pratik uygulamayı veya ortaya çıkan sistemin kendisini ifade eder.
- Büyük Dil Modelleri (LLMs): Geleneksel LLMs tek modludur ve yalnızca metin verileriyle eğitilir. Ancak sektör, görüntüleri ve metni yerel olarak işleyebilen "Büyük Çok Modlu Modeller" (LMMs) yönünde ilerlemektedir; bu eğilim PyTorch ve TensorFlow gibi çerçeveler tarafından desteklenmektedir.
- Uzmanlaşmış Görü Modelleri: En gelişmiş Ultralytics YOLO26 gibi modeller, görsel görevlerde son derece uzmanlaşmış araçlardır. Genel amaçlı çok modlu bir model bir sahneyi genel hatlarıyla açıklayabilirken, uzmanlaşmış modeller yüksek hızlı ve hassas nesne tespiti ile uç donanım üzerinde gerçek zamanlı işlemede başarılıdır.
Geleceğe Bakış#
Çok modlu yapay zekanın gelişimi, daha güçlü akıl yürütme yeteneklerine sahip sistemlere işaret ediyor. Bu modeller, dili görsel ve fiziksel gerçekliğe başarıyla dayandırarak istatistiksel korelasyonun ötesine geçip gerçek bir anlayışa doğru ilerliyor. Google DeepMind ve Temel Modeller Araştırmaları için Stanford Merkezi gibi kurumların araştırmaları, makinelerin karmaşık ortamları nasıl algıladığının sınırlarını genişletmeye devam ediyor.
Ultralytics olarak bu gelişmeleri Ultralytics Platformuna entegre ediyor; kullanıcıların verileri yönetmesini, modelleri eğitmesini ve mevcut modalitelerin tüm yelpazesinden yararlanan çözümleri dağıtmasını sağlıyoruz. Bunu, YOLO26 hızını çok modlu girdilerin esnekliğiyle birleştirerek gerçekleştiriyoruz.









