Multimodal RAG
Metin, görüntü ve videoyu işlemek için Çok Modlu RAG'ı keşfet. Ultralytics YOLO26'nın daha doğru, bağlama duyarlı yanıtlar için yapay zeka alma iş akışlarını nasıl geliştirdiğini öğren.
Çok Modüllü Bilgi Getirme Destekli Üretim (Multimodal RAG), geleneksel RAG sistemlerini metin, görüntü, video ve ses gibi çeşitli veri türlerini işleyecek ve bunlar üzerinde akıl yürütecek şekilde genişleten gelişmiş bir yapay zeka (AI) çerçevesidir. Standart Bilgi Getirme Destekli Üretim (RAG) ilgili metinsel belgeleri getirerek bir Büyük Dil Modülünün (LLM) doğruluğunu artırırken, Multimodal RAG karışık medya bilgi tabanından bağlam getirerek modellerin "görmesini" ve "duymasını" sağlar. Bu yaklaşım, modelin üretimini somut görsel veya işitsel kanıtlara dayandırarak LLM'lerdeki halüsinasyonları önemli ölçüde azaltır ve özel veri setleri üzerinde görsel soru yanıtlama gibi karmaşık görevleri mümkün kılar. Çok modüllü öğrenmeden yararlanan bu sistemler, kapsamlı ve bağlama duyarlı yanıtlar üretebilmek için kullanıcının sorgusundan (örneğin metin) ve getirilen varlıklardan (örneğin bir diyagram veya gözetim karesi) gelen bilgileri sentezleyebilir.
Çok Modlu RAG Nasıl Çalışır?#
Bir Multimodal RAG sisteminin mimarisi genellikle standart "Getir ve Üret" (Retrieve-then-Generate) boru hattını yansıtır ancak bunu metin dışı veriler için uyarlar. Bu süreç büyük ölçüde vektör veritabanlarına ve paylaşılan anlamsal alanlara dayanır.
-
İndeksleme: PDF'ler, videolar, slayt gösterileri gibi çeşitli kaynaklardaki veriler işlenir. Öznitelik çıkarma modelleri bu farklı modaliteleri gömme (embedding) olarak bilinen yüksek boyutlu sayısal vektörlere dönüştürür. Örneğin, OpenAI'nin CLIP modeli gibi bir model, bir köpek resmi ile "köpek" kelimesinin matematiksel olarak yakın olması için görüntü ve metin gömmelerini aynı hizaya getirir.
-
Bilgi Getirme (Retrieval): Bir kullanıcı bir soru yönelttiğinde (örneğin, "Bu devre kartındaki kusuru bana göster"), sistem, sorgunun niyetine uyan en alakalı görüntüleri veya video kliplerini bulmak için vektör veritabanında anlamsal arama gerçekleştirir.
-
Üretim: Getirilen görsel bağlam bir Görsel-Dil Modeline (VLM) beslenir. VLM, nihai bir yanıt üretmek için hem kullanıcının metin komutunu hem de getirilen görüntü özelliklerini işleyerek verilerle etkili bir şekilde "sohbet eder".
Gerçek Dünya Uygulamaları#
Multimodal RAG, yapay zeka ajanlarının görsel veriler aracılığıyla fiziksel dünyayla etkileşime girmesini sağlayarak endüstrileri dönüştürmektedir.
- Endüstriyel Bakım ve Üretim: Üretimde yapay zeka alanında teknisyenler, bozuk bir makine parçasının fotoğrafıyla bir sistemi sorgulayabilir. Multimodal RAG sistemi, onarım sürecine rehberlik etmek için benzer geçmiş bakım günlüklerini, teknik şemaları ve video eğitimlerini getirir. Bu, duruş süresini azaltır ve uzman bilgisini demokratikleştirir.
- Perakende ve E-Ticaret Keşfi: Perakendede yapay zeka kullanan uygulamalar, müşterilerin beğendikleri bir kıyafetin görüntüsünü yüklemesine olanak tanır. Sistem, mevcut envanterden görsel olarak benzer öğeleri getirir ve stil tavsiyesi veya ürün karşılaştırmaları üreterek son derece kişiselleştirilmiş bir alışveriş deneyimi yaratır.
İlgili Terimleri Ayırt Etme#
Çok Modlu RAG'in özel nişini anlamak için onu ilgili kavramlardan ayırt etmek yararlıdır:
- Multimodal RAG ile Çok Modüllü Model Karşılaştırması: Çok modüllü bir model (GPT-4o veya Gemini gibi) yanıtı oluşturur. Multimodal RAG, bu modele eğitilmediği harici, özel verileri (görseller, belgeler) besleyen mimaridir. Model motordur; RAG ise yakıt hattıdır.
- Multimodal RAG ile İnce Ayar (Fine-Tuning) Karşılaştırması: İnce ayar, yeni bir görevi veya stili öğrenmek için model ağırlıklarını kalıcı olarak günceller. RAG, çıkarım anında geçici bilgi sağlar. Sık yeniden eğitimin pratik olmadığı dinamik veriler (örneğin günlük envanter) için RAG tercih edilir.
Ultralytics ile Uygulama#
Geliştiriciler, Ultralytics YOLO kullanarak bir Multimodal RAG boru hattının bilgi getirme bileşenini oluşturabilir. Görüntüler içindeki nesneleri tespit edip sınıflandırarak YOLO, tabanlı getirme için indekslenebilecek veya bir VLM için ilgili görüntü bölgelerini kırpmak üzere kullanılabilecek yapılı meta veriler sağlar. Ultralytics Platform, belirli alanınız için çok önemli olan özel nesneleri tanımak üzere bu özelleştirilmiş vizyon modellerini eğitmenizi basitleştirir.
Aşağıdaki örnek, bir görüntüden görsel bağlamı (tespit edilen nesneler) çıkarmak için YOLO26 kullanımını göstermektedir; bu bağlam daha sonra bir RAG iş akışının parçası olarak bir LLM'e aktarılabilir.
from ultralytics import YOLO
# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]
print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, personDaha Fazla Okuma ve Kaynaklar#
- LangChain Belgeleri: Çok modüllü desteğin yanı sıra bilgi getirme boru hatları oluşturmaya yönelik kapsamlı bir kılavuz.
- LlamaIndex Çok Modüllü Kılavuzu: LLM'ler için karmaşık veri türlerini indeksleme ve getirme hakkında ayrıntılı belgeler.
- Google Cloud Vertex AI Araması: Ölçeklenebilir RAG uygulamaları oluşturmak için kurumsal düzeyde vektör arama yetenekleri.
- Ultralytics Çözümleri: Bilgisayarlı görü'nün çeşitli endüstrilerdeki daha geniş yapay zeka sistemleriyle nasıl entegre olduğunu keşfedin.






