Multimodal RAG
Metin, görüntü ve videoyu işlemek için Multimodal RAG'ı keşfet. Ultralytics YOLO26'nın daha doğru ve bağlam farkındalığına sahip yanıtlar için AI erişim işlem hatlarını nasıl geliştirdiğini öğren.
Çok Modlu Getirim Artırılmış Üretim (Multimodal RAG), metin, görüntü, video ve ses gibi çeşitli veri türlerini işlemek ve bunlar arasında akıl yürütmek için geleneksel RAG sistemlerini genişleten gelişmiş bir yapay zekâ (AI) çerçevesidir. Standart Getirim Artırılmış Üretim (RAG), ilgili metin belgelerini getirerek bir Büyük Dil Modeli (LLM)'nin doğruluğunu artırırken Çok Modlu RAG, karma medya içeren bir bilgi tabanından bağlam getirerek modellerin "görmesini" ve "duymasını" sağlar. Bu yaklaşım, modelin üretimini somut görsel veya işitsel kanıtlara dayandırarak LLM'lerdeki halüsinasyonları önemli ölçüde azaltır ve özel veri kümeleri üzerinde görsel soru yanıtlama gibi karmaşık görevleri mümkün kılar. Çok modlu öğrenmeden yararlanan bu sistemler, kapsamlı ve bağlamın farkında olan yanıtlar üretmek için kullanıcının sorgusundaki (ör. metin) ve getirilen varlıklardaki (ör. diyagram veya gözetim karesi) bilgileri bir araya getirebilir.
Çok Modlu RAG Nasıl Çalışır?#
Çok Modlu RAG sisteminin mimarisi genellikle standart "Getir, ardından Üret" işlem hattını yansıtır, ancak bunu metin dışı verilere uyarlar. Bu süreç büyük ölçüde vektör veritabanlarına ve ortak anlamsal uzaylara dayanır.
-
Dizinleme: Çeşitli kaynaklardan (PDF'ler, videolar, slayt desteleri) alınan veriler işlenir. Özellik çıkarma modelleri, bu farklı kipleri gömme olarak bilinen yüksek boyutlu sayısal vektörlere dönüştürür. Örneğin OpenAI'ın CLIP'i gibi bir model, görüntü ve metin gömmelerini hizalayarak bir köpek resmi ile "köpek" kelimesinin matematiksel olarak birbirine yakın olmasını sağlar.
-
Getirim: Kullanıcı bir soru sorduğunda (ör. "Bu devre kartındaki kusuru bana göster"), sistem sorgunun amacına uyan en alakalı görüntüleri veya video kliplerini bulmak için vektör veritabanında anlamsal arama gerçekleştirir.
-
Üretim: Getirilen görsel bağlam bir Görsel-Dil Modeline (VLM) aktarılır. VLM, nihai yanıtı üretmek için hem kullanıcının metin istemini hem de getirilen görüntü özelliklerini işler ve verilerle etkili bir şekilde "sohbet eder".
Gerçek Dünya Uygulamaları#
Çok Modlu RAG, AI aracılarına görsel veriler aracılığıyla fiziksel dünyayla etkileşim kurma olanağı sağlayarak endüstrileri dönüştürüyor.
- Endüstriyel Bakım ve Üretim: Üretimde AI kullanan teknisyenler, arızalı bir makine parçasının fotoğrafıyla sisteme sorgu gönderebilir. Çok Modlu RAG sistemi, onarım sürecine rehberlik etmek için benzer geçmiş bakım kayıtlarını, teknik şemaları ve video eğitimlerini getirir. Bu, duruş süresini azaltır ve uzman bilgisini herkes için erişilebilir hâle getirir.
- Perakende ve E-Ticarette Keşif: Perakendede AI kullanan uygulamalar, müşterilerin beğendikleri bir kıyafetin görüntüsünü yüklemesine olanak tanır. Sistem, mevcut envanterden görsel olarak benzer ürünleri getirir ve stil önerileri veya ürün karşılaştırmaları oluşturarak son derece kişiselleştirilmiş bir alışveriş deneyimi sunar.
İlgili Terimleri Birbirinden Ayırma#
Çok Modlu RAG'in kendine özgü alanını anlamak için onu ilişkili kavramlardan ayırmak yararlıdır:
- Çok Modlu RAG ile Çok Modlu Model Karşılaştırması: Yanıtı çok modlu bir model (GPT-4o veya Gemini gibi) oluşturur. Çok Modlu RAG ise bu modele, eğitiminde kullanılmamış harici ve özel verileri (görüntüler, belgeler) sağlayan mimaridir. Model motordur; RAG yakıt hattıdır.
- Çok Modlu RAG ile İnce Ayar Karşılaştırması: İnce ayar, yeni bir görevi veya üslubu öğrenmesi için model ağırlıklarını kalıcı olarak günceller. RAG, çıkarım sırasında geçici bilgi sağlar. Sık yeniden eğitimin pratik olmadığı dinamik veriler (ör. günlük envanter) için RAG tercih edilir.
Ultralytics ile Uygulama#
Geliştiriciler, Ultralytics YOLO kullanarak Çok Modlu RAG işlem hattının getirim bileşenini oluşturabilir. YOLO, görüntülerdeki nesneleri algılayıp sınıflandırarak metin tabanlı getirim için dizinlenebilecek veya bir VLM için ilgili görüntü bölgelerini kırpmada kullanılabilecek yapılandırılmış meta veriler sağlar. Ultralytics Platformu, özel alanın için kritik olan özel nesneleri tanıyacak bu uzmanlaşmış görme modellerinin eğitimini kolaylaştırır.
Aşağıdaki örnek, bir görüntüden görsel bağlamı (algılanan nesneleri) çıkarmak için YOLO26 kullanımını gösterir; bu bağlam daha sonra bir RAG iş akışının parçası olarak bir LLM'e aktarılabilir.
from ultralytics import YOLO
# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]
print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, personİleri Okuma ve Kaynaklar#
- LangChain Belgeleri: Çok modlu destek de dâhil olmak üzere getirim işlem hatları oluşturmaya yönelik kapsamlı bir kılavuz.
- LlamaIndex Çok Modlu Kılavuzu: LLM'ler için karmaşık veri türlerini dizinleme ve getirmeye ilişkin ayrıntılı belgeler.
- Google Cloud Vertex AI Search: Ölçeklenebilir RAG uygulamaları oluşturmak için kurumsal düzeyde vektör arama özellikleri.
- Ultralytics Çözümleri: Bilgisayarlı görmenin çeşitli sektörlerde daha geniş AI sistemleriyle nasıl bütünleştiğini keşfet.









