Multimodal RAG
Erkunde multimodales RAG zur Verarbeitung von Text, Bildern und Videos. Erfahre, wie Ultralytics YOLO26 KI-Retrieval-Pipelines für genauere, kontextbewusste Antworten verbessert.
Multimodal Retrieval Augmented Generation (Multimodal RAG) ist ein fortgeschrittenes künstliche Intelligenz (KI)-Framework, das herkömmliche RAG-Systeme erweitert, um verschiedenste Datentypen wie Text, Bilder, Videos und Audio zu verarbeiten und zu analysieren. Während Standard-Retrieval Augmented Generation (RAG) die Genauigkeit eines Large Language Model (LLM) durch den Abruf relevanter Textdokumente verbessert, versetzt Multimodal RAG Modelle durch den Abruf von Kontext aus einer Mixed-Media-Wissensbasis in die Lage zu "sehen" und zu "hören". Dieser Ansatz stützt die Generierung des Modells auf konkrete visuelle oder auditive Beweise, reduziert Halluzinationen in LLMs erheblich und ermöglicht komplexe Aufgaben wie die visuelle Beantwortung von Fragen zu privaten Datensätzen. Durch die Nutzung von multi-modalem Lernen können diese Systeme Informationen aus einer Benutzeranfrage (z. B. Text) und abgerufenen Elementen (z. B. einem Diagramm oder einem Überwachungsframe) synthetisieren, um umfassende, kontextbewusste Antworten zu liefern.
So funktioniert multimodale RAG#
Die Architektur eines Multimodal RAG-Systems spiegelt typischerweise die standardmäßige "Retrieve-then-Generate"-Pipeline wider, passt sie jedoch für nicht-textuelle Daten an. Dieser Prozess stützt sich stark auf Vektordatenbanken und gemeinsame semantische Räume.
-
Indizierung: Daten aus verschiedenen Quellen – PDFs, Videos, Präsentationen – werden verarbeitet. Feature-Extraktion-Modelle konvertieren diese unterschiedlichen Modalitäten in hochdimensionale numerische Vektoren, die als Embeddings bezeichnet werden. Ein Modell wie OpenAI's CLIP gleicht beispielsweise Bild- und Text-Embeddings so ab, dass ein Bild eines Hundes und das Wort „Hund“ mathematisch nah beieinander liegen.
-
Abruf (Retrieval): Wenn ein Benutzer eine Frage stellt (z. B. „Zeige mir den Defekt in dieser Platine“), führt das System eine semantische Suche in der Vektordatenbank durch, um die relevantesten Bilder oder Videoclips zu finden, die der Absicht der Anfrage entsprechen.
-
Generierung: Der abgerufene visuelle Kontext wird in ein Vision-Language Model (VLM) eingespeist. Das VLM verarbeitet sowohl die Texteingabe des Benutzers als auch die abgerufenen Bildmerkmale, um eine endgültige Antwort zu generieren, wodurch im Wesentlichen mit den Daten „gechattet“ wird.
Praxisanwendungen#
Multimodal RAG verändert Branchen, indem es KI-Agenten ermöglicht, über visuelle Daten mit der physischen Welt zu interagieren.
- Industrielle Instandhaltung und Fertigung: Bei KI in der Fertigung können Techniker ein System mit einem Foto eines kaputten Maschinenteils abfragen. Das Multimodal RAG-System ruft ähnliche historische Wartungsprotokolle, technische Schaltpläne und Video-Tutorials ab, um den Reparaturprozess zu leiten. Dies reduziert Ausfallzeiten und demokratisiert Expertenwissen.
- Einzelhandel und E-Commerce-Entdeckung: Anwendungen mit KI im Einzelhandel ermöglichen es Kunden, ein Bild eines Outfits hochzuladen, das ihnen gefällt. Das System ruft visuell ähnliche Artikel aus dem aktuellen Bestand ab und generiert Styling-Ratschläge oder Produktvergleiche, wodurch ein hochgradig personalisiertes Einkaufserlebnis entsteht.
Unterscheidung verwandter Begriffe#
Um die spezifische Nische der multimodalen RAG zu verstehen, ist es hilfreich, sie von verwandten Konzepten zu unterscheiden:
- Multimodal RAG vs. Multi-Modal Model: Ein multimodales Modell (wie GPT-4o oder Gemini) erstellt die Antwort. Multimodal RAG ist die Architektur, die diesem Modell externe, private Daten (Bilder, Dokumente) zuführt, mit denen es nicht trainiert wurde. Das Modell ist der Motor; RAG ist die Kraftstoffleitung.
- Multimodal RAG vs. Fine-Tuning: Fine-Tuning aktualisiert Modellgewichte dauerhaft, um eine neue Aufgabe oder einen neuen Stil zu erlernen. RAG stellt temporäres Wissen zum Zeitpunkt der Inferenz zur Verfügung. RAG wird für dynamische Daten (z. B. täglicher Bestand) bevorzugt, bei denen häufige Umschulungen unpraktisch sind.
Implementierung mit Ultralytics#
Entwickler können die Retrieval-Komponente einer Multimodal RAG-Pipeline mit Ultralytics YOLO erstellen. Durch das Erkennen und Klassifizieren von Objekten in Bildern stellt YOLO strukturierte Metadaten bereit, die für die textbasierte Suche indiziert oder zum Zuschneiden relevanter Bildbereiche für ein VLM verwendet werden können. Die Ultralytics Platform vereinfacht das Training dieser spezialisierten Vision-Modelle, um benutzerdefinierte Objekte zu erkennen, die für Ihre spezifische Domäne entscheidend sind.
Das folgende Beispiel demonstriert die Verwendung von YOLO26 zum Extrahieren von visuellem Kontext (erkannten Objekten) aus einem Bild, das dann als Teil eines RAG-Workflows an ein LLM übergeben werden könnte.
from ultralytics import YOLO
# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]
print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, personWeiterführende Literatur und Ressourcen#
- LangChain-Dokumentation: Ein umfassender Leitfaden zum Erstellen von Retrieval-Pipelines, einschließlich multimodaler Unterstützung.
- LlamaIndex Multimodal-Leitfaden: Detaillierte Dokumentation zum Indizieren und Abrufen komplexer Datentypen für LLMs.
- Google Cloud Vertex AI Search: Vektorsuchfunktionen auf Unternehmensebene zum Erstellen skalierbarer RAG-Anwendungen.
- Ultralytics Solutions: Entdecken Sie, wie Computer Vision in verschiedenen Branchen in umfassendere KI-Systeme integriert wird.






