Ultralytics YOLO27:
Zurück zum Glossar von Ultralytics

Multimodal RAG

Entdecke multimodales RAG zur Verarbeitung von Text, Bildern und Videos. Erfahre, wie Ultralytics YOLO26 Pipelines zum Abrufen von Informationen für genauere, kontextbezogene Antworten verbessert.

Multimodale Retrieval-gestützte Generierung (Multimodal RAG) ist ein fortschrittliches Framework für künstliche Intelligenz (AI), das herkömmliche RAG-Systeme erweitert, um verschiedene Datentypen wie Text, Bilder, Videos und Audio zu verarbeiten und daraus Schlussfolgerungen zu ziehen. Während die standardmäßige Retrieval-gestützte Generierung (RAG) die Genauigkeit eines großen Sprachmodells (LLM) durch das Abrufen relevanter Textdokumente verbessert, ermöglicht multimodales RAG Modellen das „Sehen“ und „Hören“, indem es Kontext aus einer Wissensbasis mit verschiedenen Medien abruft. Dieser Ansatz verankert die Generierung des Modells in konkreten visuellen oder akustischen Belegen, reduziert dadurch Halluzinationen in LLMs deutlich und ermöglicht komplexe Aufgaben wie die visuelle Beantwortung von Fragen zu privaten Datensätzen. Durch den Einsatz von multimodalem Lernen können diese Systeme Informationen aus der Anfrage eines Benutzers (z. B. Text) und abgerufenen Inhalten (z. B. einem Diagramm oder einem Überwachungsbild) zusammenführen, um umfassende, kontextbezogene Antworten zu erzeugen.

So funktioniert multimodales RAG#

Die Architektur eines multimodalen RAG-Systems entspricht typischerweise der standardmäßigen Pipeline „Abrufen, dann Generieren“, ist jedoch für nicht textbasierte Daten angepasst. Dieser Prozess stützt sich stark auf Vektordatenbanken und gemeinsame semantische Räume.

  1. Indexierung: Daten aus verschiedenen Quellen – PDFs, Videos und Foliensätze – werden verarbeitet. Modelle zur Merkmalsextraktion wandeln diese unterschiedlichen Modalitäten in hochdimensionale numerische Vektoren, sogenannte Einbettungen, um. Ein Modell wie CLIP von OpenAI ordnet beispielsweise Bild- und Texteinbettungen so aufeinander ab, dass das Bild eines Hundes und das Wort „Hund“ mathematisch nahe beieinanderliegen.

  2. Abruf: Wenn ein Benutzer eine Frage stellt (z. B. „Zeige mir den Defekt auf dieser Leiterplatte“), führt das System eine semantische Suche in der Vektordatenbank durch, um die relevantesten Bilder oder Videoclips zu finden, die der Absicht der Anfrage entsprechen.

  3. Generierung: Der abgerufene visuelle Kontext wird einem Vision-Language-Modell (VLM) zugeführt. Das VLM verarbeitet sowohl die Texteingabe des Benutzers als auch die Merkmale des abgerufenen Bildes, um eine abschließende Antwort zu generieren und so effektiv mit den Daten zu „chatten“.

Anwendungen in der Praxis#

Multimodales RAG verändert Branchen, indem es KI-Agenten ermöglicht, über visuelle Daten mit der physischen Welt zu interagieren.

  • Industrielle Wartung und Fertigung: Im Bereich der KI in der Fertigung können Techniker ein System mit einem Foto eines defekten Maschinenteils abfragen. Das multimodale RAG-System ruft ähnliche historische Wartungsprotokolle, technische Schaltpläne und Videoanleitungen ab, um den Reparaturprozess zu unterstützen. Dadurch werden Ausfallzeiten reduziert und Fachwissen besser zugänglich gemacht.
  • Einzelhandel und Entdeckung im E-Commerce: Anwendungen mit KI im Einzelhandel ermöglichen es Kunden, ein Bild eines Kleidungsstils hochzuladen, der ihnen gefällt. Das System ruft visuell ähnliche Artikel aus dem aktuellen Bestand ab und erstellt Styling-Empfehlungen oder Produktvergleiche. So entsteht ein stark personalisiertes Einkaufserlebnis.

Unterscheidung verwandter Begriffe#

Um die besondere Nische von multimodalem RAG zu verstehen, ist es hilfreich, es von verwandten Konzepten abzugrenzen:

  • Multimodales RAG im Vergleich zu einem multimodalen Modell: Ein multimodales Modell (wie GPT-4o oder Gemini) erstellt die Antwort. Multimodales RAG ist die Architektur, die diesem Modell externe private Daten (Bilder, Dokumente) zuführt, mit denen es nicht trainiert wurde. Das Modell ist der Motor, RAG die Kraftstoffleitung.
  • Multimodales RAG im Vergleich zu Feinabstimmung: Feinabstimmung aktualisiert Modellgewichte dauerhaft, damit das Modell eine neue Aufgabe oder einen neuen Stil erlernt. RAG stellt zum Zeitpunkt der Inferenz vorübergehend Wissen bereit. RAG wird für dynamische Daten (z. B. den täglichen Bestand) bevorzugt, wenn häufiges erneutes Training unpraktisch ist.

Implementierung mit Ultralytics#

Entwickler können die Abrufkomponente einer multimodalen RAG-Pipeline mit Ultralytics YOLO erstellen. Durch das Erkennen und Klassifizieren von Objekten in Bildern liefert YOLO strukturierte Metadaten, die für den textbasierten Abruf indexiert oder zum Ausschneiden relevanter Bildbereiche für ein VLM verwendet werden können. Die Ultralytics Platform vereinfacht das Training dieser spezialisierten Bildverarbeitungsmodelle, damit sie für deine spezifische Domäne wichtige benutzerdefinierte Objekte erkennen.

Das folgende Beispiel zeigt, wie YOLO26 visuellen Kontext (erkannte Objekte) aus einem Bild extrahiert, der anschließend als Teil eines RAG-Workflows an ein LLM übergeben werden könnte.

from ultralytics import YOLO

# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")

# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")

# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]

print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, person

Weiterführende Informationen und Ressourcen#

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens