Ultralytics YOLO27:
Zurück zum Glossar von Ultralytics

Multi-Modal Model

Entdecke, wie multimodale Modelle Text, Bilder und Audio integrieren. Erfahre mehr über Architekturen wie Ultralytics YOLO26 und stelle Vision-KI auf der Ultralytics Platform bereit.

Ein multimodales Modell ist eine fortschrittliche Art von künstlicher Intelligenz (AI), die gleichzeitig Informationen aus mehreren unterschiedlichen Datentypen oder „Modalitäten“ verarbeiten, interpretieren und integrieren kann. Während sich traditionelle unimodale Systeme auf einen einzelnen Bereich spezialisieren – etwa auf die Verarbeitung natürlicher Sprache (NLP) für Texte oder auf maschinelles Sehen (CV) für Bilder –, zielen multimodale Modelle darauf ab, die menschliche Wahrnehmung nachzuahmen, indem sie visuelle, akustische und sprachliche Hinweise miteinander verknüpfen. Diese Verbindung ermöglicht es dem Modell, ein umfassendes Verständnis der Welt zu entwickeln und komplexe Zusammenhänge zwischen einer visuellen Szene und einer gesprochenen Beschreibung herzustellen. Diese Fähigkeiten gelten als grundlegende Schritte auf dem Weg zu künstlicher allgemeiner Intelligenz (AGI).

Zentrale Mechanismen und Architektur#

Die Leistungsfähigkeit eines multimodalen Modells hängt von seiner Fähigkeit ab, vielfältige Datentypen auf einen gemeinsamen semantischen Raum abzubilden. Dieser Prozess beginnt typischerweise mit der Erstellung von Einbettungen, also numerischen Darstellungen, die die wesentliche Bedeutung der Eingabedaten erfassen. Durch das Training mit riesigen Datensätzen aus gepaarten Beispielen, etwa Videos mit Untertiteln, lernt das Modell, die Vektordarstellung eines Bildes einer „Katze“ an die Texteinbettung für das Wort „Katze“ anzugleichen.

Mehrere wichtige Architekturkonzepte machen diese Integration möglich:

  • Transformer-Architektur: Viele multimodale Systeme nutzen Transformer, die Aufmerksamkeitsmechanismen einsetzen, um die Bedeutung verschiedener Eingabeteile dynamisch zu gewichten. Dadurch kann sich ein Modell auf bestimmte Bildbereiche konzentrieren, die relevanten Wörtern in einer Texteingabe entsprechen – ein Konzept, das in der wegweisenden Forschungsarbeit „Attention Is All You Need“ ausführlich beschrieben wird.
  • Datenfusion: Damit ist die Strategie gemeint, Informationen aus verschiedenen Quellen zu kombinieren. Eine Sensorfusion kann früh durch das Zusammenführen von Rohdaten oder spät durch die Kombination der Entscheidungen separater Teilmodelle erfolgen. Moderne Frameworks wie PyTorch bieten die nötige Flexibilität, um diese komplexen Verarbeitungsketten zu erstellen.
  • Kontrastives Lernen: Techniken, die von Modellen wie CLIP von OpenAI eingesetzt werden, trainieren das System darauf, den Abstand zwischen zusammengehörigen Text-Bild-Paaren im Vektorraum zu minimieren und gleichzeitig den Abstand zwischen nicht zusammengehörigen Paaren zu maximieren.

Anwendungen in der Praxis#

Multimodale Modelle haben Fähigkeiten ermöglicht, die für Systeme mit nur einer Modalität zuvor unerreichbar waren.

  • Visuelle Fragebeantwortung (VQA): Diese Systeme ermöglichen es Benutzern, Fragen in natürlicher Sprache zu einem Bild zu stellen. Beispielsweise könnte eine sehbehinderte Person ein Foto einer Vorratskammer hochladen und fragen: „Steht im obersten Regal eine Dose Suppe?“ Das Modell nutzt Objekterkennung, um Gegenstände zu identifizieren, und NLP, um die Frage zu verstehen und eine hilfreiche Antwort zu geben.
  • Autonome Fahrzeuge: Selbstfahrende Autos fungieren als multimodale Agenten in Echtzeit. Sie kombinieren Kamerabilder, Tiefeninformationen von LiDAR und Geschwindigkeitsdaten von Radar. Diese Redundanz stellt sicher, dass andere Sensoren weiterhin für Verkehrssicherheit sorgen können, falls ein Sensor durch Witterungseinflüsse beeinträchtigt ist.
  • Erkennung mit offenem Vokabular: Modelle wie Ultralytics YOLO-World ermöglichen es Benutzern, Objekte mithilfe beliebiger Texteingaben statt anhand einer festen Klassenliste zu erkennen. Dadurch wird die Lücke zwischen sprachlichen Befehlen und visueller Erkennung geschlossen.

Beispiel: Erkennung mit offenem Vokabular#

Das folgende Beispiel zeigt, wie du die Bibliothek ultralytics für die Erkennung mit offenem Vokabular verwendest, bei der das Modell Texteingaben interpretiert, um Objekte in einem Bild zu identifizieren:

from ultralytics import YOLOWorld

# Load a pre-trained YOLO-World model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")

# Define custom classes using natural language text prompts
model.set_classes(["person wearing a hat", "blue backpack"])

# Run inference: The model aligns text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Visualize the detection results
results[0].show()

Abgrenzung von verwandten Begriffen#

Es ist hilfreich, das „multimodale Modell“ von verwandten Konzepten im KI-Glossar zu unterscheiden:

  • Multimodales Lernen: Damit sind der Prozess und die Methoden des maschinellen Lernens (ML) gemeint, mit denen diese Systeme trainiert werden. Das multimodale Modell ist das resultierende Artefakt oder Softwareprodukt dieses Lernprozesses.
  • Große Sprachmodelle (LLMs): Traditionelle LLMs verarbeiten ausschließlich Texte. Obwohl sich viele zu Bild-Sprach-Modellen (VLMs) weiterentwickeln, ist ein gewöhnliches LLM unimodal.
  • Basismodelle: Dies ist eine umfassendere Kategorie für groß angelegte Modelle, die sich an viele nachgelagerte Aufgaben anpassen lassen. Ein multimodales Modell ist zwar häufig ein Basismodell, aber nicht alle Basismodelle verarbeiten mehrere Modalitäten.

Die Zukunft der multimodalen KI#

Das Gebiet entwickelt sich schnell in Richtung von Systemen, die kontinuierliche Audio-, Video- und Textströme in Echtzeit verarbeiten können. Die Forschung von Organisationen wie Google DeepMind verschiebt die Grenzen der maschinellen Wahrnehmung kontinuierlich. Bei Ultralytics unterstützen wir dieses Ökosystem mit leistungsstarken visuellen Backbones wie YOLO26. YOLO26 wurde 2026 veröffentlicht und bietet überlegene Geschwindigkeit und Genauigkeit für Aufgaben wie Instanzsegmentierung, wodurch es als effiziente visuelle Komponente in größeren multimodalen Verarbeitungsketten dient. Entwickler können Daten, Training und Bereitstellung dieser komplexen Arbeitsabläufe über die einheitliche Ultralytics Platform verwalten.

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens