YOLO Vision 2026:
Zurück zum Glossar von Ultralytics

Multi-Modal Learning

Entdecke multimodales Lernen in der KI. Erfahre, wie es Text, Bild und Audio für robuste Modelle wie Ultralytics YOLO26 und YOLO-World integriert. Erfahre noch heute mehr!

Multimodales Lernen ist ein anspruchsvoller Ansatz in der künstlichen Intelligenz (AI), bei dem Algorithmen darauf trainiert werden, Informationen aus mehreren unterschiedlichen Datentypen oder „Modalitäten“ zu verarbeiten, zu verstehen und miteinander in Beziehung zu setzen. Im Gegensatz zu herkömmlichen Systemen, die auf einen einzigen Eingabetyp spezialisiert sind – etwa Text für die Übersetzung oder Pixel für die Bilderkennung –, ahmt multimodales Lernen die menschliche Wahrnehmung nach, indem es verschiedene sensorische Eingaben wie visuelle Daten, gesprochene Audiodaten, Textbeschreibungen und Sensormesswerte integriert. Dieser ganzheitliche Ansatz ermöglicht es Modellen des maschinellen Lernens (ML), ein tieferes, kontextbezogenes Verständnis der Welt zu entwickeln, was zu robusteren und vielseitigeren Vorhersagen führt.

So funktioniert multimodales Lernen#

Die zentrale Herausforderung beim multimodalen Lernen besteht darin, unterschiedliche Datentypen in einen gemeinsamen mathematischen Raum zu übertragen, in dem sie verglichen und kombiniert werden können. Dieser Prozess umfasst im Allgemeinen drei Hauptphasen: Kodierung, Ausrichtung und Fusion.

  1. Merkmalsextraktion: Spezialisierte neuronale Netze verarbeiten jede Modalität unabhängig. Beispielsweise können Faltungsneuronale Netze (CNNs) oder Vision Transformer (ViTs) Merkmale aus Bildern extrahieren, während rekurrente neuronale Netze (RNNs) oder Transformer Text verarbeiten.

  2. Ausrichtung von Einbettungen: Das Modell lernt, diese vielfältigen Merkmale auf gemeinsame hochdimensionale Vektoren abzubilden. In diesem gemeinsamen Raum werden der Vektor für das Wort „Katze“ und der Vektor für ein Bild einer Katze nahe beieinander angeordnet. Techniken wie kontrastives Lernen, die durch Arbeiten wie OpenAIs CLIP bekannt wurden, sind hierbei unverzichtbar.

  3. Datenfusion: Schließlich werden die Informationen zusammengeführt, um eine Aufgabe auszuführen. Die Fusion kann früh erfolgen (durch Kombination von Rohdaten), spät (durch Kombination der endgültigen Vorhersagen) oder über hybride Zwischenverfahren, bei denen der Aufmerksamkeitsmechanismus die Bedeutung jeder Modalität dynamisch gewichtet.

Anwendungen in der Praxis#

Multimodales Lernen ist der Motor hinter vielen der beeindruckendsten KI-Durchbrüche von heute und überbrückt die Lücke zwischen getrennten Datensilos, um komplexe Probleme zu lösen.

  • Visuelle Fragebeantwortung (VQA): Bei dieser Anwendung muss ein System ein Bild analysieren und eine natürlichsprachliche Frage dazu beantworten, etwa „Welche Farbe hat die Ampel?“. Dafür muss das Modell die Semantik des Textes verstehen und die entsprechenden visuellen Elemente mithilfe von Computer Vision räumlich lokalisieren.
  • Autonome Fahrzeuge: Selbstfahrende Autos sind in hohem Maße auf Sensorfusion angewiesen und kombinieren Punktwolken von LiDAR, Videodaten von Kameras und Radar, um sicher zu navigieren. Diese multimodale Eingabe stellt sicher, dass andere Sensoren die Verkehrssicherheit aufrechterhalten können, falls ein Sensor ausfällt (z. B. wenn eine Kamera durch Sonnenblendung beeinträchtigt wird).
  • Medizinische Diagnostik: KI im Gesundheitswesen nutzt multimodales Lernen, indem sie medizinische Bildanalyse (etwa MRT- oder Röntgenaufnahmen) zusammen mit unstrukturierten Texten zur Krankengeschichte und genetischen Daten analysiert. Diese umfassende Perspektive unterstützt Ärzte dabei, genauere Diagnosen zu stellen – ein Thema, das häufig in den Fachzeitschriften von Nature Digital Medicine behandelt wird.
  • Generative KI: Werkzeuge, die aus Texteingaben Bilder erzeugen, wie Stable Diffusion, sind vollständig darauf angewiesen, dass das Modell die Beziehung zwischen sprachlichen Beschreibungen und visuellen Texturen versteht.

Multimodale Objekterkennung mit Ultralytics#

Während herkömmliche Objekterkennungsmodelle auf vordefinierten Klassen basieren, ermöglichen multimodale Ansätze wie YOLO-World die Erkennung von Objekten mithilfe von Textvorgaben mit offenem Vokabular. Dies zeigt, wie leistungsfähig die Verknüpfung textlicher Konzepte mit visuellen Merkmalen innerhalb des Ultralytics-Ökosystems ist.

Das folgende Python-Codebeispiel zeigt, wie du ein vortrainiertes YOLO-World-Modell verwendest, um Objekte auf Grundlage benutzerdefinierter Texteingaben zu erkennen.

from ultralytics import YOLOWorld

# Load a pretrained YOLO-World model (Multi-Modal: Text + Vision)
model = YOLOWorld("yolov8s-world.pt")

# Define custom text prompts (modalities) for the model to identify
model.set_classes(["person", "bus", "traffic light"])

# Run inference: The model aligns the text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Show the results
results[0].show()

Wichtige Begriffe im Vergleich#

Um sich in der modernen KI-Landschaft zurechtzufinden, ist es hilfreich, „multimodales Lernen“ von verwandten Konzepten zu unterscheiden:

  • Multimodales Modell: „Multimodales Lernen“ bezeichnet die Methodik und das Forschungsgebiet. Ein „multimodales Modell“ (wie GPT-4 oder Googles Gemini) ist das konkrete Ergebnis oder Softwareprodukt, das aus diesem Trainingsprozess hervorgeht.
  • Unimodale KI: Herkömmliche Computer Vision ist im Allgemeinen unimodal und konzentriert sich ausschließlich auf visuelle Daten. Ein Modell wie Ultralytics YOLO26 ist zwar ein hochmodernes CV-Werkzeug zur Objekterkennung, arbeitet jedoch in der Regel ausschließlich mit visuellen Eingaben, sofern es nicht Teil einer größeren multimodalen Pipeline ist.
  • Große Sprachmodelle (LLMs): Herkömmliche LLMs sind unimodal und wurden ausschließlich mit Text trainiert. Die Branche bewegt sich jedoch zunehmend in Richtung „großer multimodaler Modelle“ (LMMs), die Bilder und Text nativ verarbeiten können – ein Trend, der durch Frameworks wie PyTorch und TensorFlow unterstützt wird.

Ausblick#

Die Entwicklung des multimodalen Lernens weist auf Systeme mit Eigenschaften der allgemeinen künstlichen Intelligenz (AGI) hin. Indem diese Modelle Sprache erfolgreich in der visuellen und physischen Realität verankern, bewegen sie sich über statistische Korrelationen hinaus in Richtung echter Schlussfolgerungen. Die Forschung an Einrichtungen wie MIT CSAIL und dem Stanford Center for Research on Foundation Models erweitert kontinuierlich die Grenzen dessen, wie Maschinen komplexe Umgebungen mit mehreren Sinnesmodalitäten wahrnehmen und mit ihnen interagieren.

Bei Ultralytics integrieren wir diese Fortschritte in unsere Ultralytics Platform. Dadurch können Nutzer Daten verwalten, Modelle trainieren und Lösungen bereitstellen, die das gesamte Spektrum verfügbarer Modalitäten nutzen – von der Geschwindigkeit von YOLO26 bis zur Vielseitigkeit der Erkennung mit offenem Vokabular.

Explore solutions

Real-time AI that works with your team

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Real-time AI that works with your team

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Real-time AI that works with your team

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Real-time AI that works with your team

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Real-time AI that works with your team

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Real-time AI that works with your team

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens