Multimodal AI
Entdecke multimodale KI und wie sie Text und Bildverarbeitung für kontextbezogenes Verständnis integriert. Erfahre noch heute, wie du Ultralytics YOLO26 und Modelle mit offenem Vokabular verwendest.
Multimodale KI bezeichnet eine hochentwickelte Klasse von Systemen der künstlichen Intelligenz (AI), die darauf ausgelegt sind, Informationen aus mehreren unterschiedlichen Datentypen oder „Modalitäten“ gleichzeitig zu verarbeiten, zu interpretieren und zusammenzuführen. Im Gegensatz zu herkömmlichen unimodalen Systemen, die auf eine einzige Eingabequelle spezialisiert sind – etwa Verarbeitung natürlicher Sprache (NLP) für Text oder Computer Vision (CV) für Bilder –, ahmt multimodale KI die menschliche Wahrnehmung nach, indem sie verschiedene Datenströme integriert. Dazu kann die Kombination visueller Daten (Bilder, Videos) mit sprachlichen Daten (Text, gesprochene Sprache) und sensorischen Informationen (LiDAR, Radar, Wärmebilder) gehören. Durch die Nutzung dieser kombinierten Eingaben entwickeln diese Modelle ein tieferes, kontextbezogeneres Verständnis komplexer Szenarien der realen Welt und nähern sich damit den umfassenden Fähigkeiten der künstlichen allgemeinen Intelligenz (AGI).
Funktionsweise multimodaler Systeme#
Die zentrale Stärke multimodaler KI liegt in ihrer Fähigkeit, unterschiedliche Datentypen in einen gemeinsamen mathematischen Raum abzubilden, in dem sie verglichen und kombiniert werden können. Dieser Prozess umfasst typischerweise drei wesentliche Phasen: Kodierung, Ausrichtung und Zusammenführung.
-
Merkmalsextraktion: Spezialisierte neuronale Netze verarbeiten jede Modalität unabhängig, um wichtige Muster zu erkennen. So könnte ein Faltungsneuronales Netz (CNN) visuelle Merkmale aus einem Foto extrahieren, während ein Transformer die zugehörige Bildunterschrift verarbeitet.
-
Ausrichtung und Einbettungen: Die extrahierten Merkmale werden in hochdimensionale numerische Vektoren umgewandelt. Das Modell lernt, diese Vektoren so auszurichten, dass semantisch ähnliche Konzepte (z. B. das Bild einer Katze und das Textwort „Katze“) im Vektorraum nahe beieinander liegen. Dies wird häufig durch Verfahren wie kontrastives Lernen erreicht, das unter anderem in Modellen wie OpenAIs CLIP eingesetzt wird.
-
Datenzusammenführung: Das System führt die ausgerichteten Daten mithilfe fortschrittlicher Verfahren zur Datenzusammenführung zusammen. Moderne Architekturen nutzen Aufmerksamkeitsmechanismen, um die Bedeutung einer Modalität gegenüber einer anderen abhängig vom Kontext dynamisch zu gewichten. Dadurch kann sich das Modell auf den Text konzentrieren, wenn das Bild mehrdeutig ist, oder umgekehrt.
Anwendungen in der Praxis#
Multimodale KI hat Fähigkeiten ermöglicht, die mit Systemen für nur eine Modalität zuvor undenkbar waren, und treibt Innovationen in zahlreichen Branchen voran.
- Visuelle Beantwortung von Fragen (VQA): Bei dieser Anwendung kann ein Nutzer einer KI ein Bild zeigen und in natürlicher Sprache Fragen dazu stellen. So könnte beispielsweise eine sehbehinderte Person ein Foto einer Vorratskammer hochladen und fragen: „Habe ich noch Nudeln?“ Das Modell verarbeitet den visuellen Inhalt und die Textanfrage, um eine konkrete Antwort zu geben.
- Autonome Fahrzeuge: Selbstfahrende Autos sind in hohem Maße auf multimodale Eingaben angewiesen und kombinieren Daten von Kameras, LiDAR-Punktwolken und Radar, um sicher zu navigieren. Diese Redundanz stellt sicher, dass andere Sensoren die von der Gesellschaft der Automobilingenieure (SAE) definierten Sicherheitsstandards einhalten können, falls ein Sensor ausfällt (z. B. eine durch Sonnenblendung beeinträchtigte Kamera).
- Medizinische Diagnostik: Fortschrittliche Systeme für medizinische KI analysieren medizinische Bilddaten (etwa MRT-Aufnahmen oder Röntgenbilder) zusammen mit unstrukturierten Texten zur Krankengeschichte und genetischen Daten. Diese umfassende Sicht unterstützt Ärzte bei genaueren Diagnosen – ein Thema, das häufig in Nature Digital Medicine behandelt wird.
- Generative KI: Werkzeuge, die aus Texteingaben Bilder erzeugen, wie Stable Diffusion, sind vollständig darauf angewiesen, dass das Modell die Beziehung zwischen sprachlichen Beschreibungen und visuellen Texturen versteht.
Erkennung mit offenem Vokabular mit Ultralytics#
Während standardmäßige Objektdetektoren auf vordefinierten Kategorienlisten basieren, ermöglichen multimodale Ansätze wie YOLO-World die Objekterkennung mithilfe von Textaufforderungen mit offenem Vokabular. Dadurch wird innerhalb des Ultralytics-Ökosystems eine Verbindung zwischen sprachlichen Befehlen und visueller Erkennung geschaffen.
Das folgende Beispiel zeigt, wie du die Bibliothek ultralytics für die Erkennung mit offenem Vokabular verwendest, bei der das Modell Objekte anhand benutzerdefinierter Texteingaben erkennt:
from ultralytics import YOLOWorld
# Load a pretrained YOLO-World model (Multimodal: Text + Vision)
model = YOLOWorld("yolov8s-world.pt")
# Define custom text prompts (modalities) for the model to identify
model.set_classes(["person wearing a red hat", "blue backpack"])
# Run inference: The model aligns the text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show the results
results[0].show()Abgrenzung verwandter Begriffe#
Um sich in der modernen Welt des maschinellen Lernens zurechtzufinden, ist es hilfreich, „multimodale KI“ von verwandten Konzepten zu unterscheiden:
- Multimodales Lernen: Damit ist das akademische Fachgebiet und die Methodik gemeint, Algorithmen mit gemischten Datentypen zu trainieren. „Multimodale KI“ bezeichnet im Allgemeinen die praktische Anwendung oder das daraus entstehende System selbst.
- Große Sprachmodelle (LLMs): Herkömmliche LLMs sind unimodal und werden ausschließlich mit Textdaten trainiert. Die Branche bewegt sich jedoch zunehmend hin zu „großen multimodalen Modellen“ (LMMs), die Bilder und Text nativ verarbeiten können – ein Trend, der durch Frameworks wie PyTorch und TensorFlow unterstützt wird.
- Spezialisierte Bildverarbeitungsmodelle: Modelle wie das hochmoderne Ultralytics YOLO26 sind hochspezialisierte Experten für visuelle Aufgaben. Während ein allgemeines multimodales Modell eine Szene möglicherweise grob beschreibt, zeichnen sich spezialisierte Modelle durch schnelle, präzise Objekterkennung und Echtzeitverarbeitung auf Geräten am Netzwerkrand aus.
Ausblick#
Die Entwicklung multimodaler KI weist auf Systeme mit umfassenderen Fähigkeiten zum Schlussfolgern hin. Indem diese Modelle Sprache erfolgreich in der visuellen und physischen Realität verankern, gehen sie über statistische Korrelationen hinaus und nähern sich einem echten Verständnis. Forschungseinrichtungen wie Google DeepMind und das Stanford Center for Research on Foundation Models erweitern weiterhin die Grenzen dessen, wie Maschinen komplexe Umgebungen wahrnehmen.
Bei Ultralytics integrieren wir diese Fortschritte in die Ultralytics Platform. Dadurch können Nutzer Daten verwalten, Modelle trainieren und Lösungen bereitstellen, die das gesamte Spektrum verfügbarer Modalitäten nutzen, indem sie die Geschwindigkeit von YOLO26 mit der Vielseitigkeit multimodaler Eingaben verbinden.









