YOLO Vision 2026:
Zurück zum Ultralytics Glossar

Vision Language Model (VLM)

Erkunde Vision Language Models (VLM) mit Ultralytics. Lerne, wie sie Computer Vision und LLMs für VQA und Open-Vocabulary-Detektion mit Ultralytics YOLO26 überbrücken.

Ein Vision Language Model (VLM) ist eine Art künstliche Intelligenz, die sowohl visuelle Informationen (Bilder oder Videos) als auch Textinformationen gleichzeitig verarbeiten und interpretieren kann. Im Gegensatz zu herkömmlichen computer vision-Modellen, die sich ausschließlich auf Pixeldaten konzentrieren, oder Large Language Models (LLMs), die nur Text verstehen, schlagen VLMs eine Brücke zwischen diesen beiden Modalitäten. Durch das Training mit riesigen Datensätzen, die Bild-Text-Paare enthalten, lernen diese Modelle, visuelle Merkmale mit sprachlichen Konzepten zu verknüpfen, sodass sie Bilder beschreiben, Fragen zu visuellen Szenen beantworten und sogar Befehle basierend auf dem ausführen können, was sie „sehen“.

Wie Vision Language Models funktionieren#

Im Kern bestehen VLMs typischerweise aus zwei Hauptkomponenten: einem Vision-Encoder und einem Text-Encoder. Der Vision-Encoder verarbeitet Bilder, um feature maps und visuelle Repräsentationen zu extrahieren, während der Text-Encoder die sprachliche Eingabe verarbeitet. Diese unterschiedlichen Datenströme werden dann mithilfe von Mechanismen wie cross-attention zusammengeführt, um die visuellen und textlichen Informationen in einem gemeinsamen Einbettungsraum anzugleichen.

Jüngste Fortschritte in den Jahren 2024 und 2025 haben sich hin zu einheitlicheren Architekturen bewegt, bei denen ein einzelnes Transformer-Backbone beide Modalitäten verarbeitet. Modelle wie Google PaliGemma 2 veranschaulichen beispielsweise, wie effektiv die Integration dieser Datenströme die Leistung bei komplexen Argumentationsaufgaben verbessern kann. Diese Ausrichtung versetzt das Modell in die Lage, den Kontext zu verstehen – etwa die Erkenntnis, dass das Wort „Apple“ auf dem Bild eines Lebensmittelgeschäfts eine Frucht, in einem Logo jedoch ein Technologieunternehmen bezeichnet.

Praxisanwendungen#

Die Fähigkeit, die Welt sowohl durch Sehen als auch durch Sprache zu verstehen, eröffnet vielfältige Anwendungen in verschiedenen Branchen:

  • Visual Question Answering (VQA): VLMs werden intensiv in der healthcare diagnostics eingesetzt, um Radiologen zu unterstützen. Ein Arzt könnte ein System fragen: „Gibt es auf diesem Röntgenbild eine Fraktur?“, woraufhin das Modell das medizinische Bild analysiert, um eine vorläufige Einschätzung abzugeben und Diagnosefehler zu reduzieren.
  • Smart E-Commerce Search: In retail environments ermöglichen VLMs Benutzern die Suche nach Produkten mithilfe von natürlichsprachlichen Beschreibungen in Kombination mit Bildern. Ein Käufer könnte ein Foto des Outfits eines Prominenten hochladen und fragen: „Finde mir ein Kleid mit diesem Muster, aber in Blau“, woraufhin das System die semantic search verwendet, um genaue Treffer abzurufen.
  • Automated Captioning and Accessibility: VLMs generieren automatisch beschreibende alt text für Bilder im Web, wodurch digitale Inhalte für sehbehinderte Benutzer, die auf Screenreader angewiesen sind, zugänglicher werden.

Unterscheidung von VLMs zu verwandten Konzepten#

Es ist hilfreich, VLMs von anderen KI-Kategorien abzugrenzen, um ihre spezifische Rolle zu verstehen:

  • VLM vs. LLM: Ein Large Language Model (wie die textbasierten Versionen von GPT-4) verarbeitet ausschließlich Textdaten. Zwar kann es kreative Geschichten oder Code generieren, aber es kann kein Bild „sehen“. Ein VLM verleiht einem LLM gewissermaßen Augen.
  • VLM vs. Object Detection: Herkömmliche object detection-Modelle wie frühe YOLO-Versionen erkennen, wo sich Objekte befinden und zu welcher Klasse sie gehören (z. B. „Auto: 99%“). Ein VLM geht weiter, indem es Beziehungen und Attribute versteht, wie etwa „ein roter Sportwagen, der neben einem Feuerbecken geparkt ist“.
  • VLM vs. Multimodal AI: Multimodal AI ist ein weiter gefasster Oberbegriff. Zwar sind alle VLMs multimodal (da sie Vision und Sprache kombinieren), aber nicht alle multimodalen Modelle sind VLMs; einige kombinieren möglicherweise Audio und Text (wie Speech-to-Text) oder Video- und Sensordaten ohne eine sprachliche Komponente.

Open-Vocabulary-Erkennung mit YOLO#

Moderne VLMs ermöglichen eine „Open-Vocabulary“-Erkennung, bei der Sie Objekte mithilfe frei formulierter Textaufforderungen anstelle vordefinierter Klassen erkennen können. Dies ist ein Kernmerkmal von Modellen wie Ultralytics YOLO-World, das dynamische Klassendefinitionen ohne Neutraining erlaubt.

Das folgende Beispiel zeigt, wie Sie das Paket ultralytics verwenden, um bestimmte, per Text beschriebene Objekte zu erkennen:

from ultralytics import YOLOWorld

# Load a model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")

# Define custom classes using natural language text prompts
model.set_classes(["person wearing sunglasses", "red backpack"])

# Run inference to find these text-defined objects in an image
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Display the detection results
results[0].show()

Herausforderungen und zukünftige Richtungen#

Vision Language Models sind zwar leistungsstark, stehen aber vor erheblichen Herausforderungen. Ein großes Problem ist die hallucination, bei der das Modell Objekte oder Text in einem Bild, die schlicht nicht vorhanden sind, überzeugend beschreibt. Forscher arbeiten aktiv an Techniken wie Reinforcement Learning from Human Feedback (RLHF), um die Verankerung und Genauigkeit zu verbessern.

Eine weitere Herausforderung sind die Rechenkosten. Das Training dieser riesigen Modelle erfordert erhebliche GPU resources. Die Veröffentlichung effizienter Architekturen wie Ultralytics YOLO26 trägt jedoch dazu bei, fortschrittliche Bildverarbeitungsfunktionen auf Edge-Geräte zu bringen. Wir gehen davon aus, dass VLMs in Zukunft eine entscheidende Rolle bei robotic agents spielen und es Robotern ermöglichen werden, basierend auf komplexen verbalen Anweisungen zu navigieren und Objekte zu manipulieren.

Für alle, die sich für die theoretischen Grundlagen interessieren, bietet das originale CLIP paper by OpenAI hervorragende Einblicke in das kontrastive Sprach-Bild-Vortraining. Darüber hinaus ist das Verfolgen der CVPR conference papers unerlässlich, um die rasante Entwicklung dieser Architekturen zu verfolgen. Um mit dem Training Ihrer eigenen Vision-Modelle zu experimentieren, können Sie die Ultralytics Platform für eine optimierte Datensatzverwaltung und Modellbereitstellung nutzen.

Explore solutions

Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr

Lass uns gemeinsam die Zukunft der KI bauen!

Beginne deine Reise mit der Zukunft des maschinellen Lernens