Vision Language Model (VLM)
Entdecke Vision-Language-Modelle (VLM) mit Ultralytics. Erfahre, wie sie Computer Vision und LLMs für VQA und die Erkennung mit offenem Vokabular verbinden – mit Ultralytics YOLO26.
Ein Vision-Language-Modell (VLM) ist eine Form künstlicher Intelligenz, die sowohl visuelle Informationen (Bilder oder Videos) als auch Text gleichzeitig verarbeiten und interpretieren kann. Anders als herkömmliche Computer-Vision-Modelle, die sich ausschließlich auf Pixeldaten konzentrieren, oder große Sprachmodelle (LLMs), die nur Text verstehen, verbinden VLMs diese beiden Modalitäten. Durch das Training mit umfangreichen Datensätzen aus Bild-Text-Paaren lernen diese Modelle, visuelle Merkmale sprachlichen Konzepten zuzuordnen. So können sie Bilder beschreiben, Fragen zu visuellen Szenen beantworten und sogar Befehle auf Grundlage dessen ausführen, was sie „sehen“.
Funktionsweise von Vision-Language-Modellen#
Im Allgemeinen bestehen VLMs aus zwei Hauptkomponenten: einem Bildencoder und einem Textencoder. Der Bildencoder verarbeitet Bilder, um Merkmalskarten und visuelle Repräsentationen zu extrahieren, während der Textencoder die sprachliche Eingabe verarbeitet. Anschließend werden diese getrennten Datenströme mithilfe von Mechanismen wie Kreuzaufmerksamkeit zusammengeführt, um visuelle und textuelle Informationen in einem gemeinsamen Einbettungsraum aufeinander abzustimmen.
Die Fortschritte der Jahre 2024 und 2025 gingen in Richtung stärker vereinheitlichter Architekturen, bei denen ein einzelnes Transformer-Grundgerüst beide Modalitäten verarbeitet. Modelle wie Google PaliGemma 2 zeigen beispielsweise, wie die effektive Integration dieser Datenströme die Leistung bei komplexen Schlussfolgerungsaufgaben verbessern kann. Dank dieser Abstimmung versteht das Modell den Kontext: So erkennt es etwa, dass sich das Wort „Apple“ in einem Bild aus einem Lebensmittelgeschäft auf eine Frucht, in einem Logo aber auf ein Technologieunternehmen bezieht.
Anwendungen in der Praxis#
Die Fähigkeit, die Welt sowohl visuell als auch sprachlich zu verstehen, eröffnet vielfältige Anwendungsmöglichkeiten in verschiedenen Branchen:
- Visuelle Fragebeantwortung (VQA): Im Bereich der medizinischen Diagnostik kommen VLMs häufig zur Unterstützung von Radiologen zum Einsatz. Ein Arzt könnte das System fragen: „Ist auf diesem Röntgenbild ein Knochenbruch zu sehen?“ Das Modell analysiert dann das medizinische Bild und gibt eine vorläufige Einschätzung ab, wodurch sich Diagnosefehler verringern lassen.
- Intelligente Produktsuche im E-Commerce: In Einzelhandelsumgebungen ermöglichen VLMs die Suche nach Produkten anhand von Beschreibungen in natürlicher Sprache in Verbindung mit Bildern. Ein Kunde könnte ein Foto des Outfits einer bekannten Person hochladen und fragen: „Finde ein Kleid mit diesem Muster, aber in Blau.“ Das System nutzt dann die semantische Suche, um passende Ergebnisse zu finden.
- Automatische Bildbeschreibungen und Barrierefreiheit: VLMs erzeugen automatisch beschreibende Alternativtexte für Bilder im Web und machen digitale Inhalte so für sehbehinderte Nutzer zugänglicher, die auf Screenreader angewiesen sind.
VLMs von verwandten Konzepten unterscheiden#
Um die besondere Rolle von VLMs zu verstehen, ist es hilfreich, sie von anderen KI-Kategorien abzugrenzen:
- VLM im Vergleich zu LLM: Ein großes Sprachmodell (wie die rein textbasierten Versionen von GPT-4) verarbeitet ausschließlich Textdaten. Es kann zwar kreative Geschichten oder Code erzeugen, aber keine Bilder „sehen“. Ein VLM verleiht einem LLM praktisch Augen.
- VLM im Vergleich zur Objekterkennung: Herkömmliche Modelle zur Objekterkennung, etwa frühe YOLO-Versionen, erkennen, wo sich Objekte befinden und welcher Klasse sie angehören (z. B. „Auto: 99 %“). Ein VLM geht weiter und versteht Beziehungen und Merkmale, etwa „ein roter Sportwagen, der neben einem Hydranten parkt“.
- VLM im Vergleich zu multimodaler KI: Multimodale KI ist ein übergeordneter Begriff. Zwar sind alle VLMs multimodal, da sie Bildverarbeitung und Sprache kombinieren, doch nicht alle multimodalen Modelle sind VLMs. Manche kombinieren beispielsweise Audio und Text (wie bei der Umwandlung von Sprache in Text) oder Video und Sensordaten, ohne eine Sprachkomponente zu verwenden.
Erkennung mit offenem Vokabular mit YOLO#
Moderne VLMs ermöglichen die Erkennung mit „offenem Vokabular“: Du kannst Objekte mithilfe frei formulierter Text-Prompts statt vordefinierter Klassen erkennen. Das ist ein wesentliches Merkmal von Modellen wie Ultralytics YOLO-World, mit denen sich Klassen dynamisch und ohne erneutes Training festlegen lassen.
Das folgende Beispiel zeigt, wie sich mit dem Paket ultralytics bestimmte, durch Text beschriebene Objekte erkennen lassen:
from ultralytics import YOLOWorld
# Ein Modell laden, das Bildverarbeitung und Sprachverständnis kombiniert
model = YOLOWorld("yolov8s-world.pt")
# Benutzerdefinierte Klassen mithilfe von Text-Prompts in natürlicher Sprache festlegen
model.set_classes(["person wearing sunglasses", "red backpack"])
# Die Inferenz ausführen, um diese textdefinierten Objekte in einem Bild zu finden
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Die Erkennungsergebnisse anzeigen
results[0].show()Herausforderungen und zukünftige Entwicklungen#
Vision-Language-Modelle sind zwar leistungsstark, stehen aber vor großen Herausforderungen. Ein zentrales Problem sind Halluzinationen: Das Modell beschreibt selbstbewusst Objekte oder Texte in einem Bild, die gar nicht vorhanden sind. Forschende arbeiten intensiv an Verfahren wie dem bestärkenden Lernen anhand menschlichen Feedbacks (RLHF), um die Verankerung in den Eingabedaten und die Genauigkeit zu verbessern.
Eine weitere Herausforderung sind die Rechenkosten. Das Training dieser riesigen Modelle erfordert erhebliche GPU-Ressourcen. Die Veröffentlichung effizienter Architekturen wie Ultralytics YOLO26 trägt jedoch dazu bei, fortschrittliche Bildverarbeitungsfunktionen auf Edge-Geräte zu bringen. In Zukunft dürften VLMs eine entscheidende Rolle bei Robotersystemen spielen und Robotern ermöglichen, sich anhand komplexer verbaler Anweisungen zu bewegen und Objekte zu manipulieren.
Wer sich für die theoretischen Grundlagen interessiert, erhält in der ursprünglichen CLIP-Studie von OpenAI hervorragende Einblicke in das kontrastive Vortraining von Sprach- und Bilddaten. Außerdem ist es wichtig, die Konferenzbeiträge der CVPR zu verfolgen, um die rasante Weiterentwicklung dieser Architekturen im Blick zu behalten. Um das Training eigener Bildverarbeitungsmodelle auszuprobieren, kannst du die Ultralytics Platform zur vereinfachten Verwaltung von Datensätzen und Bereitstellung von Modellen nutzen.









