Ultralytics YOLO27:
Zurück zum Ultralytics-Glossar

Vision Language Model (VLM)

Entdecke Vision-Language-Modelle (VLM) mit Ultralytics. Erfahre, wie sie Computer Vision und LLMs für VQA und die Erkennung mit offenem Vokabular verbinden – mit Ultralytics YOLO26.

Ein Vision-Language-Modell (VLM) ist eine Form künstlicher Intelligenz, die sowohl visuelle Informationen (Bilder oder Videos) als auch Text gleichzeitig verarbeiten und interpretieren kann. Anders als herkömmliche Computer-Vision-Modelle, die sich ausschließlich auf Pixeldaten konzentrieren, oder große Sprachmodelle (LLMs), die nur Text verstehen, verbinden VLMs diese beiden Modalitäten. Durch das Training mit umfangreichen Datensätzen aus Bild-Text-Paaren lernen diese Modelle, visuelle Merkmale sprachlichen Konzepten zuzuordnen. So können sie Bilder beschreiben, Fragen zu visuellen Szenen beantworten und sogar Befehle auf Grundlage dessen ausführen, was sie „sehen“.

Funktionsweise von Vision-Language-Modellen#

Im Allgemeinen bestehen VLMs aus zwei Hauptkomponenten: einem Bildencoder und einem Textencoder. Der Bildencoder verarbeitet Bilder, um Merkmalskarten und visuelle Repräsentationen zu extrahieren, während der Textencoder die sprachliche Eingabe verarbeitet. Anschließend werden diese getrennten Datenströme mithilfe von Mechanismen wie Kreuzaufmerksamkeit zusammengeführt, um visuelle und textuelle Informationen in einem gemeinsamen Einbettungsraum aufeinander abzustimmen.

Die Fortschritte der Jahre 2024 und 2025 gingen in Richtung stärker vereinheitlichter Architekturen, bei denen ein einzelnes Transformer-Grundgerüst beide Modalitäten verarbeitet. Modelle wie Google PaliGemma 2 zeigen beispielsweise, wie die effektive Integration dieser Datenströme die Leistung bei komplexen Schlussfolgerungsaufgaben verbessern kann. Dank dieser Abstimmung versteht das Modell den Kontext: So erkennt es etwa, dass sich das Wort „Apple“ in einem Bild aus einem Lebensmittelgeschäft auf eine Frucht, in einem Logo aber auf ein Technologieunternehmen bezieht.

Anwendungen in der Praxis#

Die Fähigkeit, die Welt sowohl visuell als auch sprachlich zu verstehen, eröffnet vielfältige Anwendungsmöglichkeiten in verschiedenen Branchen:

  • Visuelle Fragebeantwortung (VQA): Im Bereich der medizinischen Diagnostik kommen VLMs häufig zur Unterstützung von Radiologen zum Einsatz. Ein Arzt könnte das System fragen: „Ist auf diesem Röntgenbild ein Knochenbruch zu sehen?“ Das Modell analysiert dann das medizinische Bild und gibt eine vorläufige Einschätzung ab, wodurch sich Diagnosefehler verringern lassen.
  • Intelligente Produktsuche im E-Commerce: In Einzelhandelsumgebungen ermöglichen VLMs die Suche nach Produkten anhand von Beschreibungen in natürlicher Sprache in Verbindung mit Bildern. Ein Kunde könnte ein Foto des Outfits einer bekannten Person hochladen und fragen: „Finde ein Kleid mit diesem Muster, aber in Blau.“ Das System nutzt dann die semantische Suche, um passende Ergebnisse zu finden.
  • Automatische Bildbeschreibungen und Barrierefreiheit: VLMs erzeugen automatisch beschreibende Alternativtexte für Bilder im Web und machen digitale Inhalte so für sehbehinderte Nutzer zugänglicher, die auf Screenreader angewiesen sind.

Um die besondere Rolle von VLMs zu verstehen, ist es hilfreich, sie von anderen KI-Kategorien abzugrenzen:

  • VLM im Vergleich zu LLM: Ein großes Sprachmodell (wie die rein textbasierten Versionen von GPT-4) verarbeitet ausschließlich Textdaten. Es kann zwar kreative Geschichten oder Code erzeugen, aber keine Bilder „sehen“. Ein VLM verleiht einem LLM praktisch Augen.
  • VLM im Vergleich zur Objekterkennung: Herkömmliche Modelle zur Objekterkennung, etwa frühe YOLO-Versionen, erkennen, wo sich Objekte befinden und welcher Klasse sie angehören (z. B. „Auto: 99 %“). Ein VLM geht weiter und versteht Beziehungen und Merkmale, etwa „ein roter Sportwagen, der neben einem Hydranten parkt“.
  • VLM im Vergleich zu multimodaler KI: Multimodale KI ist ein übergeordneter Begriff. Zwar sind alle VLMs multimodal, da sie Bildverarbeitung und Sprache kombinieren, doch nicht alle multimodalen Modelle sind VLMs. Manche kombinieren beispielsweise Audio und Text (wie bei der Umwandlung von Sprache in Text) oder Video und Sensordaten, ohne eine Sprachkomponente zu verwenden.

Erkennung mit offenem Vokabular mit YOLO#

Moderne VLMs ermöglichen die Erkennung mit „offenem Vokabular“: Du kannst Objekte mithilfe frei formulierter Text-Prompts statt vordefinierter Klassen erkennen. Das ist ein wesentliches Merkmal von Modellen wie Ultralytics YOLO-World, mit denen sich Klassen dynamisch und ohne erneutes Training festlegen lassen.

Das folgende Beispiel zeigt, wie sich mit dem Paket ultralytics bestimmte, durch Text beschriebene Objekte erkennen lassen:

from ultralytics import YOLOWorld

# Ein Modell laden, das Bildverarbeitung und Sprachverständnis kombiniert
model = YOLOWorld("yolov8s-world.pt")

# Benutzerdefinierte Klassen mithilfe von Text-Prompts in natürlicher Sprache festlegen
model.set_classes(["person wearing sunglasses", "red backpack"])

# Die Inferenz ausführen, um diese textdefinierten Objekte in einem Bild zu finden
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Die Erkennungsergebnisse anzeigen
results[0].show()

Herausforderungen und zukünftige Entwicklungen#

Vision-Language-Modelle sind zwar leistungsstark, stehen aber vor großen Herausforderungen. Ein zentrales Problem sind Halluzinationen: Das Modell beschreibt selbstbewusst Objekte oder Texte in einem Bild, die gar nicht vorhanden sind. Forschende arbeiten intensiv an Verfahren wie dem bestärkenden Lernen anhand menschlichen Feedbacks (RLHF), um die Verankerung in den Eingabedaten und die Genauigkeit zu verbessern.

Eine weitere Herausforderung sind die Rechenkosten. Das Training dieser riesigen Modelle erfordert erhebliche GPU-Ressourcen. Die Veröffentlichung effizienter Architekturen wie Ultralytics YOLO26 trägt jedoch dazu bei, fortschrittliche Bildverarbeitungsfunktionen auf Edge-Geräte zu bringen. In Zukunft dürften VLMs eine entscheidende Rolle bei Robotersystemen spielen und Robotern ermöglichen, sich anhand komplexer verbaler Anweisungen zu bewegen und Objekte zu manipulieren.

Wer sich für die theoretischen Grundlagen interessiert, erhält in der ursprünglichen CLIP-Studie von OpenAI hervorragende Einblicke in das kontrastive Vortraining von Sprach- und Bilddaten. Außerdem ist es wichtig, die Konferenzbeiträge der CVPR zu verfolgen, um die rasante Weiterentwicklung dieser Architekturen im Blick zu behalten. Um das Training eigener Bildverarbeitungsmodelle auszuprobieren, kannst du die Ultralytics Platform zur vereinfachten Verwaltung von Datensätzen und Bereitstellung von Modellen nutzen.

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Wandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeit-Erkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse um.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Setze Vision AI für die Überwachung aus der Luft mit Ultralytics YOLO-Modellen ein. Nutze Computer-Vision-Lösungen für Drohnen, Abläufe in der Luft- und Raumfahrt, Umweltschutz und Geodatenbranchen.
Mehr erfahren
Computer Vision im Sicherheitsbereich

Computer Vision im Sicherheitsbereich

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision-KI ermöglicht die Überwachung von Grundstücksgrenzen, die Erkennung von Bedrohungen, die Kennzeichenerkennung und die Sicherheit am Arbeitsplatz.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mach Maschinen mit Ultralytics YOLO-Modellen leistungsfähiger. Vision-KI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Bildverarbeitung in der Logistik

Bildverarbeitung in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketprüfung, Sortierung und Fahrzeugverfolgung sowie die Sicherheitsüberwachung von Lagerhäusern in Echtzeit.
Mehr erfahren
Bildverarbeitung im Einzelhandel

Bildverarbeitung im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung und Warteschlangenmanagement und liefert bessere Einblicke in das Kundenverhalten.
Mehr erfahren
Bildverarbeitung im Gesundheitswesen

Bildverarbeitung im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI ermöglicht im Gesundheitswesen schnellere medizinische Bildgebung, bessere Diagnostik und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics-YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Überprüfung der Einhaltung von Vorgaben zu persönlicher Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilbranche

Computer Vision in der Automobilbranche

Setze Computer Vision in der Automobilbranche mit Ultralytics-YOLO-Modellen ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung – für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Setze mit Ultralytics YOLO-Modellen KI für Bildverarbeitung in der intelligenten Landwirtschaft ein. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und nachhaltigere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Wandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeit-Erkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse um.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Setze Vision AI für die Überwachung aus der Luft mit Ultralytics YOLO-Modellen ein. Nutze Computer-Vision-Lösungen für Drohnen, Abläufe in der Luft- und Raumfahrt, Umweltschutz und Geodatenbranchen.
Mehr erfahren
Computer Vision im Sicherheitsbereich

Computer Vision im Sicherheitsbereich

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision-KI ermöglicht die Überwachung von Grundstücksgrenzen, die Erkennung von Bedrohungen, die Kennzeichenerkennung und die Sicherheit am Arbeitsplatz.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mach Maschinen mit Ultralytics YOLO-Modellen leistungsfähiger. Vision-KI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Bildverarbeitung in der Logistik

Bildverarbeitung in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketprüfung, Sortierung und Fahrzeugverfolgung sowie die Sicherheitsüberwachung von Lagerhäusern in Echtzeit.
Mehr erfahren
Bildverarbeitung im Einzelhandel

Bildverarbeitung im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung und Warteschlangenmanagement und liefert bessere Einblicke in das Kundenverhalten.
Mehr erfahren
Bildverarbeitung im Gesundheitswesen

Bildverarbeitung im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI ermöglicht im Gesundheitswesen schnellere medizinische Bildgebung, bessere Diagnostik und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics-YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Überprüfung der Einhaltung von Vorgaben zu persönlicher Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilbranche

Computer Vision in der Automobilbranche

Setze Computer Vision in der Automobilbranche mit Ultralytics-YOLO-Modellen ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung – für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Setze mit Ultralytics YOLO-Modellen KI für Bildverarbeitung in der intelligenten Landwirtschaft ein. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und nachhaltigere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Wandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeit-Erkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse um.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Setze Vision AI für die Überwachung aus der Luft mit Ultralytics YOLO-Modellen ein. Nutze Computer-Vision-Lösungen für Drohnen, Abläufe in der Luft- und Raumfahrt, Umweltschutz und Geodatenbranchen.
Mehr erfahren
Computer Vision im Sicherheitsbereich

Computer Vision im Sicherheitsbereich

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision-KI ermöglicht die Überwachung von Grundstücksgrenzen, die Erkennung von Bedrohungen, die Kennzeichenerkennung und die Sicherheit am Arbeitsplatz.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mach Maschinen mit Ultralytics YOLO-Modellen leistungsfähiger. Vision-KI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Bildverarbeitung in der Logistik

Bildverarbeitung in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketprüfung, Sortierung und Fahrzeugverfolgung sowie die Sicherheitsüberwachung von Lagerhäusern in Echtzeit.
Mehr erfahren
Bildverarbeitung im Einzelhandel

Bildverarbeitung im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung und Warteschlangenmanagement und liefert bessere Einblicke in das Kundenverhalten.
Mehr erfahren
Bildverarbeitung im Gesundheitswesen

Bildverarbeitung im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI ermöglicht im Gesundheitswesen schnellere medizinische Bildgebung, bessere Diagnostik und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics-YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Überprüfung der Einhaltung von Vorgaben zu persönlicher Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilbranche

Computer Vision in der Automobilbranche

Setze Computer Vision in der Automobilbranche mit Ultralytics-YOLO-Modellen ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung – für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Setze mit Ultralytics YOLO-Modellen KI für Bildverarbeitung in der intelligenten Landwirtschaft ein. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und nachhaltigere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Starte deine Reise in die Zukunft des maschinellen Lernens