YOLO Vision 2026:
Zurück zum Ultralytics Glossar

Visual Instruction Tuning

Erkunde, wie Visual Instruction Tuning es Vision Language Models ermöglicht, menschlichen Anweisungen zu folgen. Lerne, fortschrittliche KI-Workflows mit Ultralytics YOLO26 zu erstellen.

Visual Instruction Tuning ist eine transformative Machine-Learning-Technik, die herkömmliche Methoden der natürlichen Sprachverarbeitung auf den modalübergreifenden Bereich ausweitet. Durch das Training eines Vision Language Model (VLM) darauf, explizite menschliche Anweisungen basierend auf Bild- oder Videoeingaben zu befolgen, kannst du KI-Assistenten erstellen, die visuelle Inhalte verstehen und analysieren. Im Gegensatz zu Standardmodellen für die image classification, die eine vordefinierte Kategorie ausgeben, befähigt Visual Instruction Tuning Modelle dazu, komplexe, offene Aufgaben auszuführen – wie das Beschreiben einer Szene, das Lesen von Text in einem Bild oder das Beantworten spezifischer Fragen zu räumlichen Beziehungen. Dies schließt die Lücke zwischen textbasierten large language models (LLMs) und traditionellen computer vision-Pipelines.

Das Konzept und die Unterschiede verstehen#

Um Visual Instruction Tuning zu verstehen, ist es hilfreich, es von eng verwandten Konzepten im KI-Ökosystem abzugrenzen:

  • Instruction Tuning: Bezieht sich typischerweise darauf, rein textbasierte LLMs so auszurichten, dass sie menschlichen Absichten sicher und präzise folgen. Visual Instruction Tuning wendet dieselbe Methodik an, bindet jedoch Bilder in den Prompt und die erwartete Ausgabe ein.
  • Visual Prompting: Beinhaltet normalerweise die Interaktion mit einer KI mithilfe visueller Hinweise – wie dem Zeichnen einer Bounding Box, dem Platzieren eines Punkts oder dem Maskieren eines Bereichs auf einem Bild –, um den Fokus des Modells zu lenken. Im Gegensatz dazu stützt sich Visual Instruction Tuning stark auf natürlichsprachliche Befehle in Kombination mit den visuellen Daten.

Der Trainingsprozess beinhaltet im Allgemeinen das fine-tuning eines vortrainierten modalübergreifenden Basismodells unter Verwendung umfangreicher Datensätze, die als Bild-Text-Anweisungs-Drillinge formatiert sind. Wegweisende arXiv research on visual instruction tuning wie das LLaVA (Large Language-and-Vision Assistant)-Projekt haben gezeigt, dass diese Modelle bemerkenswerte Zero-Shot-Fähigkeiten erreichen können. Heute setzen führende KI-Organisationen diese Technik ein, um fortschrittliche Modelle anzutreiben, darunter OpenAI GPT-4o, Anthropic Claude 3.5 Sonnet und Google DeepMind Gemini.

Praxisanwendungen#

Durch die Ausrichtung von multimodal deep learning-Architekturen an menschlichen Absichten ermöglicht Visual Instruction Tuning hochgradig interaktive Anwendungen in verschiedenen Branchen:

  • AI in Healthcare Diagnostics: Medizinisches Fachpersonal kann anweisungsangepasste Modelle für Visual Question Answering (VQA) verwenden. Ein Radiologe könnte das System mit einem Röntgenbild und der Anweisung „Markiere und erkläre alle Anzeichen einer Lungenentzündung im linken Unterlappen“ versorgen, sodass die KI als kollaborativer Diagnoseassistent agieren kann.
  • AI in Manufacturing Quality Control: Anstatt ein starres Fehlererkennungsmodell von Grund auf zu trainieren, können Bediener ein Vision-System wie Microsoft Florence-2 anweisen, indem sie sagen: „Identifiziere mikroskopische Kratzer oder Dellen auf diesem neu gefertigten Metallgehäuse.“

Vision-Workflows aufbauen#

Um Systeme aufzubauen, die diese Funktionen nutzen, verlassen sich Entwickler oft auf robuste object detection-Modelle, um strukturellen Kontext aus Bildern zu extrahieren, bevor diese Daten an ein VLM übergeben werden. Mithilfe der PyTorch multi-modal documentation oder von TensorFlow vision models kannst du hybride Pipelines erstellen.

Du kannst beispielsweise ein Ultralytics YOLO Modell verwenden, um eine Szene schnell zu erfassen und einen fundierten Sprach-Prompt für ein nachgelagertes VLM zu generieren:

from ultralytics import YOLO

# Load an Ultralytics YOLO26 model to extract visual context
model = YOLO("yolo26n.pt")

# Perform inference to identify objects for a downstream VLM prompt
results = model("https://ultralytics.com/images/bus.jpg")

# Extract object names to dynamically build an instruction prompt
objects = [model.names[int(cls)] for cls in results[0].boxes.cls]
prompt = f"Please provide a detailed safety analysis of the scene containing these objects: {', '.join(objects)}"

print(prompt)
# Output: Please provide a detailed safety analysis of the scene containing these objects: bus, person, person...

Die Verwaltung der komplexen, modalübergreifenden Datensätze, die für diese Anwendungen der nächsten Generation erforderlich sind, kann eine Herausforderung sein. Die Ultralytics Platform vereinfacht diesen Prozess, indem sie End-to-End-Tools für die Datensatzannotation, das Cloud-Training und die nahtlose Modellbereitstellung bereitstellt. Egal, ob du bahnbrechende Arbeiten in der ACM digital library oder in den Archiven von IEEE Xplore computer vision liest – der Wandel hin zu anweisungsangepassten, leistungsstarken Vision-Systemen repräsentiert den neuesten Stand der künstlichen Intelligenz. Durch die Kombination von YOLO26-Wahrnehmung mit abgestimmten Begründungsmodellen können Organisationen unglaublich robuste KI-Agenten bereitstellen.

Explore solutions

Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr

Lass uns gemeinsam die Zukunft der KI bauen!

Beginne deine Reise mit der Zukunft des maschinellen Lernens