YOLO Vision 2026:
Zurück zum Ultralytics Glossar

Image Captioning

Erfahre, wie Image Captioning Vision-Language-Modelle nutzt, um Bildbeschreibungen zu generieren, entdecke reale Anwendungsfälle und verknüpfe Beschreibungen mit Ultralytics YOLO26.

Bildbeschreibung ist eine KI-Aufgabe, die automatisch eine natürlichsprachliche Beschreibung eines Bildes generiert. Bei einem Straßenfoto kann ein System beispielsweise ausgeben: „Ein Stadtbus fährt an Fußgängern an einer Kreuzung vorbei.“ Die Aufgabe kombiniert visuelle Wahrnehmung mit Spracherzeugung, sodass das Modell wichtige Inhalte identifizieren, Beziehungen zwischen Objekten verstehen und diese Informationen klar ausdrücken muss.

Die Beschreibung wird typischerweise von einem vision-language model durchgeführt, das über visuelle und textbasierte Daten hinweg arbeitet. Im Gegensatz zu einer manuell geschriebenen Fotobeschreibung ist eine KI-generierte Beschreibung eine Vorhersage, die auf Mustern basiert, die aus Bild-Text-Paaren gelernt wurden.

Wie Bildbeschreibung funktioniert#

Ein Bildbeschreibungssystem hat normalerweise zwei miteinander verbundene Phasen:

  1. Ein Vision Encoder wandelt Pixel in Merkmalsdarstellungen um, die Objekte, Texturen, Standorte und umfassendere Szeneninformationen beschreiben.
  2. Ein Language Decoder verwandelt diese visuellen Merkmale in eine Wortsequenz.

Viele Systeme verwenden einen transformer-Decoder. Er beginnt mit einem Start-Token, sagt das nächste Token voraus, fügt es zur Sequenz hinzu und wiederholt dies, bis er ein End-Token generiert oder ein Längenlimit erreicht. Das Google Machine Learning Glossary beschreibt diesen Token-für-Token-Prozess als autoregressive Generierung.

Ein attention mechanism hilft dem Decoder, sich bei der Auswahl jedes Wortes auf relevante Bildbereiche zu konzentrieren. Beim Generieren von „Bus“ wird möglicherweise das Fahrzeug hervorgehoben; beim Generieren von „Straße“ wird möglicherweise auf die umliegende Straße geachtet. Das TensorFlow image captioning tutorial zeigt, wie Bildmerkmale, Tokenisierung, Cross-Attention und ein Textdecoder zusammenpassen.

Das Training erfordert im Allgemeinen Bilder, die mit einer oder mehreren von Menschen geschriebenen Bildunterschriften versehen sind. Mehrere Bildunterschriften sind nützlich, da dasselbe Bild auf verschiedene Weise korrekt beschrieben werden kann, wie etwa „Ein Kind, das mit einem Hund spielt“ und „Ein junger Mensch wirft einen Ball für ein Haustier“.

Unterschiede zu verwandten visuellen Aufgaben#

Bildbeschreibung überschneidet sich mit mehreren KI-Aufgaben, erzeugt jedoch eine eindeutige Ausgabe:

  • Image classification weist dem gesamten Bild ein oder mehrere Labels zu, wie zum Beispiel „Strand“. Die Beschreibung erzeugt einen Satz, der Objekte, Aktionen, Attribute und Kontext beschreiben kann.
  • Object detection identifiziert und lokalisiert vordefinierte Objekte mit Bounding Boxes. Die Beschreibung kann diese Objekte erwähnen, beschreibt aber auch deren Beziehungen, wie etwa „Zwei Radfahrer fahren neben einem Auto“.
  • Optical character recognition extrahiert sichtbaren Text aus Schildern, Dokumenten oder Verpackungen. Eine Beschreibung fasst die Szene zusammen, anstatt den gesamten Text zu transkribieren.
  • Visual question answering beantwortet eine spezifische Frage zu einem Bild. Die Beschreibung erstellt eine allgemeine Beschreibung, ohne dass eine Frage erforderlich ist.
  • Alt-Text vermittelt den Zweck eines Bildes in einem bestimmten Kontext. Eine automatisierte Beschreibung kann einen Entwurf liefern, ist jedoch nicht automatisch ein geeigneter Alt-Text, da dekorative, funktionale und komplexe Bilder gemäß dem W3C Images Tutorial eine unterschiedliche Behandlung erfordern.

Praxisanwendungen#

  • Accessible Web Content: Eine Publikationsplattform kann Entwurfsbeschreibungen für neu hochgeladene Fotografien generieren. Bei einem Nachrichtenbild kann die Beschreibung die Hauptpersonen, die Kulisse und die Handlung identifizieren, bevor ein Redakteur sie auf Genauigkeit und Relevanz prüft. Komplexe Diagramme benötigen weiterhin eine strukturierte Langbeschreibung anstelle einer generischen visuellen Zusammenfassung.

  • Searchable Media Libraries: Ein Einzelhändler oder Medienunternehmen kann große Bildsammlungen mit Bildunterschriften versehen und den generierten Text indizieren. Benutzer können dann nach Phrasen wie „roter Rucksack neben einem Zelt“ suchen, selbst wenn die Dateien nie manuell getaggt wurden. Bildunterschriften können visuelle Embeddings und Metadaten ergänzen und so die Auffindbarkeit über große Kataloge hinweg verbessern.

Praktische Fundierung mit Ultralytics YOLO#

Beschreibungsgeneratoren können nicht unterstützte Details erfinden, insbesondere in überfüllten oder ungewohnten Szenen. Ein praktisches Design besteht darin, die Generierung mit strukturierten Beobachtungen aus Ultralytics YOLO26 abzusichern. Der folgende dokumentierte YOLO prediction workflow extrahiert erkannte Objektnamen, die eine nachgeschaltete Sprachkomponente als visuellen Kontext verwenden kann:

from ultralytics import YOLO

# Detect objects that can ground a downstream caption generator
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]

# Convert detections into compact textual context
detections = result.summary()
object_names = sorted({item["name"] for item in detections})

visual_context = ", ".join(object_names)
print(visual_context)

Dieser Workflow erzeugt nicht die finale Bildunterschrift. Stattdessen liefert er verifizierbare Objekt-Labels, die ein Sprachmodell einschränken können. Für benutzerdefinierte Domänen unterstützt die Ultralytics Platform Cloud-Datensatzannotation, Training, Bereitstellung und Überwachung für die Wahrnehmungskomponente einer Beschreibungs-Pipeline.

Einschränkungen und Evaluierung#

Bildunterschriften können wichtige Objekte auslassen, Beziehungen verwechseln, Datensatz-Bias reproduzieren oder Details halluzinieren, die nicht sichtbar sind. Konfidenzwerte können dabei helfen, Kandidatenbeschreibungen zu ranken, wie die Azure image description API veranschaulicht, aber ein flüssiger Satz ist nicht unbedingt faktisch korrekt.

Die Evaluierung sollte daher die Objektabdeckung, die faktenbasierte Fundierung, die Lesbarkeit, den Bias und den Nutzen für die Zielgruppe untersuchen. Da mehrere Bildunterschriften gleichermaßen korrekt sein können, sollten Teams automatisierte Messungen mit menschlicher Überprüfung kombinieren und dabei Praktiken wie generative AI evaluation und das umfassendere NIST AI Risk Management Framework befolgen. Die menschliche Freigabe bleibt insbesondere für Barrierefreiheit, medizinische, sicherheitskritische oder öffentlich zugängliche Inhalte wichtig.

Explore solutions

Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr

Lass uns gemeinsam die Zukunft der KI bauen!

Beginne deine Reise mit der Zukunft des maschinellen Lernens