Ultralytics YOLO27:
YOLO lizenzieren
Zurück zum Ultralytics-Glossar

Image Captioning

Beim Image Captioning wird mithilfe von Vision-Language-Modellen eine natürlichsprachliche Beschreibung eines Bildes erstellt. Behandelt Anwendungsfälle, Grenzen und die Verankerung von Bildbeschreibungen mit YOLO.

Bildbeschriftung ist eine KI-Aufgabe, bei der automatisch eine natürlichsprachliche Beschreibung eines Bildes erstellt wird. Ein System könnte zum Beispiel ein Straßenfoto mit „Ein Stadtbus fährt an einer Kreuzung an Fußgängern vorbei“ beschreiben. Die Aufgabe verbindet visuelle Wahrnehmung mit Sprachgenerierung. Das Modell muss also wichtige Inhalte erkennen, Beziehungen zwischen Objekten verstehen und diese Informationen klar ausdrücken.

Die Bildbeschriftung wird üblicherweise von einem Bild-Sprach-Modell übernommen, das mit visuellen und textuellen Daten arbeitet. Anders als eine manuell verfasste Bildunterschrift ist eine KI-generierte Beschriftung eine Vorhersage auf Grundlage von Mustern, die aus Bild-Text-Paaren gelernt wurden.

So funktioniert die Bildbeschriftung#

Ein System zur Bildbeschriftung besteht üblicherweise aus zwei verbundenen Stufen:

  1. Ein Bild-Encoder wandelt Pixel in Merkmalsrepräsentationen um, die Objekte, Texturen, Positionen und umfassendere Szeneninformationen beschreiben.
  2. Ein Sprachdecoder wandelt diese visuellen Merkmale in eine Wortfolge um.

Viele Systeme verwenden einen Transformer-Decoder. Er beginnt mit einem Start-Token, sagt das nächste Token voraus, fügt es der Sequenz hinzu und wiederholt den Vorgang, bis ein End-Token erzeugt oder eine Längenbegrenzung erreicht wird. Dieser Token-für-Token-Ablauf heißt autoregressive Generierung.

Die vollständige Encoder-Decoder-Schleife sieht so aus:

Ein Aufmerksamkeitsmechanismus hilft dem Decoder, sich bei der Wortauswahl auf relevante Bildbereiche zu konzentrieren. Bei der Generierung von „Bus“ kann er das Fahrzeug hervorheben; bei „Straße“ richtet er seine Aufmerksamkeit möglicherweise auf die umgebende Fahrbahn. Ein vollständiges Bildbeschreibungsmodell kombiniert Bildmerkmale, Tokenisierung, Kreuzaufmerksamkeit und einen Textdecoder.

Für das Training werden in der Regel Bilder benötigt, die mit einer oder mehreren von Menschen verfassten Bildbeschreibungen verknüpft sind. Mehrere Beschreibungen sind hilfreich, weil dasselbe Bild auf verschiedene Weise korrekt beschrieben werden kann, etwa mit „Ein Kind spielt mit einem Hund“ und „Eine junge Person wirft einem Haustier einen Ball zu“.

Die Bildbeschriftung überschneidet sich mit mehreren KI-Aufgaben, erzeugt jedoch eine andere Ausgabe:

  • Bildklassifizierung weist dem gesamten Bild eine oder mehrere Bezeichnungen zu, zum Beispiel „Strand“. Beim Beschriften werden Sätze generiert, die Objekte, Handlungen, Eigenschaften und Kontext beschreiben können.
  • Objekterkennung erkennt vordefinierte Objekte und lokalisiert sie mit Begrenzungsrahmen. Bildbeschreibungen können diese Objekte erwähnen, aber auch ihre Beziehungen beschreiben, etwa „Zwei Radfahrer fahren neben einem Auto.“
  • Optische Zeichenerkennung extrahiert sichtbaren Text aus Schildern, Dokumenten oder Verpackungen. Eine Bildbeschriftung fasst die Szene zusammen, statt den gesamten Text zu transkribieren.
  • Visuelle Fragebeantwortung beantwortet eine konkrete Frage zu einem Bild. Die Bildbeschriftung erstellt eine allgemeine Beschreibung, ohne dass eine Frage gestellt werden muss.
  • Alternativtext vermittelt den Zweck eines Bildes in einem bestimmten Kontext. Eine automatisch erzeugte Bildbeschriftung kann als Entwurf dienen, eignet sich aber nicht automatisch als Alternativtext, da dekorative, funktionale und komplexe Bilder gemäß dem W3C-Tutorial zu Bildern unterschiedlich behandelt werden müssen.

Anwendungen in der Praxis#

  • Barrierefreie Webinhalte: Eine Veröffentlichungsplattform kann Entwurfsbeschreibungen für neu hochgeladene Fotos erstellen. Bei einem Nachrichtenbild könnte die Beschriftung die wichtigsten Personen, den Schauplatz und die Handlung nennen, bevor eine Redaktion sie auf Richtigkeit und Relevanz prüft. Für komplexe Diagramme ist weiterhin eine strukturierte ausführliche Beschreibung statt einer allgemeinen visuellen Zusammenfassung erforderlich.

  • Durchsuchbare Medienbibliotheken: Ein Einzelhändler oder Medienunternehmen kann große Bildsammlungen beschriften und den erzeugten Text indexieren. Nutzer können dann nach Formulierungen wie „roter Rucksack neben einem Zelt“ suchen, auch wenn die Dateien nie manuell verschlagwortet wurden. Bildbeschriftungen können visuelle Einbettungen und Metadaten ergänzen und so die Suche in großen Katalogen verbessern.

Praktische Verankerung mit Ultralytics YOLO#

Bildbeschriftungssysteme können nicht belegte Details erfinden, besonders bei überfüllten oder unbekannten Szenen. Ein praktischer Ansatz ist, die Generierung mit strukturierten Beobachtungen aus Ultralytics YOLO26 zu verankern. Der folgende dokumentierte YOLO-Vorhersageablauf extrahiert erkannte Objektnamen, die eine nachgelagerte Sprachkomponente als visuellen Kontext verwenden kann:

from ultralytics import YOLO

# Erkenne Objekte, die eine nachgelagerte Bildbeschriftung verankern können
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]

# Wandle Erkennungen in kompakten Textkontext um
detections = result.summary()
object_names = sorted({item["name"] for item in detections})

visual_context = ", ".join(object_names)
print(visual_context)

Dieser Ablauf erstellt nicht die endgültige Bildbeschriftung. Stattdessen liefert er überprüfbare Objektlabels, die ein Sprachmodell einschränken können. Für benutzerdefinierte Anwendungsbereiche unterstützt die Ultralytics Platform die cloudbasierte Annotation, das Training, die Bereitstellung und die Überwachung von Datensätzen für die Wahrnehmungskomponente einer Bildbeschriftungspipeline.

Einschränkungen und Auswertung#

Bildbeschreibungen lassen möglicherweise wichtige Objekte aus, verwechseln Beziehungen, reproduzieren Verzerrungen im Datensatz oder erfinden nicht sichtbare Details. Konfidenzwerte, wie sie eine API zur Bildbeschreibung zurückgibt, können beim Sortieren möglicher Beschreibungen helfen, doch ein flüssig formulierter Satz ist nicht zwangsläufig sachlich richtig.

Bei der Auswertung sollten daher Objektabdeckung, sachliche Verankerung, Lesbarkeit, Verzerrungen und der Nutzen für die vorgesehene Zielgruppe berücksichtigt werden. Da mehrere Bildbeschreibungen gleichermaßen korrekt sein können, sollten Teams automatisierte Messungen mit menschlicher Prüfung kombinieren und sich an Verfahren wie der Auswertung generativer KI und dem umfassenderen NIST-Rahmenwerk für das Risikomanagement von KI orientieren. Eine Freigabe durch Menschen bleibt besonders wichtig für barrierefreie, medizinische, sicherheitskritische oder öffentlich zugängliche Inhalte.

Explore solutions

Computer Vision im Sport

Computer Vision im Sport

Entdecke, wie Ultralytics YOLO die Sportbildanalyse voranbringt – mit Spieler- und Ballverfolgung, Leistungsanalysen, Erkenntnissen für das Coaching und der Rehabilitation von Athleten.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Wandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeit-Erkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse um.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Setze Vision AI für die Überwachung aus der Luft mit Ultralytics YOLO-Modellen ein. Nutze Computer-Vision-Lösungen für Drohnen, Abläufe in der Luft- und Raumfahrt, Umweltschutz und Geodatenbranchen.
Mehr erfahren
Computer Vision im Sicherheitsbereich

Computer Vision im Sicherheitsbereich

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision-KI ermöglicht die Überwachung von Grundstücksgrenzen, die Erkennung von Bedrohungen, die Kennzeichenerkennung und die Sicherheit am Arbeitsplatz.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mach Maschinen mit Ultralytics YOLO-Modellen leistungsfähiger. Vision-KI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Bildverarbeitung in der Logistik

Bildverarbeitung in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketprüfung, Sortierung und Fahrzeugverfolgung sowie die Sicherheitsüberwachung von Lagerhäusern in Echtzeit.
Mehr erfahren
Bildverarbeitung im Einzelhandel

Bildverarbeitung im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung und Warteschlangenmanagement und liefert bessere Einblicke in das Kundenverhalten.
Mehr erfahren
Bildverarbeitung im Gesundheitswesen

Bildverarbeitung im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI ermöglicht im Gesundheitswesen schnellere medizinische Bildgebung, bessere Diagnostik und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics-YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Überprüfung der Einhaltung von Vorgaben zu persönlicher Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilbranche

Computer Vision in der Automobilbranche

Setze Computer Vision in der Automobilbranche mit Ultralytics-YOLO-Modellen ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung – für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Setze mit Ultralytics YOLO-Modellen KI für Bildverarbeitung in der intelligenten Landwirtschaft ein. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und nachhaltigere Erträge.
Mehr erfahren
Computer Vision im Sport

Computer Vision im Sport

Entdecke, wie Ultralytics YOLO die Sportbildanalyse voranbringt – mit Spieler- und Ballverfolgung, Leistungsanalysen, Erkenntnissen für das Coaching und der Rehabilitation von Athleten.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Wandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeit-Erkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse um.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Setze Vision AI für die Überwachung aus der Luft mit Ultralytics YOLO-Modellen ein. Nutze Computer-Vision-Lösungen für Drohnen, Abläufe in der Luft- und Raumfahrt, Umweltschutz und Geodatenbranchen.
Mehr erfahren
Computer Vision im Sicherheitsbereich

Computer Vision im Sicherheitsbereich

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision-KI ermöglicht die Überwachung von Grundstücksgrenzen, die Erkennung von Bedrohungen, die Kennzeichenerkennung und die Sicherheit am Arbeitsplatz.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mach Maschinen mit Ultralytics YOLO-Modellen leistungsfähiger. Vision-KI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Bildverarbeitung in der Logistik

Bildverarbeitung in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketprüfung, Sortierung und Fahrzeugverfolgung sowie die Sicherheitsüberwachung von Lagerhäusern in Echtzeit.
Mehr erfahren
Bildverarbeitung im Einzelhandel

Bildverarbeitung im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung und Warteschlangenmanagement und liefert bessere Einblicke in das Kundenverhalten.
Mehr erfahren
Bildverarbeitung im Gesundheitswesen

Bildverarbeitung im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI ermöglicht im Gesundheitswesen schnellere medizinische Bildgebung, bessere Diagnostik und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics-YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Überprüfung der Einhaltung von Vorgaben zu persönlicher Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilbranche

Computer Vision in der Automobilbranche

Setze Computer Vision in der Automobilbranche mit Ultralytics-YOLO-Modellen ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung – für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Setze mit Ultralytics YOLO-Modellen KI für Bildverarbeitung in der intelligenten Landwirtschaft ein. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und nachhaltigere Erträge.
Mehr erfahren
Computer Vision im Sport

Computer Vision im Sport

Entdecke, wie Ultralytics YOLO die Sportbildanalyse voranbringt – mit Spieler- und Ballverfolgung, Leistungsanalysen, Erkenntnissen für das Coaching und der Rehabilitation von Athleten.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Wandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeit-Erkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse um.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Setze Vision AI für die Überwachung aus der Luft mit Ultralytics YOLO-Modellen ein. Nutze Computer-Vision-Lösungen für Drohnen, Abläufe in der Luft- und Raumfahrt, Umweltschutz und Geodatenbranchen.
Mehr erfahren
Computer Vision im Sicherheitsbereich

Computer Vision im Sicherheitsbereich

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision-KI ermöglicht die Überwachung von Grundstücksgrenzen, die Erkennung von Bedrohungen, die Kennzeichenerkennung und die Sicherheit am Arbeitsplatz.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mach Maschinen mit Ultralytics YOLO-Modellen leistungsfähiger. Vision-KI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Bildverarbeitung in der Logistik

Bildverarbeitung in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketprüfung, Sortierung und Fahrzeugverfolgung sowie die Sicherheitsüberwachung von Lagerhäusern in Echtzeit.
Mehr erfahren
Bildverarbeitung im Einzelhandel

Bildverarbeitung im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung und Warteschlangenmanagement und liefert bessere Einblicke in das Kundenverhalten.
Mehr erfahren
Bildverarbeitung im Gesundheitswesen

Bildverarbeitung im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI ermöglicht im Gesundheitswesen schnellere medizinische Bildgebung, bessere Diagnostik und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics-YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Überprüfung der Einhaltung von Vorgaben zu persönlicher Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilbranche

Computer Vision in der Automobilbranche

Setze Computer Vision in der Automobilbranche mit Ultralytics-YOLO-Modellen ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung – für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Setze mit Ultralytics YOLO-Modellen KI für Bildverarbeitung in der intelligenten Landwirtschaft ein. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und nachhaltigere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Starte deine Reise in die Zukunft des maschinellen Lernens