Image Captioning
Beim Image Captioning wird mithilfe von Vision-Language-Modellen eine natürlichsprachliche Beschreibung eines Bildes erstellt. Behandelt Anwendungsfälle, Grenzen und die Verankerung von Bildbeschreibungen mit YOLO.
Bildbeschriftung ist eine KI-Aufgabe, bei der automatisch eine natürlichsprachliche Beschreibung eines Bildes erstellt wird. Ein System könnte zum Beispiel ein Straßenfoto mit „Ein Stadtbus fährt an einer Kreuzung an Fußgängern vorbei“ beschreiben. Die Aufgabe verbindet visuelle Wahrnehmung mit Sprachgenerierung. Das Modell muss also wichtige Inhalte erkennen, Beziehungen zwischen Objekten verstehen und diese Informationen klar ausdrücken.
Die Bildbeschriftung wird üblicherweise von einem Bild-Sprach-Modell übernommen, das mit visuellen und textuellen Daten arbeitet. Anders als eine manuell verfasste Bildunterschrift ist eine KI-generierte Beschriftung eine Vorhersage auf Grundlage von Mustern, die aus Bild-Text-Paaren gelernt wurden.
So funktioniert die Bildbeschriftung#
Ein System zur Bildbeschriftung besteht üblicherweise aus zwei verbundenen Stufen:
- Ein Bild-Encoder wandelt Pixel in Merkmalsrepräsentationen um, die Objekte, Texturen, Positionen und umfassendere Szeneninformationen beschreiben.
- Ein Sprachdecoder wandelt diese visuellen Merkmale in eine Wortfolge um.
Viele Systeme verwenden einen Transformer-Decoder. Er beginnt mit einem Start-Token, sagt das nächste Token voraus, fügt es der Sequenz hinzu und wiederholt den Vorgang, bis ein End-Token erzeugt oder eine Längenbegrenzung erreicht wird. Dieser Token-für-Token-Ablauf heißt autoregressive Generierung.
Die vollständige Encoder-Decoder-Schleife sieht so aus:
Ein Aufmerksamkeitsmechanismus hilft dem Decoder, sich bei der Wortauswahl auf relevante Bildbereiche zu konzentrieren. Bei der Generierung von „Bus“ kann er das Fahrzeug hervorheben; bei „Straße“ richtet er seine Aufmerksamkeit möglicherweise auf die umgebende Fahrbahn. Ein vollständiges Bildbeschreibungsmodell kombiniert Bildmerkmale, Tokenisierung, Kreuzaufmerksamkeit und einen Textdecoder.
Für das Training werden in der Regel Bilder benötigt, die mit einer oder mehreren von Menschen verfassten Bildbeschreibungen verknüpft sind. Mehrere Beschreibungen sind hilfreich, weil dasselbe Bild auf verschiedene Weise korrekt beschrieben werden kann, etwa mit „Ein Kind spielt mit einem Hund“ und „Eine junge Person wirft einem Haustier einen Ball zu“.
Unterschiede zu verwandten Bildverarbeitungsaufgaben#
Die Bildbeschriftung überschneidet sich mit mehreren KI-Aufgaben, erzeugt jedoch eine andere Ausgabe:
- Bildklassifizierung weist dem gesamten Bild eine oder mehrere Bezeichnungen zu, zum Beispiel „Strand“. Beim Beschriften werden Sätze generiert, die Objekte, Handlungen, Eigenschaften und Kontext beschreiben können.
- Objekterkennung erkennt vordefinierte Objekte und lokalisiert sie mit Begrenzungsrahmen. Bildbeschreibungen können diese Objekte erwähnen, aber auch ihre Beziehungen beschreiben, etwa „Zwei Radfahrer fahren neben einem Auto.“
- Optische Zeichenerkennung extrahiert sichtbaren Text aus Schildern, Dokumenten oder Verpackungen. Eine Bildbeschriftung fasst die Szene zusammen, statt den gesamten Text zu transkribieren.
- Visuelle Fragebeantwortung beantwortet eine konkrete Frage zu einem Bild. Die Bildbeschriftung erstellt eine allgemeine Beschreibung, ohne dass eine Frage gestellt werden muss.
- Alternativtext vermittelt den Zweck eines Bildes in einem bestimmten Kontext. Eine automatisch erzeugte Bildbeschriftung kann als Entwurf dienen, eignet sich aber nicht automatisch als Alternativtext, da dekorative, funktionale und komplexe Bilder gemäß dem W3C-Tutorial zu Bildern unterschiedlich behandelt werden müssen.
Anwendungen in der Praxis#
-
Barrierefreie Webinhalte: Eine Veröffentlichungsplattform kann Entwurfsbeschreibungen für neu hochgeladene Fotos erstellen. Bei einem Nachrichtenbild könnte die Beschriftung die wichtigsten Personen, den Schauplatz und die Handlung nennen, bevor eine Redaktion sie auf Richtigkeit und Relevanz prüft. Für komplexe Diagramme ist weiterhin eine strukturierte ausführliche Beschreibung statt einer allgemeinen visuellen Zusammenfassung erforderlich.
-
Durchsuchbare Medienbibliotheken: Ein Einzelhändler oder Medienunternehmen kann große Bildsammlungen beschriften und den erzeugten Text indexieren. Nutzer können dann nach Formulierungen wie „roter Rucksack neben einem Zelt“ suchen, auch wenn die Dateien nie manuell verschlagwortet wurden. Bildbeschriftungen können visuelle Einbettungen und Metadaten ergänzen und so die Suche in großen Katalogen verbessern.
Praktische Verankerung mit Ultralytics YOLO#
Bildbeschriftungssysteme können nicht belegte Details erfinden, besonders bei überfüllten oder unbekannten Szenen. Ein praktischer Ansatz ist, die Generierung mit strukturierten Beobachtungen aus Ultralytics YOLO26 zu verankern. Der folgende dokumentierte YOLO-Vorhersageablauf extrahiert erkannte Objektnamen, die eine nachgelagerte Sprachkomponente als visuellen Kontext verwenden kann:
from ultralytics import YOLO
# Erkenne Objekte, die eine nachgelagerte Bildbeschriftung verankern können
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Wandle Erkennungen in kompakten Textkontext um
detections = result.summary()
object_names = sorted({item["name"] for item in detections})
visual_context = ", ".join(object_names)
print(visual_context)Dieser Ablauf erstellt nicht die endgültige Bildbeschriftung. Stattdessen liefert er überprüfbare Objektlabels, die ein Sprachmodell einschränken können. Für benutzerdefinierte Anwendungsbereiche unterstützt die Ultralytics Platform die cloudbasierte Annotation, das Training, die Bereitstellung und die Überwachung von Datensätzen für die Wahrnehmungskomponente einer Bildbeschriftungspipeline.
Einschränkungen und Auswertung#
Bildbeschreibungen lassen möglicherweise wichtige Objekte aus, verwechseln Beziehungen, reproduzieren Verzerrungen im Datensatz oder erfinden nicht sichtbare Details. Konfidenzwerte, wie sie eine API zur Bildbeschreibung zurückgibt, können beim Sortieren möglicher Beschreibungen helfen, doch ein flüssig formulierter Satz ist nicht zwangsläufig sachlich richtig.
Bei der Auswertung sollten daher Objektabdeckung, sachliche Verankerung, Lesbarkeit, Verzerrungen und der Nutzen für die vorgesehene Zielgruppe berücksichtigt werden. Da mehrere Bildbeschreibungen gleichermaßen korrekt sein können, sollten Teams automatisierte Messungen mit menschlicher Prüfung kombinieren und sich an Verfahren wie der Auswertung generativer KI und dem umfassenderen NIST-Rahmenwerk für das Risikomanagement von KI orientieren. Eine Freigabe durch Menschen bleibt besonders wichtig für barrierefreie, medizinische, sicherheitskritische oder öffentlich zugängliche Inhalte.










