Image Captioning
Apprends comment la génération de légendes d'images utilise des modèles vision-langage pour créer des descriptions d'images, explore des applications concrètes et ancre les légendes avec Ultralytics YOLO26.
La génération de légendes d'image est une tâche d'IA qui produit automatiquement une description en langage naturel d'une image. Étant donnée une photo de rue, par exemple, un système peut générer : « Un bus urbain passe devant des piétons à une intersection. » Cette tâche associe perception visuelle et génération de langage, de sorte que le modèle doit identifier le contenu important, comprendre les relations entre les objets et exprimer clairement cette information.
La génération de légendes est couramment assurée par un modèle vision-langage, qui traite à la fois des données visuelles et textuelles. Contrairement à une légende de photo rédigée manuellement, une légende générée par l'IA est une prédiction basée sur des motifs appris à partir de paires image-texte.
Fonctionnement de la génération de légendes d'image#
Un système de génération de légendes d'image comprend généralement deux étapes connectées :
- Un encodeur de vision convertit les pixels en représentations de caractéristiques décrivant les objets, les textures, les emplacements et des informations plus larges sur la scène.
- Un décodeur de langage transforme ces caractéristiques visuelles en une séquence de mots.
De nombreux systèmes utilisent un décodeur transformer. Il commence par un jeton de début, prédit le jeton suivant, l'ajoute à la séquence et répète l'opération jusqu'à ce qu'il génère un jeton de fin ou atteigne une limite de longueur. Le glossaire de machine learning de Google décrit ce processus jeton par jeton sous le nom de génération autorégressive.
Un mécanisme d'attention aide le décodeur à se concentrer sur les régions pertinentes de l'image lors du choix de chaque mot. Lors de la génération de « bus », il peut mettre l'accent sur le véhicule ; lors de la génération de « rue », il peut porter son attention sur la route environnante. Le tutoriel TensorFlow sur la génération de légendes d'image montre comment les caractéristiques d'image, la tokenisation, l'attention croisée et un décodeur de texte s'articulent.
L'entraînement nécessite généralement des images associées à une ou plusieurs légendes rédigées par des humains. Plusieurs légendes sont utiles car une même image peut être décrite correctement de différentes manières, par exemple « Un enfant qui joue avec un chien » et « Un jeune lance une balle pour un animal de compagnie ».
Différences avec les tâches de vision connexes#
La génération de légendes d'image chevauche plusieurs tâches d'IA mais produit un résultat distinct :
- La classification d'image attribue une ou plusieurs étiquettes à l'image entière, telles que « plage ». La génération de légendes produit une phrase qui peut décrire des objets, des actions, des attributs et un contexte.
- La détection d'objets identifie et localise des objets prédéfinis à l'aide de boîtes englobantes. La génération de légendes peut mentionner ces objets mais décrit également leurs relations, comme « Deux cyclistes roulant à côté d'une voiture ».
- La reconnaissance optique de caractères extrait les textes visibles de panneaux, de documents ou d'emballages. Une légende résume la scène plutôt de transcrire tout le texte.
- Le visual question answering répond à une question spécifique sur une image. La génération de légendes crée une description générale sans nécessiter de question.
- Le texte alternatif communique l'objectif d'une image dans un contexte particulier. Une légende automatisée peut fournir un brouillon, mais elle ne constitue pas automatiquement un texte alternatif adapté, car les images décoratives, fonctionnelles et complexes nécessitent un traitement différent selon le tutoriel W3C sur les images.
Applications concrètes#
-
Contenu web accessible : Une plateforme de publication peut générer des brouillons de descriptions pour des photographies nouvellement importées. Pour une image d'actualité, la légende peut identifier les principales personnes, le décor et l'action avant qu'un éditeur ne vérifie son exactitude et sa pertinence. Les diagrammes complexes nécessitent toujours une description longue structurée plutôt qu'un résumé visuel générique.
-
Bibliothèques de médias interrogeables : Un détaillant ou une entreprise de médias peut légender de grandes collections d'images et indexer le texte généré. Les utilisateurs peuvent ensuite rechercher des expressions telles que « sac à dos rouge à côté d'une tente » même si les fichiers n'ont jamais été étiquetés manuellement. Les légendes peuvent compléter les plongements visuels et les métadonnées, améliorant la découverte dans de grands catalogues.
Ancrage pratique avec Ultralytics YOLO#
Les générateurs de légendes peuvent inventer des détails non fondés, en particulier dans des scènes encombrées ou non familières. Une conception pratique consiste à ancrer la génération sur des observations structurées issues d'Ultralytics YOLO26. Le flux de travail de prédiction YOLO documenté ci-dessous extrait les noms d'objets détectés qu'un composant linguistique en aval peut utiliser comme contexte visuel :
from ultralytics import YOLO
# Detect objects that can ground a downstream caption generator
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Convert detections into compact textual context
detections = result.summary()
object_names = sorted({item["name"] for item in detections})
visual_context = ", ".join(object_names)
print(visual_context)Ce flux de travail ne produit pas la légende finale. Il fournit plutôt des étiquettes d'objets vérifiables capables de contraindre un modèle de langage. Pour les domaines personnalisés, la plateforme Ultralytics prend en charge l'annotation de jeux de données dans le cloud, l'entraînement, le déploiement et la surveillance pour le composant de perception d'un pipeline de génération de légendes.
Limites et évaluation#
Les légendes peuvent omettre des objets importants, confondre des relations, reproduire le biais d'un jeu de données ou halluciner des détails non visibles. Les scores de confiance peuvent aider à classer les descriptions candidates, comme l'illustre l'API de description d'image Azure, mais une phrase fluide n'est pas nécessairement factuelle.
L'évaluation doit donc examiner la couverture des objets, l'ancrage factuel, la lisibilité, les biais et l'utilité pour le public cible. Étant donné que plusieurs légendes peuvent être tout aussi correctes, les équipes doivent combiner des mesures automatisées et une révision humaine, en suivant des pratiques telles que l'évaluation de l'IA générative et le cadre de gestion des risques de l'IA du NIST plus global. L'approbation humaine reste particulièrement importante pour le contenu accessible, médical, critique pour la sécurité ou destiné au grand public.






