Image Captioning
Le légendage d’images consiste à rédiger une description en langage naturel d’une image à l’aide de modèles vision-langage. Présente les usages, les limites et l’ancrage des légendes avec YOLO.
La génération de légendes d’images est une tâche d’IA qui produit automatiquement une description en langage naturel d’une image. À partir d’une photo de rue, par exemple, un système pourrait générer : « Un autobus urbain passe devant des piétons à une intersection. » Cette tâche combine perception visuelle et génération de langage : le modèle doit donc repérer les éléments importants, comprendre les relations entre les objets et exprimer clairement ces informations.
La génération de légendes est couramment effectuée par un modèle vision-langage, qui traite des données visuelles et textuelles. Contrairement à une légende rédigée manuellement, une légende générée par l’IA est une prédiction fondée sur des motifs appris à partir de paires image-texte.
Fonctionnement de la génération de légendes d’images#
Un système de génération de légendes d’images comprend généralement deux étapes liées :
- Un encodeur visuel transforme les pixels en représentations de caractéristiques décrivant les objets, les textures, les emplacements et les informations générales sur la scène.
- Un décodeur de langage transforme ces caractéristiques visuelles en une séquence de mots.
De nombreux systèmes utilisent un décodeur Transformer. Il commence par un jeton de début, prédit le jeton suivant, l’ajoute à la séquence et répète l’opération jusqu’à générer un jeton de fin ou à atteindre une limite de longueur. Ce processus, qui produit un jeton à la fois, s’appelle la génération autorégressive.
La boucle complète encodeur-décodeur se présente ainsi :
Un mécanisme d’attention aide le décodeur à se concentrer sur les régions pertinentes de l’image lorsqu’il choisit chaque mot. Lorsqu’il génère « bus », il peut mettre l’accent sur le véhicule ; lorsqu’il génère « rue », il peut porter son attention sur la chaussée environnante. Un modèle complet de génération de légendes d’images combine les caractéristiques de l’image, la tokenisation, l’attention croisée et un décodeur de texte.
L’entraînement nécessite généralement des images associées à une ou plusieurs légendes rédigées par des humains. Plusieurs légendes sont utiles, car une même image peut être décrite correctement de différentes façons, par exemple « Un enfant joue avec un chien » et « Un jeune lance une balle à un animal de compagnie ».
Différences avec les tâches de vision apparentées#
La génération de légendes d’images recoupe plusieurs tâches d’IA, mais produit un résultat distinct :
- La classification d’images attribue une ou plusieurs étiquettes à l’image entière, par exemple « plage ». La génération de légendes produit une phrase pouvant décrire des objets, des actions, des attributs et le contexte.
- La détection d’objets identifie et localise les objets prédéfinis à l’aide de boîtes englobantes. La génération de légendes peut mentionner ces objets, mais décrit aussi leurs relations, par exemple « Deux cyclistes roulent à côté d’une voiture ».
- La reconnaissance optique de caractères extrait les textes visibles sur des panneaux, des documents ou des emballages. Une légende résume la scène au lieu de transcrire tout le texte.
- La réponse à des questions visuelles répond à une question précise sur une image. La génération de légendes crée une description générale sans qu’une question soit nécessaire.
- Le texte alternatif communique la fonction d’une image dans un contexte donné. Une légende automatisée peut fournir une ébauche, mais ne convient pas automatiquement comme texte alternatif, car les images décoratives, fonctionnelles et complexes exigent des traitements différents selon le tutoriel du W3C sur les images.
Applications concrètes#
-
Contenu Web accessible : Une plateforme de publication peut générer des descriptions préliminaires pour les nouvelles photos mises en ligne. Pour une image d’actualité, la légende pourrait identifier les personnes principales, le lieu et l’action avant qu’un éditeur n’en vérifie l’exactitude et la pertinence. Les diagrammes complexes nécessitent toujours une longue description structurée plutôt qu’un résumé visuel générique.
-
Bibliothèques multimédias interrogeables : Un détaillant ou une entreprise médiatique peut générer des légendes pour de grandes collections d’images et indexer le texte produit. Les utilisateurs peuvent alors rechercher des expressions telles que « sac à dos rouge à côté d’une tente », même si les fichiers n’ont jamais été étiquetés manuellement. Les légendes peuvent compléter les plongements visuels et les métadonnées afin d’améliorer la recherche dans de grands catalogues.
Ancrage pratique avec Ultralytics YOLO#
Les générateurs de légendes peuvent inventer des détails non étayés, en particulier dans des scènes encombrées ou inhabituelles. Une approche pratique consiste à ancrer la génération dans des observations structurées d’Ultralytics YOLO26. Le flux de prédiction YOLO documenté ci-dessous extrait les noms des objets détectés, qu’un composant de langage en aval peut utiliser comme contexte visuel :
from ultralytics import YOLO
# Détecter les objets susceptibles d’ancrer un générateur de légendes en aval
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Convertir les détections en un contexte textuel concis
detections = result.summary()
object_names = sorted({item["name"] for item in detections})
visual_context = ", ".join(object_names)
print(visual_context)Ce flux de travail ne produit pas la légende finale. Il fournit plutôt des étiquettes d’objets vérifiables, qui peuvent contraindre un modèle de langage. Pour les domaines personnalisés, Ultralytics Platform permet d’annoter des jeux de données dans le cloud, d’entraîner et de déployer des modèles, et de surveiller le composant de perception d’un pipeline de génération de légendes.
Limites et évaluation#
Les légendes peuvent omettre des objets importants, confondre des relations, reproduire les biais du jeu de données ou halluciner des détails invisibles. Les scores de confiance, comme ceux renvoyés par une API de description d’images, peuvent aider à classer les descriptions candidates, mais une phrase fluide n’est pas nécessairement factuelle.
L’évaluation doit donc examiner la couverture des objets, l’ancrage factuel, la lisibilité, les biais et l’utilité pour le public visé. Comme plusieurs légendes peuvent être tout aussi correctes, les équipes doivent combiner des mesures automatisées et une révision humaine, en suivant des pratiques telles que l’évaluation de l’IA générative et le NIST AI Risk Management Framework, plus général. L’approbation humaine reste particulièrement importante pour les contenus liés à l’accessibilité, à la médecine, à la sécurité critique ou destinés au public.










