Grounding
Découvre les fondamentaux du grounding en IA. Apprends à relier le langage naturel aux données visuelles avec Ultralytics YOLO26 et YOLO-World pour la détection à vocabulaire ouvert.
L’ancrage désigne la capacité d’un système d’intelligence artificielle à relier des concepts abstraits — généralement issus du langage naturel — à des représentations spécifiques et concrètes du monde physique, telles que des données visuelles ou des entrées sensorielles. Dans le contexte de la vision par ordinateur, cela signifie qu’un modèle ne se contente pas de traiter du texte ; il peut analyser une expression comme « une personne promenant un chien » et localiser précisément ces entités dans une image ou un flux vidéo. Ce processus comble le fossé entre le raisonnement symbolique et la perception au niveau des pixels, en répondant au problème de l’ancrage des symboles en sciences cognitives. En reliant les tokens linguistiques aux caractéristiques visuelles, l’ancrage constitue une pierre angulaire de l’IA multimodale moderne, permettant aux machines d’interagir plus intuitivement avec des environnements humains dynamiques.
Mécanismes de l’ancrage#
Sur le plan technique, l’ancrage consiste à aligner des données provenant de différentes modalités dans un espace vectoriel partagé de grande dimension. Les architectures avancées, souvent fondées sur le framework Transformer utilisé dans le traitement automatique du langage naturel (NLP), génèrent des représentations numériques appelées représentations vectorielles pour les descriptions textuelles comme pour les entrées visuelles. Lors de l’entraînement, le modèle apprend à réduire la distance entre la représentation vectorielle d’une invite textuelle (par exemple, « sac à dos bleu ») et celle de la région visuelle correspondante.
Cet alignement permet la détection à vocabulaire ouvert. Contrairement à l’apprentissage supervisé traditionnel, où un modèle est limité à un ensemble fixe de catégories, l’ancrage permet l’apprentissage sans exemples. Un modèle doté de capacités d’ancrage peut identifier des objets qu’il n’a jamais vus explicitement pendant l’entraînement, à condition de comprendre le langage qui les décrit. Cette flexibilité est prise en charge par des frameworks de deep learning comme PyTorch, qui facilitent les opérations matricielles complexes nécessaires à ces alignements multimodaux.
Applications concrètes#
La technologie d’ancrage transforme les secteurs d’activité en permettant aux systèmes d’interpréter efficacement l’intention des utilisateurs et de naviguer dans des environnements non structurés.
- IA en robotique : L’ancrage est essentiel pour les agents autonomes qui exécutent des instructions vocales. Si on demande à un robot d’entrepôt de « prendre le colis sur l’étagère du haut », il doit associer les concepts « colis » et « étagère du haut » à des coordonnées 3D précises dans son champ de vision. Cette capacité constitue un axe majeur de la recherche en robotique au MIT CSAIL, permettant aux robots de fonctionner en toute sécurité aux côtés des humains.
- Recherche sémantique et récupération de contenus multimédias : L’ancrage alimente des moteurs de recherche avancés qui vont au-delà de la correspondance de mots-clés. Les utilisateurs peuvent interroger des archives vidéo avec des descriptions complexes comme « un cycliste tournant à gauche au coucher du soleil », et le système utilise l’ancrage pour retrouver les horodatages précis. Cela améliore considérablement la compréhension vidéo dans les domaines de la sécurité et de la gestion des contenus multimédias.
- Technologies d’assistance : Pour les personnes malvoyantes, l’ancrage permet à des applications de décrire leur environnement en temps réel ou de répondre à des questions sur celui-ci, en s’appuyant sur une reconnaissance d’image robuste associée à la génération vocale.
L’ancrage avec Ultralytics YOLO-World#
L’écosystème Ultralytics prend en charge l’ancrage grâce à des architectures spécialisées comme YOLO-World. Alors que les modèles standards nécessitent un entraînement sur des jeux de données spécifiques, YOLO-World permet aux utilisateurs de définir instantanément des classes de détection personnalisées à l’aide d’invites textuelles. Cela « ancre » efficacement l’entrée en langage naturel dans l’image sans nouvel entraînement.
L’exemple suivant montre comment utiliser le package ultralytics pour détecter des objets à partir de descriptions textuelles personnalisées :
from ultralytics import YOLO
# Load a pre-trained YOLO-World model for open-vocabulary detection
model = YOLO("yolov8s-world.pt")
# Define custom text prompts (classes) to ground in the image
# The model maps these descriptions to visual features
model.set_classes(["person wearing hat", "blue backpack"])
# Run prediction on an image source to localize the described objects
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()Distinguer l’ancrage des concepts connexes#
Pour comprendre pleinement l’utilité de l’ancrage, il est utile de le distinguer de tâches similaires en vision par ordinateur :
- Par rapport à la détection d’objets : Les modèles de détection traditionnels, comme le modèle de pointe YOLO26, identifient les objets à partir d’un ensemble fermé et prédéfini de catégories (par exemple, les 80 classes de COCO). L’ancrage est ouvert, et identifie les objets à partir de textes en langage libre.
- Par rapport à la génération de légendes d’image : La génération de légendes produit une phrase descriptive pour une image entière (Image $\to$ Texte). L’ancrage fonctionne généralement dans la direction inverse ou de manière bidirectionnelle, en localisant des éléments visuels spécifiques à partir d’une entrée textuelle (Texte $\to$ Région de l’image).
- Par rapport à la réponse visuelle aux questions (VQA) : La VQA consiste à répondre à une question précise sur une image (par exemple, « De quelle couleur est la voiture ? »). L’ancrage se concentre spécifiquement sur l’étape de localisation — tracer une boîte englobante autour de l’objet mentionné.
Défis et perspectives d’avenir#
Malgré les avancées, l’ancrage reste très exigeant en ressources de calcul. L’alignement de modèles de langage massifs avec des encodeurs visuels nécessite d’importantes ressources GPU et une gestion efficace de la mémoire, un défi souvent relevé par des innovateurs du matériel comme NVIDIA. De plus, les modèles peuvent avoir des difficultés face à l’ambiguïté linguistique, ce qui nécessite de grandes fenêtres de contexte pour déterminer si le mot « bat » désigne un instrument de sport ou un animal.
Les développements futurs s’orientent vers des modèles de fondation unifiés et nativement multimodaux. Des outils comme l’Ultralytics Platform évoluent pour aider les développeurs à gérer les jeux de données complexes nécessaires à ces tâches, en proposant des workflows rationalisés pour l’annotation des données et le déploiement des modèles. À mesure que ces technologies mûrissent, on peut s’attendre à une intégration fluide de l’ancrage dans les appareils edge, permettant des applications d’IA plus intelligentes et plus réactives.









