Visual Prompting
Explore le prompting visuel pour guider les modèles d’IA à l’aide de points et de boîtes. Apprends comment Ultralytics YOLO et SAM permettent une segmentation précise et une annotation plus rapide des données.
Le prompting visuel est une technique émergente de la vision par ordinateur dans laquelle les utilisateurs fournissent des indications spatiales ou visuelles — comme des points, des boîtes englobantes ou des annotations manuscrites — pour orienter l'attention d'un modèle d'IA vers des objets ou des régions spécifiques d'une image. Contrairement à l'ingénierie des prompts traditionnelle, qui repose principalement sur des descriptions textuelles, le prompting visuel permet une interaction plus précise et intuitive avec les systèmes d'intelligence artificielle (IA). Cette méthode exploite les capacités des modèles de fondation modernes pour effectuer des tâches comme la segmentation et la détection sans nécessiter de réentraînement approfondi ni de grands jeux de données annotés. En « pointant » efficacement vers ce qui compte, les utilisateurs peuvent adapter instantanément des modèles généralistes à de nouvelles tâches, comblant ainsi l'écart entre l'intention humaine et la perception machine.
Mécanismes du prompting visuel#
À la base, le prompting visuel fonctionne en injectant directement des informations spatiales dans le pipeline de traitement du modèle. Lorsqu'un utilisateur clique sur un objet ou dessine une boîte, ces entrées sont converties en représentations vectorielles fondées sur les coordonnées, que le réseau neuronal intègre aux caractéristiques de l'image. Ce processus est au cœur d'architectures interactives comme le Segment Anything Model (SAM), dans lesquelles le modèle prédit des masques à partir d'indications géométriques.
La flexibilité du prompting visuel permet différents types d'interaction :
- Indications ponctuelles : L'utilisateur clique sur un pixel spécifique pour indiquer l'objet d'intérêt. Le modèle étend ensuite cette sélection à l'ensemble des contours de l'objet.
- Indications par boîte : Le tracé d'une boîte englobante fournit une localisation approximative et indique au modèle de segmenter ou de classer tout ce qui se trouve dans cette zone.
- Indications par annotation manuscrite : Des lignes tracées à main levée sur un objet peuvent aider à lever l'ambiguïté dans les scènes complexes où les objets se chevauchent ou présentent des textures similaires.
Des recherches récentes présentées à la CVPR 2024 montrent que le prompting visuel réduit considérablement le temps nécessaire à l'annotation des données, car les annotateurs humains peuvent corriger les prédictions du modèle en temps réel par de simples clics plutôt que de tracer manuellement des polygones.
Prompting visuel ou prompting textuel#
Bien que les deux techniques visent à orienter le comportement du modèle, il est important de distinguer le prompting visuel des méthodes fondées sur le texte. La génération texte vers image ou la détection zero-shot repose sur le traitement du langage naturel (NLP) pour interpréter des descriptions sémantiques (par exemple, « trouver la voiture rouge »). Cependant, le langage peut être ambigu ou insuffisant pour décrire des emplacements spatiaux précis ou des formes abstraites.
Le prompting visuel résout cette ambiguïté en ancrant l'instruction directement dans l'espace des pixels. Par exemple, dans l'analyse d'images médicales, il est bien plus précis pour un radiologue de cliquer sur un nodule suspect que d'essayer de décrire ses coordonnées exactes et sa forme irrégulière au moyen de texte. Souvent, les workflows les plus puissants combinent les deux approches : le texte pour le filtrage sémantique et les indications visuelles pour la précision spatiale — un concept appelé apprentissage multimodal.
Applications concrètes#
L'adaptabilité du prompting visuel a entraîné son adoption rapide dans différents secteurs :
- Diagnostic médical interactif : Les médecins utilisent des outils de prompting visuel pour isoler des tumeurs ou des organes dans des examens IRM. En cliquant simplement sur une région d'intérêt, ils peuvent générer instantanément des mesures volumétriques 3D, ce qui facilite la détection des tumeurs et la planification chirurgicale de précision.
- ** retouche photo intelligente :** Dans les logiciels grand public comme Adobe Photoshop ou les applications mobiles, le prompting visuel alimente les outils de « sélection magique ». Les utilisateurs peuvent toucher une personne ou un objet pour supprimer l'arrière-plan ou appliquer des filtres ciblés, en s'appuyant sur des technologies sous-jacentes de segmentation d'instances sans avoir besoin de compétences en masquage manuel.
- Manipulation robotique : Dans l'IA en robotique, les robots peuvent recevoir l'instruction de saisir des objets spécifiques via une interface visuelle. Un opérateur clique sur un objet dans le flux vidéo de la caméra du robot, fournissant une indication visuelle que le robot traduit en coordonnées de préhension, ce qui facilite l'automatisation avec intervention humaine dans les entrepôts.
Implémentation avec Ultralytics#
L'écosystème Ultralytics prend en charge les workflows de prompting visuel, notamment grâce à des modèles comme FastSAM et SAM. Ces modèles permettent aux développeurs de transmettre par programmation des coordonnées de points ou de boîtes afin de récupérer des masques de segmentation.
L'exemple suivant montre comment utiliser le package ultralytics pour appliquer une indication ponctuelle à une image et demander au modèle de segmenter l'objet situé à des coordonnées précises.
from ultralytics import SAM
# Load the Segment Anything Model (SAM)
model = SAM("sam2.1_b.pt")
# Apply a visual point prompt to the image
# The 'points' argument accepts [x, y] coordinates
# labels: 1 indicates a foreground point (include), 0 indicates background
results = model("https://ultralytics.com/images/bus.jpg", points=[[300, 350]], labels=[1])
# Display the segmented result
results[0].show()Améliorer l'agilité des modèles#
Le prompting visuel représente une évolution vers une vision par ordinateur « pilotable par prompt », dans laquelle les modèles ne sont plus des « boîtes noires » statiques, mais des outils interactifs. Cette capacité est essentielle aux boucles d'apprentissage actif, dans lesquelles les modèles s'améliorent rapidement en intégrant les retours des utilisateurs.
Pour les développeurs qui souhaitent intégrer ces capacités en production, l'Ultralytics Platform propose des outils permettant de gérer des jeux de données et de déployer des modèles capables de traiter des entrées dynamiques. À mesure que la recherche progresse, nous nous attendons à une intégration encore plus étroite entre les indications visuelles et les grands modèles de langage (LLMs), permettant aux systèmes de raisonner sur des entrées visuelles avec la même aisance qu'ils traitent actuellement le texte.









