Comprendre la segmentation de concepts guidée par des prompts
Explore la segmentation de concepts guidée par des prompts, découvre en quoi elle diffère des méthodes traditionnelles et comment des modèles associés tels que YOLOE-26 permettent des capacités à vocabulaire ouvert.

L’IA de vision progresse rapidement et est largement utilisée pour analyser des images et des vidéos dans des environnements réels. Par exemple, des applications allant des systèmes de gestion du trafic à l’analyse du commerce de détail sont intégrées à des modèles de vision par ordinateur.
Dans beaucoup de ces applications, les modèles de vision, comme les modèles de détection d’objets, sont entraînés à reconnaître un ensemble prédéfini d’objets, notamment des véhicules, des personnes et des équipements. Pendant l’entraînement, ces modèles reçoivent de nombreux exemples annotés afin d’apprendre à quoi ressemble chaque objet et comment le distinguer des autres dans une scène.
Pour les tâches de segmentation, les modèles vont plus loin en produisant des contours précis de ces objets au niveau des pixels. Cela permet aux systèmes de comprendre exactement où se trouve chaque objet dans une image.
Cette approche fonctionne bien tant que le système doit uniquement reconnaître ce sur quoi il a été entraîné. Cependant, dans les environnements réels, c’est rarement le cas.
Les scènes visuelles sont généralement dynamiques. De nouveaux objets et concepts visuels apparaissent, les conditions changent et les utilisateurs veulent souvent segmenter des objets qui ne faisaient pas partie de la configuration d’entraînement initiale.
Ces limites sont particulièrement évidentes lorsqu’il s’agit de segmentation. À mesure que l’IA de vision évolue, le besoin de modèles de segmentation plus flexibles, capables de s’adapter à de nouveaux concepts sans réentraînement répété, augmente. C’est pourquoi la segmentation de concepts guidée par des prompts (PCS) suscite de plus en plus d’intérêt.
Au lieu de dépendre d’une liste fixe de catégories d’objets, tu peux décrire ce que tu veux segmenter à l’aide de texte, de prompts visuels ou d’images d’exemple. Ces modèles peuvent ensuite identifier et segmenter toutes les régions correspondant au concept décrit, même si ce concept n’a pas été explicitement inclus pendant l’entraînement.
Dans cet article, nous allons voir comment fonctionne la segmentation de concepts guidée par des prompts, en quoi elle diffère des approches traditionnelles et où elle est utilisée aujourd’hui.
Qu’est-ce que la segmentation de concepts guidée par des prompts ?#
Dans la plupart des cas, les modèles de segmentation sont entraînés à reconnaître une courte liste de types d’objets. Cette approche fonctionne bien lorsqu’un système d’IA de vision doit uniquement détecter et segmenter un ensemble précis d’objets.
Dans les applications réelles, cependant, les scènes visuelles sont dynamiques. De nouveaux objets apparaissent, les exigences des tâches évoluent et les utilisateurs doivent souvent segmenter des concepts qui ne figuraient pas dans l’ensemble initial de labels. Pour gérer ces situations, il faut généralement collecter de nouvelles données et annotations de haute qualité, puis réentraîner le modèle, ce qui augmente les coûts et ralentit le déploiement.
La segmentation de concepts guidée par des prompts résout ce problème en permettant aux utilisateurs d’indiquer au modèle ce qu’il doit rechercher, plutôt que de choisir dans une liste fixe de labels. Les utilisateurs décrivent l’objet ou l’idée recherchée, et le modèle met en évidence toutes les zones correspondantes dans l’image. Il devient ainsi beaucoup plus facile de relier l’intention de l’utilisateur aux pixels réels d’une image.

Fig. 1. Exemple d’utilisation de prompts de concepts pour la segmentation (Source)
Guider la segmentation avec différents types de prompts#
Les modèles prenant en charge la segmentation de concepts guidée par des prompts sont flexibles, car ils peuvent recevoir différents types d’entrées. Autrement dit, il existe plusieurs façons d’indiquer au modèle ce qu’il doit rechercher, par exemple avec des descriptions textuelles, des indications visuelles ou des images d’exemple.
Examinons chaque approche de plus près :
- Prompts textuels : de courtes expressions comme « bus scolaire » ou « région tumorale » peuvent servir à décrire le concept à segmenter. Le modèle interprète le sens des mots et identifie les régions correspondantes.
- Prompts visuels : ces prompts utilisent des points, des boîtes ou des esquisses approximatives dans l’image comme indications. Ces repères orientent la recherche et contribuent à définir le contour final.
- Images exemplaires : des images de référence ou de petites zones recadrées représentent le concept d’intérêt. Le modèle recherche des régions visuellement similaires et les segmente en fonction de leur apparence visuelle.
Différence entre PCS et segmentation traditionnelle#
Avant d’expliquer le fonctionnement de la segmentation de concepts guidée par des prompts, comparons-la d’abord à différentes méthodes traditionnelles de segmentation d’objets.
PCS permet de créer des modèles à vocabulaire ouvert et guidés par des prompts. Elle peut fonctionner avec de nouvelles idées décrites au moyen de prompts, contrairement à la segmentation traditionnelle. Il existe plusieurs types d’approches traditionnelles de segmentation, chacune reposant sur ses propres hypothèses et présentant ses propres limites.
Voici quelques-uns des principaux types de segmentation traditionnelle :
- Segmentation sémantique : chaque pixel de l’image est associé à une catégorie comme une route, un bâtiment ou une personne. Tous les pixels portant le même label sont regroupés ; le modèle ne sépare donc pas les différentes instances d’un même objet.
- Segmentation d’instances : le modèle identifie et segmente les objets individuellement ; deux personnes ou deux voitures sont donc traitées comme des éléments distincts.
- Segmentation panoptique : cette technique combine la segmentation sémantique et la segmentation d’instances pour fournir une vue complète de la scène, couvrant à la fois les régions d’arrière-plan et les objets individuels.
Toutes ces approches reposent sur une liste prédéfinie de catégories d’objets. Elles fonctionnent bien dans ce cadre, mais gèrent assez mal les concepts qui en sortent. Lorsqu’un nouvel objet spécifique doit être segmenté, des données d’entraînement supplémentaires et un ajustement du modèle sont généralement nécessaires.
PCS vise à changer cela. Au lieu d’être limité à des catégories prédéfinies, le modèle te permet de décrire ce que tu veux segmenter dans une image au moment de l’inférence.
L’évolution des modèles PCS#
Voyons maintenant comment les modèles de segmentation ont évolué vers la segmentation de concepts guidée par des prompts.
Un modèle de fondation populaire qui a marqué un tournant dans la segmentation est SAM, ou modèle capable de tout segmenter. Il a été présenté en 2023. Au lieu de dépendre de catégories d’objets prédéfinies, SAM permettait aux utilisateurs de guider la segmentation à l’aide de prompts visuels simples, comme des points ou des boîtes englobantes.
Avec SAM, les utilisateurs n’avaient plus besoin de sélectionner un label. Ils pouvaient simplement indiquer où se trouvait un objet, et le modèle générait un masque correspondant. La segmentation devenait ainsi plus flexible, mais les utilisateurs devaient toujours montrer au modèle où chercher.
SAM 2, sorti en 2024, a développé cette idée en gérant des scènes plus complexes et en étendant la segmentation guidée par des prompts à la vidéo. Il a amélioré la robustesse dans différentes conditions d’éclairage, formes d’objets et situations de mouvement, tout en reposant principalement sur des prompts visuels pour guider la segmentation.
Le modèle SAM 3 constitue l’étape la plus récente de cette évolution. Sorti l’année dernière, il s’agit d’un modèle unifié qui associe compréhension visuelle et guidage par le langage, permettant un comportement cohérent pour les tâches de segmentation d’images et de vidéos.
Avec SAM 3, les utilisateurs ne sont plus limités au pointage ou au dessin de prompts. Ils peuvent plutôt décrire avec du texte ce qu’ils veulent segmenter, et le modèle recherche dans l’image ou les images vidéo les régions correspondant à cette description.
La segmentation est guidée par des concepts plutôt que par des catégories d’objets fixes, ce qui permet d’utiliser un vocabulaire ouvert dans différentes scènes et au fil du temps. En fait, SAM 3 opère dans un vaste espace de concepts appris, ancré dans une ontologie dérivée de sources comme Wikidata et enrichie par des données d’entraînement à grande échelle.

Fig. 2. Exemple d’utilisation de prompts avec SAM 3 pour segmenter une image unique (Source)
Par rapport aux versions précédentes, qui reposaient principalement sur des prompts géométriques, SAM 3 constitue une avancée vers une segmentation plus flexible et orientée par les concepts. Il est donc mieux adapté aux applications réelles, où les objets ou idées d’intérêt peuvent changer et ne peuvent pas toujours être définis à l’avance.
Comprendre le fonctionnement de la segmentation visuelle guidée par des prompts#
Alors, comment fonctionne la segmentation de concepts guidée par des prompts ? Elle s’appuie sur de grands modèles de vision préentraînés et des modèles de vision et de langage, entraînés sur d’immenses collections d’images et, dans de nombreux cas, sur des textes associés. Cet entraînement leur permet d’apprendre des motifs visuels généraux et une signification sémantique.
La plupart des modèles PCS utilisent des architectures fondées sur des Transformer, qui traitent une image entière à la fois afin de comprendre les relations entre ses différentes régions. Un Transformer de vision extrait les caractéristiques visuelles de l’image, tandis qu’un encodeur de texte convertit les mots en représentations numériques que le modèle peut exploiter.
Pendant l’entraînement, ces modèles peuvent apprendre à partir de différents types de supervision, notamment des masques au niveau des pixels qui définissent précisément les contours des objets, des boîtes englobantes qui localisent approximativement les objets et des labels au niveau de l’image qui décrivent ce qu’elle contient. L’entraînement à partir de différents types de données annotées aide le modèle à saisir à la fois les détails fins et les concepts visuels plus généraux.
Au moment de l’inférence, c’est-à-dire lorsque le modèle est effectivement utilisé pour produire des prédictions, PCS suit un processus guidé par un prompt. L’utilisateur fournit des indications sous forme de descriptions textuelles, d’indices visuels comme des points ou des boîtes, ou d’images d’exemple. Le modèle encode le prompt et l’image dans une représentation interne partagée, ou sous forme d’embeddings, puis identifie les régions correspondant au concept décrit.
Un décodeur de masques convertit ensuite cette représentation partagée en masques de segmentation précis au niveau des pixels. Comme le modèle relie les caractéristiques visuelles à leur signification sémantique, il peut segmenter de nouveaux concepts même s’ils n’ont pas été explicitement inclus pendant l’entraînement.
En outre, la sortie peut souvent être affinée en ajustant le prompt ou en ajoutant des indications, ce qui aide le modèle à gérer les scènes complexes ou ambiguës. Ce processus itératif facilite l’optimisation pratique lors du déploiement.
Les modèles de segmentation de concepts guidée par des prompts sont généralement évalués selon leur capacité à segmenter des concepts jamais vus auparavant et leur robustesse dans différentes scènes. Les benchmarks se concentrent souvent sur la qualité des masques, la généralisation et l’efficacité computationnelle, conformément aux exigences des déploiements réels.
Cas d’utilisation réels de PCS#
Examinons maintenant les domaines dans lesquels la segmentation de concepts guidée par des prompts est déjà utilisée et commence à avoir un impact concret.
Une segmentation flexible des images médicales#
L’imagerie médicale couvre de nombreuses structures biologiques, maladies et types d’examens, et de nouveaux cas apparaissent chaque jour. Les modèles de segmentation traditionnels peinent à suivre cette diversité.
PCS s’intègre naturellement à ce domaine, car elle permet aux cliniciens de décrire ce qu’ils veulent trouver au lieu de choisir dans une liste courte et rigide. Avec des expressions textuelles ou des prompts visuels, PCS peut segmenter directement des organes ou des zones préoccupantes, sans réentraîner le modèle pour chaque nouvelle tâche. Cela facilite la prise en charge de besoins cliniques variés, réduit la nécessité de dessiner manuellement les masques et fonctionne avec de nombreux types d’imagerie.
MedSAM-3 en est un excellent exemple : il adapte l’architecture SAM 3 à la PCS guidée par du texte en imagerie médicale. Ce modèle peut recevoir des termes anatomiques et pathologiques explicites, comme des noms d’organes tels que le foie ou le rein, ainsi que des concepts liés aux lésions comme tumeur ou lésion. À partir d’un prompt, le modèle segmente directement la région correspondante dans l’image médicale.
MedSAM-3 intègre également des grands modèles de langage multimodaux (MLLMs ou LLM multimodaux), capables de raisonner à partir de textes et d’images. Ces modèles fonctionnent dans une configuration avec agent dans la boucle, où les résultats sont affinés de manière itérative afin d’améliorer la précision dans les cas plus complexes.

Fig. 3. Pipeline MedSAM-3 pour la segmentation de tumeurs guidée par du texte dans des images médicales (Source)
MedSAM-3 offre de bonnes performances sur les données de radiographie, d’IRM, de CT, d’échographie et de vidéo, illustrant comment PCS peut permettre des workflows d’imagerie médicale plus flexibles et efficaces dans des environnements cliniques réels.
Segmentation adaptative pour la chirurgie robotique et l’automatisation#
La chirurgie robotique s’appuie sur des systèmes de vision pour suivre les instruments et comprendre des scènes chirurgicales qui évoluent rapidement. Les instruments se déplacent vite, l’éclairage varie et de nouveaux outils peuvent apparaître à tout moment, ce qui rend les systèmes de labels prédéfinis difficiles à maintenir.
Avec PCS, les robots peuvent suivre les instruments, guider les caméras et suivre les étapes chirurgicales en temps réel. Cela réduit l’annotation manuelle et facilite l’adaptation des systèmes à différentes procédures. Les chirurgiens ou les systèmes automatisés peuvent utiliser des prompts textuels comme « pince », « scalpel » ou « instrument caméra » pour indiquer ce qui doit être segmenté dans une image.

Fig. 4. Segmentation d’instruments chirurgicaux utilisés pendant une chirurgie robotique (Source)
Segmentation à vocabulaire ouvert avec Ultralytics YOLOE-26#
Un autre modèle de pointe intéressant lié à la segmentation de concepts guidée par des prompts est notre Ultralytics YOLOE-26. Notre modèle introduit la segmentation à vocabulaire ouvert et guidée par des prompts dans la famille de modèles Ultralytics YOLO.
YOLOE-26 repose sur l’architecture Ultralytics YOLO26 et prend en charge la segmentation d’instances à vocabulaire ouvert. YOLOE-26 permet aux utilisateurs de guider la segmentation de plusieurs façons.
Il prend en charge les prompts textuels, où de courtes expressions ancrées visuellement peuvent désigner l’objet cible, ainsi que les prompts visuels, qui fournissent des indications supplémentaires fondées sur les éléments de l’image. De plus, YOLOE-26 inclut un mode sans prompt pour l’inférence zero-shot, dans lequel le modèle détecte et segmente des objets à partir d’un vocabulaire intégré sans nécessiter de prompts utilisateur.
YOLOE-26 convient parfaitement à des applications comme l’analyse vidéo, la perception robotique et les systèmes en périphérie, où les catégories d’objets peuvent changer, mais où une faible latence et un débit fiable restent essentiels. Il est également particulièrement utile pour l’annotation des données et la curation des jeux de données, car il rationalise les workflows en automatisant une partie du processus d’annotation.
Avantages et inconvénients de la segmentation de concepts guidée par des prompts#
Voici quelques-uns des principaux avantages de la segmentation de concepts guidée par des prompts :
- Itération et prototypage plus rapides : de nouvelles tâches de segmentation peuvent être testées rapidement en modifiant les prompts plutôt qu’en reconstruisant les jeux de données ou en réentraînant les modèles, ce qui accélère l’expérimentation et le développement.
- Adaptabilité entre les domaines : un même modèle PCS peut souvent être appliqué à différents domaines, comme l’imagerie médicale, la robotique ou l’analyse vidéo, avec un minimum de changements dans le workflow.
- Affinement interactif : les utilisateurs peuvent ajuster les prompts de manière itérative ou ajouter des indications pour améliorer les résultats, ce qui facilite la gestion des scènes ambiguës ou des cas limites sans réentraînement.
Bien que PCS présente des avantages évidents, voici quelques limites à prendre en compte :
- Sensibilité aux prompts : de petites modifications dans la formulation ou la manière de fournir un prompt peuvent affecter la sortie. Des prompts trop vagues ou trop spécifiques peuvent entraîner une segmentation incomplète ou incorrecte.
- Comportement moins prévisible : puisque le modèle interprète les prompts au lieu de sélectionner des labels fixes, les résultats peuvent davantage varier d’une scène ou d’une entrée à l’autre, ce qui peut poser problème dans les pipelines strictement contrôlés.
- Interprétation ambiguë des concepts : certains concepts sont subjectifs ou peu définis, ce qui peut entraîner des résultats de segmentation incohérents selon les utilisateurs ou les images.
- Fiabilité limitée pour les cibles très spécifiques : les modèles fondés sur des prompts sont généralement moins fiables pour les tâches étroitement définies et propres à une instance, comme la détection de défauts, qui exige une identification précise et cohérente de caractéristiques subtiles.
Choisir entre la segmentation guidée par des prompts et la segmentation traditionnelle#
En explorant la segmentation guidée par des prompts, tu peux te demander à quelles applications elle convient le mieux et dans quels cas un modèle traditionnel de vision par ordinateur comme Ultralytics YOLO26 est plus adapté au problème que tu cherches à résoudre. La segmentation guidée par des prompts fonctionne bien pour les objets généraux, mais elle ne convient pas aux cas d’utilisation qui exigent des résultats très précis et cohérents.
La détection de défauts en est un bon exemple. Dans l’industrie manufacturière, les défauts sont souvent minuscules et subtils, comme de petites rayures, des bosses, des défauts d’alignement ou des irrégularités de surface. Ils peuvent également varier considérablement selon les matériaux, l’éclairage et les conditions de production.
Ces problèmes sont difficiles à décrire avec un simple prompt et encore plus difficiles à détecter de manière fiable pour un modèle généraliste. Globalement, les modèles fondés sur des prompts ont tendance à manquer les défauts ou à produire des résultats instables, tandis que les modèles entraînés spécifiquement sur des données de défauts sont beaucoup plus fiables pour les systèmes d’inspection réels.
Points clés à retenir#
La segmentation de concepts guidée par des prompts facilite l’adaptation des systèmes de vision au monde réel, où de nouveaux objets et de nouvelles idées apparaissent constamment. Au lieu d’être limités à des labels fixes, les utilisateurs peuvent simplement décrire ce qu’ils veulent segmenter et laisser le modèle s’occuper du reste, ce qui fait gagner du temps et réduit le travail manuel. Malgré ses limites, PCS transforme déjà l’utilisation pratique de la segmentation et devrait probablement devenir un élément central des futurs systèmes de vision.
Pour en savoir plus sur l’IA, consulte notre dépôt GitHub et rejoins notre communauté. Consulte nos pages de solutions pour découvrir l’IA appliquée à la robotique et la vision par ordinateur dans l’industrie manufacturière. Découvre nos options de licence pour te lancer dès aujourd’hui dans l’IA de vision !









