Qu'est-ce que la segmentation d'instances ? Guide rapide
Rejoins-nous pour examiner de plus près ce qu'est la segmentation d'instances, son fonctionnement, son utilisation dans diverses applications de vision par ordinateur et son impact potentiel.

Les applications de vision par ordinateur sont de plus en plus courantes dans notre quotidien, des caméras de circulation qui surveillent l’état des routes aux systèmes de caisse automatique dans les magasins. En permettant aux machines de comprendre les données visuelles d’une manière similaire aux humains, l’IA visuelle transforme de nombreux secteurs.
Bon nombre de ces applications reposent sur la détection d’objets, une tâche de vision par ordinateur qui place des boîtes englobantes autour des objets importants dans les images. Bien que cette approche soit souvent efficace, certaines solutions d’analyse d’images nécessitent une précision encore supérieure.
Par exemple, l’imagerie médicale ne se limite pas à détecter une tumeur : il est essentiel d’en délimiter précisément la forme. De même, en robotique, les machines doivent reconnaître les contours exacts d’un objet pour le saisir correctement. Pour relever ces défis, la segmentation d’instances offre une solution plus précise.
La segmentation d’instances est une tâche de vision par ordinateur conçue pour les cas d’utilisation où la détection des objets ne suffit pas : elle fournit une précision au niveau du pixel. Des modèles de vision par ordinateur comme Ultralytics YOLO11 peuvent facilement appliquer la segmentation d’instances aux images et aux vidéos.

Fig. 1 Exemple d’utilisation de YOLO11 pour la segmentation d’instances.
Dans ce guide, nous allons voir en détail comment fonctionne la segmentation d’instances, quelles sont ses applications et comment entraîner Ultralytics YOLO11 sur des données personnalisées pour des tâches de segmentation spécifiques.
Qu’est-ce que la segmentation d’instances ?#
Imaginons une photo de groupe où plusieurs personnes se tiennent proches les unes des autres. La détection d’objets peut aider à tracer des boîtes autour de chaque personne, mais elle n’indique pas leur forme exacte.
La segmentation d’instances, quant à elle, revient à suivre soigneusement le contour de chaque personne afin d’en voir la silhouette complète, même lorsque les personnes se chevauchent. Au lieu d’indiquer simplement la position d’un objet avec une boîte, elle identifie sa forme exacte au niveau du pixel, ce qui facilite la compréhension des images complexes.
Le résultat est un masque détaillé qui remplit la forme d’un objet et identifie précisément les pixels qui lui appartiennent. Ce niveau de précision est utile dans de nombreuses applications concrètes où il est important de comprendre la forme exacte et les limites des objets.

Fig. 2. Présentation de la prise en charge de la segmentation d’instances par Ultralytics YOLO11.
Segmentation d’instances et segmentation sémantique#
En explorant la segmentation d’instances, tu peux rencontrer le concept de segmentation sémantique.
Les deux techniques aident les ordinateurs à comprendre les images au niveau du pixel, mais elles ont des objectifs différents. La segmentation sémantique attribue une étiquette à chaque pixel en fonction de sa catégorie et regroupe tous les objets du même type. Par exemple, dans une image contenant plusieurs voitures, la segmentation sémantique les identifierait toutes comme « voiture », sans distinguer les véhicules individuels.
La segmentation d’instances va plus loin en identifiant chaque objet séparément. Elle attribue des étiquettes uniques aux instances individuelles et crée des masques précis autour de leurs formes. Ainsi, dans la même image, la segmentation d’instances ne se contenterait pas d’identifier tous les objets comme des « voitures » : elle reconnaîtrait et délimiterait chaque voiture individuellement.
La principale différence entre les deux est que la segmentation sémantique regroupe les objets par catégorie, tandis que la segmentation d’instances distingue chaque objet comme une entité unique aux limites clairement définies. Le choix de la tâche dépend de l’application concernée : suffit-il de savoir ce qui figure dans une image ou est-il important de différencier les objets individuels ?

Fig. 3 Segmentation d’instances et segmentation sémantique (respectivement à droite et à gauche).
Modèles populaires de segmentation d’instances#
La communauté de l’IA visuelle dispose aujourd’hui de nombreux modèles de segmentation d’instances. Certains sont plus rapides, d’autres plus précis, et d’autres encore plus faciles à utiliser.
Ces options, bien qu’utiles, peuvent soulever une question : quel modèle choisir pour une tâche donnée ? Parmi ces options, les modèles Ultralytics YOLO sont très populaires, car ils privilégient la vitesse et la précision.
De plus, ces modèles ont considérablement évolué au fil des ans. Par exemple, Ultralytics YOLOv5 a simplifié le déploiement à l’aide de frameworks comme PyTorch, rendant l’IA visuelle avancée accessible à un public plus large sans nécessiter une expertise technique approfondie.
Fort de ce succès, Ultralytics YOLOv8 a amélioré la prise en charge de tâches de vision par ordinateur telles que la segmentation d’instances, l’estimation de pose et la classification d’images.
Aujourd’hui, Ultralytics YOLO11 fait passer les performances à un niveau supérieur. Il atteint une précision moyenne (mAP) plus élevée sur le jeu de données COCO avec 22 % de paramètres en moins que YOLOv8m, ce qui signifie qu’il peut reconnaître les objets plus précisément tout en utilisant moins de ressources.

Fig. 4 Évaluation comparative de YOLO11.
En bref, Ultralytics YOLO11 offre une précision de pointe sans compromettre l’efficacité, ce qui en fait une solution particulièrement performante dans ce domaine.
Comprendre le fonctionnement de la segmentation d’instances#
Voyons maintenant comment fonctionne généralement la segmentation d’instances. Les anciens modèles de vision par ordinateur utilisent une approche en deux étapes.
Tout d’abord, ils détectent les objets en traçant des boîtes englobantes autour d’eux. Ensuite, ils génèrent un masque au niveau du pixel pour délimiter la forme exacte de chaque objet. Mask R-CNN en est un exemple bien connu : il s’appuie sur des modèles de détection d’objets en ajoutant une étape de prédiction de masque. Bien que cette méthode soit efficace, elle peut être lente, car elle traite l’image en plusieurs étapes, ce qui complique les applications en temps réel.
De leur côté, les modèles comme Ultralytics YOLO11 traitent les images en une seule passe et prédisent simultanément les boîtes englobantes des objets et les masques de segmentation d’instances. Cette approche rationalisée est beaucoup plus rapide tout en conservant une grande précision. Elle est donc particulièrement utile pour les applications en temps réel comme la conduite autonome, l’analyse vidéo et la robotique, où vitesse et précision sont essentielles.
Entraîner Ultralytics YOLO11 sur des données personnalisées pour la segmentation d’instances#
Prêt à l’emploi, YOLO11 est un modèle préentraîné. Il a été entraîné sur le jeu de données COCO-Seg, qui couvre des objets du quotidien pour la segmentation d’instances. Cependant, le package Ultralytics Python prend en charge l’entraînement personnalisé, essentiel pour les applications spécialisées qui nécessitent de segmenter des objets spécifiques.
Pourquoi l’entraînement personnalisé ou l’affinage d’un modèle est-il important ? L’entraînement personnalisé s’appuie sur l’apprentissage par transfert en exploitant les connaissances déjà intégrées aux modèles préentraînés. Au lieu de repartir de zéro, il adapte un modèle existant à de nouvelles tâches à l’aide de jeux de données plus petits et de ressources de calcul moindres, tout en conservant une grande précision.
Comment entraîner Ultralytics YOLO11 sur des données personnalisées#
Examinons de plus près les étapes nécessaires pour affiner Ultralytics YOLO11 afin de réaliser une segmentation d’instances :
- Préparation des données : collecte et annote des images en fonction de ton application. Ultralytics prend en charge plusieurs jeux de données d’images, mais tu peux aussi entraîner le modèle avec ton propre jeu de données en préparant les images et les annotations au format YOLO requis.
- Utilisation d’un modèle préentraîné : au lieu de repartir de zéro, utilise un modèle Ultralytics YOLO11 préentraîné.
- Entraînement du modèle : ajuste les paramètres essentiels de l’entraînement, comme la taille des lots (images traitées par itération), la taille des images (résolution d’entrée cible) et le nombre d’époques (nombre total de cycles d’entraînement), puis entraîne le modèle.
- Évaluation des performances : une fois l’entraînement du modèle terminé, tu peux tester sa précision à l’aide de métriques de performance comme la mAP. Le package Ultralytics Python fournit également des fonctions intégrées pour évaluer le modèle.
Applications de la segmentation d’instances rendues possibles par Ultralytics YOLO11#
La segmentation d’instances peut aider à résoudre des problèmes concrets en permettant aux machines de voir et de comprendre les objets avec davantage de précision. De l’amélioration de l’automatisation à la protection de l’environnement, elle joue un rôle clé dans de nombreux domaines. Découvrons quelques exemples de son impact.
Sécurité et surveillance des chantiers de construction avec Ultralytics YOLO11#
La segmentation d’instances peut jouer un rôle essentiel pour garantir la sécurité et l’efficacité sur les chantiers de construction. Elle peut par exemple servir à surveiller les engins lourds.
Ultralytics YOLO11 peut être affiné pour segmenter et identifier avec précision différents types d’équipements, comme les grues, les excavatrices et les bulldozers, et suivre leur position en temps réel. Cela permet aux responsables de chantier de s’assurer que les machines opèrent strictement dans les zones désignées et n’empiètent pas sur les zones où se trouvent des travailleurs ou des dangers.
L’intégration de telles solutions à des systèmes d’alerte en temps réel permet également de prendre rapidement des mesures correctives. De plus, les informations recueillies peuvent contribuer à optimiser l’agencement et le flux de travail du chantier, réduisant davantage les risques et améliorant la productivité.

Fig. 5 Surveillance des engins lourds avec Ultralytics YOLO11.
Surveillance des animaux avec la segmentation et Ultralytics YOLO11#
La surveillance du comportement animal aide les chercheurs, les agriculteurs et les spécialistes de la conservation à mieux prendre soin des animaux dans différents environnements. La segmentation d’instances joue un rôle utile dans ces systèmes en identifiant et en segmentant les animaux individuellement dans les fermes, les zoos et les habitats naturels. Contrairement à la détection d’objets traditionnelle, qui utilise des boîtes englobantes, la segmentation d’instances fournit une délimitation de chaque animal au niveau du pixel, ce qui est particulièrement utile lorsque les animaux sont proches les uns des autres.
Une segmentation détaillée facilite un suivi plus précis des mouvements et des comportements. Les animaux qui se chevauchent ou sont regroupés de près peuvent être reconnus distinctement, ce qui permet une analyse plus précise des interactions, de l’état de santé et des schémas d’activité. Globalement, une compréhension plus approfondie du comportement animal améliore les pratiques de soins et de gestion des animaux.

Fig. 6 Surveillance des bovins avec la segmentation d’instances.
Ultralytics YOLO11 pour l’analyse sportive et le suivi des joueurs#
Le suivi précis des joueurs et des événements constitue une part importante de l’analyse sportive. Les méthodes de suivi traditionnelles reposent sur un étiquetage manuel, qui peut ne pas restituer les interactions en détail. La vision par ordinateur peut servir à segmenter au niveau du pixel des éléments comme chaque joueur, le ballon et les événements clés afin d’obtenir des informations détaillées.
Par exemple, la segmentation d’instances peut aider à détecter des événements comme les fautes ou les incidents loin du ballon en séparant clairement chaque joueur et chaque objet. Cette surveillance détaillée, rendue possible par des modèles comme Ultralytics YOLO11, fournit aux analystes des informations plus claires pour étudier les schémas de déplacement, le positionnement spatial et les interactions avec une grande précision. L’un des principaux avantages de ces informations est qu’elles aident les équipes à affiner leurs stratégies et à améliorer leurs performances globales.
Avantages et inconvénients de la segmentation d’instances#
Voici quelques-uns des principaux avantages que la segmentation d’instances peut apporter à différents secteurs :
- Automatisation améliorée : en automatisant des tâches comme le contrôle qualité et la surveillance de la sécurité, la segmentation d’instances réduit le besoin d’intervention manuelle et limite les erreurs humaines.
- Meilleure compréhension de la scène : en délimitant précisément chaque objet, la segmentation d’instances contribue à une compréhension plus approfondie des scènes complexes et favorise une prise de décision mieux éclairée.
- Post-traitement efficace : la sortie au niveau du pixel simplifie des tâches comme la suppression de l’arrière-plan, le comptage des objets et l’analyse spatiale, réduisant le besoin d’étapes de traitement supplémentaires.
Bien que ces avantages montrent l’impact de la segmentation d’instances dans différents cas d’utilisation, il est également essentiel de prendre en compte les difficultés liées à sa mise en œuvre.
Voici quelques-unes des principales limites de la segmentation d’instances :
- Difficultés liées à la transparence : la segmentation d’objets transparents ou réfléchissants comme le verre et l’eau est difficile, ce qui entraîne des limites imprécises.
- Charge de maintenance : pour conserver des modèles précis et pertinents, des mises à jour et des affinages continus sont nécessaires à mesure que les conditions environnementales et les jeux de données évoluent.
- Effort d’annotation élevé : l’entraînement de modèles de segmentation d’instances nécessite des annotations détaillées au niveau du pixel, ce qui augmente considérablement le temps et le coût consacrés à la préparation des données.
Points clés à retenir#
La segmentation d’instances permet de distinguer les objets individuels avec précision, même lorsqu’ils se chevauchent. En capturant les limites des objets au niveau du pixel, elle fournit une compréhension plus approfondie des données visuelles que les tâches traditionnelles de vision par ordinateur comme la détection d’objets.
Les avancées récentes en vision par ordinateur ont rendu la segmentation d’instances plus rapide et plus facile à utiliser. En particulier, les modèles de vision par ordinateur comme Ultralytics YOLO11 simplifient le processus et permettent une segmentation en temps réel avec une configuration minimale, la rendant plus accessible à divers secteurs et applications.
Tu t’intéresses à l’IA ? Visite notre dépôt GitHub et rejoins notre communauté pour continuer à explorer le sujet. Découvre des innovations comme l’IA dans les voitures autonomes et l’IA visuelle dans l’agriculture sur nos pages consacrées aux solutions. Consulte nos options de licence et lance-toi dans un projet de vision par ordinateur !









