Ultralytics YOLO27 :
Vision par IA

Exploration de SAM 3 : le nouveau Segment Anything Model de Meta AI

Découvre comment SAM 3, le nouveau Segment Anything Model de Meta AI, facilite la détection, la segmentation et le suivi des objets dans des images et vidéos du monde réel.

ABAbirami Vina13 min read
Le Segment Anything Model SAM 3 de Meta AI

Le 19 novembre 2025, Meta AI a publié Segment Anything Model 3, également appelé SAM 3. Cette dernière version du Segment Anything Model introduit de nouvelles façons de détecter, segmenter et suivre des objets dans des images et des vidéos du monde réel à l'aide d'instructions textuelles, d'invites visuelles et d'exemples d'images.

Le modèle SAM 3 s'appuie sur SAM et SAM 2, et apporte de nouvelles avancées et fonctionnalités comme la segmentation par concept, la détection à vocabulaire ouvert et le suivi vidéo en temps réel. Il peut comprendre de courtes expressions nominales, suivre des objets d'une image à l'autre et identifier des concepts précis ou rares que les modèles précédents ne géraient pas avec autant de constance.

Dans le cadre de la sortie de SAM 3, Meta a également présenté SAM 3D. Cette suite de modèles de nouvelle génération reconstruit des objets, des scènes et des corps humains entiers à partir d'une seule image, et étend l'écosystème Segment Anything à la compréhension 3D. Ces ajouts ouvrent de nouvelles applications dans la vision par ordinateur, la robotique, le montage multimédia et les flux de travail créatifs.

Dans cet article, nous allons découvrir ce qu'est SAM 3, ce qui le distingue de SAM 2, comment le modèle fonctionne et quelles sont ses applications dans le monde réel. C'est parti !

Qu'est-ce que SAM 3 ? Découvre le Segment Anything Model 3 de Meta#

SAM 3 est un modèle de vision par ordinateur de pointe capable d'identifier, de séparer et de suivre des objets dans des images et des vidéos à partir d'instructions simples. Au lieu de s'appuyer sur une liste fixe d'étiquettes, SAM 3 comprend le langage naturel et les indices visuels, ce qui te permet d'indiquer facilement au modèle ce que tu veux trouver.

Par exemple, avec SAM 3, tu peux saisir une courte expression comme « autobus scolaire jaune » ou « un chat tigré », cliquer sur un objet ou mettre en évidence un exemple dans une image. Le modèle détecte alors chaque objet correspondant et génère des masques de segmentation propres (un contour visuel qui indique exactement quels pixels appartiennent à un objet). SAM 3 peut également suivre ces objets d'une image vidéo à l'autre en les gardant cohérents lorsqu'ils se déplacent.

SAM 3D permet la reconstruction 3D à partir d'une seule image#

Autre aspect remarquable de l'annonce de Meta AI : SAM 3D étend le projet Segment Anything à la compréhension 3D. SAM 3D peut prendre une seule image 2D et reconstruire la forme, la pose ou la structure d'un objet ou d'un corps humain en trois dimensions. En d'autres termes, le modèle peut estimer comment un élément occupe l'espace même lorsqu'un seul point de vue est disponible.

SAM 3D est disponible sous la forme de deux modèles distincts : SAM 3D Objects, qui reconstruit des objets du quotidien avec leur géométrie et leur texture, et SAM 3D Body, qui estime la forme et la pose du corps humain à partir d'une seule image. Les deux modèles utilisent la sortie de segmentation de SAM 3, puis génèrent une représentation 3D alignée sur l'apparence et la position de l'objet dans la photo d'origine.

Exemple d'utilisation de SAM 3D

Fig. 1. Exemple d'utilisation de SAM 3D. (Source : créé avec le terrain de jeu segment anything de Meta AI)

SAM 3 : de nouvelles fonctionnalités pour unifier détection, segmentation et suivi#

Voici quelques-unes des principales mises à jour introduites par SAM 3 pour réunir détection, segmentation et suivi au sein d'un même modèle unifié :

  • Tâches de segmentation par concept : Dans SAM et SAM 2, la segmentation d'objets dépendait d'invites visuelles comme des clics ou des cadres. SAM 3 ajoute la possibilité de segmenter des objets à partir d'une courte expression textuelle ou d'un recadrage d'exemple extrait de l'image. Le modèle peut ainsi identifier toutes les instances correspondantes sans nécessiter un clic pour chacune d'elles.
  • Invites textuelles à vocabulaire ouvert : Contrairement aux versions précédentes, SAM 3 peut interpréter de courtes expressions en langage naturel. Cela élimine le besoin d'une liste fixe d'étiquettes et permet au modèle de travailler avec des concepts plus spécifiques ou moins courants.
  • Un seul modèle pour la détection, la segmentation et le suivi : SAM 3 unifie la détection, la segmentation et le suivi au sein d'un seul modèle, ce qui élimine le besoin de systèmes distincts pour trouver les objets, générer les masques de segmentation et les suivre d'une image vidéo à l'autre. Cela crée un flux de travail plus cohérent et rationalisé, aussi bien pour les images que pour les vidéos. Même si SAM 2 offrait également certaines capacités de suivi, SAM 3 fournit des performances nettement supérieures et plus fiables.
  • Des résultats plus stables dans les scènes complexes : Comme SAM 3 peut combiner du texte, des images d'exemple et des invites visuelles, il gère les scènes encombrées ou répétitives de manière plus fiable que les versions précédentes qui reposaient uniquement sur des clics visuels.

Segmentation par concept de SAM 3 avec du texte ou des exemples d'images

Fig. 2. SAM 3 introduit la segmentation par concept avec du texte ou des exemples d'images. (Source)

Comparaison entre SAM 3, SAM 2 et SAM 1#

Imaginons que tu regardes une vidéo de safari contenant de nombreux animaux différents et que tu souhaites détecter et segmenter uniquement les éléphants. À quoi cette tâche ressemblerait-elle avec les différentes versions de SAM ?

Avec SAM, tu devrais cliquer manuellement sur chaque éléphant dans chaque image pour générer un masque de segmentation. Il n'y a pas de suivi, donc chaque nouvelle image nécessite de nouveaux clics.

Avec SAM 2, tu pourrais cliquer une fois sur un éléphant, obtenir son masque, puis le modèle suivrait ce même éléphant dans la vidéo. Toutefois, tu devrais toujours effectuer des clics distincts si tu voulais segmenter plusieurs éléphants (des objets spécifiques), car SAM 2 ne comprend pas de lui-même les catégories comme « éléphant ».

Avec SAM 3, le flux de travail devient beaucoup plus simple. Tu peux saisir « éléphant » ou dessiner un cadre englobant autour d'un seul éléphant pour fournir un exemple, puis le modèle trouve automatiquement tous les éléphants dans la vidéo, les segmente et les suit de manière cohérente d'une image à l'autre. Il prend toujours en charge les invites par clic et par cadre utilisées dans les versions précédentes, mais il peut désormais aussi répondre à des invites textuelles et à des images exemplaires, ce que SAM et SAM 2 ne pouvaient pas faire.

Comment fonctionne le modèle SAM 3#

Examinons maintenant plus en détail le fonctionnement du modèle SAM 3 et la manière dont il a été entraîné.

Présentation de l'architecture du modèle SAM 3#

SAM 3 réunit plusieurs composants pour prendre en charge les invites conceptuelles et les invites visuelles au sein d'un même système. Au cœur du modèle se trouve le Meta Perception Encoder, l'encodeur unifié open source d'images et de texte de Meta.

Cet encodeur peut traiter à la fois des images et de courtes expressions nominales. En bref, cela permet à SAM 3 de relier plus efficacement les caractéristiques linguistiques et visuelles que les versions précédentes du Segment Anything Model.

En plus de cet encodeur, SAM 3 intègre un détecteur basé sur la famille de modèles Transformer DETR. Ce détecteur identifie les objets dans l'image et aide le système à déterminer quels objets correspondent à l'invite de l'utilisateur.

Plus précisément, pour la segmentation vidéo, SAM 3 utilise un composant de suivi qui s'appuie sur la banque mémoire et l'encodeur mémoire de SAM 2. Le modèle peut ainsi conserver des informations sur les objets d'une image à l'autre afin de les réidentifier et de les suivre au fil du temps.

Fonctionnement de la segmentation par concept

Fig. 3. Fonctionnement de la segmentation par concept (Source : scontent)

Le moteur de données évolutif derrière Segment Anything Model 3#

Pour entraîner SAM 3, Meta avait besoin de bien plus de données annotées que ce qui existe actuellement sur Internet. Les masques de segmentation et les étiquettes textuelles de haute qualité sont difficiles à créer à grande échelle, et délimiter entièrement chaque instance d'un concept dans des images et des vidéos est long et coûteux.

Pour résoudre ce problème, Meta a créé un nouveau moteur de données qui combine SAM 3 lui-même, des modèles d'IA supplémentaires et des annotateurs humains travaillant ensemble. Le flux de travail commence par un pipeline de systèmes d'IA, notamment SAM 3 et un modèle de génération de légendes basé sur Llama.

Ces systèmes analysent de grandes collections d'images et de vidéos, génèrent des légendes, convertissent ces légendes en étiquettes textuelles et produisent les premiers masques de segmentation candidats. Des annotateurs humains et IA examinent ensuite ces candidats.

Les annotateurs IA, entraînés à atteindre, voire à dépasser, la précision humaine pour des tâches comme la vérification de la qualité des masques et de la couverture des concepts, filtrent les cas simples. Les humains interviennent uniquement pour les exemples plus difficiles, lorsque le modèle peut encore rencontrer des difficultés.

Moteur de données de SAM 3

Fig. 4. Moteur de données de SAM 3 (Source)

Cette approche donne à Meta un gain considérable en vitesse d'annotation. En laissant les annotateurs IA traiter les cas simples, le pipeline devient environ cinq fois plus rapide avec les invites négatives et 36 % plus rapide avec les invites positives dans les domaines à grain fin.

Cette efficacité a permis d'étendre le jeu de données à plus de quatre millions de concepts uniques. La boucle constante de propositions de l'IA, de corrections humaines et de prédictions actualisées du modèle améliore également la qualité des étiquettes au fil du temps et aide SAM 3 à apprendre un ensemble bien plus vaste de concepts visuels et textuels.

Les améliorations de performance de SAM 3#

En matière de performance, SAM 3 apporte une amélioration nette par rapport aux modèles précédents. Sur le nouveau benchmark SA-Co de Meta, qui évalue la détection et la segmentation de concepts à vocabulaire ouvert, SAM 3 atteint environ deux fois les performances des systèmes précédents, aussi bien sur les images que sur les vidéos.

Il égale ou dépasse également SAM 2 sur des tâches visuelles interactives comme point-vers-masque et masque-vers-masklet. Meta fait état de gains supplémentaires sur des évaluations plus difficiles comme LVIS zero-shot (où les modèles doivent reconnaître des catégories rares sans exemples d'entraînement) et le comptage d'objets (qui mesure si toutes les instances d'un objet sont détectées), ce qui souligne une meilleure généralisation entre les domaines.

En plus de ces améliorations de précision, SAM 3 est efficace : il traite une image contenant plus de 100 objets détectés en environ 30 millisecondes sur un GPU H200 et conserve une vitesse proche du temps réel lors du suivi de plusieurs objets dans une vidéo.

Applications du Segment Anything Model 3#

Maintenant que nous comprenons mieux SAM 3, découvrons comment il est utilisé dans des applications concrètes, du raisonnement avancé guidé par le texte à la recherche scientifique et aux propres produits de Meta.

Gérer des requêtes textuelles complexes avec SAM 3 Agent#

SAM 3 peut également être utilisé comme outil au sein d'un modèle de langage multimodal plus vaste, que Meta appelle SAM 3 Agent. Au lieu de fournir à SAM 3 une courte expression comme « éléphant », l'agent peut décomposer une question plus complexe en invites plus petites que SAM 3 comprend.

Par exemple, si l'utilisateur demande : « Quel objet dans l'image sert à contrôler et guider un cheval ? », l'agent essaie différentes expressions nominales, les envoie à SAM 3 et vérifie quels masques sont cohérents. Il affine sa recherche jusqu'à trouver le bon objet.

Même sans avoir été entraîné sur des jeux de données de raisonnement spécialisés, SAM 3 Agent obtient de bons résultats sur des benchmarks conçus pour les requêtes textuelles complexes, comme ReasonSeg et OmniLabel. Cela montre que SAM 3 peut prendre en charge des systèmes qui nécessitent à la fois une compréhension du langage et une segmentation visuelle détaillée.

Applications scientifiques et de conservation de SAM 3#

Fait intéressant, SAM 3 est déjà utilisé dans des contextes de recherche où les étiquettes visuelles détaillées sont importantes. Meta a collaboré avec Conservation X Labs et Osa Conservation pour créer SA-FARI, un jeu de données public de surveillance de la faune contenant plus de 10 000 vidéos issues de pièges photographiques.

Chaque animal de chaque image est étiqueté avec des cadres et des masques de segmentation, ce qui serait extrêmement long à annoter manuellement. De même, dans la recherche océanographique, SAM 3 est utilisé avec FathomNet et MBARI pour créer des masques de segmentation d'instances pour des images sous-marines et prendre en charge de nouveaux benchmarks d'évaluation.

De tels jeux de données aident les scientifiques à analyser plus efficacement les séquences vidéo et à étudier des animaux et des habitats généralement difficiles à suivre à grande échelle. Les chercheurs peuvent également utiliser ces ressources pour créer leurs propres modèles d'identification des espèces, d'analyse des comportements et de suivi écologique automatisé.

Comment Meta déploie SAM 3 dans ses produits#

En plus de ses usages dans la recherche, SAM 3 alimente également de nouvelles fonctionnalités et de nouveaux cas d'utilisation dans les produits grand public de Meta. Voici un aperçu de certaines des façons dont il est déjà intégré :

  • Montage sur Instagram : Les créateurs peuvent appliquer des effets à une personne ou à un objet précis dans une vidéo sans effectuer de travail manuel image par image.
  • Application Meta AI et meta.ai sur le Web : SAM 3 prend en charge de nouveaux outils pour modifier, améliorer et remixer des images et des vidéos.
  • « View in Room » de Facebook Marketplace : SAM 3 fonctionne avec SAM 3D pour permettre aux utilisateurs de prévisualiser des meubles ou des éléments de décoration chez eux à partir d'une seule photo.
  • Lunettes de recherche Aria Gen 2 : Le Segment Anything Model 3 aide à segmenter et à suivre les mains et les objets en vue subjective, ce qui favorise la réalité augmentée (AR), la robotique et la recherche en IA contextuelle.

Points clés à retenir#

SAM 3 constitue une avancée importante pour la segmentation. Il introduit la segmentation par concept, les invites textuelles à vocabulaire ouvert et un suivi amélioré. Grâce à des performances nettement supérieures sur les images comme sur les vidéos, ainsi qu'à l'ajout de SAM 3D, cette suite de modèles ouvre de nouvelles possibilités pour l'IA de vision, les outils créatifs, la recherche scientifique et les produits du monde réel.

Rejoins notre communauté et explore notre dépôt GitHub pour en découvrir davantage sur l'IA. Si tu souhaites créer ton propre projet d'IA de vision, consulte nos options de licence. Découvre davantage d'applications comme l'IA dans la santé et l'IA de vision dans le commerce de détail en visitant nos pages de solutions.

Explore solutions

Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l'avenir de l'IA !

Commence ton parcours vers l'avenir de l'apprentissage automatique