Ultralytics YOLO27 :
Vision par IA

Actualités de la recherche en IA de Meta FAIR : SAM 2.1 et CoTracker3

Explore les derniers modèles d’IA de Meta FAIR, SAM 2.1 et CoTracker3, qui offrent des capacités avancées de segmentation et de suivi pour diverses applications concrètes.

ABAbirami Vina10 min read
Recherche en IA de Meta FAIR : SAM 2.1 et CoTracker3

L’intelligence artificielle (AI) est un domaine de recherche qui suscite récemment beaucoup d’enthousiasme et d’énergie, avec de nouvelles innovations et des avancées qui apparaissent plus rapidement que jamais. Au cours des dernières semaines, l’équipe de recherche fondamentale en IA (FAIR) de Meta a dévoilé un ensemble d’outils et de modèles destinés à relever des défis dans différents domaines de l’IA. Ces publications comprennent des mises à jour susceptibles d’avoir un impact sur des secteurs aussi variés que les soins de santé, la robotique et la réalité augmentée.

Par exemple, le modèle SAM 2.1 mis à jour améliore la segmentation d’objets, ce qui facilite l’identification et la séparation précises des objets dans les images et les vidéos. De son côté, CoTracker3 se concentre sur le suivi de points, en aidant à suivre les points dans les images vidéo, même lorsque les objets se déplacent ou sont partiellement masqués.

Meta a également présenté des versions plus légères et plus rapides de son modèle de langage Llama pour une utilisation efficace sur l’appareil, ainsi qu’une nouvelle technologie de détection tactile pour la robotique. Dans cet article, nous allons examiner ces dernières publications de Meta FAIR et voir ce que chaque outil propose. Commençons !

Le Segment Anything Model amélioré de Meta : SAM 2.1#

La segmentation d’objets, une tâche clé de la vision par ordinateur, permet d’identifier et de séparer des objets distincts au sein d’une image ou d’une vidéo, ce qui facilite l’analyse de zones d’intérêt spécifiques. Depuis sa publication, le modèle Segment Anything 2 (SAM 2) de Meta est utilisé pour la segmentation d’objets dans différents domaines, notamment l’imagerie médicale et la météorologie. S’appuyant sur les retours de la communauté, Meta a maintenant présenté SAM 2.1, une version améliorée conçue pour relever certains des défis rencontrés avec le modèle original et offrir de meilleures performances globales.

Évaluation comparative des performances du modèle SAM 2.1

Fig. 1 Évaluation comparative des performances du modèle SAM 2.1.

SAM 2.1 comprend des mises à jour qui lui permettent de mieux gérer les objets visuellement similaires et de plus petite taille, grâce à de nouvelles techniques d’augmentation des données. Il améliore également la gestion des occultations (lorsque certaines parties d’un objet sont masquées) en l’entraînant sur des séquences vidéo plus longues, ce qui lui permet de « se souvenir » des objets et de les reconnaître au fil du temps, même s’ils sont temporairement masqués. Par exemple, si quelqu’un filme une vidéo d’une personne marchant derrière un arbre, SAM 2.1 peut suivre cette personne lorsqu’elle réapparaît de l’autre côté, en utilisant sa mémoire de la position de l’objet et de son mouvement pour combler les interruptions lorsque la vue est brièvement obstruée.

Parallèlement à ces mises à jour, Meta a publié la suite de développement SAM 2, qui fournit du code d’entraînement open source et une infrastructure complète de démonstration afin que les développeurs puissent affiner SAM 2.1 avec leurs propres données et l’intégrer à un large éventail d’applications.

CoTracker3 : le modèle de suivi de Meta, ses fonctionnalités et ses mises à jour#

Une autre tâche intéressante de vision par ordinateur est le suivi de points. Elle consiste à suivre des points ou des caractéristiques spécifiques à travers plusieurs images d’une vidéo. Prenons l’exemple d’une vidéo montrant un cycliste roulant sur une piste : le suivi de points permet au modèle de garder une trace des points du cycliste, comme son casque ou ses roues, même s’ils sont momentanément masqués par des obstacles.

Le suivi de points est essentiel pour des applications telles que la reconstruction 3D, la robotique et le montage vidéo. Les modèles traditionnels reposent souvent sur des configurations complexes et de grands jeux de données synthétiques, ce qui limite leur efficacité dans des scénarios réels.

Le modèle de suivi CoTracker3 de Meta répond à ces limites en simplifiant l’architecture du modèle. Il introduit également une technique de pseudo-étiquetage qui permet au modèle d’apprendre à partir de vidéos réelles non annotées, ce qui rend CoTracker3 plus efficace et évolutif pour une utilisation pratique.

Comparaison de CoTracker3 avec d’autres modèles de suivi

Fig. 2 Comparaison de CoTracker3 avec d’autres modèles de suivi.

L’une des fonctionnalités qui distingue CoTracker3 est sa capacité à bien gérer les occultations. Grâce à l’attention inter-suivi, une technique qui permet au modèle de partager des informations entre plusieurs points suivis, CoTracker3 peut déduire la position de points masqués en se référant aux points visibles. Ainsi, CoTracker3 est conçu pour être très efficace dans des environnements dynamiques, par exemple pour suivre une personne dans une scène bondée.

CoTracker3 propose également des modes en ligne et hors ligne. Le mode en ligne fournit un suivi en temps réel, tandis que le mode hors ligne peut être utilisé pour un suivi plus complet sur des séquences vidéo entières, ce qui est idéal pour des tâches comme le montage vidéo ou l’animation.

Autres actualités et recherches de Meta FAIR#

Si SAM 2.1 et CoTracker3 illustrent les dernières avancées de Meta en matière de vision par ordinateur, d’autres mises à jour intéressantes concernent également des domaines de l’IA, comme le traitement du langage naturel (NLP) et la robotique. Examinons quelques-unes de ces autres avancées récentes de Meta FAIR.

Spirit LM de Meta : innovations en IA dans les modèles de langage et multimodaux#

Spirit LM de Meta est un nouveau modèle de langage multimodal qui combine des capacités de texte et de parole, rendant les interactions avec l’IA plus naturelles. Contrairement aux modèles traditionnels qui ne traitent que le texte ou que la parole, Spirit LM peut passer de l’un à l’autre de manière fluide.

Spirit LM peut comprendre et générer du langage d’une manière plus proche de l’humain. Il peut par exemple améliorer des assistants virtuels capables d’écouter et de répondre en langage parlé ou écrit, ou prendre en charge des outils d’accessibilité qui convertissent la parole en texte et inversement.

Un exemple de synthèse vocale avec Spirit LM de Meta

Fig. 3 Exemple de synthèse vocale avec Spirit LM de Meta.

De plus, Meta a développé des techniques pour rendre les grands modèles de langage plus efficaces. L’une d’elles, appelée Layer Skip, contribue à réduire les besoins en calcul et les coûts énergétiques en n’activant que les couches nécessaires à une tâche donnée. Cette approche est particulièrement utile pour les applications sur des appareils disposant d’une mémoire et d’une puissance limitées.

Pour répondre davantage au besoin de déployer des applications d’IA sur ce type d’appareils, Meta a également proposé des versions quantifiées de ses modèles Llama. Ces modèles sont compressés afin de s’exécuter plus rapidement sur des appareils mobiles sans sacrifier la précision.

Un aperçu de l’avenir de l’optimisation avec Meta Lingua#

À mesure que les modèles d’IA gagnent en taille et en complexité, l’optimisation de leur processus d’entraînement est devenue cruciale. En matière d’optimisation, Meta a présenté Meta Lingua, une base de code flexible et efficace qui facilite l’entraînement des grands modèles de langage. La conception modulaire de Meta Lingua permet aux chercheurs de personnaliser et de mettre à l’échelle rapidement leurs expériences.

Les chercheurs peuvent consacrer moins de temps à la configuration technique et davantage à la recherche proprement dite. La base de code est également légère et facile à intégrer, ce qui la rend adaptée aussi bien aux petites expériences qu’aux projets de grande envergure. En supprimant ces obstacles techniques, Meta Lingua aide les chercheurs à progresser plus rapidement et à tester de nouvelles idées plus facilement.

Vue d’ensemble de Meta Lingua

Fig. 4 Vue d’ensemble de Meta Lingua.

Les améliorations de Meta en matière de sécurité de l’IA#

À mesure que l’informatique quantique progresse, elle pose de nouveaux défis pour la sécurité des données. Contrairement aux ordinateurs actuels, il est probable que les ordinateurs quantiques puissent résoudre des calculs complexes beaucoup plus rapidement. Ils pourraient donc potentiellement casser les méthodes de chiffrement actuellement utilisées pour protéger les informations sensibles. C’est pourquoi la recherche dans ce domaine devient de plus en plus importante : développer de nouvelles façons de protéger les données est essentiel alors que nous nous préparons à l’avenir de l’informatique quantique.

Pour y répondre, Meta a développé Salsa, un outil destiné à renforcer la sécurité cryptographique post-quantique. Salsa aide les chercheurs à tester des attaques pilotées par l’IA et à identifier les faiblesses potentielles, afin de mieux comprendre et traiter les vulnérabilités des systèmes cryptographiques. En simulant des scénarios d’attaque avancés, Salsa fournit des informations précieuses qui peuvent guider le développement de mesures de sécurité plus robustes et résilientes pour l’ère quantique.

L’IA chez Meta : dernières innovations en robotique#

Les derniers travaux de Meta en robotique visent à aider l’IA à interagir plus naturellement avec le monde physique en améliorant la perception tactile, la dextérité et la collaboration avec les humains. En particulier, Meta Digit 360 est un capteur tactile avancé qui donne aux robots une perception affinée du toucher. Ces capteurs aident les robots à détecter des détails comme la texture, la pression et même la forme des objets. Grâce à ces informations, les robots peuvent manipuler les objets avec davantage de précision, ce qui est essentiel dans des domaines comme les soins de santé et la fabrication.

Voici quelques-unes des fonctionnalités clés de Meta Digit 360 :

  • Il est équipé de 18 fonctionnalités de détection distinctes, ce qui lui permet de capturer un large éventail de détails tactiles.
  • Le capteur peut détecter des variations de pression aussi faibles que 1 millinewton, permettant aux robots de réagir à des textures fines et à des mouvements subtils.
  • Il comprend plus de 8 millions de taxels (minuscules points de détection) répartis sur la surface du bout du doigt, fournissant une cartographie haute résolution des informations tactiles.

Une extension de Meta Digit 360 est Meta Digit Plexus, une plateforme qui intègre plusieurs capteurs tactiles sur une seule main robotique. Cette configuration permet aux robots de traiter simultanément les informations tactiles provenant de plusieurs points, à l’instar de la façon dont les mains humaines recueillent les données sensorielles.

La plateforme de détection tactile Meta Digit Plexus

Fig. 5 Meta Digit Plexus.

Préparer le prochain chapitre de l’IA#

Les dernières mises à jour de Meta en matière d’IA, allant des avancées en vision par ordinateur avec SAM 2.1 et CoTracker3 aux nouveaux développements dans les modèles de langage et la robotique, montrent comment l’IA passe progressivement de la théorie à des solutions pratiques et concrètes ayant un impact réel.

Ces outils sont conçus pour rendre l’IA plus adaptable et utile dans différents domaines, qu’il s’agisse de segmenter des images complexes, de comprendre le langage humain ou même de travailler à nos côtés dans des espaces physiques.

En donnant la priorité à l’accessibilité et aux applications concrètes, Meta FAIR nous rapproche d’un avenir où l’IA pourra relever les défis du monde réel et améliorer notre quotidien de manière significative.

Tu t’intéresses à l’IA ? Rejoins notre communauté pour découvrir les dernières actualités et analyses, et consulte notre dépôt GitHub. Tu peux également découvrir comment la vision par ordinateur peut être utilisée dans des secteurs comme les voitures autonomes et l’agriculture !

Explore solutions

Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l'avenir de l'IA !

Commence ton parcours vers l'avenir de l'apprentissage automatique