Ultralytics YOLO27 :
Vision par IA

Florence-2 : le dernier modèle vision-langage de Microsoft

Découvre Florence-2, le modèle de langage visuel de Microsoft qui offre une détection d’objets, une segmentation et des performances zero-shot améliorées avec une grande efficacité.

ABAbirami Vina9 min read
Le modèle vision-langage Florence-2 de Microsoft

En juin 2024, Microsoft a présenté Florence-2, un modèle de langage visuel multimodal (VLM) conçu pour gérer un large éventail de tâches, notamment la détection d’objets, la segmentation, la génération de légendes d’images et l’ancrage visuel. Florence-2 établit une nouvelle référence en matière de performances zero-shot, ce qui signifie qu’il peut effectuer des tâches sans entraînement spécifique préalable, tout en affichant une taille de modèle inférieure à celle d’autres modèles de vision-langage de pointe.

Florence-2 est bien plus qu’un simple modèle supplémentaire : sa polyvalence et ses performances améliorées pourraient avoir un impact significatif sur divers secteurs en améliorant la précision et en réduisant le besoin d’un entraînement approfondi. Dans cet article, nous explorerons les fonctionnalités innovantes de Florence-2, comparerons ses performances à celles d’autres VLM et examinerons ses applications potentielles.

Qu’est-ce que Florence-2 ?#

Florence-2 peut gérer diverses tâches au sein d’un cadre unifié unique. Les capacités impressionnantes du modèle sont notamment dues à son vaste jeu de données d’entraînement appelé FLD-5B. FLD-5B comprend 5,4 milliards d’annotations réparties sur 126 millions d’images. Ce jeu de données complet a été créé spécifiquement pour doter Florence-2 des capacités nécessaires à la gestion d’un large éventail de tâches de vision avec une grande précision et efficacité.

Voici un aperçu plus détaillé des tâches prises en charge par Florence-2 :

  • Détection d’objets : il peut identifier et localiser les objets dans les images avec une grande précision.
  • Segmentation : cette tâche consiste à diviser une image en segments pertinents afin d’en faciliter l’analyse et l’interprétation.
  • Génération de légendes d’images : Florence-2 est capable de générer des légendes descriptives pour les images, fournissant du contexte et des détails.
  • Ancrage visuel : le modèle peut associer des phrases ou des mots précis d’une légende aux régions correspondantes de l’image.
  • Performances zero-shot : il peut effectuer des tâches sans entraînement spécifique.

Schéma de l’entraînement de Florence-2

Fig. 1 Comprendre l’entraînement de Florence-2.

Le modèle prend en charge les tâches fondées à la fois sur le texte et sur les régions. Des tokens de localisation spéciaux sont ajoutés au vocabulaire du modèle pour les tâches portant sur des régions précises d’une image. Ces tokens aident le modèle à comprendre différentes formes, comme les rectangles autour des objets (représentation par boîte), les formes à quatre côtés (représentation par boîte quadrilatère) et les formes à plusieurs côtés (représentation par polygone). Le modèle est entraîné à l’aide d’une méthode appelée perte d’entropie croisée, qui l’aide à apprendre en comparant ses prédictions aux réponses correctes et en ajustant ses paramètres internes en conséquence.

Création du jeu de données FLD-5B#

Le jeu de données FLD-5B comprend différents types d’annotations : des descriptions textuelles, des paires de régions et de textes, ainsi que des combinaisons de textes, de phrases et de régions. Il a été créé en deux étapes, avec notamment la collecte et l’annotation des données. Les images provenaient de jeux de données populaires tels qu’ImageNet-22k, Object 365, Open Images, Conceptual Captions et LAION. Les annotations du jeu de données FLD-5B sont principalement synthétiques, c’est-à-dire qu’elles ont été générées automatiquement plutôt qu’étiquetées manuellement.

Schéma de la création du jeu de données FLD-5B

Fig. 2 Création du jeu de données FLD-5B.

Dans un premier temps, des modèles spécialisés et performants pour des tâches spécifiques, comme la détection d’objets ou la segmentation, ont créé ces annotations. Ensuite, un processus de filtrage et d’enrichissement a été utilisé pour garantir que les annotations soient détaillées et précises. Après suppression du bruit, le jeu de données a fait l’objet d’un affinage itératif, au cours duquel les sorties de Florence-2 ont été utilisées pour mettre continuellement à jour et améliorer les annotations.

Comprendre l’architecture du modèle Florence-2#

L’architecture du modèle Florence-2 repose sur une approche d’apprentissage séquence-à-séquence. Cela signifie que le modèle traite une séquence d’entrée (comme une image accompagnée d’une invite textuelle) et génère une séquence de sortie (comme une description ou une étiquette) étape par étape. Dans le cadre séquence-à-séquence, chaque tâche est traitée comme un problème de traduction : le modèle reçoit une image d’entrée et une invite propre à la tâche, puis génère la sortie correspondante.

Schéma de l’architecture du modèle de vision-langage Florence-2

Fig. 3 Architecture du modèle de vision-langage Florence-2.

Au cœur de l’architecture du modèle se trouve un Transformer encodeur-décodeur multimodal, qui combine un encodeur d’image et un encodeur-décodeur multimodal. L’encodeur d’image, appelé DaViT (Transformer de vision économe en données), traite les images d’entrée en les convertissant en embeddings de tokens visuels — des représentations compactes de l’image qui capturent à la fois les informations spatiales (où se trouvent les éléments) et sémantiques (ce que sont les éléments). Ces tokens visuels sont ensuite combinés avec des embeddings textuels (représentations du texte), ce qui permet au modèle de fusionner harmonieusement les données textuelles et visuelles.

Comparaison de Florence-2 avec d’autres VLM#

Florence-2 se démarque des autres modèles de langage visuel par ses impressionnantes capacités zero-shot. Contrairement à des modèles comme PaliGemma, qui reposent sur un réglage fin approfondi pour s’adapter à diverses tâches, Florence-2 fonctionne efficacement dès sa sortie. De plus, Florence-2 est capable de rivaliser avec des modèles plus volumineux comme GPT-4V et Flamingo, qui possèdent souvent beaucoup plus de paramètres, sans toujours égaler les performances de Florence-2. Par exemple, Florence-2 obtient de meilleurs résultats zero-shot que Kosmos-2, malgré le fait que Kosmos-2 possède plus de deux fois plus de paramètres.

Lors de tests de référence, Florence-2 a affiché des performances remarquables dans des tâches telles que la génération de légendes sur COCO et la compréhension d’expressions référentielles. Il a surpassé des modèles comme PolyFormer et UNINEXT dans les tâches de détection d’objets et de segmentation sur le jeu de données COCO. Il constitue une option très compétitive pour les applications concrètes où les performances et l’efficacité des ressources sont toutes deux essentielles.

Applications de Florence-2#

Florence-2 peut être utilisé dans de nombreux secteurs, notamment le divertissement, l’accessibilité et l’éducation, entre autres. Examinons quelques exemples pour mieux comprendre.

Applications de la génération de légendes d’images#

Lorsque tu es sur une plateforme de streaming et que tu essaies de choisir un programme à regarder, tu peux lire le résumé d’un film pour t’aider à décider. Et si la plateforme pouvait également fournir une description détaillée de l’affiche du film ? Florence-2 peut rendre cela possible grâce à la génération de légendes d’images, qui produit du texte descriptif pour les images. Florence-2 peut générer des descriptions détaillées d’affiches de films, rendant les plateformes de streaming plus inclusives pour les utilisateurs malvoyants. En analysant les éléments visuels d’une affiche, comme les personnages, le décor et le texte, Florence-2 peut créer des descriptions détaillées qui transmettent le contenu et l’ambiance de l’affiche. L’image ci-dessous montre le niveau de détail que Florence-2 peut fournir dans sa description.

Exemple de légende d’image générée par Florence-2

Fig. 4 Exemple de légende d’image générée par Florence-2.

Voici d’autres exemples de situations où la génération de légendes d’images peut être utile :

  • E-commerce : la génération de légendes d’images peut fournir des descriptions détaillées des images de produits, aidant les clients à mieux comprendre leurs caractéristiques et leurs détails.
  • Voyage et tourisme : elle peut fournir des descriptions détaillées des sites et attractions dans les guides et applications de voyage.
  • Éducation : la génération de légendes d’images peut étiqueter et décrire des images et des schémas pédagogiques, facilitant l’enseignement et l’apprentissage.
  • Immobilier : elle peut fournir des descriptions détaillées des images de biens immobiliers, mettant en évidence leurs caractéristiques et leurs équipements pour les acheteurs potentiels.

Utiliser l’ancrage visuel en cuisine#

Florence-2 peut également être utilisé pour enrichir les expériences culinaires. Par exemple, un livre de recettes en ligne pourrait utiliser Florence-2 pour effectuer un ancrage visuel et étiqueter les différentes parties d’une image de recette complexe. L’ancrage visuel est utile ici, car il relie des parties précises de l’image au texte descriptif correspondant. Chaque ingrédient et chaque étape peuvent être étiquetés et expliqués avec précision, ce qui permet aux cuisiniers amateurs de suivre plus facilement la recette et de comprendre le rôle de chaque élément dans le plat.

Exemple d’ancrage visuel avec Florence-2

Fig. 5 Exemple d’ancrage visuel avec Florence-2.

OCR fondue sur les régions pour les documents financiers#

L’OCR avec traitement par régions, qui se concentre sur l’extraction de texte depuis des zones précises d’un document, peut s’avérer utile dans des domaines comme la comptabilité. Les zones désignées des documents financiers peuvent être analysées afin d’extraire automatiquement des informations importantes telles que les détails des transactions, les numéros de compte et les dates d’échéance. En réduisant le besoin de saisie manuelle des données, cette méthode limite les erreurs et accélère les délais de traitement. Les institutions financières peuvent l’utiliser pour rationaliser des tâches telles que le traitement des factures, le rapprochement des reçus et la compensation des chèques, ce qui permet d’accélérer les transactions et d’améliorer le service client.

Exemple d’OCR avec région à l’aide de Florence-2

Fig. 6 Exemple d’extraction OCR avec région à l’aide de Florence-2.

Segmentation fondée sur les régions dans les applications industrielles#

La segmentation fondée sur les régions, qui consiste à diviser une image en parties pertinentes pour une analyse ciblée et une inspection détaillée, peut alimenter des applications industrielles améliorant la précision et l’efficacité de divers processus. En se concentrant sur des zones précises d’une image, cette technologie permet d’inspecter et d’analyser en détail les composants et les produits. En matière de contrôle qualité, elle peut identifier les défauts ou les incohérences des matériaux, comme les fissures ou les défauts d’alignement, afin de garantir que seuls des produits de qualité optimale arrivent sur le marché.

Exemple de segmentation fondée sur les régions avec Florence-2

Fig. 7 Exemple de segmentation fondée sur les régions avec Florence-2.

Elle améliore également les chaînes d’assemblage automatisées en guidant les bras robotisés vers des pièces précises et en optimisant le positionnement et l’assemblage des composants. De même, dans la gestion des stocks, elle aide à suivre et à surveiller l’état et l’emplacement des marchandises, ce qui permet une logistique plus efficace et réduit les temps d’arrêt. Globalement, la segmentation fondée sur les régions améliore la précision et la productivité, entraînant une réduction des coûts et une meilleure qualité des produits dans les environnements industriels.

Points clés à retenir#

Nous commençons à observer une tendance selon laquelle les modèles d’IA deviennent plus légers tout en maintenant des performances élevées. Florence-2 représente une avancée majeure pour les modèles de vision-langage. Il peut gérer diverses tâches comme la détection d’objets, la segmentation, la génération de légendes d’images et l’ancrage visuel, avec des performances zero-shot impressionnantes. Malgré sa taille réduite, Florence-2 est efficace et multifonctionnel, ce qui le rend extrêmement utile pour des applications dans différents secteurs. Des modèles comme Florence-2 ouvrent de nouvelles possibilités et élargissent le potentiel des innovations en matière d’IA.

Pour en savoir plus sur l’IA, consulte notre dépôt GitHub et rejoins notre communauté. Consulte nos pages de solutions pour découvrir les applications de l’IA dans l’industrie manufacturière et l’agriculture. 🚀

Explore solutions

Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l'avenir de l'IA !

Commence ton parcours vers l'avenir de l'apprentissage automatique