Ultralytics YOLO27 :
Vision par IA

PaliGemma 2 de Google : aperçu des modèles VLM avancés

Découvre avec nous les nouveaux modèles de langage et de vision de Google : PaliGemma 2. Ces modèles peuvent aider à comprendre et à analyser des images et du texte.

ABAbirami Vina10 min read
Le modèle de langage et de vision PaliGemma 2 de Google

Le 5 décembre 2024, Google a présenté PaliGemma 2, la dernière version de son modèle vision-langage (VLM) de pointe. PaliGemma 2 est conçu pour gérer des tâches combinant images et texte, comme la génération de légendes, la réponse à des questions visuelles et la détection d’objets dans des éléments visuels.

S’appuyant sur le PaliGemma original, qui était déjà un outil performant pour la génération de légendes multilingues et la reconnaissance d’objets, PaliGemma 2 apporte plusieurs améliorations clés. Parmi celles-ci figurent des tailles de modèle plus importantes, la prise en charge d’images à plus haute résolution et de meilleures performances sur les tâches visuelles complexes. Ces améliorations le rendent encore plus flexible et efficace pour un large éventail d’usages.

Dans cet article, nous allons examiner de plus près PaliGemma 2, notamment son fonctionnement, ses principales fonctionnalités et les applications dans lesquelles il excelle. Commençons !

De Gemma 2 à PaliGemma 2#

PaliGemma 2 repose sur deux technologies clés : l’encodeur visuel SigLIP et le modèle de langage Gemma 2. L’encodeur SigLIP traite les données visuelles, comme les images ou les vidéos, et les décompose en caractéristiques que le modèle peut analyser. De son côté, Gemma 2 traite le texte, ce qui permet au modèle de comprendre et de générer du langage multilingue. Ensemble, ils forment un VLM conçu pour interpréter et relier harmonieusement les informations visuelles et textuelles.

Ce qui fait de PaliGemma 2 une avancée majeure, c’est son évolutivité et sa polyvalence. Contrairement à la version originale, PaliGemma 2 est proposé en trois tailles : 3 milliards (3B), 10 milliards (10B) et 28 milliards (28B) de paramètres. Ces paramètres sont comparables aux réglages internes du modèle et l’aident à apprendre et à traiter efficacement les données. Il prend également en charge différentes résolutions d’image (par exemple, 224 x 224 pixels pour les tâches rapides et 896 x 896 pour les analyses détaillées), ce qui le rend adaptable à diverses applications.

Présentation de PaliGemma 2

Fig. 1 Présentation de PaliGemma 2.

L’intégration des capacités avancées de traitement du langage de Gemma 2 avec le traitement d’images de SigLIP rend PaliGemma 2 nettement plus intelligent. Il peut gérer des tâches telles que :

  • Génération de légendes pour des images ou des vidéos : le modèle peut générer des descriptions textuelles détaillées d’éléments visuels, ce qui le rend utile pour créer automatiquement des légendes.
  • Réponse à des questions visuelles : PaliGemma 2 peut répondre à des questions à partir d’images, par exemple en identifiant des objets, des personnes ou des actions dans une scène.
  • Reconnaissance d’objets : il identifie et étiquette les objets présents dans une image, par exemple en distinguant un chat, une table ou une voiture sur une photo.

PaliGemma 2 va au-delà du traitement séparé des images et du texte : il les associe de manière pertinente. Par exemple, il peut comprendre les relations dans une scène, comme reconnaître que « Le chat est assis sur la table », ou identifier des objets tout en ajoutant du contexte, comme lorsqu’il reconnaît un monument célèbre.

Fonctionnement des modèles VLM PaliGemma 2 de Google#

Nous allons maintenant parcourir un exemple utilisant le graphique présenté dans l’image ci-dessous afin de mieux comprendre comment PaliGemma 2 traite les données visuelles et textuelles. Imaginons que tu importes ce graphique et que tu demandes au modèle : « Que représente ce graphique ? »

Exemple des capacités de PaliGemma 2

Fig. 2 Exemple des capacités de PaliGemma 2.

Le processus commence avec l’encodeur visuel SigLIP de PaliGemma 2, qui analyse les images et extrait les caractéristiques clés. Pour un graphique, cela comprend l’identification d’éléments tels que les axes, les points de données et les libellés. L’encodeur est entraîné pour capturer à la fois les tendances générales et les détails fins. Il utilise également la reconnaissance optique de caractères (OCR) pour détecter et traiter le texte intégré à l’image. Ces caractéristiques visuelles sont converties en jetons, qui sont des représentations numériques que le modèle peut traiter. Ces jetons sont ensuite ajustés à l’aide d’une couche de projection linéaire, une technique qui garantit qu’ils peuvent être combinés harmonieusement avec les données textuelles.

Parallèlement, le modèle de langage Gemma 2 traite la requête associée afin d’en déterminer la signification et l’intention. Le texte de la requête est converti en jetons, puis ceux-ci sont combinés aux jetons visuels de SigLIP pour créer une représentation multimodale, un format unifié qui relie les données visuelles et textuelles.

Grâce à cette représentation intégrée, PaliGemma 2 génère une réponse étape par étape par décodage autorégressif, une méthode dans laquelle le modèle prédit une partie de la réponse à la fois en fonction du contexte qu’il a déjà traité.

Principales capacités de PaliGemma 2#

Maintenant que nous avons compris son fonctionnement, explorons les principales fonctionnalités qui font de PaliGemma 2 un modèle vision-langage fiable :

  • Flexibilité de l’affinage : s’adapte facilement à des jeux de données et à des tâches spécifiques, avec de bonnes performances dans des applications telles que la génération de légendes d’images, le raisonnement spatial et l’imagerie médicale.
  • Diversité des données d’entraînement : entraîné sur des jeux de données comme WebLI et OpenImages, il dispose de solides capacités de reconnaissance d’objets et peut générer des sorties multilingues.
  • Intégration de l’OCR : inclut la reconnaissance optique de caractères pour extraire et interpréter le texte des images, ce qui le rend idéal pour l’analyse de documents et d’autres tâches basées sur le texte.
  • Sorties multilingues : génère des légendes et des réponses dans plusieurs langues, ce qui est idéal pour les applications internationales.
  • Intégration avec des outils : il est compatible avec des frameworks comme Hugging Face Transformers, PyTorch et Keras, ce qui facilite son déploiement et son expérimentation.

Comparaison entre PaliGemma 2 et PaliGemma : quelles améliorations ?#

Examiner l’architecture de la première version de PaliGemma est un bon moyen de comprendre les améliorations de PaliGemma 2. L’un des changements les plus notables est le remplacement du modèle de langage Gemma original par Gemma 2, qui apporte d’importantes améliorations en matière de performances et d’efficacité.

Gemma 2, disponible avec 9B et 27B paramètres, a été conçu pour offrir une précision et une vitesse de premier ordre tout en réduisant les coûts de déploiement. Il y parvient grâce à une architecture repensée et optimisée pour l’efficacité de l’inférence sur différentes configurations matérielles, des GPU puissants aux configurations plus accessibles.

Retour sur la première version de PaliGemma

Fig. 3 Retour sur la première version de PaliGemma 2.

Par conséquent, PaliGemma 2 est un modèle très précis. La version 10B de PaliGemma 2 obtient un score Non-Entailment Sentence (NES) inférieur, de 20,3 contre 34,3 pour le modèle original, ce qui signifie que ses sorties contiennent moins d’erreurs factuelles. Ces avancées rendent PaliGemma 2 plus évolutif, précis et adaptable à un éventail plus large d’applications, de la génération de légendes détaillées à la réponse à des questions visuelles.

Applications de PaliGemma 2 : usages concrets des modèles VLM#

PaliGemma 2 a le potentiel de transformer les secteurs en associant harmonieusement la compréhension visuelle et linguistique. Par exemple, en matière d’accessibilité, il peut générer des descriptions détaillées d’objets, de scènes et de relations spatiales, apportant une aide essentielle aux personnes malvoyantes. Cette capacité aide les utilisateurs à mieux comprendre leur environnement et leur offre davantage d’autonomie dans les tâches quotidiennes.

PaliGemma 2 peut rendre le monde plus accessible

Fig. 4 PaliGemma 2 peut rendre le monde plus accessible.

En plus de l’accessibilité, PaliGemma 2 a un impact dans divers secteurs, notamment :

  • Commerce électronique : le modèle améliore la catégorisation des produits en analysant et en décrivant les articles présents dans les images, ce qui simplifie la gestion des stocks et améliore l’expérience de recherche des utilisateurs.
  • Santé : il aide les professionnels de santé en interprétant des images médicales, comme des radiographies et des IRM, parallèlement aux notes cliniques afin de fournir des diagnostics plus précis et éclairés.
  • Éducation : PaliGemma 2 aide les enseignants à créer des supports pédagogiques descriptifs et accessibles en générant des légendes et en fournissant des informations contextuelles pour les images.
  • Création de contenu : le modèle automatise la génération de légendes et de descriptions visuelles pour les contenus multimédias, ce qui fait gagner du temps aux créateurs.

Essaie-le toi-même : PaliGemma 2#

Pour essayer PaliGemma 2, tu peux commencer par la démo interactive de Hugging Face. Elle te permet d’explorer ses capacités dans des tâches comme la génération de légendes d’images et la réponse à des questions visuelles. Il te suffit d’importer une image et de poser au modèle des questions à son sujet ou de lui demander une description de la scène.

Démo de PaliGemma 2

Fig. 5. Démo de PaliGemma 2 (source : Hugging Face).

Si tu souhaites aller plus loin, voici comment passer à la pratique :

  • Modèles préentraînés : tu peux accéder à des modèles préentraînés et à du code sur des plateformes comme Hugging Face et Kaggle. Ces ressources fournissent tout ce dont tu as besoin pour commencer à travailler avec le modèle.
  • Notebooks : une documentation complète et des notebooks d’exemple sont disponibles pour te familiariser avec PaliGemma 2. Tu peux commencer par des exemples d’inférence et expérimenter l’affinage du modèle sur ton propre jeu de données pour des tâches spécifiques.
  • Intégrations : PaliGemma 2 est compatible avec des frameworks largement utilisés comme Hugging Face Transformers, Keras, PyTorch, JAX et Gemma.cpp, ce qui te permet de l’intégrer facilement à tes workflows existants.

Avantages et inconvénients de PaliGemma 2 de Google#

Maintenant que tu sais comment commencer avec PaliGemma 2, examinons de plus près ses principaux atouts et inconvénients à garder à l’esprit lors de l’utilisation de ces modèles.

Voici ce qui distingue PaliGemma 2 en tant que modèle vision-langage :

  • Gains d’efficacité : grâce à l’architecture optimisée de Gemma 2, PaliGemma 2 offre de hautes performances tout en minimisant les coûts de déploiement.
  • Fonctionnalités de sécurité améliorées : PaliGemma 2 intègre des améliorations significatives de la sécurité dans son processus d’entraînement, notamment un filtrage robuste des données de préentraînement pour réduire les biais et une évaluation rigoureuse à l’aide de benchmarks de sécurité.
  • Faible latence pour les configurations plus petites : le modèle 3B offre des temps d’inférence plus rapides, ce qui le rend adapté aux cas d’usage où la vitesse est essentielle, comme les recommandations de produits en commerce électronique ou les systèmes d’assistance en direct.

Voici maintenant quelques domaines dans lesquels PaliGemma 2 peut rencontrer des limites :

  • Latence : bien que puissants, les modèles plus grands peuvent rencontrer des problèmes de latence, notamment lorsqu’ils sont déployés pour des tâches nécessitant des réponses immédiates, comme les systèmes d’IA interactifs en temps réel.
  • Dépendance à de grands jeux de données : les performances de PaliGemma 2 sont étroitement liées à la qualité et à la diversité de ses jeux de données d’entraînement, ce qui peut limiter son efficacité dans les domaines sous-représentés ou les langues absentes des données d’entraînement.
  • Besoins élevés en ressources : malgré les optimisations, les versions à 10B et 28B paramètres nécessitent une puissance de calcul importante, ce qui les rend moins accessibles aux petites organisations disposant de ressources limitées.

Points clés à retenir#

PaliGemma 2 constitue une avancée remarquable dans la modélisation vision-langage, en offrant une meilleure évolutivité, une plus grande flexibilité d’affinage et une précision accrue. Il peut servir d’outil précieux pour des applications allant des solutions d’accessibilité et du commerce électronique au diagnostic médical et à l’éducation.

Bien qu’il présente certaines limites, comme ses besoins en calcul et sa dépendance à des données de haute qualité, ses atouts en font un choix pratique pour s’attaquer à des tâches complexes intégrant des données visuelles et textuelles. PaliGemma 2 peut fournir une base solide aux chercheurs et aux développeurs qui souhaitent explorer et étendre le potentiel de l’IA dans les applications multimodales.

Participe aux discussions sur l’IA en consultant notre dépôt GitHub et notre communauté. Découvre comment l’IA fait progresser l’agriculture et la santé ! 🚀

Explore solutions

Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l'avenir de l'IA !

Commence ton parcours vers l'avenir de l'apprentissage automatique