Ultralytics YOLO27 :
Vision par IA

Découvre concrètement Google Gemini 2.5 pour des tâches de vision par ordinateur

Découvre concrètement Google Gemini 2.5 pour des tâches de vision par ordinateur comme la détection d’objets, le sous-titrage d’images et l’OCR dans des solutions d’IA de vision.

ABAbirami Vina9 min read
Utiliser Google Gemini 2.5 pour des tâches de vision par ordinateur

Les avancées de l’IA progressent rapidement, avec de nouvelles innovations qui font presque chaque jour la une de l’actualité. L’une de ces récentes avancées est Gemini 2.5, le dernier modèle multimodal de Google DeepMind, lancé le 26 mars. Alors que les grands modèles de langage (LLMs) traditionnels peuvent apprendre à partir de quantités massives de données pour générer du texte semblable à celui d’un humain, Gemini 2.5 va plus loin.

Il est conçu comme un « modèle de raisonnement » capable de traiter des images, de l’audio et des vidéos. Ses capacités de raisonnement et de programmation sont améliorées. Fait intéressant, il est également particulièrement performant pour les tâches de vision par ordinateur, dans lesquelles les machines interprètent et analysent des données visuelles, comme la détection d’objets, le captioning d’images et la reconnaissance optique de caractères (OCR).

Utiliser Gemini 2.5 pour comprendre le contenu d’une image

Fig. 1. Exemple d’utilisation de Gemini 2.5 pour comprendre le contenu d’une image.

Dans cet article, nous allons parcourir l’un des notebooks d’Ultralytics qui peut t’aider à découvrir concrètement les capacités de Gemini 2.5 en matière de vision par ordinateur. Nous examinerons également de plus près les principales fonctionnalités de Gemini 2.5 et montrerons comment l’utiliser pour créer des solutions de vision par ordinateur destinées à des applications concrètes. Commençons !

Présentation de Gemini 2.5 : fonctionnalités et capacités#

La première version de la série de modèles Gemini 2.5 qui vient de sortir est une version expérimentale de Gemini 2.5 Pro. Elle est conçue pour traiter des problèmes complexes en réfléchissant à ses réponses avant de donner une réponse. Elle utilise des méthodes comme l’apprentissage par renforcement (le modèle apprend à partir des retours) et le chain-of-thought prompting (une approche étape par étape pour résoudre les problèmes).

L’une de ses principales fonctionnalités est sa fenêtre de contexte gigantesque, qui peut contenir 1 million de tokens (environ un million de mots ou de fragments de mots) et devrait atteindre 2 millions. Cela signifie que le modèle peut assimiler beaucoup d’informations à la fois, ce qui permet d’obtenir des résultats plus détaillés et plus précis.

En plus du traitement du langage, Gemini 2.5 peut être utilisé pour les tâches de vision par ordinateur suivantes :

  • Détection d’objets : il s’agit d’identifier et de localiser des objets dans une image. Elle peut être utilisée dans des applications comme la vidéosurveillance ou les voitures autonomes.

  • Captioning d’images : cette tâche consiste à générer un texte descriptif pour une image. Elle rend le contenu visuel plus accessible et plus facile à comprendre.

  • Reconnaissance optique de caractères : cette technologie convertit le texte présent dans les images en texte modifiable et lisible par machine. Elle est utile pour numériser des documents et automatiser la saisie de données.

Évaluer et comparer Google Gemini 2.5 à d’autres modèles#

Plusieurs modèles multimodaux sont aujourd’hui disponibles dans le domaine de l’IA ; il est donc important de comprendre comment Gemini 2.5 Pro se compare à eux. D’après les résultats d’évaluation publiés par DeepMind de Google, Gemini 2.5 Pro affiche des performances impressionnantes sur un large éventail de tâches.

Par exemple, lors d’un test appelé Humanity’s Last Exam, qui simule un examen difficile couvrant de nombreuses matières et évalue le raisonnement avancé ainsi que les connaissances générales, Gemini 2.5 Pro obtient environ 18,8 %, dépassant des modèles comme o3-mini d’OpenAI, qui obtient environ 14 %.

Vue d’ensemble des performances de Gemini 2.5 Pro aux évaluations

Fig. 2. Vue d’ensemble des performances de Gemini 2.5 Pro aux évaluations.

Il est également très performant dans les défis de mathématiques et de programmation, égalant ou dépassant souvent les performances de modèles comme OpenAI GPT-4.5, Claude 3.7 Sonnet, Grok 3 Beta et DeepSeek R1, ce qui démontre sa capacité à gérer des tâches complexes et à traiter de grandes quantités de données.

Découvrir Gemini 2.5 : comment utiliser la Google Gemini API#

Gemini 2.5 Pro est disponible sur plusieurs plateformes. Tu peux l’expérimenter dans Google AI Studio et y accéder via l’application Gemini si tu disposes de Gemini Advanced. Dans son annonce de lancement, Google DeepMind a également indiqué que le modèle serait bientôt pris en charge sur Vertex AI. Ces différents points d’accès permettent aux développeurs d’utiliser facilement Gemini 2.5 Pro pour des applications d’IA concrètes.

Cependant, si tu veux utiliser la Google Gemini API et démarrer en quelques minutes seulement, sans configuration complexe, tout en approfondissant ta compréhension de ses capacités de vision par ordinateur, tu peux consulter le notebook Ultralytics, qui présente des tâches comme la détection d’objets et le captioning d’images avec Gemini 2.5 Pro. Parcourons en détail ce que tu peux attendre de ce notebook.

Configurer l’inférence avec le notebook Google Gemini 2.5#

Pour commencer avec le notebook Ultralytics et utiliser Google Gemini 2.5, tu dois d’abord générer une clé API via Google AI Studio. Cette clé te donne accès à la Gemini API afin que tu puisses utiliser le modèle.

Une fois ta clé API obtenue, vérifie que ton environnement dispose des bibliothèques nécessaires, notamment des paquets d’Ultralytics et de la boîte à outils IA de Google. Cette étape est clairement expliquée dans le notebook, afin que tu puisses facilement suivre les instructions et configurer ton espace de travail.

Une fois tout configuré, tu peux te connecter à la Gemini API en saisissant ta clé API (comme indiqué ci-dessous), ce qui crée un lien entre ton espace de travail et le modèle. Tu seras ensuite prêt à envoyer des images et des prompts textuels à Gemini 2.5.

En pratique, tu peux fournir une image et une instruction simple (comme « détecte les objets dans cette image » ou « décris ce que tu vois ») au modèle, qui te renverra les résultats dont tu as besoin. Ce processus direct facilite l’exploration des capacités de Gemini 2.5 en matière de vision par ordinateur.

Détection d’objets avec Google Gemini 2.5#

L’un des principaux exemples du notebook est la détection d’objets avec Gemini 2.5 Pro. Dans cet exemple, tu fournis au modèle une image et un prompt simple lui demandant de détecter les objets.

Le modèle traite l’image et renvoie un ensemble de coordonnées et d’étiquettes pour chaque objet qu’il trouve ; ces coordonnées sont fournies sous forme normalisée. Des fonctions du package Python Ultralytics sont ensuite utilisées pour convertir ces valeurs normalisées afin qu’elles correspondent aux dimensions réelles de l’image et pour dessiner des boîtes englobantes claires autour de chaque objet, comme illustré ci-dessous.

Utiliser Google Gemini 2.5 pour la détection d’objets

Fig. 3. Utiliser Google Gemini 2.5 pour la détection d’objets.

Captioning d’images avec Gemini 2.5#

Un autre exemple intéressant du notebook est le captioning d’images avec Gemini 2.5 Pro. Dans cet exemple, tu fournis au modèle une image et un prompt lui demandant de générer une légende détaillée décrivant ce qui se trouve dans l’image.

Le modèle analyse ensuite le contenu visuel et renvoie un récit, souvent présenté sous la forme de plusieurs phrases, qui restitue à la fois le contenu et le contexte de l’image. Cette fonctionnalité est utile pour améliorer l’accessibilité, résumer des informations visuelles et même enrichir la narration créative.

Améliorer la précision de l’OCR avec les modèles Google Gemini#

L’OCR est une tâche de vision par ordinateur qui exploite la capacité de Gemini 2.5 Pro à lire le texte présent dans les images. Dans le notebook, tu peux fournir au modèle une image contenant du texte ainsi qu’un prompt lui demandant d’extraire ce texte. Le modèle traite l’image et renvoie à la fois le texte détecté et les coordonnées de son emplacement, comme illustré ci-dessous.

Des fonctions du package Python Ultralytics sont ensuite utilisées pour convertir ces coordonnées normalisées en dimensions réelles de l’image et dessiner des boîtes englobantes autour des régions de texte. Cette sortie annotée indique clairement où se trouve le texte, ce qui est utile pour numériser des documents, automatiser la saisie de données et améliorer l’accessibilité.

Extraire des données textuelles d’une image avec Google Gemini 2.5

Fig. 4. Extraire des données textuelles d’une image avec Google Gemini 2.5.

Applications concrètes de Google Gemini 2.5#

Maintenant que nous avons vu comment Google Gemini 2.5 Pro peut être utilisé pour différentes tâches de vision par ordinateur, explorons quelques applications concrètes dans lesquelles ces capacités peuvent être exploitées.

La capacité de Gemini 2.5 Pro à détecter les objets peut, par exemple, aider à étiqueter et à organiser automatiquement de grands ensembles d’images, accélérant ainsi considérablement des tâches comme la création de datasets ou la gestion de contenu. Il peut également être utilisé pour analyser des images dans des domaines comme la vente au détail et l’agriculture, par exemple pour détecter des produits en rayon ou identifier des signes de stress des cultures sur des photos prises dans des exploitations agricoles.

Gemini 2.5 Pro analyse la santé d’une plante

Fig. 5. Gemini 2.5 Pro analyse la santé d’une plante.

Parallèlement, la fonctionnalité de captioning d’images du modèle peut aider les personnes malvoyantes à comprendre ce qui se trouve dans une image. Par exemple, si tu disposes d’une photo d’une rue animée, le modèle peut produire une légende décrivant la scène en détail, en mentionnant les types de véhicules, l’activité des piétons et même le moment de la journée en fonction des indices de luminosité.

En outre, la fonctionnalité OCR de Gemini 2.5 peut être utilisée dans de nombreuses applications. Tu peux par exemple numériser des documents imprimés en scannant des pages ou des reçus. Cette capacité est idéale pour automatiser les tâches de saisie de données, traiter des formulaires ou même lire le texte de cartes de visite et de panneaux.

Globalement, Google Gemini 2.5 Pro ouvre la voie à un large éventail d’applications pratiques de l’IA.

Points clés à retenir#

Au-delà de la génération et de l’analyse de texte, Google Gemini 2.5 Pro peut être utilisé pour des tâches de vision par ordinateur comme la détection d’objets, le captioning d’images et l’OCR. Grâce à sa fenêtre de contexte massive et à ses capacités de raisonnement améliorées, il produit des résultats détaillés et adaptés au contexte, qui fonctionnent bien dans des scénarios réels.

À mesure que les modèles d’IA continuent d’évoluer, des outils comme Gemini 2.5 Pro facilitent la résolution de problèmes complexes dans de nombreux secteurs. Il est probable que l’adoption de l’IA s’élargisse encore, tandis que davantage d’organisations recherchent des solutions multimodales flexibles capables de gérer un large éventail de tâches, de la compréhension visuelle au traitement du langage.

Rejoins notre communauté et découvre des projets d’IA de pointe sur notre dépôt GitHub. Découvre les applications de la Vision AI dans l’agriculture et le rôle de l’IA dans l’industrie manufacturière sur nos pages de solutions. Explore nos plans de licence et crée dès aujourd’hui des solutions de vision par ordinateur !

Explore solutions

Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l'avenir de l'IA !

Commence ton parcours vers l'avenir de l'apprentissage automatique