Ultralytics YOLO27 :
Vision par IA

Analyse approfondie des capacités de GPT-4o Mini d’OpenAI

Explore les fonctionnalités et les applications de GPT-4o Mini. Le dernier modèle d’OpenAI, plus économique, offre des capacités avancées d’IA pour un coût inférieur de 60 % à celui de GPT-3.5 Turbo.

ABAbirami Vina9 min read
Le modèle d’IA multimodal économique OpenAI GPT-4o Mini

En mai 2024, OpenAI a lancé GPT-4o, et maintenant, seulement trois mois plus tard, l’entreprise revient avec un autre modèle impressionnant : GPT-4o Mini. Le 18 juillet 2024, OpenAI a présenté GPT-4o Mini. L’entreprise le présente comme son « modèle le plus rentable » ! GPT-4o Mini est un modèle compact qui s’appuie sur les capacités des modèles précédents et vise à rendre l’IA avancée plus accessible et plus abordable.

GPT-4o Mini prend actuellement en charge les interactions textuelles et visuelles, et de futures mises à jour devraient ajouter des capacités de traitement des images, des vidéos et de l’audio. Dans cet article, nous allons découvrir ce qu’est GPT-4o Mini, ses principales fonctionnalités, ses utilisations possibles, les différences entre GPT-4 et GPT-4o Mini, ainsi que la manière dont il peut être utilisé dans différents cas d’usage de la vision par ordinateur. Voyons ce que GPT-4o Mini a à offrir !

Qu’est-ce que GPT-4o Mini ?#

GPT-4o Mini est le dernier-né de la gamme de modèles d’IA d’OpenAI, conçu pour être plus rentable et plus accessible. Il s’agit d’un grand modèle de langage (LLM) multimodal, ce qui signifie qu’il peut traiter et générer différents types de données, comme du texte, des images, des vidéos et de l’audio. Ce modèle s’appuie sur les points forts de modèles précédents comme GPT-4 et GPT-4o pour offrir de puissantes capacités dans un format compact.

GPT-4o Mini coûte 60 % moins cher que GPT-3.5 Turbo : 15 centimes par million de tokens d’entrée (unités de texte ou de données traitées par le modèle) et 60 centimes par million de tokens de sortie (unités générées par le modèle en réponse). Pour donner un ordre de grandeur, un million de tokens équivaut approximativement au traitement de 2 500 pages de texte. Avec une fenêtre de contexte de 128K tokens et la capacité de gérer jusqu’à 16K tokens de sortie par requête, GPT-4o Mini est conçu pour être à la fois efficace et abordable.

GPT-4o Mini coûte 60 % moins cher que GPT-3.5 Turbo

Fig. 1. GPT-4o Mini coûte 60 % moins cher que GPT-3.5 Turbo.

Principales fonctionnalités de GPT-4o Mini#

GPT-4o Mini prend en charge un éventail de tâches qui en font une excellente option pour diverses applications. Tu peux l’utiliser pour exécuter plusieurs opérations à la fois, comme appeler plusieurs API, traiter de grandes quantités de données telles que des bases de code complètes ou des historiques de conversations, et fournir des réponses rapides en temps réel dans des chatbots de support client.

Voici quelques autres fonctionnalités clés :

  • Base de connaissances actualisée : le modèle contient des informations allant jusqu’à octobre 2023.
  • Tokenizer amélioré : GPT-4o Mini rend le traitement des textes non anglophones plus rentable.
  • Mesures de sécurité robustes : ces mesures comprennent le filtrage des contenus nuisibles et la protection contre les problèmes de sécurité comme les injections de prompts et les manipulations du système.

Premiers pas avec GPT-4o Mini#

Tu peux essayer GPT-4o Mini via l’interface de ChatGPT. Il est accessible aux utilisateurs des formules Free, Plus et Team, en remplacement de GPT-3.5 comme illustré ci-dessous. Les utilisateurs Enterprise y auront également bientôt accès, conformément à l’objectif d’OpenAI de faire bénéficier tout le monde des avantages de l’IA. GPT-4o Mini est aussi disponible via l’API pour les développeurs qui souhaitent intégrer ses capacités à leurs applications. Pour le moment, les capacités visuelles sont accessibles uniquement via l’API.

Options de modèles dans ChatGPT

Fig. 2. Options de modèles dans ChatGPT.

La différence entre GPT-4o et GPT-4o Mini#

GPT-4o Mini et GPT-4o affichent tous deux d’excellentes performances sur différents benchmarks. Même si GPT-4o surpasse généralement GPT-4o Mini, GPT-4o Mini reste une solution rentable pour les tâches quotidiennes. Les benchmarks couvrent les tâches de raisonnement, les compétences en mathématiques et en programmation, ainsi que le raisonnement multimodal. Comme le montre l’image ci-dessous, GPT-4o Mini obtient de très bons résultats par rapport à d’autres modèles populaires.

Comparaison de GPT-4o Mini avec d’autres modèles populaires

Fig. 3. Comparaison de GPT-4o Mini avec d’autres modèles populaires.

Mise en pratique avec GPT-4o et GPT-4o Mini#

Un prompt intéressant, très discuté en ligne, concerne le fait que des LLM populaires comparent incorrectement des nombres décimaux. Lorsque nous avons mis GPT-4o et GPT-4o Mini à l’épreuve, leurs capacités de raisonnement ont révélé des différences nettes. Dans l’image ci-dessous, nous avons demandé aux deux modèles lequel était le plus grand : 9.11 ou 9.9, puis nous leur avons demandé d’expliquer leur raisonnement.

Évaluation du raisonnement de GPT-4o et GPT-4o Mini

Fig. 4. Évaluation de GPT-4o et GPT-4o Mini.

Les deux modèles répondent d’abord incorrectement et affirment que 9.11 est supérieur. Cependant, GPT-4o parvient à corriger son raisonnement et indique que 9.9 est supérieur. Il fournit une explication détaillée et compare correctement les nombres décimaux. À l’inverse, GPT-4o Mini s’en tient obstinément à sa réponse initiale erronée, malgré le fait d’avoir correctement compris le raisonnement montrant que 9.9 est supérieur.

Les deux modèles démontrent de solides capacités de raisonnement. La capacité de GPT-4o à se corriger le rend supérieur et utile pour les tâches plus complexes. GPT-4o Mini, bien que moins adaptable, offre tout de même un raisonnement clair et précis pour les tâches plus simples.

Utiliser GPT-4o Mini pour différents cas d’usage de la vision par ordinateur#

Si tu préfères explorer les capacités visuelles de GPT-4o Mini sans te plonger dans le code, tu peux facilement tester l’API sur l’OpenAI Playground. Nous l’avons nous-mêmes essayé pour évaluer la capacité de GPT-4o Mini à gérer différents cas d’usage liés à la vision par ordinateur.

Classification d’images avec GPT-4o Mini#

Nous avons demandé à GPT-4o Mini de classer deux images : l’une représentant un papillon et l’autre une carte. Le modèle d’IA a correctement identifié le papillon et la carte. Il s’agit d’une tâche assez simple, puisque les deux images sont très différentes.

Classification d’images d’un papillon et d’une carte avec GPT-4o Mini

Fig. 5. Classification d’images avec l’aide de GPT-4o Mini.

Nous avons ensuite soumis deux autres images au modèle : l’une montrant un papillon posé sur une plante et l’autre un papillon posé au sol. L’IA a de nouveau très bien réussi, en repérant correctement le papillon sur la plante et celui au sol. Nous avons donc encore complexifié la tâche.

Classification d’images similaires de papillons avec GPT-4o Mini

Fig. 6. Classification d’images similaires avec l’aide de GPT-4o Mini.

Nous avons ensuite demandé à GPT-4o Mini de classer deux images : l’une montrant un papillon se nourrissant des fleurs d’une Swamp Milkweed et l’autre un papillon se nourrissant d’une fleur de Zinnia. Il est impressionnant que le modèle ait pu attribuer une étiquette aussi précise sans réglage fin supplémentaire. Ces exemples rapides montrent que GPT-4o Mini pourrait être utilisé pour des tâches de classification d’images sans nécessiter d’entraînement personnalisé.

Classification d’images détaillées de papillons avec GPT-4o Mini

Fig. 7. Classification d’images détaillées avec l’aide de GPT-4o Mini.

Comprendre les poses avec GPT-4o Mini#

Pour le moment, les tâches de vision par ordinateur comme la détection d’objets et la segmentation d’instances ne peuvent pas être traitées avec GPT-4o Mini. GPT-4o rencontre des difficultés en matière de précision, mais peut être utilisé pour ce type de tâches. De même, en ce qui concerne la compréhension des poses, nous ne pouvons pas détecter ni estimer la pose dans l’image, mais nous pouvons la classer et la comprendre.

Utilisation de GPT-4o Mini pour comprendre les poses dans une image

Fig. 8. Utilisation de GPT-4o Mini pour comprendre les poses dans une image.

L’image ci-dessus montre comment GPT-4o Mini peut classer et comprendre les poses, même s’il ne peut pas détecter ni estimer les coordonnées précises de la pose. Cela peut être utile dans différentes applications. Par exemple, dans l’analyse sportive, il peut évaluer globalement les mouvements des athlètes et contribuer à prévenir les blessures. De même, dans la kinésithérapie, il peut aider à surveiller les exercices afin de vérifier que les patients effectuent les bons mouvements pendant leur rééducation. Dans le domaine de la vidéosurveillance, il peut également aider à identifier les activités suspectes en analysant le langage corporel général. Même si GPT-4o Mini ne peut pas détecter de points clés spécifiques, sa capacité à classer les poses générales le rend utile dans ces domaines et dans bien d’autres.

Applications adaptées à GPT-4o Mini#

Nous avons examiné ce que GPT-4o Mini peut faire. Voyons maintenant les applications pour lesquelles il est le plus pertinent.

GPT-4o Mini est idéal pour les applications qui nécessitent une compréhension avancée du langage naturel tout en ayant une faible empreinte de calcul. Il permet d’intégrer l’IA à des applications pour lesquelles cette intégration serait normalement trop coûteuse. En effet, une analyse détaillée réalisée par Artificial Analysis montre que GPT-4o Mini fournit des réponses de haute qualité à une vitesse fulgurante par rapport à la plupart des autres modèles.

Qualité et vitesse de sortie de GPT-4o Mini

Fig. 9. Qualité et vitesse de sortie de GPT-4o Mini.

Voici quelques domaines clés dans lesquels il pourrait se démarquer à l’avenir :

  • Assistants virtuels et chatbots : GPT-4o Mini peut fournir des réponses rapides et pertinentes afin d’améliorer les interactions avec les utilisateurs.
  • Outils pédagogiques : le modèle peut servir à créer des outils proposant un accompagnement personnalisé et la génération de contenu.
  • Outils de productivité : il peut améliorer des tâches comme le résumé de documents, la rédaction d’e-mails et la traduction de langues afin d’accroître l’efficacité.
  • Traduction linguistique : la dernière version de GPT peut servir à développer des traducteurs offrant une traduction précise et en temps réel, pour faciliter la communication entre différentes langues.

GPT-4o Mini ouvre de nouvelles perspectives#

GPT-4o Mini crée de nouvelles opportunités pour l’avenir de l’IA multimodale. Le coût du traitement de chaque élément de texte ou de données, appelé coût par token, a considérablement diminué — de près de 99 % — depuis 2022, année de sortie de text-davinci-003, le modèle GPT-3. Cette baisse des coûts montre une tendance claire vers une IA avancée plus abordable. À mesure que les modèles d’IA continuent de progresser, il devient de plus en plus probable que l’intégration de l’IA dans chaque application et chaque site web soit économiquement viable !

Tu veux mettre l’IA en pratique ? Consulte notre dépôt GitHub pour découvrir nos innovations et rejoindre notre communauté active. Découvre-en plus sur les applications de l’IA dans la fabrication et l’agriculture sur nos pages consacrées aux solutions.

Explore solutions

Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l'avenir de l'IA !

Commence ton parcours vers l'avenir de l'apprentissage automatique