Une analyse approfondie des capacités du GPT-4o Mini d'OpenAI
Explore les fonctionnalités et applications de GPT-4o Mini. Le modèle le plus récent et le plus rentable d'OpenAI offre des capacités d'IA avancées pour 60 % moins cher que GPT-3.5 Turbo.

En mai 2024, OpenAI a publié GPT-4o, et maintenant, tout juste trois mois plus tard, ils reviennent avec un autre modèle impressionnant : GPT-4o Mini. Le 18 juillet 2024, OpenAI a introduit GPT-4o Mini. Ils le qualifient de leur « modèle le plus économique » ! GPT-4o Mini est un modèle compact qui s'appuie sur les capacités des modèles précédents et vise à rendre l'IA avancée plus accessible et abordable.
GPT-4o Mini prend actuellement en charge les interactions textuelles et visuelles, et de futures mises à jour devraient ajouter des capacités de traitement d'images, de vidéos et de l'audio. Dans cet article, nous explorerons ce qu'est GPT-4o Mini, ses fonctionnalités remarquables, comment il peut être utilisé, les différences entre GPT-4 et GPT-4o Mini, et comment il peut être appliqué dans divers cas d'usage de la vision par ordinateur. Plongeons dans le vif du sujet et voyons ce que GPT-4o Mini a à offrir !
Qu'est-ce que GPT-4o Mini ?#
GPT-4o Mini est le dernier ajout à la gamme de modèles d'IA d'OpenAI, conçu pour être plus économique et accessible. C'est un grand modèle de langage (LLM) multimodal, ce qui signifie qu'il peut traiter et générer différents types de données, tels que du texte, des images, des vidéos et de l'audio. Le modèle s'appuie sur les points forts des modèles précédents comme GPT-4 et GPT-4o pour offrir des capacités puissantes dans un format compact.
GPT-4o Mini est 60 % moins cher que GPT-3.5 Turbo, coûtant 15 cents par million de tokens en entrée (unités de texte ou de données traitées par le modèle) et 60 cents par million de tokens en sortie (unités générées par le modèle en réponse). Pour mettre cela en perspective, un million de tokens équivaut environ au traitement de 2 500 pages de texte. Avec une fenêtre de contexte de 128K tokens et la capacité de gérer jusqu'à 16K tokens en sortie par requête, GPT-4o Mini est conçu pour être à la fois efficace et abordable.

Fig 1. GPT-4o Mini est 60 % moins cher que GPT-3.5 Turbo.
Fonctionnalités clés de GPT-4o Mini#
GPT-4o Mini prend en charge une gamme de tâches qui en font une excellente option pour diverses applications. Il peut être utilisé lors de l'exécution de plusieurs opérations à la fois, telles que l'appel de multiples API, le traitement de grandes quantités de données comme des bases de code entières ou des historiques de conversation, et la fourniture de réponses rapides en temps réel dans les chatbots de support client.
Voici quelques autres fonctionnalités clés :
- Base de connaissances mise à jour : Le modèle contient des informations allant jusqu'en octobre 2023.
- Tokeniseur amélioré : GPT-4o Mini rend le traitement du texte non anglais plus rentable.
- Mesures de sécurité robustes : Ces mesures incluent le filtrage du contenu dangereux et la protection contre les problèmes de sécurité comme les injections de prompt et les manipulations système.
Démarrer avec GPT-4o Mini#
Tu peux essayer d'utiliser GPT-4o Mini via l'interface ChatGPT. Il est accessible aux utilisateurs Free, Plus et Team, remplaçant GPT-3.5 comme indiqué ci-dessous. Les utilisateurs Enterprise y auront également accès bientôt, conformément à l'objectif d'OpenAI de faire bénéficier tout le monde des avantages de l'IA. GPT-4o Mini est également disponible via l'API pour les développeurs qui souhaitent intégrer ses capacités dans leurs applications. Pour l'instant, les capacités de vision sont accessibles uniquement via l'API.

Fig 2. Options de modèles dans ChatGPT.
La différence entre GPT-4o et GPT-4o Mini#
GPT-4o Mini et GPT-4o obtiennent tous deux des résultats impressionnants sur divers benchmarks. Bien que GPT-4o surpasse généralement GPT-4o Mini, GPT-4o Mini reste une solution rentable pour les tâches quotidiennes. Les benchmarks incluent des tâches de raisonnement, des compétences en mathématiques et en codage, ainsi que le raisonnement multimodal. Comme le montre l'image ci-dessous, GPT-4o Mini se classe assez haut par rapport à d'autres modèles populaires.

Fig 3. Comparaison de GPT-4o Mini avec d'autres modèles populaires.
Prendre en main GPT-4o et GPT-4o Mini#
Une invite intéressante qui a fait l'objet de débats en ligne concerne des LLM populaires comparant des nombres décimaux de manière incorrecte. Lorsque nous avons mis GPT-4o et GPT-4o Mini à l'épreuve, leurs capacités de raisonnement ont montré des différences nettes. Dans l'image ci-dessous, nous avons demandé aux deux modèles lequel est le plus grand : 9.11 ou 9.9, puis nous leur avons demandé d'expliquer leur raisonnement.

Fig 4. Test de GPT-4o et GPT-4o Mini.
Les deux modèles répondent initialement de manière incorrecte et affirment que 9.11 est plus grand. Cependant, GPT-4o est capable de raisonner pour trouver la bonne réponse et affirme que 9.9 est plus grand. Il fournit une explication détaillée et compare les décimales avec précision. En revanche, GPT-4o Mini maintient obstinément sa première mauvaise réponse malgré le fait d'avoir trouvé correctement le raisonnement expliquant pourquoi 9.9 est plus grand.
Les deux modèles font preuve de solides compétences en raisonnement. La capacité de GPT-4o à se corriger le rend supérieur et utile pour des tâches plus complexes. GPT-4o Mini, bien que moins adaptable, offre toujours un raisonnement clair et précis pour des tâches plus simples.
Utiliser GPT-4o Mini pour divers cas d'usage en vision par ordinateur#
Si tu préfères explorer les capacités de vision de GPT-4o Mini sans plonger dans le code, tu peux facilement tester l'API sur l'OpenAI Playground. Nous l'avons testé nous-mêmes pour voir dans quelle mesure GPT-4o Mini est capable de gérer divers cas d'usage liés à la vision par ordinateur.
Classification d'images à l'aide de GPT-4o Mini#
Nous avons demandé à GPT-4o Mini de classifier deux images : l'une d'un papillon et l'autre d'une carte. Le modèle d'IA a identifié avec succès le papillon et la carte. C'est une tâche assez simple étant donné que les images sont très différentes.

Fig 5. Classification d'images avec l'aide de GPT-4o Mini.
Nous avons continué et soumis deux images supplémentaires au modèle : l'une montrant un papillon posé sur une plante et une autre montrant un papillon posé sur le sol. L'IA a encore fait un excellent travail, repérant correctement le papillon sur la plante et celui sur le sol. Nous sommes donc allés encore plus loin.

Fig 6. Classification d'images similaires avec l'aide de GPT-4o Mini.
Nous avons ensuite demandé à GPT-4o Mini de classifier deux images : l'une montrant un papillon se nourrissant des fleurs d'une asclépiade incarnate et l'autre montrant un papillon se nourrissant d'une fleur de zinnia. Il est incroyable que le modèle ait été capable de classifier une étiquette aussi spécifique sans entraînement supplémentaire. Ces exemples rapides montrent que GPT-4o Mini pourrait éventuellement être utilisé pour des tâches de classification d'images sans nécessiter d'entraînement personnalisé.

Fig 7. Classification d'images détaillées avec l'aide de GPT-4o Mini.
Comprendre les poses en utilisant GPT-4o Mini#
À l'heure actuelle, les tâches de vision par ordinateur telles que la détection d'objets et la segmentation d'instances ne peuvent pas être gérées à l'aide de GPT-4o Mini. GPT-4o peine en termes de précision, mais peut être utilisé pour de telles tâches. Dans la même veine, en ce qui concerne la compréhension des poses, nous ne pouvons pas détecter ou estimer la pose dans l'image, mais nous pouvons classifier et comprendre la pose.

Fig 8. Utiliser GPT-4o Mini pour comprendre les poses dans une image.
L'image ci-dessus montre comment GPT-4o Mini peut classifier et comprendre les poses, malgré son incapacité à détecter ou à estimer les coordonnées précises de la pose. Cela peut être utile dans différentes applications. Par exemple, dans l'analytique sportive, cela peut évaluer globalement les mouvements des athlètes et aider à prévenir les blessures. De même, en physiothérapie, cela peut aider à surveiller les exercices pour s'assurer que les patients effectuent les bons mouvements pendant leur rééducation. De plus, pour la surveillance, cela peut aider à identifier des activités suspectes en analysant le langage corporel général. Bien que GPT-4o Mini ne puisse pas détecter des points clés spécifiques, sa capacité à classifier des poses générales le rend utile dans ces domaines et dans d'autres.
Applications auxquelles GPT-4o Mini est adapté#
Nous avons examiné ce que GPT-4o Mini peut faire. Maintenant, discutons des applications pour lesquelles il est le plus optimal d'utiliser GPT-4o Mini.
GPT-4o Mini est idéal pour les applications qui nécessitent une compréhension avancée du langage naturel et ont une empreinte de calcul réduite. Il permet d'intégrer l'IA dans des applications où elle serait normalement trop coûteuse. En fait, une analyse détaillée par Artificial Analysis montre que GPT-4o Mini fournit des réponses de haute qualité à des vitesses fulgurantes par rapport à la plupart des autres modèles.

Fig 9. Qualité par rapport à la vitesse de sortie de GPT-4o Mini.
Voici quelques domaines clés où il pourrait briller à l'avenir :
- Assistants virtuels et chatbots : GPT-4o Mini peut fournir des réponses rapides et intelligentes pour améliorer les interactions des utilisateurs.
- Outils éducatifs : Le modèle peut être utilisé pour créer des outils offrant un tutorat personnalisé et une génération de contenu.
- Outils de productivité : Il peut améliorer des tâches telles que résumer des documents, rédiger des e-mails et traduire des langues pour stimuler l'efficacité.
- Traduction linguistique : La dernière version de GPT peut être utilisée pour développer des traducteurs qui fournissent une traduction linguistique précise et en temps réel pour une meilleure communication entre différentes langues.
GPT-4o Mini ouvre de nouvelles portes#
GPT-4o Mini crée de nouvelles opportunités pour l'avenir de l'IA multimodale. La dépense pour traiter chaque morceau de texte ou de données, connue sous le nom de coût par token, a diminué de manière substantielle - de près de 99 % - depuis 2022, lorsque text-davinci-003, le modèle GPT-3, a été publié. La baisse du coût montre une tendance claire vers une IA avancée plus abordable. Alors que les modèles d'IA continuent de s'améliorer, il devient de plus en plus probable que l'intégration de l'IA dans chaque application et site web sera économiquement viable !
Tu veux mettre la main à la pâte avec l'IA ? Visite notre dépôt GitHub pour voir nos innovations et fais partie de notre communauté active. Découvre-en plus sur les applications de l'IA dans la fabrication et l'agriculture sur nos pages de solutions.






