Les dernières mises à jour d’OpenAI : Canvas, réglage fin de la vision et plus encore
Avec nous, examine de plus près les récentes mises à jour de ChatGPT publiées par OpenAI. Nous explorerons Canvas, le réglage fin des capacités de vision et la dernière fonctionnalité Search.

Depuis que nous avons examiné les modèles o1 d’OpenAI en septembre (conçus pour améliorer le raisonnement), de nombreuses fonctionnalités nouvelles et passionnantes ont été ajoutées à ChatGPT. Certaines de ces nouveautés s’adressent aux développeurs, tandis que d’autres visent à améliorer l’expérience utilisateur. Globalement, chaque mise à niveau contribue à rendre les interactions avec ChatGPT plus intuitives et efficaces.
Des nouveautés comme Canvas, conçu pour la rédaction et le développement collaboratifs, et le fine-tuning des capacités de vision, qui améliore la façon dont ChatGPT traite les images, suscitent beaucoup d’intérêt et encouragent les utilisateurs à explorer davantage de possibilités créatives. Parallèlement, des mises à niveau techniques, comme les nouvelles API et les rapports de tests d’équité, abordent des aspects tels que l’intégration des modèles et les pratiques d’IA éthique. Plongeons-nous dans les dernières fonctionnalités de ChatGPT d’OpenAI pour mieux les comprendre !
Présentation de la fonctionnalité Canvas d’OpenAI#
Canvas est la première mise à jour majeure de l’interface utilisateur (UI) de ChatGPT depuis son lancement. Il s’agit d’une nouvelle interface avec une disposition à deux écrans, les invites dans la barre latérale gauche et les réponses dans la fenêtre de droite. Cette nouvelle UI abandonne le flux de travail habituel d’une structure de conversation sur un seul écran au profit d’une disposition à deux écrans adaptée au multitâche afin d’améliorer la productivité.

Fig. 1 Canvas apporte des mises à jour de l’UI à ChatGPT.
Avant l’introduction de Canvas, travailler avec de longs documents dans ChatGPT impliquait de faire défiler l’écran de haut en bas assez fréquemment. Dans la nouvelle disposition, les invites s’affichent dans la barre latérale gauche, tandis que le document texte ou l’extrait de code occupe la majeure partie de l’écran. Si nécessaire, tu peux même personnaliser la taille de la barre latérale gauche et de l’écran de sortie. Tu peux également sélectionner une partie du texte ou une section de code et modifier cette section précise sans altérer l’ensemble du document.

Fig. 2. Modifier des sections précises de texte avec Canvas.
Si tu utilises Canvas, tu remarqueras qu’il n’y a pas de bouton ni de bascule spécifique pour l’ouvrir dans l’interface de ChatGPT. À la place, lorsque tu travailles avec le modèle GPT-4o, Canvas s’ouvre automatiquement s’il détecte que tu es en train de modifier, d’écrire ou de programmer. Pour les invites plus simples, il reste inactif. Si tu veux l’ouvrir manuellement, tu peux utiliser des invites comme « Open the Canvas » ou « Get me the Canvas layout ».
Actuellement, Canvas est en version bêta et disponible uniquement avec GPT-4o. Cependant, OpenAI a indiqué que Canvas serait disponible pour tous les utilisateurs gratuits à sa sortie de la version bêta.
Les mises à jour de l’API de ChatGPT#
OpenAI a publié trois nouvelles mises à jour de l’API de ChatGPT destinées à améliorer l’efficacité, l’évolutivité et la polyvalence. Examinons chacune de ces mises à jour de plus près.
Distillation de modèles#
Grâce à la fonctionnalité de distillation de modèles via les API d’OpenAI, les développeurs peuvent utiliser les sorties de modèles avancés comme GPT-4o ou o1-preview pour améliorer les performances de modèles plus petits et économiques comme GPT-4o mini. La distillation de modèles est un processus qui consiste à entraîner des modèles plus petits pour qu’ils imitent le comportement de modèles plus avancés, les rendant ainsi plus efficaces pour des tâches spécifiques.
Avant l’introduction de cette fonctionnalité, les développeurs devaient coordonner manuellement diverses tâches à l’aide de différents outils. Ces tâches comprenaient la génération de jeux de données, la mesure des performances des modèles et le fine-tuning des modèles, ce qui rendait souvent le processus complexe et sujet aux erreurs. La mise à jour de la distillation de modèles permet aux développeurs d’utiliser Stored Completions, un outil qui leur permet de générer automatiquement des jeux de données en capturant et en stockant les paires entrée-sortie produites par des modèles avancés via l’API.
Une autre fonctionnalité de la distillation de modèles, Evals (actuellement en version bêta), aide à mesurer les performances d’un modèle sur des tâches spécifiques, sans avoir à créer de scripts d’évaluation personnalisés ni à utiliser des outils distincts. En utilisant des jeux de données générés avec Stored Completions et en évaluant les performances avec Evals, les développeurs peuvent effectuer le fine-tuning de leurs propres modèles GPT personnalisés.

Fig. 3 Tu peux utiliser Evals pour mesurer les performances d’un modèle.
Mise en cache des invites#
Lors de la création d’applications d’IA, en particulier de chatbots, le même contexte (les informations générales ou l’historique des conversations précédentes nécessaires pour comprendre la demande actuelle) est souvent utilisé à plusieurs reprises pour plusieurs appels d’API. La mise en cache des invites permet aux développeurs de réutiliser des tokens d’entrée récemment utilisés (des segments de texte que le modèle traite pour comprendre l’invite et générer une réponse), ce qui contribue à réduire les coûts et la latence.
Depuis le 1er octobre, OpenAI applique automatiquement la mise en cache des invites à ses modèles comme GPT-4o, GPT-4o mini, o1-preview et o1-mini. Cela signifie que lorsque les développeurs utilisent l’API pour interagir avec un modèle au moyen d’une longue invite (de plus de 1 024 tokens), le système enregistre les parties qu’il a déjà traitées.
Ainsi, si les mêmes invites ou des invites similaires sont utilisées à nouveau, le système peut éviter de recalculer ces parties. Il met automatiquement en cache la partie la plus longue de l’invite déjà rencontrée, en commençant par 1 024 tokens et en ajoutant des blocs de 128 tokens à mesure que l’invite s’allonge.
API en temps réel#
La création d’un assistant vocal implique généralement de transcrire l’audio en texte, de traiter le texte, puis de le reconvertir en audio pour lire la réponse. L’API en temps réel d’OpenAI vise à gérer l’ensemble de ce processus avec une seule requête API. En simplifiant le processus, l’API permet d’avoir des conversations en temps réel avec l’IA.
Par exemple, un assistant vocal intégré à l’API en temps réel peut effectuer des actions spécifiques, comme passer une commande ou rechercher des informations, en fonction des demandes de l’utilisateur. L’API rend l’assistant vocal plus réactif et capable de s’adapter rapidement aux besoins des utilisateurs. L’API en temps réel est devenue disponible en version bêta publique le 1er octobre, avec six voix. Le 30 octobre, cinq voix supplémentaires ont été ajoutées, portant le total à onze voix disponibles.

Fig. 4 Exemple d’utilisation de l’API en temps réel pour pratiquer des conversations dans une nouvelle langue.
Effectuer le fine-tuning de ChatGPT pour les tâches de vision#
À l’origine, le modèle de langage et de vision GPT-4o ne pouvait être soumis à un fine-tuning et personnalisé qu’à l’aide de jeux de données contenant uniquement du texte. Désormais, avec la publication de l’API de fine-tuning de la vision, les développeurs peuvent entraîner et personnaliser GPT-4o à l’aide de jeux de données d’images. Depuis sa sortie, le fine-tuning de la vision est devenu un sujet d’intérêt majeur parmi les développeurs et les ingénieurs en vision par ordinateur.
Pour effectuer le fine-tuning des capacités de vision de GPT-4o, les développeurs peuvent utiliser des jeux de données d’images allant de 100 images seulement à 50 000 images. Après s’être assuré que le jeu de données respecte le format requis par OpenAI, il peut être téléversé sur la plateforme OpenAI, puis le modèle peut être soumis à un fine-tuning pour des applications spécifiques.
Par exemple, Automat, une entreprise spécialisée dans l’automatisation, a utilisé un jeu de données de captures d’écran pour entraîner GPT-4o à identifier des éléments d’UI à l’écran à partir d’une description. Cela contribue à rationaliser l’automatisation robotisée des processus (RPA) en facilitant l’interaction des robots avec les interfaces utilisateur. Au lieu de s’appuyer sur des coordonnées fixes ou des règles de sélection complexes, le modèle peut identifier les éléments d’UI à partir de descriptions simples, ce qui rend les configurations d’automatisation plus adaptables et plus faciles à maintenir lorsque les interfaces changent.

Fig. 5 Utiliser une version du modèle GPT-4o soumise à un fine-tuning pour détecter des éléments d’UI.
Équité de ChatGPT et détection des biais#
Les préoccupations éthiques entourant les applications d’IA sont un sujet de discussion important à mesure que l’IA devient de plus en plus avancée. Comme les réponses de ChatGPT reposent sur les invites fournies par les utilisateurs et les données disponibles sur Internet, il peut être difficile d’ajuster son langage pour qu’il soit toujours responsable. Des rapports indiquent que les réponses de ChatGPT sont biaisées en fonction du nom, du genre et de l’origine ethnique. Pour résoudre ce problème, l’équipe interne d’OpenAI a réalisé un premier test d’équité en conditions réelles.
Les noms véhiculent souvent des indices subtils sur notre culture et des facteurs géographiques. Dans la plupart des cas, ChatGPT ignore les indices subtils contenus dans les noms. Cependant, dans certains cas, les noms reflétant une origine ethnique ou une culture entraînent des réponses différentes de ChatGPT, dont environ 1 % contiennent un langage préjudiciable. Éliminer les biais et le langage préjudiciable est une tâche difficile pour un modèle de langage. Toutefois, en partageant publiquement ces résultats et en reconnaissant les limites du modèle, OpenAI aide les utilisateurs à affiner leurs invites afin d’obtenir des réponses plus neutres et impartiales.

Fig. 6 Exemple de réponses différentes dues au nom de l’utilisateur.
Comprendre la recherche de ChatGPT#
Lorsque ChatGPT a été lancé pour la première fois, la communauté de l’IA s’est demandé s’il pouvait remplacer la navigation web traditionnelle. Désormais, de nombreux utilisateurs utilisent ChatGPT à la place de Google Search.
La nouvelle mise à jour d’OpenAI, la fonctionnalité Search, va encore plus loin. Avec Search, ChatGPT génère des réponses à jour et inclut des liens vers des sources pertinentes. Depuis le 31 octobre, la fonctionnalité Search est disponible pour tous les utilisateurs ChatGPT Plus et Team, ce qui permet à ChatGPT de fonctionner davantage comme un moteur de recherche optimisé par l’IA.

Fig. 7 Exemple d’utilisation de la nouvelle fonctionnalité Search de ChatGPT.
La suite#
Les dernières mises à jour de ChatGPT visent à rendre l’IA plus utile, flexible et équitable. La nouvelle fonctionnalité Canvas aide les utilisateurs à travailler plus efficacement, tandis que le fine-tuning de la vision permet aux développeurs de personnaliser les modèles afin qu’ils gèrent mieux les tâches visuelles. La lutte contre les problèmes d’équité et la réduction des biais sont également des priorités essentielles, afin de garantir que l’IA fonctionne correctement pour tout le monde, quelle que soit son identité. Que tu sois un développeur qui effectue le fine-tuning de modèles ou que tu utilises simplement les dernières fonctionnalités, ChatGPT évolue pour répondre à un large éventail de besoins. Grâce à ses capacités en temps réel, à son intégration visuelle et à l’accent mis sur une utilisation responsable, ces mises à jour contribuent à créer une expérience d’IA plus digne de confiance et plus fiable pour tout le monde.
Découvre-en davantage sur l’IA en consultant notre dépôt GitHub et en rejoignant notre communauté. En savoir plus sur les applications de l’IA dans les domaines de la conduite autonome et de la santé.









