Les dernières mises à jour d'OpenAI : Canvas, réglage fin de la vision, et plus
Rejoins-nous pour examiner de plus près les récentes mises à jour de ChatGPT publiées par OpenAI. Nous explorerons Canvas, le réglage fin pour les capacités visuelles et la dernière fonctionnalité de recherche.

Après notre dernier examen des OpenAI's o1 models en septembre (qui ont été conçus pour améliorer le raisonnement), de nombreuses nouvelles fonctionnalités passionnantes ont été ajoutées à ChatGPT. Certaines de ces sorties sont destinées aux développeurs, et d'autres sont conçues pour affiner l'expérience utilisateur. Globalement, chaque mise à niveau contribue à rendre les interactions avec ChatGPT plus intuitives et efficaces.
Des mises à jour telles que Canvas, conçue pour la writing and coding collaborative, et le fine-tuning pour les vision capabilities qui améliore la façon dont ChatGPT fonctionne avec les images, ont suscité beaucoup d'intérêt, encourageant les utilisateurs à explorer davantage de possibilités créatives. Parallèlement, des améliorations techniques, comme de nouvelles API et des rapports de tests d'équité, abordent des aspects tels que l'integration des modèles et les pratiques d'ethical AI. Plongeons-nous dans le sujet pour mieux comprendre les dernières fonctionnalités de ChatGPT par OpenAI !
Un aperçu de la fonctionnalité Canvas d'OpenAI#
Canvas est la première mise à jour majeure de l'interface utilisateur (UI) de ChatGPT depuis son lancement. Il s'agit d'une nouvelle interface avec une disposition à deux écrans, des invites dans la barre latérale gauche et les réponses dans la fenêtre de droite. La nouvelle UI élimine la structure habituelle en écran unique semblable à un chat et passe à une mise en page à deux écrans adaptée au multitâche pour booster la productivité.

Fig 1. Canvas apporte des mises à jour d'interface à ChatGPT.
Avant l'introduction de Canvas, travailler sur de longs documents dans ChatGPT signifiait devoir faire pas mal de défilement vers le haut et vers le bas. Dans la nouvelle disposition, les invites sont affichées dans la barre latérale gauche, et le document textuel ou l'extrait de code occupe la majeure partie de l'écran. Si nécessaire, tu peux même personnaliser la taille de la barre latérale gauche et de l'écran de sortie. De plus, tu peux sélectionner une portion de texte ou une section de code et modifier cette section spécifique sans altérer l'ensemble du document.

Fig 2. Modifie des sections spécifiques de texte à l'aide de Canvas.
Si tu utilises Canvas, tu remarqueras qu'il n'y a pas de bouton spécifique ou de bascule pour l'ouvrir sur l'interface de ChatGPT. Au lieu de cela, lorsque tu travailles avec le modèle GPT-4o, Canvas s'ouvre automatiquement s'il détecte que tu es en train d'editing, de writing ou de coding. Pour les invites plus simples, il reste inactif. Si tu souhaites l'ouvrir manuellement, tu peux utiliser des invites telles que "Open the Canvas" ou "Get me the Canvas layout."
Actuellement, Canvas est en version bêta et disponible uniquement avec GPT-4o. Cependant, OpenAI a mentionné que Canvas sera disponible pour tous les utilisateurs gratuits une fois la version bêta terminée.
Mises à jour de l'API de ChatGPT#
OpenAI a publié trois nouvelles mises à jour de l'API ChatGPT visant à améliorer l'efficacité, l'évolutivité et la polyvalence. Examinons de plus près chacune de ces mises à jour.
Distillation de modèle#
En utilisant la fonctionnalité de Model Distillation via les API OpenAI, les développeurs peuvent utiliser les sorties de advanced models comme GPT-4o ou o1-preview pour améliorer les performance de modèles plus petits et économiques comme GPT-4o mini. La distillation de modèles est un processus qui implique l'training de modèles plus petits pour imiter le comportement de modèles plus avancés, les rendant plus efficaces pour des specific tasks.
Avant l'introduction de cette fonctionnalité, les développeurs devaient coordonner manuellement une variété de tâches à l'aide de différents outils. Ces tâches incluaient la génération de datasets, la mesure des model performance et le fine-tuning des modèles, ce qui rendait souvent le processus complexe et sujet aux erreurs. La mise à jour de la distillation de modèles permet aux développeurs d'utiliser Stored Completions, un outil qui leur permet de generate datasets automatiquement en capturant et en stockant les paires entrée-sortie produites par les modèles avancés via l'API.
Une autre fonctionnalité de la distillation de modèles, Evals (actuellement en version bêta), aide à mesurer les model performs sur des tâches spécifiques, sans avoir besoin de créer des scripts d'evaluation personnalisés ou d'utiliser des outils séparés. En utilisant des ensembles de données generated avec Stored Completions et en evaluating performance avec Evals, les développeurs peuvent affiner leurs propres modèles GPT personnalisés.

Fig 3. Tu peux utiliser Evals pour mesurer la performance du modèle.
Mise en cache des invites#
Souvent, lors de la création d'AI applications, en particulier de chatbots, le même context (les informations d'arrière-plan ou l'historique des conversations précédentes nécessaires pour comprendre la requête actuelle) sera utilisé de manière répétée pour plusieurs appels d'API. Prompt Caching permet aux développeurs de réutiliser des input tokens (segments de texte que le modèle traite pour comprendre l'invite et générer une réponse) récemment utilisés, contribuant ainsi à réduire les coûts et la latence.
À partir du 1er octobre, OpenAI a appliqué automatiquement Prompt Caching à ses modèles tels que GPT-4o, GPT-4o mini, o1-preview et o1-mini. Cela signifie que lorsque les développeurs utilisent l'API pour interagir avec un modèle doté d'un long prompt (plus de 1 024 tokens), le système enregistre les parties qu'il a déjà traitées.
De cette façon, si les mêmes invites ou des invites similaires sont utilisées à nouveau, il peut ignorer le recalcul de ces parties. Le système met automatiquement en cache la plus longue partie de l'invite qu'il a précédemment rencontrée, en commençant par 1 024 tokens et en ajoutant des morceaux de 128 tokens à mesure que l'invite devient plus longue.
API en temps réel#
La création d'un voice assistant implique généralement de transcrire de l'audio to text, de traiter le texte, puis de le reconvertir en audio to play la réponse. L'API Realtime d'OpenAI vise à gérer l'ensemble de ce processus avec une seule requête API. En simplifiant le processus, l'API permet des conversations en temps réel avec l'IA.
Par exemple, un assistant vocal intégré à l'API Realtime peut effectuer des actions spécifiques, telles que placing an order ou finding information, en fonction des demandes des utilisateurs. L'API rend l'assistant vocal plus réactif et capable de s'adapter rapidement aux besoins des utilisateurs. L'API Realtime est devenue disponible via une version bêta publique le 1er octobre, avec six voix. Le 30 octobre, cinq voix supplémentaires ont été ajoutées, portant le total à onze voix disponibles.

Fig 4. Un exemple d'utilisation de l'API Realtime pour pratiquer des conversations dans une nouvelle langue.
Réglage fin de ChatGPT pour les tâches de vision#
À l'origine, le modèle de langage de vision GPT-4o ne pouvait être réglé et personnalisé qu'en utilisant des datasets textuels uniquement. Maintenant, avec la sortie de l'API de réglage fin de la vision, les développeurs peuvent entraîner et personnaliser GPT-4o en utilisant des datasets d'images. Depuis sa sortie, le réglage fin de la vision est devenu un sujet d'intérêt majeur parmi les développeurs et les ingénieurs en vision par ordinateur.
Pour affiner les capacités de vision de GPT-4o, les développeurs peuvent utiliser des datasets d'images allant de seulement 100 images à 50 000 images. Après avoir vérifié que le dataset correspond au format requis par OpenAI, il peut être téléchargé sur la plateforme OpenAI, et le modèle peut être affiné pour des applications spécifiques.
Par exemple, Automat, une entreprise d'automatisation, a utilisé un ensemble de données de captures d'écran pour train GPT-4o afin de pouvoir identifier des éléments d'interface utilisateur sur un écran à partir d'une description. Cela aide à rationaliser l'automatisation des processus robotiques (RPA) en facilitant l'interaction des bots avec les interfaces utilisateur. Au lieu de s'appuyer sur des coordonnées fixes ou des règles de sélecteur complexes, le modèle peut identifier les éléments de l'interface utilisateur sur la base de descriptions simples, rendant les configurations d'automatisation plus adaptables et plus faciles à maintenir lorsque les interfaces changent.

Fig 5. Utilisation d'une version affinée du modèle GPT-4o pour détecter les éléments d'interface utilisateur.
Équité de ChatGPT et détection des biais#
Les Ethical concerns entourant les AI applications sont un sujet de conversation important à mesure que l'IA devient de plus en plus avancée. Étant donné que les réponses de ChatGPT sont basées sur des invites fournies par l'utilisateur et des données disponibles sur Internet, il peut être difficile d'affiner son langage pour qu'il soit responsable en tout temps. Des rapports indiquent que ChatGPT’s answers are biased en fonction du nom, du genre et de la race. Pour résoudre ce problème, l'équipe interne d'OpenAI a mené un test d'équité à la première personne.
Les noms portent souvent des indices subtils sur our culture et des facteurs géographiques. Dans la plupart des cas, ChatGPT ignorera ces indices subtils dans les noms. Cependant, dans certains cas, les noms qui reflètent la race ou la culture entraînent des réponses différentes de la part de ChatGPT, environ 1 % de celles-ci reflétant un harmful language. Éliminer les biais et le langage nuisible est une tâche difficile pour un language model. Cependant, en partageant ces conclusions publiquement et en reconnaissant les limites du modèle, OpenAI aide les utilisateurs à affiner leurs invites pour obtenir des réponses plus neutres et impartiales.

Fig 6. Un exemple de réponses différentes en raison du nom de l'utilisateur.
Comprendre la recherche ChatGPT#
Lorsque ChatGPT a été lancé pour la première fois, il y avait des discussions dans la communauté de l'IA sur la question de savoir s'il pouvait remplacer la navigation Web traditionnelle. Aujourd'hui, de nombreux utilisateurs utilisent ChatGPT au lieu de Google Search.
La nouvelle mise à jour d'OpenAI, la fonctionnalité de recherche (Search), va encore plus loin. Avec Search, ChatGPT génère des réponses à jour et inclut des liens vers des sources pertinentes. Depuis le 31 octobre, la fonctionnalité Search est disponible pour tous les utilisateurs de ChatGPT Plus et Team, faisant fonctionner ChatGPT davantage comme un moteur de recherche alimenté par l'IA.

Fig 7. Un exemple d'utilisation de la nouvelle fonctionnalité Search de ChatGPT.
La route à suivre#
Les récentes mises à jour de ChatGPT se concentrent sur la manière de rendre l'IA plus utile, flexible et équitable. La nouvelle fonctionnalité Canvas aide les utilisateurs à travailler plus efficacement, tandis que le réglage fin de la vision permet aux développeurs de personnaliser les modèles pour mieux gérer les tâches visuelles. L'équité et la réduction des biais sont également des priorités clés, garantissant que l'IA fonctionne bien pour tout le monde, peu importe qui ils sont. Que tu sois un développeur qui affine des modèles ou que tu utilises simplement les dernières fonctionnalités, ChatGPT évolue pour répondre à un large éventail de besoins. Avec des capacités en temps réel, une intégration visuelle et un accent sur l'utilisation responsable, ces mises à jour construisent une expérience d'IA plus fiable pour tout le monde.
Découvre-en plus sur l'IA en visitant notre GitHub repository et en rejoignant notre community. Apprends-en davantage sur les applications de l'IA dans la self-driving et la healthcare.






