Ultralytics YOLO27 :
Vision par IA

Faire le lien entre le traitement du langage naturel et la vision par ordinateur

Découvre comment le traitement du langage naturel (NLP) et la vision par ordinateur (CV) peuvent fonctionner ensemble pour transformer les secteurs grâce à des systèmes d’IA intermodaux plus intelligents.

ABAbirami Vina10 min read
Faire le lien entre le traitement du langage naturel et la vision par ordinateur

Le traitement automatique du langage naturel (NLP) et la vision par ordinateur (CV) sont deux branches distinctes de l’intelligence artificielle (AI) qui ont gagné en popularité ces dernières années. Grâce aux avancées de l’AI, ces deux branches sont désormais plus interconnectées que jamais.

Le sous-titrage automatique d’images en est un excellent exemple. La vision par ordinateur peut servir à analyser et à comprendre le contenu d’une image, tandis que le traitement automatique du langage naturel peut être utilisé pour générer une légende qui la décrit. Le sous-titrage automatique d’images est couramment utilisé sur les plateformes de réseaux sociaux pour améliorer l’accessibilité, ainsi que dans les systèmes de gestion de contenu afin d’aider à organiser et à étiqueter les images efficacement.

Les innovations dans le domaine du NLP et de la Vision AI ont donné naissance à de nombreux cas d’utilisation de ce type dans un large éventail de secteurs. Dans cet article, nous examinerons de plus près le NLP et la vision par ordinateur, et nous expliquerons leur fonctionnement. Nous explorerons également des applications intéressantes qui utilisent ces deux technologies conjointement. Commençons !

Comprendre le NLP et la Vision AI#

Le NLP se concentre sur l’interaction entre les ordinateurs et le langage humain. Il permet aux machines de comprendre, d’interpréter et de générer du texte ou de la parole de manière pertinente. Il peut être utilisé pour effectuer des tâches comme la traduction, l’analyse des sentiments ou la synthèse automatique.

La vision par ordinateur aide quant à elle les machines à analyser et à traiter des images et des vidéos. Elle peut être utilisée pour des tâches comme la détection d’objets dans une photo, la reconnaissance faciale, le suivi d’objets ou la classification d’images. La technologie Vision AI permet aux machines de mieux comprendre le monde visuel et d’interagir avec lui.

Exemple de classification d’images

Fig. 1 Un exemple de classification d’images.

Lorsqu’il est intégré à la vision par ordinateur, le NLP peut donner du sens aux données visuelles en combinant texte et images, ce qui permet une compréhension plus approfondie. Comme le dit l’adage, « une image vaut mille mots » ; associée à du texte, elle devient encore plus puissante et offre des informations plus riches.

Exemples de collaboration entre le NLP et la vision par ordinateur#

Tu as probablement déjà vu le NLP et la vision par ordinateur fonctionner ensemble dans des outils du quotidien sans même t’en rendre compte, par exemple lorsque ton téléphone traduit le texte d’une image.

En fait, Google Translate utilise à la fois le traitement automatique du langage naturel et la vision par ordinateur pour traduire le texte présent dans les images. Lorsque tu prends en photo un panneau de signalisation dans une autre langue, la vision par ordinateur identifie et extrait le texte, tandis que le NLP le traduit dans la langue de ton choix.

Le NLP et le CV travaillent ensemble pour rendre le processus fluide et efficace, permettant aux utilisateurs de comprendre et d’utiliser des informations dans plusieurs langues en temps réel. Cette intégration harmonieuse des technologies élimine les barrières de communication.

Fonctionnalité Google Translate traduisant le texte d’une image

Fig. 2. Fonctionnalité de traduction de Google.

Voici d’autres applications dans lesquelles le NLP et la vision par ordinateur fonctionnent ensemble :

  • Voitures autonomes : le CV peut être utilisé pour détecter les panneaux de signalisation, les voies et les obstacles, tandis que le NLP peut traiter les commandes vocales ou le texte présent sur les panneaux routiers.
  • Lecteurs de documents : la Vision AI peut reconnaître du texte dans des documents numérisés ou manuscrits, tandis que le traitement automatique du langage naturel peut interpréter et résumer les informations.
  • Recherche visuelle dans les applications d’achat : la vision par ordinateur peut identifier les produits sur des photos, tandis que le NLP traite les termes de recherche afin d’améliorer les recommandations.
  • Outils pédagogiques : le CV peut reconnaître des notes manuscrites ou des éléments visuels, et le NLP peut fournir des explications ou des commentaires basés sur le contenu.

Concepts clés reliant la vision par ordinateur et le NLP#

Maintenant que nous avons vu comment la vision par ordinateur et le traitement automatique du langage naturel sont utilisés, découvrons comment ils se combinent pour permettre une AI multimodale.

L’AI multimodale combine la compréhension visuelle de la vision par ordinateur avec la compréhension du langage issue du NLP afin de traiter et de relier des informations dans des textes et des images. Par exemple, dans le domaine des soins de santé, l’AI multimodale peut aider à analyser une radiographie et à générer un résumé écrit et clair des problèmes potentiels, aidant ainsi les médecins à prendre des décisions plus rapides et plus précises.

Compréhension du langage naturel (NLU)#

La compréhension du langage naturel est un sous-ensemble spécialisé du NLP qui se concentre sur l’interprétation et l’extraction du sens d’un texte en analysant son intention, son contexte, sa sémantique, son ton et sa structure. Alors que le NLP traite le texte brut, la NLU permet aux machines de comprendre plus efficacement le langage humain. Par exemple, l’analyse syntaxique est une technique de NLU qui convertit un texte écrit en un format structuré que les machines peuvent comprendre.

Diagramme représentant la relation entre le NLP et la NLU

Fig. 3. La relation entre le NLP et la NLU.

La NLU fonctionne avec la vision par ordinateur lorsque les données visuelles contiennent du texte qui doit être compris. La vision par ordinateur, à l’aide de technologies comme la reconnaissance optique de caractères (OCR), extrait le texte d’images, de documents ou de vidéos. Cela peut inclure des tâches comme la numérisation d’un reçu, la lecture du texte sur un panneau ou la numérisation de notes manuscrites.

La NLU traite ensuite le texte extrait pour en comprendre le sens, le contexte et l’intention. Cette combinaison permet aux systèmes de faire plus que simplement reconnaître du texte. Ils peuvent catégoriser les dépenses figurant sur des reçus ou analyser le ton et les sentiments. Ensemble, la vision par ordinateur et la NLU transforment le texte visuel en informations pertinentes et exploitables.

Ingénierie des prompts#

L’ingénierie des prompts consiste à concevoir des prompts d’entrée clairs, précis et détaillés afin de guider les systèmes d’AI générative, tels que les grands modèles de langage (LLMs) et les modèles vision-langage (VLMs), dans la production des résultats souhaités. Ces prompts servent d’instructions pour aider le modèle d’AI à comprendre l’intention de l’utilisateur.

Une ingénierie des prompts efficace nécessite de comprendre les capacités du modèle et de concevoir des entrées qui maximisent sa capacité à générer des réponses précises, créatives ou pertinentes. Cela est particulièrement important pour les modèles d’AI qui traitent à la fois du texte et des images.

Prenons par exemple le modèle DALL·E d’OpenAI. Si tu lui demandes de créer « une image photoréaliste d’un astronaute chevauchant un cheval », il peut générer exactement cela à partir de ta description. Cette capacité est particulièrement utile dans des domaines comme la conception graphique, où les professionnels peuvent rapidement transformer des idées textuelles en maquettes visuelles, gagner du temps et accroître leur productivité.

Une image créée avec DALL-E d’OpenAI

Fig. 4. Une image créée avec DALL-E d’OpenAI.

Tu te demandes peut-être quel est le lien avec la vision par ordinateur : ne s’agit-il pas simplement d’AI générative ? Les deux sont en réalité étroitement liées. L’AI générative s’appuie sur les fondements de la vision par ordinateur pour créer des contenus visuels entièrement nouveaux.

Les modèles d’AI générative qui créent des images à partir de prompts textuels sont entraînés sur de grands ensembles de données composés d’images associées à des descriptions textuelles. Cela leur permet d’apprendre les relations entre le langage et des concepts visuels comme les objets, les textures et les relations spatiales.

Ces modèles n’interprètent pas les données visuelles de la même manière que les systèmes traditionnels de vision par ordinateur, par exemple lorsqu’il s’agit de reconnaître des objets dans des images du monde réel. Ils utilisent plutôt leur compréhension acquise de ces concepts pour générer de nouveaux éléments visuels à partir de prompts. En combinant ces connaissances avec des prompts bien conçus, l’AI générative peut produire des images réalistes et détaillées qui correspondent aux entrées de l’utilisateur.

Questions-réponses (QA)#

Les systèmes de questions-réponses sont conçus pour comprendre les questions en langage naturel et fournir des réponses précises et pertinentes. Ils utilisent des techniques comme la recherche d’informations, la compréhension sémantique et l’apprentissage profond pour interpréter les requêtes et y répondre.

Les modèles avancés comme GPT-4o d’OpenAI peuvent gérer les questions-réponses visuelles (VQA), c’est-à-dire analyser des images et répondre à des questions les concernant. Cependant, GPT-4o n’effectue pas directement de tâches de vision par ordinateur. Il utilise plutôt un encodeur d’image spécialisé pour traiter les images, extraire des caractéristiques et les combiner avec sa compréhension du langage afin de fournir des réponses.

Capacité de ChatGPT à répondre à des questions visuelles

Fig. 5. Capacité de ChatGPT à répondre à des questions visuelles. Image réalisée par l’auteur.

D’autres systèmes vont plus loin en intégrant pleinement les capacités de vision par ordinateur. Ces systèmes peuvent analyser directement des images ou des vidéos pour identifier des objets, des scènes ou du texte. Associés au traitement automatique du langage naturel, ils peuvent traiter des questions plus complexes sur le contenu visuel. Par exemple, ils peuvent répondre à « Quels objets se trouvent dans cette image ? » ou « Qui apparaît dans cette séquence ? » en détectant et en interprétant les éléments visuels.

Apprentissage en zéro-shot (ZSL)#

L’apprentissage en zéro-shot (ZSL) est une méthode d’apprentissage automatique qui permet aux modèles d’AI de traiter de nouvelles tâches inédites sans avoir été spécifiquement entraînés sur celles-ci. Pour ce faire, elle utilise des informations supplémentaires, comme des descriptions ou des relations sémantiques, afin de relier ce que le modèle connaît déjà (classes vues) à de nouvelles catégories inédites.

Dans le traitement automatique du langage naturel, le ZSL aide les modèles à comprendre et à traiter des sujets sur lesquels ils n’ont pas été entraînés, en s’appuyant sur les relations entre les mots et les concepts. De même, en vision par ordinateur, le ZSL permet aux modèles de reconnaître des objets ou des scènes qu’ils n’ont jamais rencontrés en reliant des caractéristiques visuelles, comme des ailes ou des plumes, à des concepts connus tels que les oiseaux.

Le ZSL relie le NLP et le CV en combinant la compréhension du langage et la reconnaissance visuelle, ce qui le rend particulièrement utile pour les tâches qui font appel aux deux. Par exemple, lors de questions-réponses visuelles, un modèle peut analyser une image tout en comprenant une question associée afin de fournir une réponse précise. Il est également utile pour des tâches comme le sous-titrage automatique d’images.

Points clés à retenir#

La combinaison du traitement automatique du langage naturel et de la vision par ordinateur a donné naissance à des systèmes d’AI capables de comprendre à la fois le texte et les images. Cette combinaison est utilisée dans de nombreux secteurs, qu’il s’agisse d’aider les voitures autonomes à lire les panneaux routiers, d’améliorer les diagnostics médicaux ou de rendre les réseaux sociaux plus sûrs. À mesure que ces technologies progressent, elles continueront à simplifier la vie et à ouvrir de nouvelles possibilités dans un large éventail de domaines. Pour en savoir plus, consulte notre dépôt GitHub et participe à notre communauté. Découvre les applications de l’AI dans les voitures autonomes et l’agriculture sur nos pages de solutions. 🚀

Explore solutions

Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l'avenir de l'IA !

Commence ton parcours vers l'avenir de l'apprentissage automatique