Ultralytics YOLO27 :
Retour au glossaire Ultralytics

Multi-Modal Learning

Explore l’apprentissage multimodal en IA. Découvre comment il intègre le texte, la vision et l’audio pour créer des modèles robustes comme Ultralytics YOLO26 et YOLO-World. Découvre-en plus dès aujourd’hui !

L'apprentissage multimodal est une approche sophistiquée de l'intelligence artificielle (AI) qui entraîne des algorithmes à traiter, comprendre et corréler des informations provenant de plusieurs types distincts de données, ou « modalités ». Contrairement aux systèmes traditionnels spécialisés dans un seul type d'entrée — comme le texte pour la traduction ou les pixels pour la reconnaissance d'images — l'apprentissage multimodal imite la cognition humaine en intégrant diverses entrées sensorielles telles que les données visuelles, l'audio parlé, les descriptions textuelles et les relevés de capteurs. Cette approche holistique permet aux modèles d'apprentissage automatique (ML) de développer une compréhension plus approfondie du monde, sensible au contexte, ce qui conduit à des prédictions plus robustes et polyvalentes.

Fonctionnement de l'apprentissage multimodal#

Le principal défi de l'apprentissage multimodal consiste à traduire différents types de données dans un espace mathématique partagé, où ils peuvent être comparés et combinés. Ce processus comporte généralement trois grandes étapes : l'encodage, l'alignement et la fusion.

  1. Extraction de caractéristiques : Des réseaux neuronaux spécialisés traitent chaque modalité indépendamment. Par exemple, des réseaux neuronaux convolutionnels (CNNs) ou des Transformers de vision (ViTs) peuvent extraire des caractéristiques d'images, tandis que des réseaux neuronaux récurrents (RNNs) ou des Transformers traitent le texte.

  2. Alignement des représentations vectorielles : Le modèle apprend à projeter ces diverses caractéristiques dans des vecteurs partagés de grande dimension. Dans cet espace commun, le vecteur du mot « chat » et celui d'une image de chat sont rapprochés. Des techniques comme l'apprentissage contrastif, popularisées par des articles tels que CLIP d'OpenAI, sont essentielles à cette étape.

  3. Fusion des données : Enfin, les informations sont fusionnées pour effectuer une tâche. La fusion peut avoir lieu en amont (en combinant les données brutes), en aval (en combinant les prédictions finales) ou au moyen de méthodes hybrides intermédiaires utilisant le mécanisme d'attention pour pondérer dynamiquement l'importance de chaque modalité.

Applications concrètes#

L'apprentissage multimodal est le moteur de nombreuses avancées les plus impressionnantes de l'AI actuelle, comblant le fossé entre des silos de données distincts pour résoudre des problèmes complexes.

  • Réponse visuelle aux questions (VQA) : Dans cette application, un système doit analyser une image et répondre à une question en langage naturel à son sujet, telle que « De quelle couleur est le feu de circulation ? ». Cela exige du modèle qu'il comprenne la sémantique du texte et localise spatialement les éléments visuels correspondants à l'aide de la vision par ordinateur.
  • Véhicules autonomes : Les voitures autonomes s'appuient fortement sur la fusion de capteurs, en combinant les données de nuages de points LiDAR, les flux vidéo des caméras et les données radar pour se déplacer en toute sécurité. Ces entrées multimodales garantissent que, si un capteur tombe en panne (par exemple, une caméra aveuglée par l'éblouissement du soleil), les autres peuvent maintenir la sécurité routière.
  • Diagnostic médical : Dans le domaine de la santé, l'AI utilise l'apprentissage multimodal en analysant l'analyse d'images médicales (comme les IRM ou les radiographies) avec les antécédents textuels non structurés des patients et les données génétiques. Cette vision globale aide les médecins à établir des diagnostics plus précis, un sujet fréquemment abordé dans les revues de Nature Digital Medicine.
  • AI générative : Les outils qui créent des images à partir d'invites textuelles, comme Stable Diffusion, reposent entièrement sur la capacité du modèle à comprendre la relation entre les descriptions linguistiques et les textures visuelles.

Détection d'objets multimodale avec Ultralytics#

Alors que les détecteurs d'objets standard s'appuient sur des classes prédéfinies, les approches multimodales comme YOLO-World permettent aux utilisateurs de détecter des objets à l'aide d'invites textuelles à vocabulaire ouvert. Cela illustre la puissance de la mise en relation des concepts textuels et des caractéristiques visuelles au sein de l'écosystème Ultralytics.

L'extrait de code Python suivant montre comment utiliser un modèle YOLO-World préentraîné pour détecter des objets à partir d'entrées textuelles personnalisées.

from ultralytics import YOLOWorld

# Load a pretrained YOLO-World model (Multi-Modal: Text + Vision)
model = YOLOWorld("yolov8s-world.pt")

# Define custom text prompts (modalities) for the model to identify
model.set_classes(["person", "bus", "traffic light"])

# Run inference: The model aligns the text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Show the results
results[0].show()

Différenciation des principaux termes#

Pour s'orienter dans le paysage de l'AI moderne, il est utile de distinguer l'« apprentissage multimodal » des concepts connexes :

  • Modèle multimodal : L'« apprentissage multimodal » désigne la méthodologie et le domaine d'étude. Un « modèle multimodal » (comme GPT-4 ou Gemini de Google) est l'artefact ou le produit logiciel spécifique issu de ce processus d'entraînement.
  • AI unimodale : La vision par ordinateur traditionnelle est généralement unimodale et se concentre exclusivement sur les données visuelles. Bien qu'un modèle comme Ultralytics YOLO26 soit un outil CV de pointe pour détecter des objets, il fonctionne généralement uniquement sur des entrées visuelles, sauf s'il fait partie d'un pipeline multimodal plus vaste.
  • Grands modèles de langage (LLMs) : Les LLMs traditionnels sont unimodaux et entraînés uniquement sur du texte. Toutefois, le secteur s'oriente vers les « grands modèles multimodaux » (LMMs), capables de traiter nativement les images et le texte, une tendance soutenue par des frameworks comme PyTorch et TensorFlow.

Perspectives d’avenir#

La trajectoire de l'apprentissage multimodal s'oriente vers des systèmes présentant les caractéristiques de l'intelligence artificielle générale (AGI). En ancrant avec succès le langage dans la réalité visuelle et physique, ces modèles vont au-delà de la corrélation statistique pour tendre vers un véritable raisonnement. Les recherches menées par des institutions comme le MIT CSAIL et le Centre de recherche sur les modèles de fondation de Stanford continuent de repousser les limites de la façon dont les machines perçoivent et appréhendent des environnements complexes et multisensoriels.

Chez Ultralytics, nous intégrons ces avancées à notre Ultralytics Platform, afin de permettre aux utilisateurs de gérer leurs données, d'entraîner des modèles et de déployer des solutions exploitant tout l'éventail des modalités disponibles, de la rapidité de YOLO26 à la polyvalence de la détection à vocabulaire ouvert.

Explore solutions

Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l'avenir de l'IA !

Commence ton parcours vers l'avenir de l'apprentissage automatique