Multi-Modal Learning
Explore l’apprentissage multimodal en IA. Découvre comment il intègre le texte, la vision et l’audio pour créer des modèles robustes comme Ultralytics YOLO26 et YOLO-World. Découvre-en plus dès aujourd’hui !
L'apprentissage multimodal est une approche sophistiquée de l'intelligence artificielle (AI) qui entraîne des algorithmes à traiter, comprendre et corréler des informations provenant de plusieurs types distincts de données, ou « modalités ». Contrairement aux systèmes traditionnels spécialisés dans un seul type d'entrée — comme le texte pour la traduction ou les pixels pour la reconnaissance d'images — l'apprentissage multimodal imite la cognition humaine en intégrant diverses entrées sensorielles telles que les données visuelles, l'audio parlé, les descriptions textuelles et les relevés de capteurs. Cette approche holistique permet aux modèles d'apprentissage automatique (ML) de développer une compréhension plus approfondie du monde, sensible au contexte, ce qui conduit à des prédictions plus robustes et polyvalentes.
Fonctionnement de l'apprentissage multimodal#
Le principal défi de l'apprentissage multimodal consiste à traduire différents types de données dans un espace mathématique partagé, où ils peuvent être comparés et combinés. Ce processus comporte généralement trois grandes étapes : l'encodage, l'alignement et la fusion.
-
Extraction de caractéristiques : Des réseaux neuronaux spécialisés traitent chaque modalité indépendamment. Par exemple, des réseaux neuronaux convolutionnels (CNNs) ou des Transformers de vision (ViTs) peuvent extraire des caractéristiques d'images, tandis que des réseaux neuronaux récurrents (RNNs) ou des Transformers traitent le texte.
-
Alignement des représentations vectorielles : Le modèle apprend à projeter ces diverses caractéristiques dans des vecteurs partagés de grande dimension. Dans cet espace commun, le vecteur du mot « chat » et celui d'une image de chat sont rapprochés. Des techniques comme l'apprentissage contrastif, popularisées par des articles tels que CLIP d'OpenAI, sont essentielles à cette étape.
-
Fusion des données : Enfin, les informations sont fusionnées pour effectuer une tâche. La fusion peut avoir lieu en amont (en combinant les données brutes), en aval (en combinant les prédictions finales) ou au moyen de méthodes hybrides intermédiaires utilisant le mécanisme d'attention pour pondérer dynamiquement l'importance de chaque modalité.
Applications concrètes#
L'apprentissage multimodal est le moteur de nombreuses avancées les plus impressionnantes de l'AI actuelle, comblant le fossé entre des silos de données distincts pour résoudre des problèmes complexes.
- Réponse visuelle aux questions (VQA) : Dans cette application, un système doit analyser une image et répondre à une question en langage naturel à son sujet, telle que « De quelle couleur est le feu de circulation ? ». Cela exige du modèle qu'il comprenne la sémantique du texte et localise spatialement les éléments visuels correspondants à l'aide de la vision par ordinateur.
- Véhicules autonomes : Les voitures autonomes s'appuient fortement sur la fusion de capteurs, en combinant les données de nuages de points LiDAR, les flux vidéo des caméras et les données radar pour se déplacer en toute sécurité. Ces entrées multimodales garantissent que, si un capteur tombe en panne (par exemple, une caméra aveuglée par l'éblouissement du soleil), les autres peuvent maintenir la sécurité routière.
- Diagnostic médical : Dans le domaine de la santé, l'AI utilise l'apprentissage multimodal en analysant l'analyse d'images médicales (comme les IRM ou les radiographies) avec les antécédents textuels non structurés des patients et les données génétiques. Cette vision globale aide les médecins à établir des diagnostics plus précis, un sujet fréquemment abordé dans les revues de Nature Digital Medicine.
- AI générative : Les outils qui créent des images à partir d'invites textuelles, comme Stable Diffusion, reposent entièrement sur la capacité du modèle à comprendre la relation entre les descriptions linguistiques et les textures visuelles.
Détection d'objets multimodale avec Ultralytics#
Alors que les détecteurs d'objets standard s'appuient sur des classes prédéfinies, les approches multimodales comme YOLO-World permettent aux utilisateurs de détecter des objets à l'aide d'invites textuelles à vocabulaire ouvert. Cela illustre la puissance de la mise en relation des concepts textuels et des caractéristiques visuelles au sein de l'écosystème Ultralytics.
L'extrait de code Python suivant montre comment utiliser un modèle YOLO-World préentraîné pour détecter des objets à partir d'entrées textuelles personnalisées.
from ultralytics import YOLOWorld
# Load a pretrained YOLO-World model (Multi-Modal: Text + Vision)
model = YOLOWorld("yolov8s-world.pt")
# Define custom text prompts (modalities) for the model to identify
model.set_classes(["person", "bus", "traffic light"])
# Run inference: The model aligns the text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show the results
results[0].show()Différenciation des principaux termes#
Pour s'orienter dans le paysage de l'AI moderne, il est utile de distinguer l'« apprentissage multimodal » des concepts connexes :
- Modèle multimodal : L'« apprentissage multimodal » désigne la méthodologie et le domaine d'étude. Un « modèle multimodal » (comme GPT-4 ou Gemini de Google) est l'artefact ou le produit logiciel spécifique issu de ce processus d'entraînement.
- AI unimodale : La vision par ordinateur traditionnelle est généralement unimodale et se concentre exclusivement sur les données visuelles. Bien qu'un modèle comme Ultralytics YOLO26 soit un outil CV de pointe pour détecter des objets, il fonctionne généralement uniquement sur des entrées visuelles, sauf s'il fait partie d'un pipeline multimodal plus vaste.
- Grands modèles de langage (LLMs) : Les LLMs traditionnels sont unimodaux et entraînés uniquement sur du texte. Toutefois, le secteur s'oriente vers les « grands modèles multimodaux » (LMMs), capables de traiter nativement les images et le texte, une tendance soutenue par des frameworks comme PyTorch et TensorFlow.
Perspectives d’avenir#
La trajectoire de l'apprentissage multimodal s'oriente vers des systèmes présentant les caractéristiques de l'intelligence artificielle générale (AGI). En ancrant avec succès le langage dans la réalité visuelle et physique, ces modèles vont au-delà de la corrélation statistique pour tendre vers un véritable raisonnement. Les recherches menées par des institutions comme le MIT CSAIL et le Centre de recherche sur les modèles de fondation de Stanford continuent de repousser les limites de la façon dont les machines perçoivent et appréhendent des environnements complexes et multisensoriels.
Chez Ultralytics, nous intégrons ces avancées à notre Ultralytics Platform, afin de permettre aux utilisateurs de gérer leurs données, d'entraîner des modèles et de déployer des solutions exploitant tout l'éventail des modalités disponibles, de la rapidité de YOLO26 à la polyvalence de la détection à vocabulaire ouvert.









