Multi-Modal Model
Explore comment les modèles multimodaux intègrent le texte, les images et l’audio. Découvre des architectures comme Ultralytics YOLO26 et déploie une IA de vision sur la plateforme Ultralytics.
Un modèle multimodal est un type avancé de système d’intelligence artificielle (AI) capable de traiter, d’interpréter et d’intégrer simultanément des informations provenant de plusieurs types de données différents, ou « modalités ». Alors que les systèmes unimodaux traditionnels se spécialisent dans un seul domaine — comme le traitement du langage naturel (NLP) pour le texte ou la vision par ordinateur (CV) pour les images — les modèles multimodaux cherchent à imiter la perception humaine en synthétisant conjointement des indices visuels, auditifs et linguistiques. Cette convergence permet au modèle de développer une compréhension globale du monde, en l’autorisant à établir des corrélations complexes entre une scène visuelle et une description orale. Ces capacités sont considérées comme des étapes fondamentales vers l’atteinte de l’intelligence artificielle générale (AGI).
Mécanismes fondamentaux et architecture#
L’efficacité d’un modèle multimodal repose sur sa capacité à projeter divers types de données dans un espace sémantique partagé. Ce processus commence généralement par la création d’embeddings, qui sont des représentations numériques capturant la signification essentielle des données d’entrée. En s’entraînant sur d’immenses jeux de données composés d’exemples appariés, comme des vidéos sous-titrées, le modèle apprend à aligner la représentation vectorielle d’une image de « chat » avec l’embedding textuel du mot « chat ».
Plusieurs concepts architecturaux clés rendent cette intégration possible :
- Architecture Transformer : De nombreux systèmes multimodaux utilisent des transformers, qui recourent à des mécanismes d’attention pour pondérer dynamiquement l’importance des différentes parties de l’entrée. Cela permet à un modèle de se concentrer sur des régions spécifiques d’une image correspondant aux mots pertinents d’une invite textuelle, un concept détaillé dans l’article de recherche fondateur « Attention Is All You Need ».
- Fusion de données : Cette expression désigne la stratégie consistant à combiner des informations provenant de différentes sources. La fusion de capteurs peut avoir lieu en amont, en fusionnant les données brutes, ou en aval, en combinant les décisions de sous-modèles distincts. Les frameworks modernes comme PyTorch offrent la flexibilité nécessaire pour créer ces pipelines complexes.
- Apprentissage contrastif : Les techniques utilisées par des modèles tels que CLIP d’OpenAI entraînent le système à réduire la distance entre les paires texte-image correspondantes dans l’espace vectoriel, tout en maximisant la distance entre les paires qui ne correspondent pas.
Applications concrètes#
Les modèles multimodaux ont ouvert la voie à des capacités qu’il était auparavant impossible pour les systèmes unimodaux d’atteindre.
- Réponse à des questions visuelles (VQA) : Ces systèmes permettent aux utilisateurs de poser des questions en langage naturel à propos d’une image. Par exemple, une personne malvoyante pourrait importer une photo d’un garde-manger et demander : « Y a-t-il une boîte de soupe sur l’étagère du haut ? » Le modèle utilise la détection d’objets pour identifier les éléments et le NLP pour comprendre la question, puis fournir une réponse utile.
- Véhicules autonomes : Les voitures autonomes fonctionnent comme des agents multimodaux en temps réel. Elles combinent les flux visuels provenant de caméras, les informations de profondeur issues du LiDAR et les données de vitesse provenant de radars. Cette redondance garantit que, si un capteur est obstrué par les conditions météorologiques, les autres peuvent préserver la sécurité routière.
- Détection à vocabulaire ouvert : Des modèles comme Ultralytics YOLO-World permettent aux utilisateurs de détecter des objets à l’aide d’invites textuelles arbitraires plutôt qu’à partir d’une liste fixe de classes. Cela comble l’écart entre les instructions linguistiques et la reconnaissance visuelle.
Exemple : détection à vocabulaire ouvert#
L’exemple suivant montre comment utiliser la bibliothèque ultralytics pour effectuer une détection à vocabulaire ouvert, dans laquelle le modèle interprète des invites textuelles afin d’identifier des objets dans une image :
from ultralytics import YOLOWorld
# Load a pre-trained YOLO-World model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes using natural language text prompts
model.set_classes(["person wearing a hat", "blue backpack"])
# Run inference: The model aligns text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Visualize the detection results
results[0].show()Différences avec les termes associés#
Il est utile de distinguer le « modèle multimodal » des concepts associés du glossaire de l’AI :
- Apprentissage multimodal : Cette expression désigne le processus et les techniques d’apprentissage automatique (ML) utilisés pour entraîner ces systèmes. Le modèle multimodal est l’artefact ou le produit logiciel résultant de ce processus d’apprentissage.
- Grands modèles de langage (LLMs) : Les LLMs traditionnels traitent uniquement du texte. Bien que beaucoup évoluent pour devenir des modèles vision-langage (VLMs), un LLM standard est unimodal.
- Modèles de fondation : Il s’agit d’une catégorie plus large décrivant des modèles à grande échelle adaptables à de nombreuses tâches en aval. Bien qu’un modèle multimodal soit souvent un modèle de fondation, tous les modèles de fondation ne gèrent pas plusieurs modalités.
L’avenir de l’AI multimodale#
Le domaine progresse rapidement vers des systèmes capables de traiter en temps réel des flux continus de signaux audio, de vidéos et de textes. Les recherches menées par des organisations comme Google DeepMind continuent de repousser les limites de la perception automatique. Chez Ultralytics, nous soutenons cet écosystème avec des backbones de vision hautes performances comme YOLO26. Sorti en 2026, YOLO26 offre une vitesse et une précision supérieures pour des tâches telles que la segmentation d’instances, et constitue un composant visuel efficace dans des pipelines multimodaux plus vastes. Les développeurs peuvent gérer les données, l’entraînement et le déploiement de ces workflows complexes à l’aide de l’Ultralytics Platform.









