YOLO Vision 2026 :
Retour au glossaire Ultralytics

Multi-Modal Learning

Explore l'apprentissage multimodal en IA. Apprends comment il intègre le texte, la vision et l'audio pour des modèles robustes comme Ultralytics YOLO26 et YOLO-World. Découvre-en plus aujourd'hui !

L'apprentissage multimodal est une approche sophistiquée en artificial intelligence (AI) qui entraîne des algorithmes à traiter, comprendre et corréler des informations provenant de plusieurs types de données distincts, ou « modalités ». Contrairement aux systèmes traditionnels qui se spécialisent dans un seul type d'entrée — tel que le texte pour la traduction ou les pixels pour la image recognition —, l'apprentissage multimodal imite la cognition humaine en intégrant diverses entrées sensorielles comme les données visuelles, l'audio parlé, les descriptions textuelles et les lectures de capteurs. Cette approche holistique permet aux modèles machine learning (ML) de développer une compréhension plus profonde et contextuelle du monde, conduisant à des prédictions plus robustes et polyvalentes.

Comment fonctionne l'apprentissage multi-modal#

Le défi central de l'apprentissage multi-modal est de traduire différents types de données dans un espace mathématique partagé où ils peuvent être comparés et combinés. Ce processus implique généralement trois étapes principales : l'encodage, l'alignement et la fusion.

  1. Feature Extraction: Des réseaux de neurones spécialisés traitent chaque modalité indépendamment. Par exemple, les convolutional neural networks (CNNs) ou les Vision Transformers (ViTs) peuvent extraire des caractéristiques d'images, tandis que les Recurrent Neural Networks (RNNs) ou les Transformers traitent le texte.

  2. Embeddings Alignment: Le modèle apprend à mapper ces diverses caractéristiques dans des vecteurs partagés de grande dimension. Dans cet espace partagé, le vecteur du mot « chat » et le vecteur d'une image de chat sont rapprochés. Des techniques telles que l'contrastive learning, popularisées par des articles comme OpenAI's CLIP, sont essentielles ici.

  3. Data Fusion: Enfin, les informations sont fusionnées pour exécuter une tâche. La fusion peut se produire tôt (combinaison des données brutes), tard (combinaison des prédictions finales) ou via des méthodes hybrides intermédiaires utilisant le mécanisme d'attention mechanism pour pondérer dynamiquement l'importance de chaque modalité.

Applications concrètes#

L'apprentissage multi-modal est le moteur derrière nombre des percées les plus impressionnantes de l'IA actuelle, comblant le fossé entre des silos de données distincts pour résoudre des problèmes complexes.

  • Visual Question Answering (VQA): Dans cette application, un système doit analyser une image et répondre à une question en langage naturel à son sujet, telle que « De quelle couleur est le feu tricolore ? ». Cela nécessite que le modèle comprenne la sémantique du texte et localise spatialement les éléments visuels correspondants à l'aide de la computer vision.
  • Autonomous Vehicles: Les voitures autonomes dépendent fortement de la fusion de capteurs, combinant les données de nuages de points LiDAR, de flux vidéo de caméras et de radar pour naviguer en toute sécurité. Cette entrée multimodale garantit que si un capteur tombe en panne (par exemple, une caméra aveuglée par les reflets du soleil), d'autres peuvent maintenir la road safety.
  • Healthcare Diagnostics: L'IA dans le secteur de la santé utilise l'apprentissage multimodal en analysant medical image analysis (comme les IRM ou les radiographies) aux côtés de l'historique textuel non structuré des patients et des données génétiques. Cette vue d'ensemble aide les médecins à poser des diagnostics plus précis, un sujet fréquemment abordé dans les revues Nature Digital Medicine journals.
  • Generative AI: Les outils qui créent des images à partir d'invites textuelles, tels que Stable Diffusion, reposent entièrement sur la capacité du modèle à comprendre la relation entre les descriptions linguistiques et les textures visuelles.

Détection d'objets multi-modale avec Ultralytics#

Alors que les détecteurs d'objets standard reposent sur des classes prédéfinies, les approches multimodales comme YOLO-World permettent aux utilisateurs de détecter des objets à l'aide d'invites textuelles à vocabulaire ouvert. Cela démontre la puissance de la liaison de concepts textuels avec des caractéristiques visuelles au sein de l'écosystème Ultralytics.

L'extrait de code Python suivant montre comment utiliser un modèle YOLO-World pré-entraîné pour détecter des objets basés sur des entrées textuelles personnalisées.

from ultralytics import YOLOWorld

# Load a pretrained YOLO-World model (Multi-Modal: Text + Vision)
model = YOLOWorld("yolov8s-world.pt")

# Define custom text prompts (modalities) for the model to identify
model.set_classes(["person", "bus", "traffic light"])

# Run inference: The model aligns the text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Show the results
results[0].show()

Différencier les termes clés#

Pour naviguer dans le paysage de l'IA moderne, il est utile de distinguer l'« Apprentissage Multi-Modal » des concepts associés :

  • Multi-Modal Model: « Multi-Modal Learning » désigne la méthodologie et le domaine d'étude. Un « Multi-Modal Model » (comme GPT-4 ou Gemini de Google) est l'artefact spécifique ou le produit logiciel résultant de ce processus d'entraînement.
  • Unimodal AI: La vision par ordinateur traditionnelle est généralement unimodale, se concentrant exclusivement sur les données visuelles. Bien qu'un modèle comme Ultralytics YOLO26 soit un outil de CV de pointe pour la détection d'objets, il fonctionne généralement sur des entrées visuelles seules, à moins de faire partie d'un pipeline multimodal plus vaste.
  • Large Language Models (LLMs): Les LLM traditionnels sont unimodaux, entraînés uniquement sur du texte. Cependant, l'industrie évolue vers des « Grands Modèles Multimodaux » (LMM) capables de traiter nativement des images et du texte, une tendance soutenue par des frameworks comme PyTorch et TensorFlow.

Perspectives d'avenir#

La trajectoire de l'apprentissage multimodal pointe vers des systèmes dotés de caractéristiques Artificial General Intelligence (AGI). En ancrant avec succès le langage dans la réalité visuelle et physique, ces modèles vont au-delà de la corrélation statistique vers un véritable raisonnement. Les recherches d'institutions telles que MIT CSAIL et le Stanford Center for Research on Foundation Models continuent de repousser les limites de la façon dont les machines perçoivent et interagissent avec des environnements complexes et multisensoriels.

Chez Ultralytics, nous intégrons ces avancées dans notre Ultralytics Platform, permettant aux utilisateurs de gérer des données, d'entraîner des modèles et de déployer des solutions qui exploitent tout le spectre des modalités disponibles, de la vitesse de YOLO26 à la polyvalence de la détection à vocabulaire ouvert.

Explore solutions

Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble le futur de l'IA !

Commence ton aventure avec le futur de l'apprentissage automatique