Vision Language Model (VLM)
Explore les modèles de langage et de vision (VLM) avec Ultralytics. Découvre comment ils font le lien entre la vision par ordinateur et les LLM pour la VQA et la détection à vocabulaire ouvert avec Ultralytics YOLO26.
Un modèle vision-langage (VLM) est un type d'intelligence artificielle capable de traiter et d'interpréter simultanément des informations visuelles (images ou vidéos) et textuelles. Contrairement aux modèles traditionnels de vision par ordinateur, qui se concentrent uniquement sur les données de pixels, ou aux grands modèles de langage (LLMs), qui ne comprennent que le texte, les VLM font le lien entre ces deux modalités. En s'entraînant sur de vastes jeux de données contenant des paires image-texte, ces modèles apprennent à associer des caractéristiques visuelles à des concepts linguistiques, ce qui leur permet de décrire des images, de répondre à des questions sur des scènes visuelles et même d'exécuter des commandes en fonction de ce qu'ils « voient ».
Fonctionnement des modèles vision-langage#
À la base, les VLM comportent généralement deux composants principaux : un encodeur visuel et un encodeur de texte. L'encodeur visuel traite les images pour en extraire des cartes de caractéristiques et des représentations visuelles, tandis que l'encodeur de texte traite l'entrée linguistique. Ces flux de données distincts sont ensuite fusionnés à l'aide de mécanismes comme l'attention croisée, afin d'aligner les informations visuelles et textuelles dans un espace d'embedding partagé.
Les avancées récentes de 2024 et 2025 s'orientent vers des architectures plus unifiées, dans lesquelles un même backbone Transformer traite les deux modalités. Par exemple, des modèles comme Google PaliGemma 2 montrent à quel point l'intégration efficace de ces flux peut améliorer les performances sur des tâches de raisonnement complexes. Cet alignement permet au modèle de comprendre le contexte, par exemple de reconnaître que le mot « apple » désigne un fruit dans l'image d'une épicerie, mais une entreprise technologique sur un logo.
Applications concrètes#
La capacité à comprendre le monde par la vue et le langage ouvre la voie à des applications variées dans de nombreux secteurs :
- Réponse à des questions visuelles (VQA) : Les VLM sont largement utilisés dans le diagnostic médical pour aider les radiologues. Un médecin peut demander à un système : « Y a-t-il une fracture sur cette radiographie ? » Le modèle analyse alors l'image médicale pour fournir une première évaluation et réduire les erreurs de diagnostic.
- Recherche intelligente dans le commerce en ligne : Dans les environnements de vente au détail, les VLM permettent aux utilisateurs de rechercher des produits à partir de descriptions en langage naturel et d'images. Un client pourrait téléverser une photo de la tenue d'une célébrité et demander : « Trouve-moi une robe avec ce motif, mais en bleu » ; le système utilise alors la recherche sémantique pour trouver des correspondances précises.
- Génération automatique de légendes et accessibilité : Les VLM génèrent automatiquement des textes alternatifs descriptifs pour les images sur le Web, rendant le contenu numérique plus accessible aux personnes malvoyantes qui utilisent des lecteurs d'écran.
Différences entre les VLM et les concepts apparentés#
Il est utile de distinguer les VLM des autres catégories d'IA pour comprendre leur rôle spécifique :
- VLM vs LLM : Un grand modèle de langage (comme les versions textuelles uniquement de GPT-4) traite exclusivement des données textuelles. Il peut générer des récits créatifs ou du code, mais il ne peut pas « voir » une image. Un VLM donne en quelque sorte des yeux à un LLM.
- VLM vs détection d'objets : Les modèles traditionnels de détection d'objets, comme les premières versions de YOLO, déterminent où se trouvent les objets et à quelle classe ils appartiennent (par exemple, « Voiture : 99 % »). Un VLM va plus loin en comprenant les relations et les attributs, comme dans « une voiture de sport rouge garée à côté d'une borne incendie ».
- VLM vs IA multimodale : L'IA multimodale est un terme générique plus large. Tous les VLM sont multimodaux (ils combinent vision et langage), mais tous les modèles multimodaux ne sont pas des VLM ; certains peuvent combiner audio et texte (comme la transcription vocale) ou vidéo et données de capteurs, sans composante linguistique.
Détection en vocabulaire ouvert avec YOLO#
Les VLM modernes permettent la détection en « vocabulaire ouvert », où tu peux détecter des objets à l'aide de prompts en texte libre plutôt que de classes prédéfinies. C'est une fonctionnalité clé de modèles comme Ultralytics YOLO-World, qui permet de définir des classes dynamiquement sans réentraînement.
L'exemple suivant montre comment utiliser le package ultralytics pour détecter des objets précis décrits par du texte :
from ultralytics import YOLOWorld
# Charger un modèle capable de comprendre la vision et le langage
model = YOLOWorld("yolov8s-world.pt")
# Définir des classes personnalisées à l'aide de prompts en langage naturel
model.set_classes(["person wearing sunglasses", "red backpack"])
# Lancer l'inférence pour repérer dans une image les objets définis par le texte
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Afficher les résultats de détection
results[0].show()Défis et orientations futures#
Malgré leurs capacités, les modèles vision-langage sont confrontés à des défis importants. L'un des problèmes majeurs est l'hallucination, lorsque le modèle décrit avec assurance des objets ou du texte qui ne figurent tout simplement pas dans l'image. Les chercheurs travaillent activement sur des techniques comme l'apprentissage par renforcement à partir des retours humains (RLHF) afin d'améliorer l'ancrage et la précision.
Le coût de calcul constitue un autre défi. L'entraînement de ces modèles massifs nécessite d'importantes ressources GPU. Toutefois, la sortie d'architectures efficaces comme Ultralytics YOLO26 contribue à apporter des capacités de vision avancées aux appareils edge. À l'avenir, nous prévoyons que les VLM joueront un rôle essentiel dans les agents robotiques, permettant aux robots de se déplacer et de manipuler des objets en fonction de consignes verbales complexes.
Pour les personnes intéressées par les fondements théoriques, l'article original de CLIP par OpenAI offre d'excellents éclairages sur le préentraînement contrastif langage-image. De plus, suivre les articles des conférences CVPR est essentiel pour suivre l'évolution rapide de ces architectures. Pour expérimenter l'entraînement de tes propres modèles de vision, tu peux utiliser l'Ultralytics Platform afin de simplifier la gestion des jeux de données et le déploiement des modèles.









