Vision Language Model (VLM)
Explore les modèles Vision Language (VLM) avec Ultralytics. Apprends comment ils font le pont entre la vision par ordinateur et les LLM pour le VQA et la détection à vocabulaire ouvert en utilisant Ultralytics YOLO26.
Un Vision Language Model (VLM) est un type d'intelligence artificielle capable de traiter et d'interpréter simultanément des informations visuelles (images ou vidéos) et textuelles. Contrairement aux modèles de computer vision traditionnels qui se concentrent uniquement sur les données de pixels, ou aux Large Language Models (LLMs) qui ne comprennent que le texte, les VLM font le lien entre ces deux modalités. En s'entraînant sur des ensembles de données massifs contenant des paires image-texte, ces modèles apprennent à associer des caractéristiques visuelles à des concepts linguistiques, ce qui leur permet de décrire des images, de répondre à des questions sur des scènes visuelles et même d'exécuter des commandes en fonction de ce qu'ils "voient."
Comment fonctionnent les modèles de langage visuel#
À la base, les VLM se composent généralement de deux éléments principaux : un encodeur de vision et un encodeur de texte. L'encodeur de vision traite les images pour extraire des feature maps et des représentations visuelles, tandis que l'encodeur de texte gère l'entrée linguistique. Ces flux de données distincts sont ensuite fusionnés à l'aide de mécanismes tels que le cross-attention pour aligner les informations visuelles et textuelles dans un espace d'embedding partagé.
Les progrès récents réalisés en 2024 et 2025 ont évolué vers des architectures plus unifiées où un seul backbone de Transformer gère les deux modalités. Par exemple, des modèles comme Google PaliGemma 2 démontrent à quel point l'intégration efficace de ces flux peut améliorer les performances sur des tâches de raisonnement complexes. Cet alignement permet au modèle de comprendre le contexte, par exemple en reconnaissant que le mot "apple" désigne un fruit sur l'image d'une épicerie mais une entreprise technologique dans un logo.
Applications concrètes#
La capacité à comprendre le monde à la fois par la vue et par le langage ouvre des applications variées dans de nombreux secteurs :
- Visual Question Answering (VQA): Les VLM sont largement utilisés en healthcare diagnostics pour assister les radiologues. Un médecin peut demander à un système : "Y a-t-il une fracture sur cette radiographie ?" et le modèle analyse l'image médicale pour fournir une évaluation préliminaire, réduisant ainsi les erreurs de diagnostic.
- Smart E-Commerce Search: Dans les environnements retail environments, les VLM permettent aux utilisateurs de rechercher des produits à l'aide de descriptions en langage naturel associées à des images. Un acheteur peut télécharger la photo de la tenue d'une célébrité et demander : "Trouve-moi une robe avec ce motif mais en bleu", et le système utilise la semantic search pour récupérer des correspondances précises.
- Automated Captioning and Accessibility: Les VLM génèrent automatiquement du alt text descriptif pour les images sur le Web, rendant le contenu numérique plus accessible aux utilisateurs malvoyants qui utilisent des lecteurs d'écran.
Différencier les VLM des concepts associés#
Il est utile de distinguer les VLM des autres catégories d'IA pour comprendre leur rôle spécifique :
- VLM vs. LLM: Un Large Language Model (comme les versions textuelles de GPT-4) traite uniquement des données textuelles. Bien qu'il puisse générer des histoires créatives ou du code, il ne peut pas "voir" une image. Un VLM donne effectivement des yeux à un LLM.
- VLM vs. Object Detection: Les modèles de object detection traditionnels, tels que les premières versions de YOLO, identifient où se trouvent les objets et à quelle classe ils appartiennent (par exemple, "Car: 99%"). Un VLM va plus loin en comprenant les relations et les attributs, tels que "une voiture de sport rouge garée à côté d'une borne incendie."
- VLM vs. Multimodal AI: Le Multimodal AI est un terme générique plus large. Bien que tous les VLM soient multimodaux (combinant vision et langage), tous les modèles multimodaux ne sont pas des VLM ; certains peuvent combiner l'audio et le texte (comme la reconnaissance vocale) ou la vidéo et des données de capteurs sans composant linguistique.
Détection à vocabulaire ouvert avec YOLO#
Les VLM modernes permettent la détection à "vocabulaire ouvert", où tu peux détecter des objets à l'aide de invites textuelles en format libre plutôt que de classes prédéfinies. C'est une fonctionnalité clé de modèles tels que Ultralytics YOLO-World, qui permet des définitions de classes dynamiques sans réentraînement.
L'exemple suivant montre comment utiliser le package ultralytics pour détecter des objets spécifiques décrits par du texte :
from ultralytics import YOLOWorld
# Load a model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes using natural language text prompts
model.set_classes(["person wearing sunglasses", "red backpack"])
# Run inference to find these text-defined objects in an image
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the detection results
results[0].show()Défis et orientations futures#
Bien que puissants, les Vision Language Models font face à des défis importants. Un problème majeur est la hallucination, où le modèle décrit avec assurance des objets ou du texte dans une image qui n'y figurent tout simplement pas. Les chercheurs travaillent activement sur des techniques telles que le Reinforcement Learning from Human Feedback (RLHF) pour améliorer l'ancrage et la précision.
Un autre défi est le coût de calcul. L'entraînement de ces modèles massifs nécessite des GPU resources substantielles. Cependant, la sortie d'architectures efficaces telles que Ultralytics YOLO26 aide à apporter des capacités de vision avancées aux appareils de périphérie. À mesure que nous avançons, nous prévoyons que les VLM joueront un rôle crucial dans les robotic agents, permettant aux robots de naviguer et de manipuler des objets sur la base d'instructions verbales complexes.
Pour ceux qui s'intéressent aux fondements théoriques, le CLIP paper by OpenAI d'origine offre un excellent aperçu du pré-entraînement contrastif image-texte. De plus, il est essentiel de suivre les CVPR conference papers pour suivre l'évolution rapide de ces architectures. Pour expérimenter l'entraînement de tes propres modèles de vision, tu peux utiliser la Ultralytics Platform pour une gestion simplifiée des datasets et un déploiement de modèles rationalisé.






