YOLO Vision 2026 :
Retour au glossaire Ultralytics

CLIP (Contrastive Language-Image Pre-training)

Explore CLIP (Contrastive Language-Image Pre-training) pour faire le pont entre la vision et le langage. Apprends comment il permet l'apprentissage zéro-shot et propulse Ultralytics YOLO26.

CLIP (Contrastive Language-Image Pre-training) est une architecture de neural network révolutionnaire développée par OpenAI qui comble le fossé entre les données visuelles et le langage naturel. Contrairement aux systèmes de computer vision (CV) traditionnels qui nécessitent un data labeling fastidieux pour un ensemble fixe de catégories, CLIP apprend à comprendre les images en s'entraînant sur des millions de paires image-texte collectées sur Internet. Cette approche permet au modèle d'effectuer du zero-shot learning, ce qu'il signifie qu'il peut identifier des objets, des concepts ou des styles qu'il n'a jamais vus explicitement pendant l'entraînement, simplement en lisant une description textuelle. En mappant les informations visuelles et linguistiques dans un espace de caractéristiques partagé, CLIP sert de foundation model puissant pour une grande variété de tâches en aval sans nécessiter de fine-tuning spécifique et approfondi.

Comment fonctionne l'architecture#

Le mécanisme central de CLIP implique deux encodeurs parallèles : un encodeur d'images, généralement basé sur un Vision Transformer (ViT) ou un ResNet, et un Transformer textuel similaire à ceux utilisés dans les large language models (LLMs) modernes. Grâce à un processus connu sous le nom de contrastive learning, le système est entraîné à prédire quel extrait de texte correspond à quelle image dans un lot.

Pendant l'entraînement, le modèle optimise ses paramètres pour rapprocher les embeddings vectoriels des paires image-texte correspondantes tout en éloignant les paires non correspondantes. Cela crée un latent space multimodal où la représentation mathématique d'une image d'un "golden retriever" est située spatialement près de l'embedding textuel pour "une photo de chien". En calculant la cosine similarity entre ces vecteurs, le modèle peut quantifier dans quelle mesure une image correspond à une invite en langage naturel, permettant une image classification et une récupération flexibles.

Applications concrètes#

La capacité à lier la vision et le langage a fait de CLIP une technologie angulaire dans les applications d'IA modernes :

  • Semantic Search intelligente : CLIP permet aux utilisateurs de rechercher dans de grandes bases de données d'images à l'aide de requêtes complexes de natural language processing (NLP). Par exemple, dans le domaine de l'AI in retail, un acheteur pourrait rechercher "robe d'été florale vintage" et obtenir des résultats visuellement précis sans que les images ne possèdent ces balises de métadonnées spécifiques. Ceci est souvent alimenté par des vector databases haute performance.
  • Contrôle de l'IA générative : Des modèles comme Stable Diffusion s'appuient sur CLIP pour interpréter les invites des utilisateurs et guider le processus de génération. CLIP agit comme un évaluateur, mesurant dans quelle mesure la sortie visuelle générée s'aligne sur la description textuelle, ce qui est essentiel pour une synthèse text-to-image de haute qualité.
  • Object Detection à vocabulaire ouvert : Des architectures avancées comme YOLO-World intègrent des embeddings CLIP pour détecter des objets basés sur des entrées textuelles arbitraires. Cela permet une détection dynamique dans des domaines tels que l'AI in healthcare, où l'identification de nouveaux équipements ou anomalies est nécessaire sans réentraînement.

Utiliser les fonctionnalités de CLIP avec Ultralytics#

Alors que les détecteurs d'objets standard se limitent à leurs classes d'entraînement, l'utilisation de caractéristiques basées sur CLIP permet une détection à vocabulaire ouvert. Le code Python suivant montre comment utiliser le paquet ultralytics pour détecter des objets à l'aide d'invites textuelles personnalisées :

from ultralytics import YOLOWorld

# Load a pre-trained YOLO-World model utilizing CLIP features
model = YOLOWorld("yolov8s-world.pt")

# Define custom classes using natural language text prompts
model.set_classes(["person wearing sunglasses", "red backpack"])

# Run inference on an image to detect the text-defined objects
results = model.predict("travelers.jpg")

# Display the results
results[0].show()

Distinguer les concepts apparentés#

Il est utile de différencier CLIP des autres paradigmes d'IA courants pour comprendre son utilité spécifique :

  • CLIP vs Supervised Learning : Les modèles supervisés traditionnels nécessitent des définitions strictes et des exemples étiquetés pour chaque catégorie (par exemple, "chat", "voiture"). CLIP apprend à partir de paires texte-image brutes trouvées sur le web, offrant une plus grande flexibilité et éliminant le goulet d'étranglement de l'annotation manuelle souvent gérée via des outils comme la Ultralytics Platform.
  • CLIP vs YOLO26 : Bien que CLIP fournisse une compréhension généralisée des concepts, YOLO26 est un détecteur d'objets spécialisé en temps réel optimisé pour la vitesse et la localisation précise. CLIP est souvent utilisé comme extracteur de caractéristiques ou classificateur zero-shot, tandis que YOLO26 est le moteur pour une real-time inference à haute vitesse dans les environnements de production.
  • CLIP vs apprentissage contrastif standard : Des méthodes comme SimCLR comparent généralement deux vues augmentées de la même image pour apprendre des caractéristiques. CLIP contraste une image par rapport à une description textuelle, reliant deux modalités de données distinctes plutôt qu'une seule.

Explore solutions

Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble le futur de l'IA !

Commence ton aventure avec le futur de l'apprentissage automatique