Découvrir YOLO-World en pratique
Découvre YOLO-World, un modèle innovant de détection d’objets capable d’identifier des objets à partir d’invites textuelles. Explore son fonctionnement et ses applications, puis mets-le en pratique avec un exemple de code rapide.

Les projets de vision par ordinateur impliquent souvent de consacrer beaucoup de temps à l’annotation des données et à l’entraînement de modèles de détection d’objets. Mais cela pourrait bientôt appartenir au passé. Le laboratoire d’IA de Tencent a publié YOLO-World, un modèle de détection d’objets en temps réel à vocabulaire ouvert, le 31 janvier 2024. YOLO-World est un modèle zero-shot, ce qui signifie que tu peux effectuer des inférences de détection d’objets sur des images sans avoir à l’entraîner.
Les modèles zero-shot pourraient changer notre approche des applications de vision par ordinateur. Dans cet article, nous allons explorer le fonctionnement de YOLO-World et ses utilisations potentielles, puis partager un exemple de code pratique pour te permettre de démarrer.
Un aperçu de YOLO-World#
Tu peux transmettre une image et une invite textuelle décrivant les objets que tu recherches au modèle YOLO-World. Par exemple, si tu souhaites trouver « une personne portant une chemise rouge » dans une photo, YOLO-World prend cette entrée en charge et se met au travail.
L’architecture unique du modèle combine trois éléments principaux :
- Un détecteur basé sur le modèle de détection d’objets Ultralytics YOLOv8, qui analyse le contenu visuel de l’image.
- Un encodeur de texte pré-entraîné par le modèle CLIP d’OpenAI, spécialement conçu pour comprendre ton invite textuelle.
- Un réseau, le réseau d’agrégation des chemins vision-langage (RepVL-PAN), qui intègre les données d’image traitées aux données textuelles.
Le détecteur YOLO parcourt ton image d’entrée pour identifier les objets potentiels. L’encodeur de texte transforme ta description dans un format que le modèle peut comprendre. Ces deux flux d’informations sont ensuite fusionnés par le RepVL-PAN à l’aide d’une fusion multimodale croisée à plusieurs niveaux. Cela permet à YOLO-World de détecter et de localiser précisément dans l’image les objets décrits dans ton invite.

Exemple de résultats de YOLO-World.
Avantages de choisir YOLO-World#
L’un des principaux avantages de YOLO-World est que tu n’as pas besoin d’entraîner le modèle pour une classe spécifique. Il a déjà appris à partir de paires d’images et de textes, et sait donc trouver des objets en fonction de descriptions. Tu peux éviter des heures de collecte et d’annotation de données, d’entraînement sur des GPU coûteux, et bien plus encore.
Voici quelques autres avantages de YOLO-World :
- Performances en temps réel - YOLO-World offre des performances en temps réel, comme l’architecture YOLO originale. Il est idéal pour les applications nécessitant une détection immédiate des objets, comme les véhicules autonomes et les systèmes de surveillance.
- Segmentation d’instances - YOLO-World peut délimiter et séparer proprement les objets dans les images, même si ces objets ne lui ont pas été spécifiquement enseignés pendant son entraînement.
- Efficacité - YOLO-World associe une grande précision à une efficacité de calcul élevée, ce qui le rend pratique pour les applications du monde réel. Son architecture rationalisée permet une détection rapide des objets sans exiger une puissance de traitement excessive.
Applications de YOLO-World#
Les modèles YOLO-World peuvent être utilisés dans une grande variété d’applications. Explorons-en quelques-unes.
Contrôle qualité dans l’industrie manufacturière#
Les produits fabriqués sur une chaîne de montage sont inspectés visuellement pour détecter les défauts avant leur emballage. Cette détection est souvent effectuée manuellement, ce qui prend du temps et peut entraîner des erreurs. Ces erreurs peuvent provoquer des problèmes tels que des coûts élevés et la nécessité de réparations ou de rappels. Pour y remédier, des caméras spécialisées de vision industrielle et des systèmes d’IA ont été créés afin d’effectuer ces contrôles.
Les modèles YOLO-World représentent une avancée majeure dans ce domaine. Grâce à leurs capacités zero-shot, ils peuvent détecter des défauts sur les produits même s’ils n’ont pas été entraînés pour ce problème spécifique. Par exemple, une usine qui fabrique des bouteilles d’eau peut facilement distinguer une bouteille correctement fermée par un bouchon d’une bouteille dont le bouchon manque ou est défectueux grâce à YOLO-World.

Exemple d’inspection de bouchons de bouteilles.
Robotique#
Les modèles YOLO-World permettent aux robots d’interagir avec des environnements inconnus. Même sans avoir été entraînés sur les objets spécifiques qui peuvent se trouver dans une pièce, ils peuvent identifier les objets présents. Imaginons par exemple qu’un robot entre dans une pièce où il n’est jamais allé. Avec un modèle YOLO-World, il peut tout de même reconnaître et identifier des objets comme des chaises, des tables ou des lampes, même s’il n’a pas été spécifiquement entraîné sur ces éléments.
En plus de la détection d’objets, YOLO-World peut également déterminer l’état de ces objets grâce à sa fonctionnalité « prompt-then-detect ». Par exemple, en robotique agricole, il peut être utilisé pour distinguer les fruits mûrs des fruits qui ne le sont pas en programmant le robot pour les détecter.
L’IA dans l’industrie automobile#
L’industrie automobile implique de nombreuses pièces mobiles, et YOLO-World peut être utilisé dans différentes applications automobiles. Par exemple, pour la maintenance automobile, la capacité de YOLO-World à reconnaître une grande variété d’objets sans étiquetage manuel ni pré-entraînement approfondi est extrêmement utile. YOLO-World peut identifier les pièces automobiles qui doivent être remplacées. Il pourrait même automatiser des tâches comme les contrôles qualité, en repérant les défauts ou les pièces manquantes sur les voitures neuves.
Une autre application est la détection d’objets zero-shot dans les voitures autonomes. Les capacités de détection zero-shot de YOLO-World peuvent améliorer la capacité d’un véhicule autonome à détecter et à classer en temps réel les objets présents sur la route, comme les piétons, les panneaux de signalisation et les autres véhicules. Il peut ainsi contribuer à détecter les obstacles et à prévenir les accidents pour rendre les trajets plus sûrs.

Exemple de détection d’objets sur une route.
Gestion des stocks dans les magasins de détail#
L’identification des objets dans les rayons des magasins de détail est essentielle au suivi des stocks, à leur gestion et à l’automatisation des processus. La capacité d’Ultralytics YOLO-World à reconnaître une grande variété d’objets sans étiquetage manuel ni pré-entraînement approfondi est extrêmement utile pour la gestion des stocks.
Par exemple, dans la gestion des stocks, YOLO-World peut repérer et catégoriser rapidement les articles présents sur un rayon, comme différentes marques de boissons énergétiques. Les magasins peuvent ainsi conserver un inventaire précis, gérer efficacement les niveaux de stock et fluidifier les opérations de la chaîne d’approvisionnement.
Toutes ces applications sont uniques et montrent à quel point YOLO-World peut être utilisé dans de nombreux contextes. Passons maintenant à la pratique avec YOLO-World et examinons un exemple de code.
Parcours du code#
Comme nous l’avons mentionné précédemment, YOLO-World peut être utilisé pour détecter différentes pièces d’une voiture dans le cadre de sa maintenance. Une application de vision par ordinateur qui détecte les réparations nécessaires consisterait à prendre une photo de la voiture, à identifier ses pièces, à examiner chacune d’elles pour détecter d’éventuels dommages et à recommander des réparations. Chaque partie de ce système utiliserait des techniques et des approches d’IA différentes. Pour ce parcours du code, concentrons-nous sur la détection des pièces automobiles.
Avec YOLO-World, tu peux identifier différentes pièces automobiles dans une image en moins de 5 minutes. Tu peux également étendre ce code pour tester différentes applications avec YOLO-World ! Pour commencer, nous devons installer le package Ultralytics avec pip, comme indiqué ci-dessous.
Pour obtenir davantage d’instructions et de bonnes pratiques concernant le processus d’installation, consulte notre guide d’installation d’Ultralytics. Lors de l’installation des packages requis pour YOLOv8, si tu rencontres des difficultés, consulte notre guide des problèmes courants pour trouver des solutions et des conseils.
Une fois le package nécessaire installé, nous pouvons télécharger une image depuis Internet pour y effectuer nos inférences. Nous allons utiliser l’image ci-dessous.

Notre image d’entrée.
Nous allons ensuite importer le package nécessaire, initialiser notre modèle et définir les classes que nous recherchons dans notre image d’entrée. Ici, nous nous intéressons aux classes suivantes : voiture, roue, portière, rétroviseur et plaque d’immatriculation.
Nous utiliserons ensuite la méthode predict, en fournissant le chemin de l’image ainsi que les paramètres correspondant au nombre maximal de détections et aux seuils d’intersection sur union (IoU) et de confiance (conf), afin d’effectuer une inférence sur l’image. Enfin, les objets détectés sont enregistrés dans un fichier nommé « result.jpg ».
L’image de sortie suivante sera enregistrée dans tes fichiers.

Notre image de sortie.
Si tu préfères voir ce que YOLO-World peut faire sans coder, tu peux accéder à la page de démonstration de YOLO-World, téléverser une image d’entrée et saisir les classes personnalisées.
Consulte notre page de documentation sur YOLO-World pour apprendre à enregistrer le modèle avec les classes personnalisées afin de pouvoir ensuite l’utiliser directement sans saisir ces classes à plusieurs reprises.
As-tu remarqué que les portières de la voiture n’ont pas été détectées ?#
Si tu regardes à nouveau l’image de sortie, tu constateras que la classe personnalisée « portière » n’a pas été détectée. Malgré ses excellentes performances, YOLO-World présente certaines limites. Pour les surmonter et utiliser efficacement le modèle YOLO-World, il est important d’employer les bons types d’invites textuelles.
Voici quelques informations à ce sujet :
- YOLO-World n’a peut-être pas besoin de niveaux de confiance élevés pour produire des prédictions précises ; réduire les seuils de confiance peut donc améliorer les taux de détection.
- Ajoute des classes qui ne t’intéressent pas. Cela contribuera à améliorer la détection d’objets principale en réduisant les faux positifs pour les objets secondaires.
- Détecter d’abord les objets les plus grands avant de se concentrer sur les détails plus petits peut améliorer la précision de la détection.
- Mentionne les couleurs dans tes classes pour détecter les objets en fonction d’indices de couleur.
- Décrire la taille des objets dans les invites peut également aider YOLO-World à identifier plus précisément certains objets.
- Les méthodes de post-traitement, comme le filtrage des prédictions par taille ou l’ajustement des niveaux de confiance pour chaque classe, peuvent améliorer davantage les résultats de détection d’objets.
Les possibilités sont infinies#
Dans l’ensemble, les modèles YOLO-World peuvent devenir des outils puissants grâce à leurs capacités avancées de détection d’objets. Ils offrent une grande efficacité et une excellente précision, et contribuent à automatiser différentes tâches dans diverses applications, comme l’exemple d’identification des pièces automobiles que nous avons présenté en pratique.
N’hésite pas à explorer notre dépôt GitHub pour en savoir plus sur nos contributions à la vision par ordinateur et à l’IA. Si tu souhaites découvrir comment l’IA transforme des secteurs comme les technologies de santé, consulte nos pages consacrées aux solutions. Les possibilités offertes par des innovations comme YOLO-World semblent infinies !









