Qu’est-ce que YOLOE ? Repousser les limites des modèles de vision par ordinateur
Découvre comment YOLOE te permet de trouver des objets à l’aide d’une simple invite ou d’une photo. Il permet une vision par ordinateur plus intelligente et plus rapide, sans réentraînement ni réglage fin des modèles.

La détection d’objets est une tâche clé de la vision par ordinateur, dont l’objectif est d’identifier et de localiser des objets dans des images ou des vidéos. C’est un élément essentiel de la vision par ordinateur, un domaine de l’intelligence artificielle (AI) qui permet aux machines de comprendre et d’interpréter les données visuelles. Par exemple, la détection d’objets peut aider à identifier une voiture sur une photo ou à repérer une personne dans un flux vidéo.
L’une des séries de modèles les plus connues prenant en charge les tâches de vision par ordinateur, comme la détection d’objets, est la série de modèles YOLO (Vous ne regardez qu’une seule fois). Conçus pour allier rapidité et précision, les modèles YOLO se sont continuellement améliorés au fil du temps. Par exemple, l’une des versions les plus récentes, Ultralytics YOLO11, offre de bonnes performances dans des situations réelles et fournit des résultats précis, même dans des environnements plus complexes.
Pour faire progresser encore davantage ce domaine, un nouveau modèle appelé YOLOE vise à étendre les capacités des modèles YOLO. Contrairement aux modèles traditionnels, qui nécessitent un nouvel entraînement pour reconnaître de nouveaux objets, YOLOE peut suivre de simples prompts textuels ou visuels pour détecter des objets qu’il n’a jamais vus auparavant, ce qui le rend beaucoup plus adaptable aux environnements changeants.
Dans cet article, nous examinerons de plus près ce qui rend YOLOE unique, ses différences par rapport aux précédents modèles YOLO et la façon dont tu peux commencer à l’utiliser dès aujourd’hui. Commençons !
Présentation de YOLOE#
YOLOE est un modèle de vision par ordinateur qui fait passer la détection d’objets à un niveau supérieur. Il a été présenté en mars 2025 par des chercheurs de l’université Tsinghua. Ce qui distingue YOLOE des modèles traditionnels, c’est son utilisation de la détection à vocabulaire ouvert.
Alors que la plupart des modèles sont entraînés à reconnaître une liste fixe d’objets, YOLOE te permet de préciser ce que tu veux rechercher à l’aide d’une courte description ou d’une image d’exemple. Par exemple, si tu recherches un « sac à dos vert », tu peux saisir cette description ou montrer une photo au modèle, et YOLOE le localisera dans la scène.
De plus, même sans prompt, YOLOE peut détecter de nombreux objets du quotidien par lui-même. Cette capacité à reconnaître des objets qu’il n’a jamais vus auparavant s’appelle la détection zero-shot. Elle est particulièrement utile dans les environnements dynamiques où la tâche ou les objets d’intérêt peuvent changer de manière imprévisible.

Fig 1. Un aperçu des capacités de YOLOE.
Fonctionnalités clés de YOLOE#
YOLOE prend en charge un large éventail de fonctionnalités conçues pour améliorer ses performances dans les applications réelles. Grâce à sa capacité à traiter des entrées structurées et non structurées, YOLOE ouvre de nouvelles possibilités pour la détection et la segmentation d’objets.
Voici quelques-unes des fonctionnalités clés proposées par le modèle :
- Détection basée sur des prompts : YOLOE peut rechercher des objets à partir d’un court prompt textuel ou d’une image d’exemple. Tu n’as donc pas besoin de réentraîner le modèle chaque fois que ta tâche change : il suffit de lui décrire ou de lui montrer ce que tu recherches.
- Segmentation d’instances : en plus de tracer des cadres englobants autour des objets, YOLOE peut délimiter leur forme exacte grâce à la segmentation d’instances. C’est particulièrement utile lorsque les objets se chevauchent ou lorsque tu dois connaître les limites précises d’un objet.
- Reconnaissance d’objets sans prompt : YOLOE peut reconnaître des objets même sans instructions précises. Il utilise un ensemble de descriptions préapprises pour identifier rapidement les objets, ce qui rend le processus plus rapide et plus efficace.
Comparaison de YOLOE avec d’autres modèles YOLO#
Maintenant que nous comprenons mieux ce qu’est YOLOE, examinons certains modèles similaires de la famille YOLO.
À mesure que la vision par ordinateur a progressé, les modèles YOLO ont eux aussi évolué. Par exemple, Ultralytics YOLOv8 a pris en charge de nouvelles tâches comme la segmentation et la classification, tandis que les versions ultérieures, comme Ultralytics YOLO11, se sont concentrées sur l’amélioration de la précision et des performances pour un plus large éventail de tâches.
De plus, YOLO-World est sorti en janvier 2024 et a introduit la possibilité d’utiliser des prompts écrits, permettant aux utilisateurs de décrire les objets qu’ils souhaitent trouver. Bien que YOLO-World ait été une excellente option pour la détection zero-shot, il ne disposait pas de fonctionnalités comme la segmentation d’instances et la prise en charge des prompts visuels.
YOLOE s’appuie sur YOLO-World en ajoutant ces fonctionnalités, en améliorant la flexibilité et les performances, et en proposant un outil plus efficace pour les applications de vision par ordinateur du monde réel.

Fig 2. YOLO-World et YOLOE prennent tous deux en charge la détection zero-shot.
Utiliser YOLOE avec le package Python Ultralytics#
Que tu souhaites détecter des objets précis ou explorer tout ce qui se trouve dans une image, commencer à utiliser YOLOE est simple. Ce modèle est pris en charge par le package Python Ultralytics, ce qui facilite son intégration à tes projets. Voyons maintenant comment l’utiliser.
Installer le package Ultralytics#
La première étape consiste à installer le package Python Ultralytics à l’aide d’un gestionnaire de packages comme « pip ». Pour cela, exécute la commande “pip install ultralytics” dans ton terminal ou ton invite de commandes.
Une fois le package installé, tu disposeras de tout ce qu’il faut pour charger le modèle, effectuer des prédictions et expérimenter différents modes de détection. Si tu rencontres des problèmes lors de l’installation, la documentation officielle d’Ultralytics propose une section de dépannage utile.
Il existe plusieurs façons d’utiliser YOLOE pour effectuer des prédictions. Effectuer des prédictions signifie utiliser le modèle entraîné pour identifier et localiser des objets dans des images ou des vidéos. Ces différentes méthodes te permettent de personnaliser ton interaction avec le modèle en fonction de tes besoins spécifiques.
Examinons chacune de ces méthodes, une par une.
Détecter des objets précis avec des prompts textuels ou visuels#
YOLOE peut détecter des objets à partir d’une courte description textuelle. Par exemple, si tu recherches un cheval en mouvement, tu peux utiliser un prompt comme « horse walking ».
Pour commencer, charge d’abord le modèle YOLOE préentraîné et définis ton prompt (la description de ce que tu veux que le modèle recherche), comme indiqué dans l’extrait de code ci-dessous.
from ultralytics import YOLOE
model = YOLOE("yoloe-11l-seg.pt")
prompt = ["horse walking"]
model.set_classes(prompt, model.get_text_pe(prompt))Une fois ton modèle et ton prompt définis, tu peux exécuter le modèle sur une image ou une vidéo. Remplace le chemin du fichier dans le code par le chemin vers ton fichier image ou vidéo :
results = model.predict("path/to/your/image.jpg")
results[0].show()L’image affichera l’objet détecté clairement identifié en fonction de ton prompt. Tu peux modifier le prompt pour rechercher différents objets, comme « red suitcase », « bicycle » ou « zebra », selon ce que tu cherches.

Fig 3. Exemple d’utilisation de YOLOE pour détecter des objets précis à l’aide d’un prompt textuel.
De même, tu peux utiliser une image pour fournir un prompt à YOLOE avec le package Python Ultralytics. En mode prompt visuel, le modèle utilise l’image pour trouver des éléments d’apparence similaire dans une autre scène. C’est particulièrement utile pour les objets difficiles à décrire ou dépourvus d’étiquettes claires.
Pour consulter le code plus en détail, tu peux consulter la documentation Ultralytics.
Détection générale d’objets avec YOLOE#
Dans certains cas, tu ne sais peut-être pas exactement quoi rechercher ou tu ne cherches peut-être pas un objet particulier. C’est là que le mode sans prompt se révèle utile.
Avec cette option, tu n’as pas besoin de saisir une description ni de fournir une image d’exemple. YOLOE analyse simplement les images de manière autonome et détecte tout ce qu’il peut reconnaître, comme des personnes, des animaux, des meubles ou des objets du quotidien.
C’est une manière pratique d’explorer une scène sans donner d’instructions précises au modèle. Que tu analyses une pièce bondée ou que tu consultes une séquence comportant beaucoup d’activité, le mode sans prompt te donne rapidement un aperçu de ce qui est présent dans une image.
Tu peux utiliser le code suivant pour exécuter YOLOE en mode sans prompt. Le modèle est d’abord chargé, puis il traite l’image et détecte automatiquement les objets qu’elle contient. Enfin, les résultats sont affichés et les objets détectés sont mis en évidence.
Veille à remplacer le chemin du fichier par le chemin réel vers ton image.
from ultralytics import YOLOE
model = YOLOE("yoloe-11l-seg-pf.pt")
results = model.predict("path/to/image.jpg")
results[0].show()L’image ci-dessous montre un exemple de ce que YOLOE peut détecter en mode sans prompt.

Fig 4. Utiliser YOLOE en mode sans prompt.
Applications de YOLOE en temps réel#
La capacité de YOLOE à répondre aux prompts textuels et visuels en fait un outil fiable pour les applications en temps réel. Sa flexibilité est particulièrement utile dans les environnements rapides où le temps de réaction et la précision sont essentiels.
Explorons quelques exemples concrets d’utilisation de YOLOE.
Améliorer la gestion des bagages : détection des bagages en temps réel#
Dans les aéroports très fréquentés, localiser un bagage précis peut être difficile, surtout lorsqu’il s’agit de retrouver des bagages manquants. YOLOE peut simplifier ce processus en aidant à analyser des vidéos en direct et à identifier rapidement les objets à partir de prompts simples comme « red bag ».
Si un bagage est manquant ou égaré, le personnel peut facilement modifier le prompt pour rechercher un autre objet, comme une « black suitcase ». Cette capacité d’adaptation instantanée peut aider le personnel de l’aéroport à localiser rapidement le bon bagage sans examiner de longues heures d’enregistrement ni réentraîner le modèle, ce qui rend la gestion des bagages et la résolution des problèmes de bagages manquants beaucoup plus rapides et efficaces.
Surveiller les espaces publics avec YOLOE#
Les vidéos de surveillance d’espaces publics, comme les marchés et les cafés bondés, contiennent souvent un mélange de personnes, d’objets et d’activités qui évoluent au cours de la journée. YOLOE peut analyser ces vidéos en temps réel en mode sans prompt, en détectant automatiquement des éléments comme des sacs, des tables ou des vélos sans nécessiter d’instructions précises.

Fig 5. YOLOE peut détecter divers objets dans un espace public animé.
Cela est particulièrement utile aux équipes de sécurité pour repérer les objets laissés sans surveillance ou suivre les mouvements de foule. La capacité de YOLOE à détecter plusieurs objets à la fois facilite la gestion des espaces publics pendant les événements ou les périodes de forte affluence, en aidant les équipes à rester informées et réactives.
Avantages et inconvénients de YOLOE#
Voici quelques-uns des principaux avantages de l’utilisation de YOLOE pour les applications de vision par ordinateur :
- Performances en temps réel : YOLOE est optimisé pour un traitement rapide et efficace, ce qui permet une détection en temps réel, même dans des environnements dynamiques comme les flux vidéo en direct ou les espaces publics très fréquentés.
- Évolutivité : YOLOE est évolutif et fonctionne bien pour une grande variété d’applications, de la sécurité et de la surveillance au commerce, aux soins de santé et aux véhicules autonomes.
- Facilité d’utilisation : puisque YOLOE est pris en charge par le package Python Ultralytics, il est facile de l’intégrer à tes projets de vision par ordinateur existants.
Cependant, il existe quelques limites à garder à l’esprit lors de l’utilisation de YOLOE. Voici deux facteurs à prendre en compte :
- Nécessite suffisamment de données d’entraînement : bien que YOLOE prenne en charge la détection zero-shot, ses performances sur des objets inconnus dépendent de sa capacité à généraliser à partir de ses données d’entraînement. Dans certains cas, il peut avoir besoin de données supplémentaires ou d’un réglage fin pour être performant dans des tâches très spécialisées.
- Sensible à la qualité des entrées : la précision du modèle peut être affectée par des images ou des vidéos de mauvaise qualité. Des entrées floues ou mal éclairées peuvent réduire la capacité du modèle à détecter précisément les objets ; des entrées de haute qualité sont donc importantes pour obtenir des performances optimales.
Points clés à retenir#
YOLOE apporte davantage de flexibilité à la vision par ordinateur en permettant aux utilisateurs de guider la détection à l’aide de prompts textuels ou visuels. Il fonctionne bien dans les situations réelles où les scènes changent rapidement et où le réentraînement n’est pas envisageable.
De la gestion des bagages à la surveillance des espaces publics, YOLOE s’adapte facilement à de nouvelles tâches. À mesure que l’AI devient plus accessible, des modèles comme YOLOE aident davantage de secteurs à utiliser la technologie de vision de manière pratique et efficace.
Rejoins notre communauté et explore notre dépôt GitHub pour en savoir plus sur les innovations en matière d’AI. Découvre les dernières avancées dans des domaines comme l’AI dans le commerce et la vision par ordinateur dans les soins de santé sur nos pages de solutions. Consulte nos options de licence et commence dès aujourd’hui à utiliser la vision par ordinateur !









