Zero-Shot Learning
Explore l’apprentissage zéro-shot (ZSL) pour détecter et classifier des objets sans données d’entraînement. Découvre comment Ultralytics YOLO-World permet la détection en temps réel avec un vocabulaire ouvert.
L'apprentissage zero-shot (ZSL) est un paradigme d'apprentissage automatique qui permet aux modèles d'intelligence artificielle de reconnaître, classer ou détecter des objets qu'ils n'ont jamais rencontrés pendant leur phase d'entraînement. Dans le cadre de l'apprentissage supervisé traditionnel, un modèle nécessite des milliers d'exemples annotés pour chaque catégorie spécifique qu'il doit identifier. Le ZSL élimine cette dépendance stricte en exploitant des informations auxiliaires — généralement des descriptions textuelles, des attributs sémantiques ou des représentations vectorielles — afin de combler l'écart entre les classes vues et non vues. Cette capacité permet aux systèmes d'intelligence artificielle (AI) d'être beaucoup plus flexibles et évolutifs, et de gérer des environnements dynamiques où la collecte de données exhaustives pour chaque objet possible serait irréaliste.
Fonctionnement de l'apprentissage zero-shot#
Le mécanisme central du ZSL consiste à transférer les connaissances de concepts familiers à des concepts inconnus à l'aide d'un espace sémantique partagé. Au lieu d'apprendre à reconnaître un « zèbre » uniquement en mémorisant les motifs de pixels formés de rayures noires et blanches, le modèle apprend la relation entre les caractéristiques visuelles et les attributs sémantiques (par exemple, « silhouette proche de celle d'un cheval », « motif rayé », « quatre pattes ») issus du traitement automatique du langage naturel (NLP).
Ce processus repose souvent sur des modèles multimodaux qui alignent les représentations des images et du texte. Par exemple, des travaux fondateurs comme CLIP d'OpenAI montrent comment les modèles peuvent apprendre des concepts visuels à partir d'une supervision en langage naturel. Lorsqu'un modèle ZSL rencontre un objet non vu, il en extrait les caractéristiques visuelles et les compare à un dictionnaire de vecteurs sémantiques. Si les caractéristiques visuelles correspondent à la description sémantique de la nouvelle classe, le modèle peut la classer correctement et effectuer ainsi une prédiction « zero-shot ». Cette approche est fondamentale pour les modèles de fondation modernes, qui se généralisent à une vaste gamme de tâches.
Applications concrètes#
L'apprentissage zero-shot stimule l'innovation dans différents secteurs en permettant aux systèmes de se généraliser au-delà de leurs données d'entraînement initiales.
-
Détection d'objets à vocabulaire ouvert : Les architectures modernes comme YOLO-World utilisent le ZSL pour détecter des objets à partir d'invites textuelles définies par l'utilisateur. Cela permet d'effectuer une détection d'objets dans des scénarios où il est impossible de définir à l'avance une liste fixe de classes, par exemple pour rechercher des éléments spécifiques dans de vastes archives vidéo. Les chercheurs de Google Research continuent de repousser les limites de ces capacités à vocabulaire ouvert.
-
Diagnostics médicaux : Dans le domaine de l'IA dans les soins de santé, l'obtention de données annotées pour les maladies rares est souvent difficile et coûteuse. Les modèles ZSL peuvent être entraînés sur des affections courantes et des descriptions de symptômes rares issues de la littérature médicale disponible dans des bases de données comme PubMed, ce qui permet au système de signaler d'éventuelles anomalies rares sur des images médicales sans nécessiter un vaste jeu de données de cas positifs.
-
Préservation de la faune : Pour l'IA dans l'agriculture et l'écologie, l'identification des espèces menacées rarement photographiées est essentielle. Le ZSL permet aux défenseurs de la nature de détecter ces animaux à l'aide de descriptions fondées sur leurs attributs, définies dans des bases de données biologiques comme l'Encyclopedia of Life.
Détection zero-shot avec Ultralytics#
Le modèle Ultralytics YOLO-World illustre l'application concrète de l'apprentissage zero-shot. Il permet aux utilisateurs de définir dynamiquement des classes personnalisées lors de l'exécution, sans réentraîner le modèle. Pour cela, il associe un backbone de détection robuste à un encodeur de texte capable de comprendre le langage naturel.
L'exemple Python suivant montre comment utiliser YOLO-World pour détecter des objets qui ne faisaient pas explicitement partie d'un jeu d'entraînement standard à l'aide du paquet ultralytics.
from ultralytics import YOLOWorld
# Load a pre-trained YOLO-World model capable of Zero-Shot Learning
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes via text prompts (e.g., specific accessories)
# The model adjusts to detect these new classes without retraining
model.set_classes(["blue backpack", "red apple", "sunglasses"])
# Run inference on an image to detect the new zero-shot classes
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()Distinction avec les concepts associés#
Pour bien comprendre le ZSL, il est utile de le distinguer des stratégies d'apprentissage similaires utilisées en vision par ordinateur (CV) :
- Apprentissage few-shot (FSL) : Alors que le ZSL ne nécessite aucun exemple de la classe cible, le FSL fournit au modèle un très petit ensemble de support (généralement de 1 à 5 exemples) pour s'adapter. Le ZSL est généralement considéré comme plus difficile, car il repose entièrement sur l'inférence sémantique plutôt que sur des exemples visuels.
- Apprentissage one-shot : Sous-ensemble du FSL dans lequel le modèle apprend à partir d'un seul exemple annoté. Le ZSL s'en distingue fondamentalement, car il fonctionne sans même disposer d'une seule image de la nouvelle catégorie.
- Apprentissage par transfert : Ce terme général désigne le transfert de connaissances d'une tâche à une autre. Le ZSL est un type spécifique d'apprentissage par transfert qui utilise des attributs sémantiques pour transférer des connaissances à des classes non vues, sans nécessiter de réglage fin traditionnel sur de nouvelles données.
Défis et perspectives d’avenir#
Bien que le ZSL offre un immense potentiel, il présente des difficultés telles que le problème de décalage de domaine, où les attributs sémantiques appris pendant l'entraînement ne correspondent pas parfaitement à l'apparence visuelle des classes non vues. De plus, les modèles ZSL peuvent souffrir de biais : la précision des prédictions est alors nettement supérieure pour les classes vues que pour les classes non vues.
Les recherches menées par des organisations comme l'AI Lab de l'Université Stanford et l'IEEE Computer Society continuent de s'attaquer à ces limites. À mesure que les outils de vision par ordinateur deviennent plus robustes, le ZSL devrait devenir une fonctionnalité standard et réduire la dépendance aux efforts massifs d'annotation des données. Pour les équipes qui cherchent à gérer efficacement leurs jeux de données avant de déployer des modèles avancés, l'Ultralytics Platform propose des outils complets d'annotation et de gestion des jeux de données.









