One-Shot Learning
Explore l’apprentissage en une seule occurrence en IA. Découvre comment classer des objets à partir d’une seule image avec Ultralytics YOLO26 et des réseaux siamois pour une vision par ordinateur efficace.
L'apprentissage en un coup est une technique de classification spécialisée en apprentissage automatique (ML), conçue pour apprendre des informations sur des catégories d'objets à partir d'un seul exemple d'entraînement. Contrairement aux algorithmes traditionnels d'apprentissage profond (DL), qui nécessitent d'immenses jeux de données contenant des milliers d'images annotées pour généraliser efficacement, l'apprentissage en un coup imite la capacité cognitive humaine à assimiler instantanément un nouveau concept. Par exemple, une personne peut généralement reconnaître un oiseau exotique particulier après ne l'avoir vu qu'une seule fois ; cette méthode tente de reproduire cette efficacité dans les systèmes d'intelligence artificielle (AI). Elle est particulièrement utile lorsque l'étiquetage des données est coûteux, que les données sont rares ou que de nouvelles catégories doivent être ajoutées dynamiquement sans réentraîner l'intégralité du modèle.
Mécanismes sous-jacents au concept#
Le principe fondamental de l'apprentissage en un coup consiste à faire passer l'objectif de la classification standard à l'évaluation de la similarité. Au lieu d'entraîner un réseau neuronal (NN) à produire l'étiquette d'une classe spécifique (par exemple, « chien » ou « chat »), le modèle apprend une fonction de distance. Une architecture couramment utilisée à cette fin est le réseau neuronal siamois, qui se compose de deux sous-réseaux identiques partageant les mêmes poids du modèle.
Pendant son fonctionnement, le réseau effectue une extraction de caractéristiques pour convertir les images d'entrée en vecteurs numériques compacts appelés représentations vectorielles. Le système compare ensuite la représentation vectorielle d'une nouvelle image requête à celle de l'unique « exemple de référence ». Si la distance mathématique — souvent calculée à l'aide de la distance euclidienne ou de la similarité cosinus — est inférieure à un certain seuil, les images sont considérées comme appartenant à la même classe. Cela permet au modèle de vérifier une identité ou de classifier des objets en fonction de leur proximité dans l'espace des caractéristiques appris.
Le code Python suivant montre comment extraire des représentations vectorielles et calculer la similarité à l'aide d'un modèle de classification YOLO26 issu du package ultralytics.
import numpy as np
from ultralytics import YOLO
# Load a pre-trained YOLO26 classification model for feature extraction
model = YOLO("yolo26n-cls.pt")
# Extract embeddings for a reference 'shot' and a query image
# The embed() method returns the feature vector directly
shot_vec = model.embed("reference_img.jpg")[0]
query_vec = model.embed("query_img.jpg")[0]
# Calculate similarity (higher dot product implies greater similarity)
similarity = np.dot(shot_vec, query_vec) / (np.linalg.norm(shot_vec) * np.linalg.norm(query_vec))
print(f"Similarity Score: {similarity:.4f}")Différencier les paradigmes apparentés#
Il est important de distinguer l'apprentissage en un coup des autres techniques d'apprentissage économes en données, car elles résolvent des problèmes similaires avec des contraintes différentes :
- Apprentissage à quelques exemples (FSL) : Il s'agit de la catégorie plus large qui englobe l'apprentissage en un coup. En FSL, le modèle reçoit un petit « ensemble de support » d'exemples, généralement de deux à cinq images par classe. L'apprentissage en un coup est simplement le cas extrême où la taille de l'ensemble de support est exactement égale à un.
- Apprentissage sans exemple (ZSL) : Le ZSL consiste à reconnaître des catégories que le modèle n'a jamais vues visuellement. Au lieu de s'appuyer sur une image de référence, le ZSL utilise des attributs sémantiques ou des descriptions textuelles (par exemple, identifier un « zèbre » en associant des caractéristiques visuelles à la description textuelle « cheval rayé ») via le traitement automatique du langage naturel (NLP).
- Apprentissage par transfert : Il consiste à prendre un modèle préentraîné sur une vaste base de données telle qu'ImageNet et à l'affiner sur une nouvelle tâche. Bien que l'apprentissage par transfert alimente les extracteurs de caractéristiques utilisés dans l'apprentissage en un coup, l'apprentissage par transfert standard nécessite généralement plus d'un exemple pour mettre à jour efficacement les poids sans surapprentissage.
Applications concrètes#
L'apprentissage en un coup a ouvert de nouvelles possibilités dans les secteurs où la collecte de grandes quantités de données d'entraînement est irréalisable.
Reconnaissance faciale et sécurité#
L'application la plus répandue de l'apprentissage en un coup concerne la sécurité biométrique. Lors de la configuration de Face ID sur un smartphone ou de son inscription à un système d'accès des employés, l'appareil capture une représentation mathématique unique du visage de l'utilisateur. Lors de l'utilisation quotidienne, le système de reconnaissance faciale compare le flux vidéo en direct de la caméra à cet « exemple unique » stocké afin de vérifier l'identité. Cela repose sur des techniques robustes de représentation vectorielle, telles que celles présentées dans les travaux fondateurs sur FaceNet, afin de garantir que les variations d'éclairage ou d'angle ne perturbent pas la correspondance de similarité.
Contrôle qualité industriel#
Dans le domaine de l'IA dans l'industrie manufacturière, il est difficile de créer un jeu de données équilibré de pièces « défectueuses », car les défauts sont rares et irréguliers. L'apprentissage en un coup permet aux systèmes de vision par ordinateur (CV) d'apprendre la représentation d'une seule pièce de référence « parfaite ». Tout article de la chaîne de production dont la représentation vectorielle est sensiblement éloignée de cette référence est signalé pour la détection d'anomalies. Cela permet d'assurer immédiatement la qualité sans avoir besoin de milliers d'images de pièces endommagées, qui peuvent être gérées et déployées via la plateforme Ultralytics.
Défis et perspectives d’avenir#
Bien que puissant, l'apprentissage en un coup est sensible au bruit ; si l'image de référence unique est floue, obstruée ou non représentative, la capacité du modèle à reconnaître cette classe se dégrade considérablement. Les chercheurs utilisent souvent le méta-apprentissage, ou « apprendre à apprendre », pour améliorer la stabilité et la généralisation du modèle. À mesure que les architectures évoluent, de nouveaux modèles comme YOLO26 intègrent des extracteurs de caractéristiques plus robustes, ce qui rend l'inférence en un coup plus rapide et plus précise et ouvre la voie à des appareils d'IA en périphérie plus adaptatifs et intelligents.









