Anchor-Based Detectors
Explore comment les détecteurs avec ancres utilisent des boîtes englobantes prédéfinies pour la détection d’objets. Découvre leurs mécanismes fondamentaux, leurs cas d’utilisation réels et leur comparaison avec Ultralytics YOLO26, plus moderne et plus rapide.
Les détecteurs à ancres constituent une classe fondamentale de modèles de détection d’objets en vision par ordinateur. Ils utilisent un ensemble de boîtes englobantes prédéfinies pour localiser et classifier les objets. Au lieu d’essayer de prédire les coordonnées d’un objet à partir de rien, ces systèmes commencent avec des gabarits de référence fixes appelés boîtes d’ancrage. Le réseau neuronal est ensuite entraîné à déterminer lequel de ces gabarits correspond le mieux à un objet dans l’image et à calculer les décalages spécifiques — des ajustements de position et de taille — nécessaires pour aligner parfaitement l’ancre sur la cible. Cette approche transforme le problème difficile de la prédiction de coordonnées arbitraires en une tâche de régression plus stable, ce qui a constitué une avancée majeure dans le développement des premières architectures d’apprentissage profond (DL) comme Faster R-CNN et SSD.
Fonctionnement des mécanismes à ancres#
Le fonctionnement central d’un détecteur à ancres repose sur la division de l’image d’entrée en une grille dense. À chaque cellule de cette grille, le modèle génère plusieurs boîtes d’ancrage présentant différentes échelles et rapports d’aspect afin de prendre en compte différentes formes d’objets, comme des piétons grands et minces ou des véhicules larges. Lorsque les données de l’image traversent le backbone du modèle, le réseau extrait des caractéristiques riches pour effectuer simultanément deux tâches :
-
Classification : Le modèle attribue un score de probabilité à chaque ancre afin de prédire si elle contient une classe d’objet spécifique (par exemple, « voiture » ou « chien ») ou s’il s’agit simplement de bruit de fond.
-
Régression des boîtes : Pour les ancres identifiées comme contenant un objet, le réseau prédit des facteurs de correction afin d’affiner les coordonnées centrales
x, y, la largeur et la hauteur de l’ancre, ce qui produit une boîte englobante ajustée.
Lors de l’entraînement du modèle, ces détecteurs utilisent une métrique appelée Intersection sur Union (IoU) pour faire correspondre les ancres prédéfinies aux annotations de vérité terrain fournies dans le jeu de données. Les ancres présentant un chevauchement important sont considérées comme des échantillons positifs. Comme ce processus génère des milliers de détections potentielles, un algorithme de filtrage appelé suppression non maximale (NMS) est appliqué lors de l’inférence afin d’éliminer les boîtes redondantes et de ne conserver que la prédiction la plus précise pour chaque objet.
Comparaison avec les détecteurs sans ancres#
Bien que les méthodes à ancres aient établi la norme pendant des années, le domaine a évolué vers les détecteurs sans ancres. Comprendre cette distinction est essentiel pour les professionnels actuels.
- À ancres : Des modèles comme YOLOv5 et le RetinaNet original s’appuient sur une configuration manuelle ou sur des algorithmes de regroupement comme le regroupement k-means pour déterminer les meilleures tailles d’ancres adaptées à un jeu de données. Cette approche offre une certaine stabilité, mais peut manquer de flexibilité si les objets présentent des formes très variables.
- Sans ancres : Les architectures modernes, notamment YOLO26, suppriment souvent entièrement l’étape des ancres. Elles prédisent directement les centres et les tailles des objets à partir des pixels de la carte de caractéristiques, ce qui réduit le coût de calcul et simplifie la recherche d’hyperparamètres. Cette approche « de bout en bout » est généralement plus rapide et plus facile à entraîner sur des données variées.
Applications concrètes#
La logique à ancres reste pertinente dans de nombreux systèmes de production anciens et spécialisés où les formes des objets sont prévisibles et cohérentes.
- Surveillance du trafic : Dans les systèmes de transport intelligents, les caméras détectent les véhicules pour gérer la circulation ou identifier les infractions. Comme les voitures et les camions ont des dimensions standardisées, les modèles à ancres peuvent être réglés avec des a priori spécifiques afin de maximiser la précision et le rappel.
- Automatisation du commerce de détail : Les systèmes de paiement automatisé utilisent la vision par ordinateur pour identifier les produits. Comme les produits emballés, tels que les boîtes de céréales, conservent un rapport d’aspect fixe, les ancres fournissent un a priori solide au réseau et l’aident à distinguer des articles d’apparence similaire dans une scène encombrée.
Exemple d’implémentation#
Bien que les derniers modèles YOLO26 utilisent des têtes sans ancres pour offrir de meilleures performances, l’interface d’exécution de la détection reste cohérente. La plateforme Ultralytics et l’API Python masquent la complexité liée à l’utilisation d’ancres ou de points centraux par un modèle, ce qui permet aux utilisateurs de se concentrer sur les résultats.
Voici comment charger un modèle et exécuter une inférence pour détecter des objets, un workflow qui s’applique quelle que soit l’architecture à ancres sous-jacente :
from ultralytics import YOLO
# Load the YOLO26 model (optimized for speed and accuracy)
model = YOLO("yolo26n.pt")
# Run inference on an image source
# The model handles internal logic (anchor-based or anchor-free) automatically
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the first result with bounding boxes
results[0].show()Pour aller plus loin#
Pour approfondir ta compréhension des mécanismes de détection, consulte les travaux de recherche fondamentaux sur Faster R-CNN, qui a introduit le réseau de propositions de régions (RPN), ou lis la documentation sur le détecteur MultiBox à tir unique (SSD), qui a optimisé la détection à ancres pour la vitesse. Pour obtenir une vue d’ensemble du domaine, le jeu de données COCO sert de référence standard pour évaluer les modèles à ancres et sans ancres. De plus, les cours avancés sur Coursera abordent souvent les détails mathématiques de la régression des boîtes et de la mise en correspondance des ancres.









