Two-Stage Object Detectors
Explore le fonctionnement des détecteurs d’objets en deux étapes, en te concentrant sur les propositions de régions et la classification. Découvre pourquoi les modèles modernes comme Ultralytics YOLO26 sont désormais en tête.
Les détecteurs d’objets à deux étapes sont une classe sophistiquée d’architectures d’apprentissage profond (DL) utilisées en vision par ordinateur pour identifier et localiser des éléments dans une image. Contrairement à leurs équivalents à une étape, qui effectuent la détection en un seul passage, ces modèles divisent la tâche en deux phases distinctes : la proposition de régions et la classification des objets. Cette approche en deux parties a été mise au point pour privilégier une grande précision de localisation, ce qui a rendu ces détecteurs historiquement importants dans l’évolution de l’intelligence artificielle (AI). En séparant le « où » du « quoi », les détecteurs à deux étapes atteignent souvent une précision supérieure, notamment sur les objets de petite taille ou occultés, mais cela se fait généralement au prix d’une augmentation des ressources de calcul et d’une latence d’inférence plus élevée.
Le processus en deux étapes#
L’architecture d’un détecteur à deux étapes repose sur un flux de travail séquentiel qui imite la façon dont une personne pourrait examiner attentivement une scène.
-
Proposition de régions : Lors de la première étape, le modèle parcourt l’image d’entrée pour identifier les zones potentielles où des objets pourraient se trouver. Un composant appelé réseau de proposition de régions (RPN) génère un ensemble restreint de boîtes candidates, souvent appelées régions d’intérêt (RoIs). Cette étape élimine la majeure partie de l’arrière-plan, ce qui permet au réseau de concentrer sa puissance de calcul sur les zones pertinentes.
-
Classification et affinage : Lors de la deuxième étape, le modèle extrait les caractéristiques de ces régions candidates à l’aide de réseaux de neurones convolutifs (CNNs). Il attribue ensuite une étiquette de classe précise (par exemple, « personne » ou « véhicule ») à chaque région et affine les coordonnées de la boîte englobante afin qu’elle entoure précisément l’objet.
Parmi les exemples marquants de cette architecture figurent la famille R-CNN, en particulier Faster R-CNN et Mask R-CNN, qui ont défini la référence pour les benchmarks universitaires pendant plusieurs années.
Comparaison avec les détecteurs à une étape#
Il est utile de distinguer les modèles à deux étapes des détecteurs d’objets à une étape comme le détecteur MultiBox à tir unique (SSD) et la série Ultralytics YOLO. Alors que les modèles à deux étapes privilégient l’exactitude en traitant les régions séparément, les modèles à une étape formulent la détection comme un unique problème de régression, en associant directement les pixels de l’image aux coordonnées des boîtes englobantes et aux probabilités de classe.
Historiquement, cela créait un compromis : les modèles à deux étapes étaient plus précis, mais plus lents, tandis que les modèles à une étape étaient plus rapides, mais moins précis. Cependant, les avancées modernes ont estompé cette distinction. Les modèles de pointe comme YOLO26 utilisent désormais des architectures de bout en bout qui rivalisent avec la précision des détecteurs à deux étapes tout en conservant la vitesse nécessaire à l’inférence en temps réel.
Applications concrètes#
En raison de l’importance qu’ils accordent à la précision et au rappel, les détecteurs à deux étapes sont souvent privilégiés dans les scénarios où la sécurité et le niveau de détail sont plus critiques que la seule vitesse de traitement.
- Imagerie diagnostique médicale : Dans le domaine de l’IA dans le secteur de la santé, ne pas détecter un diagnostic peut avoir de graves conséquences. Les architectures à deux étapes sont fréquemment utilisées dans l’analyse d’images médicales pour détecter des anomalies telles que des tumeurs sur des radiographies ou des examens MRI. Le processus en plusieurs étapes contribue à garantir que les petites lésions ne soient pas négligées sur des arrière-plans tissulaires complexes, offrant aux radiologues une assistance automatisée hautement fiable.
- Inspection industrielle de haute précision : Dans la fabrication intelligente, les systèmes d’inspection visuelle automatisée utilisent ces modèles pour identifier les défauts microscopiques sur les chaînes d’assemblage. Par exemple, détecter une fissure capillaire sur une pale de turbine nécessite la grande précision de l’Intersection over Union (IoU) fournie par les détecteurs à deux étapes, afin de garantir que seuls les composants irréprochables passent à l’étape suivante de la production.
Mise en œuvre de la détection moderne#
Bien que les détecteurs à deux étapes aient établi les fondations de la vision à haute précision, les développeurs modernes utilisent souvent des modèles avancés à une étape qui offrent des performances comparables avec des flux de travail de déploiement nettement plus simples. La plateforme Ultralytics simplifie l’entraînement et le déploiement de ces modèles, en gérant efficacement les jeux de données et les ressources de calcul.
L’exemple Python suivant montre comment charger un flux de travail moderne de détection d’objets et exécuter l’inférence avec ultralytics, en obtenant des résultats très précis similaires à ceux des approches traditionnelles à deux étapes, mais avec une plus grande efficacité :
from ultralytics import YOLO
# Load the YOLO26 model, a modern high-accuracy detector
model = YOLO("yolo26n.pt")
# Run inference on an image to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Process results (bounding boxes, classes, and confidence scores)
for result in results:
result.show() # Display the detection outcomes
print(result.boxes.conf) # Print confidence scores








