Two-Stage Object Detectors
Explora la mecánica de los detectores de objetos de dos etapas, centrándote en las propuestas de regiones y la clasificación. Aprende por qué modelos modernos como Ultralytics YOLO26 ahora lideran.
Los detectores de objetos de dos etapas son una clase sofisticada de arquitecturas de aprendizaje profundo (DL) utilizadas en visión artificial para identificar y localizar elementos dentro de una imagen. A diferencia de sus homólogos de una etapa, que realizan la detección en una sola pasada, estos modelos dividen la tarea en dos fases distintas: la propuesta de regiones y la clasificación de objetos. Este enfoque bifurcado fue pionero para priorizar una alta precisión de localización, lo que hace que estos detectores sean históricamente significativos en la evolución de la inteligencia artificial (AI). Al separar el "dónde" del "qué", los detectores de dos etapas suelen lograr una precisión superior, particularmente en objetos pequeños o ocluidos, aunque esto suele tener el costo de mayores recursos informáticos y una latencia de inferencia más lenta.
El proceso de dos etapas#
La arquitectura de un detector de dos etapas se basa en un flujo de trabajo secuencial que imita cómo un humano podría examinar cuidadosamente una escena.
-
Propuesta de regiones: En la primera etapa, el modelo escanea la imagen de entrada para identificar áreas potenciales donde puedan existir objetos. Un componente conocido como red de propuesta de regiones (RPN) genera un conjunto disperso de cuadros candidatos, a menudo denominados regiones de interés (RoIs). Esta etapa filtra la mayor parte del fondo, lo que permite que la red centre su potencia de procesamiento en las áreas relevantes.
-
Clasificación y refinamiento: En la segunda etapa, el modelo extrae características de estas regiones candidatas utilizando redes neuronales convolucionales (CNN). A continuación, asigna una etiqueta de clase específica (por ejemplo, "persona", "vehículo") a cada región y refina las coordenadas de la caja delimitadora para rodear ajustadamente el objeto.
Ejemplos destacados de esta arquitectura incluyen la familia R-CNN, específicamente Faster R-CNN y Mask R-CNN, que establecieron el estándar para los puntos de referencia académicos durante varios años.
Comparación con los detectores de una etapa#
Es útil distinguir los modelos de dos etapas de los detectores de objetos de una etapa como el Single Shot MultiBox Detector (SSD) y la serie Ultralytics YOLO. Mientras que los modelos de dos etapas priorizan la precisión procesando las regiones por separado, los modelos de una etapa enmarcan la detección como un único problema de regresión, mapeando los píxeles de la imagen directamente a las coordenadas de la caja delimitadora y a las probabilidades de clase.
Históricamente, esto creó un compromiso: los modelos de dos etapas eran más precisos pero más lentos, mientras que los modelos de una etapa eran más rápidos pero menos precisos. Sin embargo, los avances modernos han difuminado esta línea. Los modelos de última generación como YOLO26 utilizan ahora arquitecturas de extremo a extremo que rivalizan con la precisión de los detectores de dos etapas al tiempo que mantienen la velocidad necesaria para la inferencia en tiempo real.
Aplicaciones en el mundo real#
Debido a su énfasis en la precisión y la exhaustividad, los detectores de dos etapas suelen preferirse en escenarios donde la seguridad y el detalle son más críticos que la velocidad de procesamiento pura.
- Imagenología de diagnóstico médico: En el campo de la IA en la salud, pasar por alto un diagnóstico puede ser crítico. Las arquitecturas de dos etapas se utilizan con frecuencia en el análisis de imágenes médicas para detectar anomalías como tumores en radiografías o resonancias magnéticas. El proceso de varios pasos ayuda a garantizar que las lesiones pequeñas no se pasen por alto frente a fondos de tejido complejos, proporcionando a los radiólogos asistencia automatizada de alta confianza.
- Inspección industrial de alta precisión: En la fabricación inteligente, los sistemas de inspección visual automatizada utilizan estos modelos para identificar defectos microscópicos en las líneas de montaje. Por ejemplo, detectar una microfisura en el álabe de una turbina requiere la gran precisión de la intersección sobre unión (IoU) que proporcionan los detectores de dos etapas, lo que garantiza que solo los componentes sin defectos pasen a la siguiente etapa de producción.
Implementación de la detección moderna#
Si bien los detectores de dos etapas sentaron las bases para la visión de alta precisión, los desarrolladores modernos suelen utilizar modelos avanzados de una etapa que ofrecen un rendimiento comparable con flujos de trabajo de implementación significativamente más sencillos. La Ultralytics Platform simplifica el entrenamiento y la implementación de estos modelos, gestionando conjuntos de datos y recursos de computación de manera eficiente.
El siguiente ejemplo en Python demuestra cómo cargar y ejecutar una inferencia utilizando un flujo de trabajo moderno de detección de objetos con ultralytics, logrando resultados de alta precisión similares a los enfoques tradicionales de dos etapas pero con mayor eficiencia:
from ultralytics import YOLO
# Load the YOLO26 model, a modern high-accuracy detector
model = YOLO("yolo26n.pt")
# Run inference on an image to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Process results (bounding boxes, classes, and confidence scores)
for result in results:
result.show() # Display the detection outcomes
print(result.boxes.conf) # Print confidence scores





