Two-Stage Object Detectors
Explora el funcionamiento de los detectores de objetos de dos etapas, centrándote en las propuestas de regiones y la clasificación. Descubre por qué los modelos modernos como Ultralytics YOLO26 lideran actualmente.
Los detectores de objetos de dos etapas son una clase sofisticada de arquitecturas de aprendizaje profundo (DL) utilizadas en visión artificial para identificar y localizar elementos dentro de una imagen. A diferencia de sus homólogos de una etapa, que realizan la detección en una sola pasada, estos modelos dividen la tarea en dos fases distintas: propuesta de regiones y clasificación de objetos. Este enfoque bifurcado se desarrolló para priorizar una alta precisión de localización, lo que hizo que estos detectores fueran históricamente importantes en la evolución de la inteligencia artificial (AI). Al separar el «dónde» del «qué», los detectores de dos etapas suelen lograr una precisión superior, especialmente con objetos pequeños u ocluidos, aunque esto normalmente implica un mayor consumo de recursos computacionales y una mayor latencia de inferencia.
El proceso de dos etapas#
La arquitectura de un detector de dos etapas se basa en un flujo de trabajo secuencial que imita la forma en que una persona podría examinar detenidamente una escena.
-
Propuesta de regiones: En la primera etapa, el modelo analiza la imagen de entrada para identificar posibles áreas donde podrían existir objetos. Un componente conocido como Red de propuestas de regiones (RPN) genera un conjunto disperso de cajas candidatas, a menudo denominadas Regiones de interés (RoIs). Esta etapa filtra la mayor parte del fondo, lo que permite a la red concentrar la capacidad de procesamiento en las áreas relevantes.
-
Clasificación y refinamiento: En la segunda etapa, el modelo extrae características de estas regiones candidatas mediante redes neuronales convolucionales (CNNs). A continuación, asigna una etiqueta de clase específica (por ejemplo, «persona» o «vehículo») a cada región y refina las coordenadas de la caja delimitadora para que esta delimite el objeto con precisión.
Entre los ejemplos destacados de esta arquitectura se encuentra la familia R-CNN, concretamente Faster R-CNN y Mask R-CNN, que establecieron el estándar para las evaluaciones comparativas académicas durante varios años.
Comparación con los detectores de una etapa#
Es útil distinguir los modelos de dos etapas de los detectores de objetos de una etapa, como el Detector MultiBox de una sola pasada (SSD) y la serie Ultralytics YOLO. Mientras que los modelos de dos etapas priorizan la precisión procesando las regiones por separado, los modelos de una etapa plantean la detección como un único problema de regresión, asignando directamente los píxeles de la imagen a las coordenadas de las cajas delimitadoras y a las probabilidades de clase.
Históricamente, esto generaba una disyuntiva: los modelos de dos etapas eran más precisos, pero más lentos, mientras que los modelos de una etapa eran más rápidos, pero menos precisos. Sin embargo, los avances modernos han difuminado esta diferencia. Los modelos de vanguardia, como YOLO26, utilizan ahora arquitecturas de extremo a extremo que igualan la precisión de los detectores de dos etapas y mantienen la velocidad necesaria para la inferencia en tiempo real.
Aplicaciones en el mundo real#
Debido a su énfasis en la precisión y la exhaustividad, los detectores de dos etapas suelen preferirse en situaciones en las que la seguridad y el nivel de detalle son más importantes que la velocidad de procesamiento sin más.
- Diagnóstico por imagen médica: En el ámbito de la AI en la atención sanitaria, pasar por alto un diagnóstico puede tener consecuencias críticas. Las arquitecturas de dos etapas se utilizan con frecuencia en el análisis de imágenes médicas para detectar anomalías, como tumores, en radiografías o escáneres de MRI. El proceso en varias etapas ayuda a garantizar que las lesiones pequeñas no pasen desapercibidas frente a fondos de tejido complejos, proporcionando a los radiólogos asistencia automatizada de alta confianza.
- Inspección industrial de alta precisión: En la fabricación inteligente, los sistemas automatizados de inspección visual utilizan estos modelos para identificar defectos microscópicos en las líneas de montaje. Por ejemplo, detectar una fisura capilar en un álabe de turbina requiere la alta precisión de intersección sobre unión (IoU) que ofrecen los detectores de dos etapas, lo que garantiza que solo los componentes impecables pasen a la siguiente fase de producción.
Implementación de la detección moderna#
Aunque los detectores de dos etapas sentaron las bases de la visión artificial de alta precisión, los desarrolladores modernos suelen utilizar modelos avanzados de una etapa que ofrecen un rendimiento comparable con flujos de trabajo de implementación mucho más sencillos. La plataforma Ultralytics simplifica el entrenamiento y la implementación de estos modelos, y gestiona de forma eficiente los conjuntos de datos y los recursos de computación.
El siguiente ejemplo de Python muestra cómo cargar y ejecutar la inferencia mediante un flujo de trabajo moderno de detección de objetos con ultralytics, obteniendo resultados de alta precisión similares a los de los enfoques tradicionales de dos etapas, pero con mayor eficiencia:
from ultralytics import YOLO
# Load the YOLO26 model, a modern high-accuracy detector
model = YOLO("yolo26n.pt")
# Run inference on an image to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Process results (bounding boxes, classes, and confidence scores)
for result in results:
result.show() # Display the detection outcomes
print(result.boxes.conf) # Print confidence scores








