Anchor-Based Detectors
Explora cómo los detectores basados en anclas utilizan cajas delimitadoras predefinidas para la detección de objetos. Aprende sus mecanismos fundamentales, casos de uso reales y cómo se comparan con el moderno y más rápido Ultralytics YOLO26.
Los detectores basados en anclas son una clase fundamental de modelos de detección de objetos en visión artificial que utilizan un conjunto de cuadros delimitadores predefinidos para localizar y clasificar objetos. En lugar de intentar predecir las coordenadas de un objeto desde cero, estos sistemas parten de plantillas de referencia fijas conocidas como cajas ancla. A continuación, la red neuronal se entrena para determinar cuál de estas plantillas coincide mejor con un objeto de la imagen y calcular los desplazamientos específicos —ajustes de posición y tamaño— necesarios para alinear perfectamente el ancla con el objetivo. Este enfoque transforma el difícil problema de predecir coordenadas arbitrarias en una tarea de regresión más estable, lo que supuso un avance clave en el desarrollo de las primeras arquitecturas de aprendizaje profundo (DL), como Faster R-CNN y SSD.
Cómo funcionan los mecanismos basados en anclas#
La operación principal de un detector basado en anclas consiste en dividir la imagen de entrada en una cuadrícula densa. En cada celda de esta cuadrícula, el modelo genera varias cajas ancla con distintas escalas y ratios de aspecto para adaptarse a diferentes formas de objetos, como peatones altos o vehículos anchos. A medida que los datos de la imagen pasan por el backbone del modelo, la red extrae características detalladas para realizar dos tareas simultáneas:
-
Clasificación: El modelo asigna una puntuación de probabilidad a cada ancla y predice si contiene una clase específica de objeto (por ejemplo, «coche» o «perro») o si es simplemente ruido de fondo.
-
Regresión de cajas: Para las anclas identificadas como contenedoras de un objeto, la red predice factores de corrección para ajustar las coordenadas del centro
x, y, la anchura y la altura del ancla, lo que da como resultado un cuadro delimitador preciso.
Durante el entrenamiento del modelo, estos detectores utilizan una métrica llamada intersección sobre unión (IoU) para asociar las anclas predefinidas con las etiquetas de referencia proporcionadas en el conjunto de datos. Las anclas con un alto solapamiento se tratan como muestras positivas. Como este proceso genera miles de detecciones potenciales, durante la inferencia se aplica un algoritmo de filtrado conocido como supresión no máxima (NMS) para eliminar las cajas redundantes y conservar únicamente la predicción más precisa para cada objeto.
Comparación con los detectores sin anclas#
Aunque los métodos basados en anclas marcaron la pauta durante años, el campo ha evolucionado hacia los detectores sin anclas. Comprender la diferencia es fundamental para los profesionales actuales.
- Basados en anclas: Modelos como YOLOv5 y el RetinaNet original dependen de la configuración manual o de algoritmos de agrupamiento, como el agrupamiento k-means, para determinar los mejores tamaños de ancla para un conjunto de datos. Esto ofrece estabilidad, pero puede resultar rígido si los objetos presentan formas muy diversas.
- Sin anclas: Las arquitecturas modernas, incluida YOLO26, suelen eliminar por completo la etapa de anclaje. Predicen directamente los centros y tamaños de los objetos a partir de los píxeles del mapa de características, lo que reduce la sobrecarga computacional y simplifica la búsqueda de hiperparámetros. Este enfoque «de extremo a extremo» suele ser más rápido y fácil de entrenar con datos diversos.
Aplicaciones en el mundo real#
La lógica basada en anclas sigue siendo relevante en muchos sistemas de producción heredados y especializados en los que las formas de los objetos son predecibles y uniformes.
- Monitorización del tráfico: En los sistemas de transporte inteligente, las cámaras detectan vehículos para gestionar el flujo o identificar infracciones. Como los coches y los camiones tienen dimensiones estandarizadas, los modelos basados en anclas pueden ajustarse con priors específicos para maximizar la precisión y la exhaustividad.
- Automatización del comercio minorista: Los sistemas de pago automatizado utilizan la visión artificial para identificar productos. Como los productos envasados, como las cajas de cereales, mantienen un ratio de aspecto fijo, las anclas proporcionan un prior sólido a la red y la ayudan a distinguir entre artículos de aspecto similar en una escena con muchos elementos.
Ejemplo de implementación#
Aunque los modelos más recientes de YOLO26 utilizan cabezales sin anclas para ofrecer un rendimiento superior, la interfaz para ejecutar detecciones sigue siendo la misma. La Ultralytics Platform y la API de Python abstraen la complejidad de si un modelo utiliza anclas o puntos centrales, lo que te permite centrarte en los resultados.
Así puedes cargar un modelo y ejecutar inferencias para detectar objetos, un flujo de trabajo que se aplica independientemente de la arquitectura de anclas subyacente:
from ultralytics import YOLO
# Load the YOLO26 model (optimized for speed and accuracy)
model = YOLO("yolo26n.pt")
# Run inference on an image source
# The model handles internal logic (anchor-based or anchor-free) automatically
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the first result with bounding boxes
results[0].show()Lecturas adicionales#
Para profundizar en tu comprensión de los mecanismos de detección, explora la investigación fundamental sobre Faster R-CNN, que introdujo la red de propuestas de regiones (RPN), o lee sobre el detector MultiBox de disparo único (SSD), que optimizó la detección basada en anclas para aumentar la velocidad. Para obtener una visión más amplia del campo, el conjunto de datos COCO sirve como referencia estándar para evaluar tanto modelos basados en anclas como modelos sin anclas. Además, los cursos avanzados de Coursera suelen abordar los detalles matemáticos de la regresión de cajas y la asociación de anclas.









