Detection Head
Aprende cómo un cabezal de detección permite la detección de objetos en tiempo real. Explora su papel en Ultralytics YOLO26 para predecir cajas delimitadoras y etiquetas con alta precisión.
Una cabeza de detección actúa como la capa de toma de decisiones final en una arquitectura de red neuronal de detección de objetos. Mientras que las capas anteriores del modelo se encargan de entender las formas, texturas y características dentro de una imagen, la cabeza de detección es el componente específico que interpreta esta información para predecir exactamente qué objetos están presentes y dónde se encuentran. Transforma los datos abstractos y de alto nivel producidos por el extractor de características en resultados procesables, generando normalmente un conjunto de cajas delimitadoras que encierran los objetos identificados junto con sus etiquetas de clase correspondientes y puntuaciones de confianza.
Distinguir el cabezal del backbone y el neck#
Para comprender plenamente la función de una cabeza de detección, resulta útil visualizar que los detectores modernos se componen de tres etapas principales, cada una con un propósito distinto en el pipeline de visión artificial (CV):
- Backbone: Es la parte inicial de la red, a menudo una Red Neuronal Convolucional (CNN) como ResNet o CSPNet. Procesa la imagen de entrada en bruto para crear mapas de características que representan patrones visuales.
- Neck: Situado entre el backbone y la cabeza, el neck refina y combina características de diferentes escalas. Arquitecturas como la Feature Pyramid Network (FPN) aseguran que el modelo pueda detectar objetos de varios tamaños mediante la agregación de contexto.
- Head: El componente final que consume las características refinadas del neck. Realiza la tarea real de clasificación (¿qué es?) y regresión (¿dónde está?).
Evolución: Basado en anclas (Anchor-Based) vs. Sin anclas (Anchor-Free)#
El diseño de las cabezas de detección ha evolucionado significativamente para mejorar la velocidad y la precisión, en particular con la transición de los métodos tradicionales a los modelos modernos de inferencia en tiempo real.
- Cabezas basadas en anclajes (Anchor-Based Heads): Los detectores de objetos de una etapa tradicionales dependían de cajas de anclaje (anchor boxes) predefinidas—formas de referencia fijas de varios tamaños. La cabeza predecía cuánto estirar o desplazar estos anclajes para ajustarlos al objeto. Este enfoque se detalla en la investigación fundamental sobre Faster R-CNN.
- Cabezas libres de anclajes (Anchor-Free Heads): Los modelos más avanzados, incluido el último YOLO26, utilizan detectores libres de anclajes. Estas cabezas predicen los centros y las dimensiones de los objetos directamente a partir de los píxeles en los mapas de características, eliminando la necesidad de ajustar anclajes manualmente. Esto simplifica la arquitectura y mejora la capacidad del modelo para generalizar a formas de objetos novedosas, una técnica a menudo asociada con la detección de objetos totalmente convolucional de una sola etapa (FCOS).
Aplicaciones en el mundo real#
La precisión de la cabeza de detección es fundamental para desplegar inteligencia artificial (IA) en entornos industriales y críticos para la seguridad. Puedes anotar datos fácilmente y entrenar estas cabezas especializadas utilizando la Ultralytics Platform.
- Conducción autónoma: En la IA para automoción, la cabeza de detección se encarga de distinguir entre peatones, semáforos y otros vehículos en tiempo real. Una cabeza altamente optimizada garantiza que la latencia de inferencia se mantenga lo suficientemente baja como para que el vehículo reaccione al instante.
- Diagnóstico médico: En el análisis de imágenes médicas, las cabezas de detección se ajustan con precisión para localizar anomalías como tumores en resonancias magnéticas. La rama de regresión debe ser sumamente precisa para delinear los límites exactos de una lesión, ayudando a los médicos en soluciones de salud.
Ejemplo de código#
El siguiente ejemplo demuestra cómo cargar un modelo YOLO26 e inspeccionar la salida de su cabeza de detección. Cuando se ejecuta la inferencia, la cabeza procesa la imagen y devuelve el boxes final que contiene las coordenadas y los IDs de clase.
from ultralytics import YOLO
# Load the YOLO26n model (nano version)
model = YOLO("yolo26n.pt")
# Run inference on an image to utilize the detection head
results = model("https://ultralytics.com/images/bus.jpg")
# The detection head outputs are stored in results[0].boxes
for box in results[0].boxes:
# Print the bounding box coordinates and the predicted class
print(f"Class: {int(box.cls)}, Coordinates: {box.xywh.numpy()}")Esta interacción destaca cómo la cabeza de detección traduce activaciones complejas de redes neuronales en datos legibles que los desarrolladores pueden utilizar para tareas posteriores como el seguimiento de objetos o el recuento.






