Bounding Box
Aprende cómo los cuadros delimitadores definen las ubicaciones de los objetos en la visión artificial. Explora los formatos de coordenadas, las aplicaciones en el mundo real y cómo usar YOLO26 de Ultralytics.
Un bounding box es una región rectangular definida por un conjunto de coordenadas que encierra un objeto específico dentro de una imagen o fotograma de vídeo. En el campo de la visión por ordenador (CV), estas cajas sirven como las anotaciones fundamentales para enseñar a los sistemas de inteligencia artificial (IA) a localizar y reconocer elementos distintos. En lugar de limitarse a clasificar una imagen entera como «que contiene un coche», un bounding box permite a un modelo señalar la ubicación exacta y la extensión espacial del coche, separándolo del fondo y de otras entidades. Esta capacidad de localización es esencial para las tareas de detección de objetos, donde el objetivo es identificar múltiples objetos simultáneamente con alta precisión.
Conceptos clave y coordenadas#
Para procesar datos visuales de manera eficaz, los modelos de aprendizaje automático (ML) dependen de sistemas de coordenadas específicos para representar los bounding boxes matemáticamente. El formato elegido a menudo determina cómo se preparan los datos para el entrenamiento del modelo y cómo el modelo genera sus predicciones.
- Coordenadas XYXY: Este formato define una caja utilizando los valores de píxeles absolutos de la esquina superior izquierda y la esquina inferior derecha. Es intuitivo para herramientas de visualización como OpenCV o Matplotlib al dibujar rectángulos directamente sobre las imágenes.
- Formato XYWH: Común en conjuntos de datos como COCO, este método especifica el punto central del objeto seguido de la anchura y la altura de la caja. Esta representación es fundamental para calcular las funciones de pérdida durante el proceso de aprendizaje.
- Coordenadas normalizadas: Para garantizar la escalabilidad en imágenes de diferentes resoluciones, las coordenadas suelen escalarse a un rango entre 0 y 1. Esto ayuda a que los modelos se generalicen mejor al analizar entradas de dimensiones variables.
Aplicaciones en el mundo real#
Las BBox son los bloques de construcción para innumerables soluciones de IA en diversas industrias. Al permitir una localización precisa, permiten a los sistemas interactuar inteligentemente con el mundo físico.
- Vehículos autónomos: Los coches autónomos utilizan bounding boxes para detectar y rastrear peatones, otros vehículos, señales de tráfico y obstáculos en tiempo real. Esta conciencia espacial es crucial para que los sistemas de navegación y seguridad tomen decisiones en fracciones de segundo.
- Analítica minorista: En las tiendas inteligentes, los bounding boxes ayudan a supervisar el inventario en los estantes y a rastrear las interacciones de los clientes con los productos. Estos datos pueden automatizar la reposición de existencias y proporcionar información sobre el comportamiento del comprador sin necesidad de recuentos manuales.
BBox en acción#
Al utilizar arquitecturas modernas como YOLO26, el modelo predice bounding boxes junto con una etiqueta de clase y una puntuación de confianza. El siguiente ejemplo demuestra cómo ejecutar la inferencia en una imagen y acceder a las coordenadas del bounding box utilizando el paquete ultralytics.
from ultralytics import YOLO
# Load the YOLO26 model
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Access bounding box coordinates (xyxy format) for the first detected object
boxes = results[0].boxes
print(boxes.xyxy[0]) # Output: tensor([x1, y1, x2, y2, ...])Términos relacionados y diferenciación#
Aunque las BBox son estándar para la detección general, son distintas de otros tipos de anotación utilizados en tareas más granulares.
- Segmentación de instancias: A diferencia de un bounding box rectangular, la segmentación crea una máscara perfecta a nivel de píxel que traza el contorno exacto de un objeto. Esto es útil cuando la forma precisa es más importante que la ubicación general.
- Bounding Box Orientado (OBB): Los bounding boxes estándar están alineados con los ejes (rectángulos verticales). Los OBB pueden girar para ajustarse a objetos que están en ángulo, como barcos en imágenes de satélite o paquetes en una cinta transportadora, lo que proporciona un ajuste más ceñido y reduce el ruido de fondo.
- Puntos clave: En lugar de encerrar un objeto, los puntos clave identifican puntos de referencia específicos, como las articulaciones en un cuerpo humano para la estimación de poses.
Herramientas para la anotación y gestión#
La creación de anotaciones de bounding boxes de alta calidad es un paso fundamental en el pipeline de ML. La Ultralytics Platform simplifica este proceso ofreciendo herramientas para la anotación de datos y la gestión de conjuntos de datos. Una anotación adecuada garantiza que los modelos aprendan a distinguir los objetos con precisión, minimizando errores como el sobreajuste (overfitting) o la confusión con el fondo. Las técnicas avanzadas como la Supresión de No Máximos (NMS) se utilizan durante la inferencia para refinar estas predicciones eliminando las cajas superpuestas, lo que garantiza que solo permanezca la detección más precisa para cada objeto.






