Bounding Box
Aprende cómo los cuadros delimitadores definen la ubicación de los objetos en la visión por ordenador. Explora formatos de coordenadas, aplicaciones reales y cómo usar Ultralytics YOLO26.
Una caja delimitadora es una región rectangular definida por un conjunto de coordenadas que encierra un objeto específico dentro de una imagen o un fotograma de vídeo. En el campo de la visión por computador (CV), estas cajas sirven como anotaciones fundamentales para enseñar a los sistemas de inteligencia artificial (AI) a localizar y reconocer elementos concretos. En lugar de limitarse a clasificar una imagen completa como «que contiene un coche», una caja delimitadora permite a un modelo señalar la ubicación exacta y la extensión espacial del coche, separándolo del fondo y de otras entidades. Esta capacidad de localización es esencial para las tareas de detección de objetos, cuyo objetivo es identificar varios objetos simultáneamente con gran precisión.
Conceptos básicos y coordenadas#
Para procesar datos visuales de forma eficaz, los modelos de aprendizaje automático (ML) se basan en sistemas de coordenadas específicos para representar matemáticamente las cajas delimitadoras. El formato elegido suele determinar cómo se preparan los datos para el entrenamiento del modelo y cómo el modelo genera sus predicciones.
- Coordenadas XYXY: Este formato define una caja mediante los valores absolutos en píxeles de la esquina superior izquierda y la esquina inferior derecha. Resulta intuitivo para herramientas de visualización como OpenCV o Matplotlib al dibujar rectángulos directamente sobre las imágenes.
- Formato XYWH: Habitual en conjuntos de datos como COCO, este método especifica el punto central del objeto, seguido de la anchura y la altura de la caja. Esta representación es fundamental para calcular las funciones de pérdida durante el proceso de aprendizaje.
- Coordenadas normalizadas: Para garantizar la escalabilidad en imágenes con distintas resoluciones, las coordenadas suelen escalarse a un intervalo entre 0 y 1. Esto ayuda a los modelos a generalizar mejor al analizar entradas de dimensiones variables.
Aplicaciones en el mundo real#
Las cajas delimitadoras son los componentes básicos de innumerables soluciones de AI en diversos sectores. Al permitir una localización precisa, hacen posible que los sistemas interactúen de forma inteligente con el mundo físico.
- Vehículos autónomos: Los coches autónomos utilizan cajas delimitadoras para detectar y seguir a peatones, otros vehículos, señales de tráfico y obstáculos en tiempo real. Esta conciencia espacial es crucial para que los sistemas de navegación y seguridad tomen decisiones en fracciones de segundo.
- Análisis del comercio minorista: En las tiendas inteligentes, las cajas delimitadoras ayudan a supervisar el inventario de las estanterías y a seguir las interacciones de los clientes con los productos. Estos datos pueden automatizar la reposición de existencias y proporcionar información sobre el comportamiento de los compradores sin necesidad de realizar recuentos manuales.
Cajas delimitadoras en acción#
Al utilizar arquitecturas modernas como YOLO26, el modelo predice cajas delimitadoras junto con una etiqueta de clase y una puntuación de confianza. El siguiente ejemplo muestra cómo ejecutar la inferencia sobre una imagen y acceder a las coordenadas de la caja delimitadora mediante el paquete ultralytics.
from ultralytics import YOLO
# Load the YOLO26 model
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Access bounding box coordinates (xyxy format) for the first detected object
boxes = results[0].boxes
print(boxes.xyxy[0]) # Output: tensor([x1, y1, x2, y2, ...])Términos relacionados y diferencias#
Aunque las cajas delimitadoras son el estándar para la detección general, se diferencian de otros tipos de anotación utilizados en tareas más detalladas.
- Segmentación de instancias: A diferencia de una caja delimitadora rectangular, la segmentación crea una máscara con precisión de píxel que sigue el contorno exacto de un objeto. Resulta útil cuando la forma precisa es más importante que la ubicación general.
- Caja delimitadora orientada (OBB): Las cajas delimitadoras estándar están alineadas con los ejes (son rectángulos verticales). Las OBB pueden girar para ajustarse a objetos inclinados, como barcos en imágenes de satélite o paquetes en una cinta transportadora, proporcionando un ajuste más preciso y reduciendo el ruido del fondo.
- Puntos clave: En lugar de encerrar un objeto, los puntos clave identifican puntos de referencia específicos, como las articulaciones del cuerpo humano para la estimación de la pose.
Herramientas para la anotación y la gestión#
Crear anotaciones de cajas delimitadoras de alta calidad es un paso fundamental en el flujo de trabajo de ML. La Ultralytics Platform simplifica este proceso al ofrecer herramientas para la anotación de datos y la gestión de conjuntos de datos. Una anotación adecuada garantiza que los modelos aprendan a distinguir los objetos con precisión y minimiza errores como el sobreajuste o la confusión con el fondo. Durante la inferencia se utilizan técnicas avanzadas como la supresión no máxima (NMS) para perfeccionar estas predicciones mediante la eliminación de cajas superpuestas, de modo que solo permanezca la detección más precisa de cada objeto.









