Bounding Box
Узнай, как ограничивающие рамки (bounding boxes) определяют местоположение объектов в компьютерном зрении. Изучи форматы координат, практическое применение и работу с Ultralytics YOLO26.
Ограничивающая рамка (bounding box) — это прямоугольная область, определяемая набором координат, которая охватывает определенный объект на изображении или кадре видео. В области компьютерного зрения (CV) такие рамки служат основными аннотациями для обучения систем искусственного интеллекта (AI) определению местоположения и распознаванию отдельных объектов. Вместо простой классификации всего изображения как «содержащего автомобиль», ограничивающая рамка позволяет модели точно определить местоположение и пространственные границы машины, отделяя ее от фона и других объектов. Эта способность локализации имеет решающее значение для задач обнаружения объектов, где целью является одновременная идентификация нескольких объектов с высокой точностью.
Основные концепции и координаты#
Для эффективной обработки визуальных данных модели машинного обучения (ML) полагаются на определенные системы координат для математического представления ограничивающих рамок. Выбранный формат часто определяет, как данные подготавливаются для обучения модели и как модель выдает свои предсказания.
- Координаты XYXY: Этот формат определяет рамку с использованием абсолютных значений пикселей верхнего левого и нижнего правого углов. Он интуитивно понятен для инструментов визуализации, таких как OpenCV или Matplotlib, при рисовании прямоугольников прямо на изображениях.
- Формат XYWH: Этот метод, распространенный в таких наборах данных, как COCO, задает центральную точку объекта, а также ширину и высоту рамки. Это представление критически важно для расчета функций потерь в процессе обучения.
- Нормализованные координаты: Чтобы обеспечить масштабируемость для изображений с разным разрешением, координаты часто масштабируются в диапазон от 0 до 1. Это помогает моделям лучше обобщать данные при анализе входов различной размерности.
Реальные приложения#
Bounding box — это строительные блоки для бесчисленных решений в области AI в различных отраслях. Обеспечивая точную локализацию, они позволяют системам интеллектуально взаимодействовать с физическим миром.
- Автономные транспортные средства: Беспилотные автомобили используют ограничивающие рамки для обнаружения и отслеживания пешеходов, других транспортных средств, дорожных знаков и препятствий в реальном времени. Эта пространственная осведомленность крайне важна для навигации и систем безопасности при принятии молниеносных решений.
- Розничная аналитика: В умных магазинах ограничивающие рамки помогают контролировать запасы на полках и отслеживать взаимодействие покупателей с товарами. Эти данные позволяют автоматизировать пополнение запасов и получать информацию о поведении покупателей без ручного подсчета.
Bounding box в действии#
При использовании современных архитектур, таких как YOLO26, модель прогнозирует ограничивающие рамки вместе с меткой класса и оценкой уверенности. Следующий пример демонстрирует, как запустить инференс на изображении и получить доступ к координатам ограничивающей рамки с помощью пакета ultralytics.
from ultralytics import YOLO
# Load the YOLO26 model
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Access bounding box coordinates (xyxy format) for the first detected object
boxes = results[0].boxes
print(boxes.xyxy[0]) # Output: tensor([x1, y1, x2, y2, ...])Связанные термины и различия#
Хотя bounding box являются стандартом для общего обнаружения, они отличаются от других типов аннотаций, используемых в более детализированных задачах.
- Сегментация экземпляров: В отличие от прямоугольной рамки, сегментация создает попиксельно точную маску, которая повторяет точный контур объекта. Это полезно, когда точная форма важнее общего местоположения.
- Повернутая ограничивающая рамка (OBB): Стандартные ограничивающие рамки выровнены по осям (прямостоячие прямоугольники). OBB могут поворачиваться, чтобы охватить расположенные под углом объекты, такие как суда на спутниковых снимках или упаковка на конвейерной ленте, обеспечивая более плотное прилегание и уменьшая фоновый шум.
- Ключевые точки: Вместо того чтобы охватывать объект целиком, ключевые точки идентифицируют определенные ориентиры, например суставы на человеческом теле для оценки позы.
Инструменты для аннотирования и управления#
Создание высококачественных аннотаций в виде ограничивающих рамок — важнейший шаг в конвейере ML. Платформа Ultralytics упрощает этот процесс, предлагая инструменты для аннотирования данных и управления наборами данных. Правильная разметка гарантирует, что модели научатся точно отличать объекты, минимизируя такие ошибки, как переобучение или путаница с фоном. Расширенные методы, такие как немаксимальное подавление (NMS), используются во время инференса для уточнения этих предсказаний путем удаления перекрывающихся рамок, гарантируя, что для каждого объекта останется только самое точное обнаружение.






