Bounding Box
Узнай, как ограничивающие рамки определяют расположение объектов в компьютерном зрении. Изучи форматы координат, применения в реальном мире и использование Ultralytics YOLO26.
Ограничивающая рамка — это прямоугольная область, заданная набором координат, которая охватывает конкретный объект в изображении или видеокадре. В области компьютерного зрения (CV) такие рамки служат основными аннотациями для обучения систем искусственного интеллекта (AI) находить и распознавать отдельные объекты. Вместо того чтобы просто классифицировать всё изображение как «содержащее автомобиль», ограничивающая рамка позволяет модели точно определить местоположение и пространственные границы автомобиля, отделив его от фона и других объектов. Эта возможность локализации необходима для задач обнаружения объектов, цель которых — одновременно с высокой точностью находить несколько объектов.
Основные понятия и координаты#
Для эффективной обработки визуальных данных модели машинного обучения (ML) используют определённые системы координат, чтобы математически представлять ограничивающие рамки. Выбранный формат часто определяет, как подготавливаются данные для обучения модели и как модель выдаёт свои предсказания.
- Координаты XYXY: этот формат задаёт рамку с помощью абсолютных значений пикселей верхнего левого и нижнего правого углов. Он интуитивно понятен для инструментов визуализации, таких как OpenCV или Matplotlib, при непосредственной отрисовке прямоугольников на изображениях.
- Формат XYWH: этот метод, распространённый в таких наборах данных, как COCO, задаёт центральную точку объекта, а затем ширину и высоту рамки. Такое представление имеет решающее значение для вычисления функций потерь в процессе обучения.
- Нормализованные координаты: чтобы обеспечить масштабируемость для изображений с разным разрешением, координаты часто масштабируют в диапазон от 0 до 1. Это помогает моделям лучше обобщать данные при анализе входных изображений разных размеров.
Практические применения#
Ограничивающие рамки служат основой для бесчисленного множества решений на базе AI в различных отраслях. Благодаря точной локализации они позволяют системам интеллектуально взаимодействовать с физическим миром.
- Автономные транспортные средства: беспилотные автомобили используют ограничивающие рамки для обнаружения и отслеживания пешеходов, других транспортных средств, дорожных знаков и препятствий в реальном времени. Такое пространственное восприятие необходимо навигационным системам и системам безопасности для принятия решений за доли секунды.
- Аналитика розничной торговли: в умных магазинах ограничивающие рамки помогают отслеживать товары на полках и взаимодействие покупателей с ними. Эти данные позволяют автоматизировать пополнение запасов и получать сведения о поведении покупателей без ручного подсчёта.
Ограничивающие рамки в действии#
При использовании современных архитектур, таких как YOLO26, модель предсказывает ограничивающие рамки вместе с меткой класса и оценкой уверенности. В следующем примере показано, как выполнить инференс изображения и получить координаты ограничивающих рамок с помощью пакета ultralytics.
from ultralytics import YOLO
# Load the YOLO26 model
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Access bounding box coordinates (xyxy format) for the first detected object
boxes = results[0].boxes
print(boxes.xyxy[0]) # Output: tensor([x1, y1, x2, y2, ...])Связанные термины и различия#
Хотя ограничивающие рамки являются стандартом для общего обнаружения объектов, они отличаются от других типов аннотаций, используемых для более детализированных задач.
- Сегментация экземпляров: в отличие от прямоугольной ограничивающей рамки, сегментация создаёт попиксельную маску, точно повторяющую контур объекта. Это полезно, когда точная форма важнее общего местоположения.
- Ориентированная ограничивающая рамка (OBB): стандартные ограничивающие рамки выровнены по осям (представляют собой вертикальные прямоугольники). OBB могут поворачиваться в соответствии с наклонёнными объектами, например кораблями на спутниковых снимках или упаковками на конвейерной ленте, обеспечивая более плотное прилегание и уменьшая влияние фона.
- Ключевые точки: вместо охвата объекта ключевые точки обозначают конкретные ориентиры, например суставы человеческого тела, для оценки позы.
Инструменты для аннотирования и управления данными#
Создание качественных аннотаций ограничивающих рамок — критически важный этап конвейера ML. Платформа Ultralytics упрощает этот процесс, предоставляя инструменты для аннотирования данных и управления наборами данных. Корректная разметка гарантирует, что модели научатся точно различать объекты, сводя к минимуму такие ошибки, как переобучение или путаница с фоном. Во время инференса для уточнения этих предсказаний применяются продвинутые методы, такие как подавление немаксимумов (NMS): они удаляют перекрывающиеся рамки, чтобы для каждого объекта оставалось только наиболее точное обнаружение.









