返回 Ultralytics 术语表
Bounding Box
了解边界框如何定义计算机视觉中的目标位置。探索坐标格式和实际应用,以及如何使用 Ultralytics YOLO26。
边界框是由一组坐标定义的矩形区域,用于包围图像或视频帧中的特定对象。在计算机视觉(CV)领域,这些框是教会人工智能(AI)系统定位和识别不同物体的基础标注。与其仅将整张图像分类为“包含一辆汽车”,边界框还允许模型精确指出汽车的位置和空间范围,将其与背景及其他实体区分开来。这种定位能力对于目标检测任务至关重要,因为这类任务的目标是以高精度同时识别多个对象。
核心概念和坐标#
为了有效处理视觉数据,机器学习(ML)模型依赖特定的坐标系,以数学方式表示边界框。所选格式通常决定了如何为模型训练准备数据,以及模型如何输出预测结果。
- XYXY 坐标: 此格式使用左上角和右下角的绝对像素值定义边界框。在使用 OpenCV 或 Matplotlib 等可视化工具直接在图像上绘制矩形时,这种格式直观易用。
- XYWH 格式: 这种方法常见于 COCO 等数据集,它指定对象的中心点,以及边界框的宽度和高度。这种表示方式对于在学习过程中计算损失函数至关重要。
- 归一化坐标: 为了确保在不同分辨率的图像之间具备可扩展性,坐标通常会缩放到 0 到 1 的范围内。这有助于模型在分析尺寸各异的输入时获得更好的泛化能力。
实际应用#
边界框是众多行业中各种 AI 解决方案的基础。通过实现精确定位,它们使系统能够与物理世界进行智能交互。
- 自动驾驶车辆: 自动驾驶汽车使用边界框实时检测和跟踪行人、其他车辆、交通标志及障碍物。这种空间感知能力对于导航和安全系统做出瞬时决策至关重要。
- 零售分析: 在智慧商店中,边界框有助于监控货架上的库存,并跟踪顾客与商品的互动。这些数据可以自动化补货流程,并在无需人工盘点的情况下提供顾客行为洞察。
边界框实战#
使用 YOLO26 等现代架构时,模型会同时预测边界框、类别标签和置信度分数。下面的示例演示了如何对图像运行推理,并使用 ultralytics 包访问边界框坐标。
from ultralytics import YOLO
# Load the YOLO26 model
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Access bounding box coordinates (xyxy format) for the first detected object
boxes = results[0].boxes
print(boxes.xyxy[0]) # Output: tensor([x1, y1, x2, y2, ...])相关术语和区别#
虽然边界框是通用检测的标准,但它们不同于更精细任务中使用的其他标注类型。
- 实例分割: 与矩形边界框不同,分割会创建逐像素精确的掩码,沿着对象的准确轮廓进行描绘。当精确形状比大致位置更重要时,这种方法非常有用。
- 有向边界框(OBB): 标准边界框与坐标轴对齐(即正立的矩形)。OBB 可以旋转以贴合倾斜的对象,例如卫星图像中的船只或传送带上的包裹,从而实现更紧密的贴合并减少背景噪声。
- 关键点: 关键点不是包围对象,而是识别特定的标志点,例如用于姿态估计的人体关节。
标注和管理工具#
创建高质量的边界框标注是 ML 流程中的关键步骤。Ultralytics Platform 通过提供数据标注和数据集管理工具,简化了这一过程。正确的标注可确保模型准确学会区分对象,最大限度地减少过拟合或背景混淆等错误。在推理过程中,还会使用非极大值抑制(NMS)等高级技术,通过移除重叠框来优化这些预测,确保每个对象仅保留最准确的检测结果。









