Data Labeling
了解机器学习数据标注的基础知识。探索目标检测等关键类型,以及如何使用 Ultralytics YOLO26 加速工作流。
数据标注是识别原始数据(如图像、视频帧、文本或音频)并添加信息性标签或元数据以提供上下文的基础过程。在机器学习(ML)领域,算法无法天生理解物理世界;它们需要一位“教师”来引导。此类引导通过在监督学习期间使用带标签的数据集实现。标签充当真实值,代表模型努力预测的正确答案。无论是训练简单的分类器,还是训练像Ultralytics YOLO26这样的复杂架构,标签的准确性、一致性和质量都是决定模型成功与否的首要因素。
数据标注与数据注释#
虽然这些术语在日常交流中经常互换使用,但其中有一个值得注意的细微区别。“数据标注”通常指为一条数据分配类别或标签的广义行为(例如,将一封电子邮件标记为“垃圾邮件”)。相比之下,数据注释通常更具体地用于计算机视觉(CV),涉及使用边界框、多边形或关键点精确划定对象。不过,在大多数机器学习运维(MLOps)工作流中,这两个术语都用于描述高质量训练数据的创建。
计算机视觉中的主要类型#
标注方法取决于模型必须执行的任务。常见类型包括:
- 图像分类: 为整张图像分配一个标签,例如将天气状况识别为“多云”或“晴朗”。
- 目标检测: 在不同对象周围绘制二维边界框,教会模型识别对象是什么以及它位于何处。
- 实例分割: 在对象周围创建像素级精确的掩码或多边形,这对于确定精确的形状和边界至关重要。
- 姿态估计: 在目标上标记特定的关键点,例如骨骼关节,以分析运动或姿态。
实际应用#
数据标注的用途几乎覆盖了所有采用 AI 的行业。
-
自动驾驶汽车: 自动驾驶汽车依赖海量数据集,其中每辆车、行人、交通标志和车道标线都经过细致标注。这些带标签的数据使感知系统能够安全地在复杂环境中导航。自动驾驶汽车公司会大量投入像素级标注,以确保符合安全要求。
-
精准农业: 在现代农业中,农业中的 AI用于检测作物病害或监测生长阶段。农民使用基于“健康”与“患病”叶片标注图像训练的模型来自动化处理,从而减少化学品用量并提高产量。
标注工作流#
创建带标签的数据集通常是 AI 项目中最耗时的部分。该过程通常采用“人在回路”(HITL)方法,由人工标注员验证标签以确保高准确率。现代工作流利用Ultralytics Platform等工具简化数据集管理,并支持团队协作进行注释。还可以采用主动学习等高级技术:模型先对数据进行预标注,人工只需修正低置信度预测,从而显著加快流程。
以下示例演示如何使用预训练的 Ultralytics YOLO26 模型,为新图像自动生成标签(自动标注),之后再由人工进行修正:
from ultralytics import YOLO
# Load the YOLO26n model (nano version)
model = YOLO("yolo26n.pt")
# Run inference on an image to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Save the detection results to a text file in standard YOLO format
# This file can now be used as a starting point for data labeling
results[0].save_txt("bus_labels.txt")








