Data Labeling
了解机器学习数据标注的基础知识。发现目标检测等关键类型,以及如何使用 Ultralytics YOLO26 加速工作流程。
数据标注是识别原始数据(如图像、视频帧、文本或音频)并添加信息标签或元数据以提供上下文的基础过程。在机器学习 (ML)领域,算法本身无法理解物理世界;它们需要一个“老师”来引导它们。这种引导以在监督学习期间使用的数据集的形式出现。这些标签充当真实值 (ground truth),代表了模型努力预测的正确答案。无论是训练一个简单的分类器还是像 Ultralytics YOLO26 这样的复杂架构,这些标签的准确性、一致性和质量都是决定模型成功与否的首要因素。
数据标注与数据注释#
虽然这些术语在日常交流中经常被交替使用,但值得注意的是它们之间存在着细微的差别。“数据 labeling(数据标注)”通常指为一块数据分配类别或标签的广泛行为(例如,将电子邮件标记为“垃圾邮件”)。相比之下,data annotation(数据注释)通常更具体于计算机视觉 (CV),涉及使用边界框、多边形或关键点对对象进行精确勾勒。然而,在大多数机器学习运维 (MLOps)工作流中,这两个术语都描述了高质量训练数据的创建。
计算机视觉中的关键类型#
标注方法会根据模型必须执行的任务而变化。常见类型包括:
- 图像分类: 为整张图片分配一个单一的标签,例如将天气状况识别为“多云”或“晴天”。
- 目标检测: 在不同物体周围绘制二维边界框,以教导模型物体是什么以及它位于何处。
- 实例分割: 在物体周围创建像素级完美的掩码或多边形,这对于确定精确的形状和边界至关重要。
- 姿态估计: 在主体上标记特定的关键点(例如骨骼关节),以分析运动或姿势。
实际应用#
数据标注的效用几乎扩展到每一个采用 AI 的行业。
-
自动驾驶汽车: 自动驾驶汽车依赖于庞大的数据集,其中每辆车、行人、交通标志和车道线都经过了细致的标注。这些带标签的数据使感知系统能够安全地导航复杂的环境。自动驾驶汽车公司在像素级标注上投入巨资,以确保符合安全标准。
-
精准农业: 在现代农业中,农业人工智能被用于检测作物病害或监测生长阶段。农民使用根据“健康”与“患病”叶子的标注图像训练出的模型来自动化处理,从而减少化学品的使用并提高产量。
标注工作流#
创建带标签的数据集通常是人工智能项目中耗时最长的部分。该过程通常涉及“人在回路 (Human-in-the-Loop, HITL)”方法,即人工注释员验证标签以确保高准确性。现代工作流利用诸如 Ultralytics Platform 等工具,该工具简化了数据集管理并允许团队就注释进行协作。还可以采用诸如主动学习等先进技术,其中模型对数据进行预标注,而人类只纠正低置信度的预测,从而显著加快该过程。
以下示例演示了如何使用预训练的 Ultralytics YOLO26 模型为新图像自动生成标签(自动标注),然后可以由人工进行校正:
from ultralytics import YOLO
# Load the YOLO26n model (nano version)
model = YOLO("yolo26n.pt")
# Run inference on an image to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Save the detection results to a text file in standard YOLO format
# This file can now be used as a starting point for data labeling
results[0].save_txt("bus_labels.txt")





