YOLO Vision 2026:
返回 Ultralytics 词汇表

Golden Dataset

了解什么是黄金数据集,如何构建和维护它,并使用可靠的参考数据来评估AI模型、防止退化以及支持部署决策。

黄金数据集是一个经过精心策划、准确标注且具有代表性的示例集合,被用作评估AI系统的可信参考。它并不追求最大化规模,而是优先考虑正确性、覆盖率以及与预期应用的相关性。团队将其用作一个稳定的“答案键”,用于比较模型、检查回归、调查故障以及决定系统是否可以部署。

机器学习中,“黄金数据集”是一个非正式的工程术语,而不是一个普遍标准化的数据集类型。其具体内容取决于任务:用于目标检测的带有经验证边界框的图像、用于语言模型的带有批准响应的提示词,或是用于欺诈检测的带有确认结果的交易。

是什么让数据集成为黄金数据集#

黄金数据集包含输入以及可信的预期输出,通常被称为真实标签。在计算机视觉中,这些输出可能是通过严格的数据标注产生的类标签、边界框、分割掩码或关键点。

其主要品质包括:

  • 标签准确性: 领域专家或经过培训的评审员使用明确的准则来验证标注。模糊的示例会被一致地解决,而不会留给个人去解释。
  • 具有代表性的覆盖率: 数据集反映了重要的生产条件,包括常见案例、困难示例、罕见事件以及相关的用户或环境群体。
  • 任务对齐: 每个示例都有助于衡量明确定义的要求,例如在仓库照明下检测损坏的包装。
  • 独立性: 示例与训练数据相隔离,以防止数据泄露,这可能会使报告的性能高得具有误导性。
  • 可追溯性: 团队记录数据来源、收集条件、标注规则、评审员和变更。MLflow数据集追踪展示了哈希、架构、来源和数据集血缘关系如何支持可重复性。
  • 受控变更: 更新经过版本控制和审查。只有在已知确切数据集版本和评估设置的情况下,模型分数才是有意义的。

黄金并不意味着完美无瑕或永久正确。现实世界的条件和定义可能会发生变化,因此必须对参考集进行审计和更新,而不能在不声不响中重写历史结果。

黄金数据集与相关术语#

黄金数据集与几个熟悉的概念有重叠,但它强调的是信任和治理:

  • 真实标签是单个示例的可接受答案;黄金数据集则是经审查的示例及其可接受答案的集合。
  • 基准数据集通常用于在共同任务上比较系统。黄金数据集通常是私有的,并且针对单个组织、产品或部署环境定制。
  • 验证数据在开发过程中指导模型选择和调优。基于它进行重复决策会逐渐使开发过程过度拟合。
  • 测试数据保留用于最终评估。黄金数据集通常充当高质量的测试或回归集,尽管它也可能包含独立的开发和最终测试部分。
  • 训练数据用于教导模型参数,通常要大得多。黄金数据集应保留在训练之外,除非有意将某个版本化副本从评估中退役。

谷歌关于数据集拆分的指导意见建议保持训练、验证和测试示例相互独立。当数据稀缺时,交叉验证技术可以改善估计,但受保护的最终参考集仍然具有很高的价值。

实际应用#

制造缺陷检测: 工厂可以创建一个黄金数据集,其中包含经过审查的图像,展示合格产品以及诸如裂纹、组件缺失或装配错误等已确定的缺陷。它包括多条生产线、相机位置、材料和光照条件。在发布之前,每个候选模型都会在相同的集合上进行评估。如果针对小裂纹的召回率下降,即使总体指标看起来可以接受,团队也可以阻止部署。

零售货架监控: 零售商可以维护经过验证的商店图像,其中包含拥挤的货架、空置空间、部分遮挡的产品、季节性包装和反光。该数据集用于衡量视觉系统是否能在各种商店环境中可靠地检测产品和库存缺口。微软负责任的AI指南中描述了寻找高误差群体的更广泛实践,按场景或产品类别审查性能正是遵循了这一实践。

这些应用表明,仅靠总体准确率是不够的。黄金数据集应支持针对罕见类别、位置、设备或错误会导致不同后果的条件的基于切片的评估。NIST AI风险管理框架核心同样强调了文档化的测试集、合适的指标以及在类似部署条件下的评估。

构建和维护黄金数据集#

首先要定义模型的预期行为和重要的失效模式。收集具有代表性的示例,编写精确的标注说明,运行评审员校准,并通过领域专家解决分歧。将高度相似的重复项和相关视频帧保留在同一个拆分中,以防止视觉上相似的内容跨越训练与评估边界。

对于视觉项目,Ultralytics Platform支持云端数据集管理、标注、训练和部署。其标注工作流使团队能够创建和精炼标签,而数据集视图则有助于检查类别分布、未标注图像、拆分、重复项和异常值。

对每个批准的发布版本进行版本控制,并记录新增、删除、标签修正和策略变更。NIST关于AI测试、评估、验证和确认的指南为有意义的评估提供了更广泛的框架。部署后,将传入数据与黄金参考进行对比并监控条件的变化;Azure模型监控指南阐释了漂移和数据质量信号如何揭示参考集何时需要修订。

评估视觉模型#

Ultralytics YOLO可以使用验证模式针对已审查的标签评估预测结果:

from ultralytics import YOLO

# Load a pretrained object detection model
model = YOLO("yolo26n.pt")

# Evaluate predictions against a labeled reference split
metrics = model.val(data="coco8.yaml", split="val")

# Report the primary detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")

此工作流展示了黄金数据集在模型端的作用:针对固定的已标注拆分运行固定的模型,并记录可重复的指标。在生产项目中,团队在批准发布之前,还应检查每个类别的结果、混淆矩阵、困难示例以及特定于应用的验收阈值。

Explore solutions

让我们一起构建 AI 的未来!

开启你的机器学习未来之旅