Data-Centric AI
探索以数据为中心的 AI,通过优先提升数据质量来增强模型性能。了解如何使用 Ultralytics Platform 为 Ultralytics YOLO26 筛选和整理数据集。
以数据为中心的 AI 是一种机器学习理念和方法,重点在于提升用于训练模型的数据集质量,而不是主要关注模型架构或超参数的调优。在传统的以模型为中心的开发中,工程师通常会固定数据集,同时不断迭代算法,以挖掘更高的性能。以数据为中心的 AI 颠覆了这一范式,认为对于许多现代应用而言,模型架构已经足够先进,而提升性能最有效的方法是系统地改进数据本身。这包括清理、标注、增强和整理数据集,以确保它们一致、多样,并能代表现实世界中的问题。
核心理念:数据质量胜过数量#
向以数据为中心的方法转变,体现了人们对“垃圾进,垃圾出”这一基本事实的认识。在 机器学习 中,如果数据存在噪声或偏差,单纯增加更多数据并不总能解决问题。相反,这种方法强调 高质量计算机视觉数据集的重要性。通过优先关注 数据质量 和一致性,开发者通常可以借助更小但经过精心整理的数据集,实现比使用海量杂乱数据集更高的准确率。
这一理念与 主动学习 密切相关,在主动学习中,模型会帮助确定接下来最值得标注的数据点。Ultralytics Platform 等工具通过简化 数据标注 和管理来推动这一过程,使团队能够协作改善数据集的健康状况。这与纯粹的 监督学习 工作流形成对比,后者通常将数据集视为静态工件。
以数据为中心的 AI 的关键技术#
实施以数据为中心的策略需要采取多个实用步骤,而不仅仅是简单地收集数据。
- 标注一致性: 确保所有标注人员以完全相同的方式标注对象至关重要。例如,在 目标检测 中,严格定义汽车后视镜是否应包含在边界框内,可能会显著影响 模型性能。
- 数据增强: 系统地对现有数据应用变换,以覆盖边缘情况。你可以阅读我们的 数据增强终极指南,了解旋转和马赛克增强等技术如何帮助模型更好地泛化。
- 错误分析: 识别模型失效的特定类别或场景,并收集有针对性的数据来弥补这些不足。这通常需要检查 混淆矩阵,以定位薄弱环节。
- 数据清理: 删除重复图像,修正错误标注的示例,并过滤可能使 神经网络 产生混淆的低质量数据。
实际应用#
以数据为中心的方法正在改变那些对可靠性有着不可妥协要求的行业。
-
医学影像: 在 医学影像中的肿瘤检测 等领域,获取数百万张图像是不可能的。相反,研究人员会专注于整理高度准确且经过专家审核的数据集。以数据为中心的方法可以确保分割掩码中的每个像素都足够精确,因为含糊的标注可能导致危及生命的错误。
-
制造业质量控制: 在部署 视觉检测系统 时,与完好零件相比,划痕或凹痕等缺陷十分罕见。以数据为中心的策略包括合成缺陷数据或专门采集缺陷数据,以平衡数据集,确保模型不会对每件产品都只预测“合格”。
以数据为中心的 AI 与以模型为中心的 AI#
区分 以数据为中心的 AI 与 以模型为中心的 AI 非常重要。在以模型为中心的工作流中,数据集是固定的,目标是通过更改模型架构(例如,将 YOLO11 切换为自定义 ResNet)或调优 学习率 等参数来改善指标。在以数据为中心的工作流中,模型架构是固定的(例如,统一采用 YOLO26),目标是通过清理标注、添加多样化示例或处理 离群值 来改善指标。
以下代码片段演示了一个简单的以数据为中心的检查:在训练前检查你的数据集是否包含损坏的图像。这可以确保你的 训练流水线 不会因错误数据而失败。
from ultralytics.data.utils import check_cls_dataset
# Validate a classification dataset structure and integrity
# This helps identify issues with data organization before training begins
try:
# Checks the dataset defined in a YAML or path structure
check_cls_dataset("mnist", split="train")
print("Dataset structure is valid and ready for data-centric curation.")
except Exception as e:
print(f"Data issue found: {e}")以数据为中心的开发工具#
为了有效实践以数据为中心的 AI,开发者依赖可靠的工具链。Ultralytics Platform 作为管理数据生命周期的中央枢纽,提供 自动标注 等功能,在保持一致性的同时加快标注流程。此外,使用 探索工具 可以让用户通过语义方式查询数据集(例如,“查找所有夜间红色汽车的图像”),从而了解数据分布和偏差。
通过专注于数据,工程师可以构建更加稳健、公平且适合部署的系统,用于 自动驾驶汽车 或 智能零售 等动态环境。这一转变承认,对于许多问题而言,代码已经是一个解决的问题,但数据仍然是创新的前沿。









