使用 Ultralytics Platform 进行计算机视觉智能数据集管理
探索如何使用 Ultralytics Platform 更好地管理计算机视觉项目中的数据集。轻松跟踪、比较并改进你的数据集。

视觉 AI,即计算机视觉,自早期以来已经取得了长足发展,从实验性研究逐渐演变为推动现实应用的关键技术。如今,AI 爱好者可以使用易于获取的工具和框架,构建用于目标检测和实例分割等任务的强大模型。
然而,随着这些应用从实验阶段走向生产环境,数据集管理仍然是一个关键且经常被忽视的挑战。随着计算机视觉数据集的规模和复杂性不断增长,团队常常难以保持标注的一致性、跟踪不同版本之间的变更,并确保整体数据质量。
即使是尖端模型,如果训练数据不完整、不平衡或管理不善,也可能在现实环境中表现不佳。开发阶段性能与现实可靠性之间日益扩大的差距,正是需要采用更结构化数据集管理方法的原因。
另一个常见限制是,数据收集、标注和训练通常使用彼此独立的工具完成。碎片化的工作流使数据集难以高效管理,增加了不一致的风险,也拖慢了迭代速度。
为解决数据集管理和工作流碎片化等视觉 AI 瓶颈,我们最近推出了 Ultralytics Platform。这是一个端到端工作空间,将数据集管理、标注、训练、部署和监控整合到统一的工作流中。
通过连接计算机视觉生命周期的每个阶段,你可以更轻松地跟踪数据集变更、比较不同版本的性能,并持续优化数据以获得更好的结果。

图 1. 在 Ultralytics Platform 中查看数据集图像的示例(来源)
本文将深入介绍 Ultralytics Platform 如何帮助你跟踪、比较和改进数据集,从而构建更可靠的计算机视觉模型。现在开始吧!
数据集管理在计算机视觉中的重要性#
计算机视觉模型的性能与其训练数据密切相关。模型准确率,即预测正确的频率,不仅取决于算法,还取决于数据集对现实条件的表现程度。
简单来说,模型直接从数据中学习模式,因此数据集中的任何缺失、偏差或不一致,都可能影响模型进行预测的方式。换句话说,即使模型架构本身很强,低质量数据、错误标注,或对图像中现实变化的覆盖有限(例如不同的光照条件、目标角度、背景或遮挡程度),也会显著降低准确率。
微调模型时也是如此:微调是指在新数据或更新后的数据上进一步训练预训练模型,使其更好地适应特定用例或环境。由于模型准确率在很大程度上取决于数据,因此妥善管理数据至关重要。
数据集管理包括组织、标注和持续更新数据,使其保持准确且相关。这有助于随着时间推移提升性能,尤其是在使用新数据重新训练或微调模型时。
数据集质量如何影响现实世界的可靠性#
计算机视觉用例(例如安防监控系统)充分说明了妥善管理数据为何至关重要。这些系统需要在各种现实条件下可靠运行,包括不同的光照环境、摄像机角度、人群拥挤程度和部分遮挡情况。
如果训练数据未覆盖这些变化,或未能体现目标在不同场景和条件下外观的多样性,模型可能难以准确检测目标。例如,主要使用光线充足、场景整洁的图像训练的模型,在低光照环境或拥挤场景中可能表现不佳。在安防系统中,这可能导致漏检事件或产生误报。
为避免这种情况,重要的是维护不仅干净且标注准确,而且平衡良好并持续更新的数据集。这意味着要识别数据缺口,在条件发生变化时添加新示例,并确保不同类别和环境得到均衡体现。
借助更完整、更结构化的数据集,模型能够更好地应对现实世界的变化,并生成更可靠的预测。
数据集管理的关键方面#
那么,数据集管理究竟是什么样的?它包括组织、标注和维护数据,使数据能够在整个模型开发过程中得到有效使用。
例如,组织数据包括构建数据集结构,并将其拆分为训练集、验证集和测试集。训练集用于教会模型,验证集用于监控性能并在开发过程中指导调整,测试集则用于评估最终模型在完全未见过的数据上的表现。
与此同时,标注包括为图像添加类别标签、边界框或分割掩码等详细信息。由于模型从这些标注中学习,因此准确性和一致性对于帮助模型学习有意义的模式并做出可靠预测至关重要。
此外,维护数据集还包括随着时间推移审查和更新数据。这可能包括修正标注错误、删除低质量或重复数据,以及添加新示例来覆盖缺失案例或变化中的条件。
更广泛地说,数据集管理是一个持续进行的过程。随着模型接受评估并收集到新数据,数据集需要更新,以反映现实条件和边缘案例。跟踪这些更新并比较不同版本,有助于团队了解哪些变化提升了性能,以及还需要在哪里进一步调整。
使用 Ultralytics Platform 管理数据集#
Ultralytics Platform 在单一环境中提供结构化的数据集管理工作流,涵盖从数据准备到导出的各个环节。它既支持个人开发者,也支持团队协作,无论你是独立工作还是跨项目协作,都能更轻松地保持数据集管理的一致性。
每个阶段都旨在简化数据集在模型开发生命周期中的组织、处理和使用方式。将这些步骤集中到一个地方后,该平台减少了碎片化,使跨工作流保持一致性变得更加直接。
接下来,我们逐步了解其中涉及的关键步骤,以及该平台如何支持每个步骤。
将数据集上传到 Ultralytics Platform#
在平台上开始使用数据集非常灵活,你可以通过多种方式导入或复用数据。你可以上传自己的数据,也可以使用平台提供的公共数据集快速开始。你还可以克隆社区分享的现有数据集,并在其基础上继续构建。
平台的社区功能让你可以轻松探索和复用现有成果。借助其他用户创建的数据集(包括数百万张图像及其标注),你无需自行收集和标注全部数据,就能快速开始。克隆数据集会在你的工作空间中创建副本,让你能够修改和扩展它,同时保留原始数据集。
对于上传,平台支持单张图像、视频以及 ZIP、TAR 或 GZ 等数据集压缩包。它还支持 YOLO 和 COCO 等广泛使用的数据集格式,因此无需额外转换即可轻松导入现有数据集和标注。此外,你还可以使用从平台导出的 NDJSON 文件上传数据集,从而在不同项目之间无缝重建或复用数据集。
数据上传后,平台会通过结构化流水线处理数据。其中包括验证文件格式和大小、在需要时调整图像大小、解析标注,以及生成数据集统计信息。
例如,视频会被转换为帧,以便用于训练;图像则会经过优化和准备,便于浏览与分析。处理完成后,数据集即可在平台内用于标注、分析和模型训练。
在 Ultralytics Platform 上进行数据标注#
数据集上传后,可以直接在平台内进行审查和标注。平台内置了图像标注工具,支持多种计算机视觉任务,例如目标检测、实例分割、姿态估计、定向边界框(OBB)检测和图像分类。

图 2. 使用 Ultralytics Platform 进行数据标注(来源)
你可以使用这些工具手动创建标注,也可以借助 SAM 驱动的智能标注等 AI 辅助功能加快流程。借助 SAM,你可以通过与图像交互生成掩码、边界框或定向框,在保持准确性的同时加快标注过程。
通过 Ultralytics Platform 分析数据集质量#
除了准备和标注数据之外,了解数据集质量对于构建可靠的计算机视觉模型也至关重要。如果无法清晰了解类别分布、标注质量、数据集拆分,以及数据在不同条件下的表示情况,就很难发现影响模型性能的问题。
Ultralytics Platform 内置了帮助你更有效地分析数据集的功能。这些洞察可直接在数据集界面中查看,涵盖 Images、Classes 和 Charts 等选项卡。
在 Charts 选项卡中,你可以查看数据集级别的统计信息,例如拆分分布(训练集、验证集和测试集)、类别频率,以及显示目标在图像中出现位置的标注热力图。
Classes 选项卡按类别提供标注数量明细,帮助你更轻松地发现类别不平衡问题。与此同时,Images 选项卡显示图像级别的详细信息,例如尺寸、标注数量,以及标签在各张图像中的分布情况。
这些洞察有助于更轻松地识别类别不平衡、场景缺失或数据分布不均等问题。例如,你可能会发现某些类别的示例极少,或者大多数标注都集中在图像的特定区域。
除了数据分析之外,该平台还支持数据集整理和增强,即通过修正或删除有问题的数据来优化数据集,并创建现有数据的变体以提升模型性能。你可以直接在平台内根据分析洞察更新标注、添加新数据或重新组织数据集拆分,从而完成这些改进。
从 Ultralytics Platform 导出数据集#
数据集准备并验证完成后,即可将其导出到不同环境中使用。这样你就可以灵活地在偏好的环境中使用计算机视觉数据,无论是在本地、云端,还是在其他工具和工作流中训练模型。
Ultralytics Platform 支持多种导出格式,包括 YOLO、COCO 和 NDJSON,因此可以轻松将数据集集成到不同的训练工作流和工具中。

图 3. 从 Ultralytics Platform 导出数据集(来源)
导出数据集会创建数据在特定时间点的固定快照,其中包括图像、标注和结构。这很有用,因为数据集通常会随着新数据的添加、标注的更新或拆分的调整而变化。通过导出快照,你可以保留特定训练运行所使用的数据集的准确版本。
这样可以更轻松地复现实验结果,因为你可以再次使用相同的数据设置训练模型,并比较不同数据集版本之间的性能。例如,你可以评估添加新图像或修正标注是否确实提升了模型准确率,而不必猜测发生了哪些变化。
导出操作以异步方式处理,准备就绪后,数据集即可下载并用于本地、云端或离线训练环境。
通过在 Ultralytics Platform 上迭代改进数据集质量#
在机器学习和深度学习工作流中,即使模型已经部署,数据集管理仍会继续进行,因为现实数据往往不同于训练时使用的数据。
随着模型接触新的输入,数据集中的缺口(例如缺少低光照环境、不同摄像机角度、遮挡或拥挤场景等条件)以及标注错误会变得更加明显,因此有必要随着时间推移持续优化数据。
改进数据集有多种方式。你可以添加新的图像或视频来覆盖缺失条件,例如低光照环境、不同摄像机角度、遮挡或拥挤场景,从而帮助减少数据盲区。
同时,确保标注准确且一致(例如正确标记目标,以及使用精确的边界框或掩码)有助于模型学习更可靠的模式。
这通常遵循一个简单循环:训练模型、评估结果、识别错误、改进数据集,然后重新训练。每一步都有助于发现错误标注、数据缺失或代表性不足的案例等问题。
假设你正在开发一个实时零售货架监控系统,用于检测商店中的商品。早期版本的数据集可能未包含某些商品类型、光照条件或拥挤的货架布局。在评估过程中,你可能会发现模型难以检测这些情况下的商品。
为了提升性能,你可以收集覆盖这些缺失场景的新图像,并在需要时更新标注。随着时间推移,重复这一过程有助于模型在现实条件下变得更加准确和可靠。
Ultralytics Platform 通过将数据集更新与训练和评估连接起来,支持这一工作流。借助内置的实验跟踪和性能指标,你可以更轻松地监控进展,并持续改进数据集。
使用 Ultralytics Platform 跟踪数据集变更#
我们简要讨论了数据集如何随着模型开发过程的发展而变化。随着新数据的添加、标注的优化和类别的更新,跟踪这些变化对于保持数据质量和确保模型性能一致性变得至关重要。
以下是 Ultralytics Platform 中支持数据集跟踪和版本控制的一些关键功能:
- 数据集版本控制:你可以将固定的数据集版本创建为 NDJSON 快照。每个版本都会记录特定时间点的关键详细信息,例如图像数量、类别数量、标注数量和数据集大小。这些版本会被保存,之后可以下载,从而更轻松地复现实验并比较不同数据集状态下的结果。
- **Versions 选项卡:**所有数据集版本都在 Versions 选项卡中集中管理,你可以在这里查看版本历史、为变更添加描述,并跟踪数据集随时间的演变。
- **与模型关联:**Models 选项卡显示在某个数据集上训练的所有模型,包括 mAP 等指标和训练详细信息。数据集版本会与训练运行关联,帮助你了解数据变化如何影响模型性能。
- **Errors 选项卡:**Errors 选项卡会突出显示处理失败的文件,并提供错误详细信息和建议。这样你就能在训练前识别并修复损坏文件或不支持格式等问题。
- **数据集界面(Images 和 Classes 选项卡):**这些视图允许你浏览图像、审查标注、管理类别标签并分析类别分布。筛选、排序和识别未标注图像等功能,让你能够更轻松地持续监控数据集质量。
- **统计信息和图表:**内置数据可视化功能(例如拆分分布、类别频率和标注热力图)有助于跟踪数据分布变化,并在数据集演变过程中识别不平衡问题。

图 4. 在 Ultralytics Platform 上分析数据集类别分布的示例(来源)
在 Ultralytics Platform 中连接数据集与训练和部署#
Ultralytics Platform 将 AI 模型开发的不同阶段连接到单一流水线中,简化了从原始数据到可投入生产的视觉 AI 应用的整个过程。
数据集准备并完成标注后,即可直接在平台内用于训练计算机视觉模型,例如 Ultralytics YOLO26。训练期间,你可以使用内置仪表板监控性能指标、跟踪实验,并评估模型的学习效果。

图 5. 在 Ultralytics Platform 上查看模型训练指标的示例(来源)
训练完成后,你可以直接在浏览器中使用新图像测试模型,以评估预测结果并在部署前识别改进方向。当模型表现良好时,即可将其部署到生产环境。
平台支持将模型导出为多种格式,或通过推理服务和专用端点进行部署,使模型能够在不同环境中运行。
部署后,内置监控工具可以持续跟踪系统性能,包括与使用情况和模型行为相关的指标。这让你能够更直接地在现实应用中维护和改进视觉 AI 系统。
使用 Ultralytics Platform 管理数据集的最佳实践#
使用 Ultralytics Platform 管理数据集时,以下是一些需要牢记的关键因素:
- **使用筛选器查找缺口:**使用筛选工具识别未标注或代表性不足的数据,从而更顺畅地完成标注并提升覆盖范围。
- **尽早修复错误:**使用 Errors 选项卡进行质量控制,在训练前发现上传失败、文件损坏或格式不受支持等问题。
- **持续更新数据集:**添加新数据、修正标注,并纳入出现的边缘案例。这有助于提升覆盖范围,确保模型在现实场景中可靠运行。
- **谨慎管理数据集拆分:**确保训练集、验证集和测试集之间保持良好平衡。你可以手动重新组织拆分,也可以在需要时使用自动重新分配功能。
要进一步了解 Ultralytics Platform,请查看官方的 Ultralytics 文档。
要点总结#
随着计算机视觉项目规模扩大,有效管理数据集变得与模型开发同样重要。结构化的数据集管理方法有助于提升数据质量、简化工作流,并随着时间推移支持更好的模型性能。
Ultralytics Platform 将数据集管理、训练和部署整合到单一工作流中,简化了这一过程。通过采用结构化的数据集管理方法,团队可以降低复杂性、提高效率,并构建更具可扩展性和可靠性的计算机视觉系统。
加入不断壮大的社区,并探索我们的 GitHub 仓库获取 AI 资源。立即开始构建视觉 AI 应用,请查看我们的许可选项。访问我们的解决方案页面,了解 AI 在农业领域的应用如何改变农业,以及医疗健康领域的视觉 AI如何塑造未来。









