使用 Ultralytics Platform 智能管理计算机视觉数据集
了解如何在计算机视觉项目中使用 Ultralytics Platform 更好地管理数据集。轻松跟踪、比较和改进数据集。

视觉 AI(即计算机视觉)自早期发展以来已经取得长足进步,从实验性研究演变为驱动现实应用的关键技术。如今,AI 爱好者可以使用易于上手的工具和框架,构建用于目标检测和实例分割等任务的强大模型。
然而,随着这些应用从实验阶段走向生产环境,数据集管理仍然是一项关键且常被忽视的挑战。随着计算机视觉数据集规模不断扩大、复杂性不断提高,团队往往难以保持标注一致、跟踪不同版本之间的更改,并确保整体数据质量。
即使是前沿模型,如果训练数据不完整、不平衡或管理不善,在现实环境中的表现也可能不佳。开发阶段的性能与现实环境中的可靠性之间的差距日益扩大,因此需要采用更有条理的数据集管理方法。
另一个常见问题是,数据收集、标注和训练往往分别使用不同工具完成。分散的工作流会增加高效管理数据集的难度,提高数据不一致的风险,并拖慢迭代速度。
为了解决数据集管理和工作流分散等视觉 AI 瓶颈,我们最近推出了 Ultralytics Platform。这是一个端到端工作空间,将数据集管理、标注、训练、部署和监控整合到一个统一的工作流中。
通过连接计算机视觉生命周期的各个阶段,你可以更轻松地跟踪数据集更改、比较不同版本的性能,并持续完善数据以获得更好的结果。

图 1. 在 Ultralytics Platform 中查看数据集图像的示例(来源)
本文将深入介绍 Ultralytics Platform 如何帮助你跟踪、比较和改进数据集,从而构建更可靠的计算机视觉模型。我们开始吧!
数据集管理对计算机视觉的重要性#
计算机视觉模型的性能与其训练数据密切相关。模型准确率,也就是预测正确的频率,不仅取决于算法,还取决于数据集对现实条件的代表性。
简单来说,模型直接从数据中学习模式,因此数据集中的任何缺失、偏差或不一致都可能影响模型的预测方式。换句话说,数据质量差、标注错误,或未能充分覆盖图像中的现实变化(例如不同的光照条件、目标角度、背景或遮挡程度),都可能显著降低准确率,即使模型架构本身很强大。
模型微调同样如此:微调是指在新数据或更新后的数据上继续训练预训练模型,使其更好地适应特定用例或环境。由于模型准确率高度依赖数据,妥善管理数据至关重要。
数据集管理包括整理、标注并持续更新数据,以确保数据准确且相关。这有助于随着时间推移提升性能,尤其是在使用新数据重新训练或微调模型时。
数据集质量如何影响现实环境中的可靠性#
计算机视觉用例(例如安全监控系统)很好地说明了妥善管理数据为何至关重要。这些系统需要在各种现实条件下可靠运行,包括不同的光照环境、摄像头角度、人群密度和局部遮挡情况。
如果训练数据未涵盖这些变化,或者缺少不同场景和条件下目标外观的多样性,模型可能难以准确检测目标。例如,主要使用光线充足、场景整洁的图像训练的模型,在低光照环境或拥挤场景中可能表现不佳。在安全系统中,这可能导致漏报事件或误报。
为避免这种情况,数据集不仅要保持干净、标注准确,还要具备良好的平衡性并持续更新。这意味着要找出数据缺口,随着条件变化添加新样本,并确保不同类别和环境得到均衡呈现。
数据集越完整、结构越清晰,模型就越能应对现实世界中的变化,并做出更可靠的预测。
数据集管理的关键方面#
那么,数据集管理具体包括什么?它涉及整理、标注和维护数据,确保数据在模型开发过程中得到有效利用。
例如,整理数据包括为数据集建立结构,并将其划分为训练集、验证集和测试集。训练集用于教模型学习,验证集用于监控性能并指导开发过程中的调整,而测试集则用于评估最终模型在完全未见过的数据上的表现。
标注则是为图像添加类别标签、边界框或分割掩码等信息。由于模型依赖这些标注进行学习,因此准确性和一致性至关重要,能够帮助模型学习有意义的模式并做出可靠的预测。
此外,维护数据集还包括定期检查和更新数据。这可能包括修正标注错误、移除低质量或重复数据,以及添加新样本来覆盖缺失案例或不断变化的条件。
从更广泛的角度来看,数据集管理是一项持续进行的工作。随着模型评估和新数据收集的进行,数据集需要不断更新,以反映现实条件和边缘案例。跟踪这些更新并比较不同版本,有助于团队了解哪些变化提升了性能,以及还需要进行哪些改进。
使用 Ultralytics Platform 管理数据集#
Ultralytics Platform 在统一环境中提供结构化的数据集管理工作流,涵盖从数据准备到导出的各个环节。它旨在同时支持个人开发者和团队,让你无论独立工作还是跨项目协作,都能更轻松地一致管理数据集。
每个阶段都旨在简化数据集在模型开发生命周期中的整理、处理和使用方式。将这些步骤集中到一处后,平台便能减少工作流分散的问题,让你更轻松地在各个工作流中保持一致性。
接下来,我们来逐步了解其中的关键环节,以及平台如何为每个环节提供支持。
将数据集上传到 Ultralytics Platform#
在平台上开始使用数据集的方式很灵活,你可以通过多种方式导入或复用数据。你可以上传自己的数据,也可以使用平台提供的公开数据集快速入门。你还可以克隆社区分享的现有数据集,并在其基础上继续构建。
平台的社区功能让你可以轻松探索和复用现有成果。你可以访问其他用户创建的数据集,其中包含数百万张图像和标注,无需自己收集并标注所有数据,就能快速开始。克隆数据集会在你的工作空间中创建一份副本,你可以在保留原始数据集的同时对副本进行修改和扩展。
上传时,平台支持单张图像、视频,以及 ZIP、TAR 或 GZ 等数据集压缩包。平台还支持 YOLO 和 COCO 等常用数据集格式,让你无需额外转换即可导入现有数据集和标注。此外,你还可以上传通过平台导出的 NDJSON 文件,从而轻松地在不同项目中重建或复用数据集。
数据上传后,平台会通过结构化流水线处理数据,包括验证文件格式和大小、按需调整图像尺寸、解析标注,以及生成数据集统计信息。
例如,视频会转换为帧以便用于训练,而图像则会经过优化和处理,以便更轻松地浏览和分析。处理完成后,你就可以在平台中使用数据集进行标注、分析和模型训练。
在 Ultralytics Platform 上标注数据#
上传后,你可以直接在平台中查看和标注数据集。平台内置了图像标注工具,支持多种计算机视觉任务,例如目标检测、实例分割、姿态估计、有向边界框(OBB)检测和图像分类。

图 2. 使用 Ultralytics Platform 标注数据(来源)
你可以使用这些工具手动创建标注,也可以借助 SAM 驱动的智能标注等 AI 辅助功能加快标注速度。使用 SAM 时,你可以通过与图像交互来生成掩码、边界框或有向框,在保持准确性的同时加快标注流程。
通过 Ultralytics Platform 分析数据集质量#
除了准备和标注数据,了解数据集质量对于构建可靠的计算机视觉模型也至关重要。如果无法清晰了解类别分布、标注质量、数据集划分,以及数据在不同条件下的分布情况,就很难发现影响模型性能的问题。
Ultralytics Platform 内置了多种功能,帮助你更有效地分析数据集。你可以直接在数据集界面中查看这些分析结果,包括 Images、Classes 和 Charts 等选项卡。
在 Charts 选项卡中,你可以查看数据集级别的统计信息,例如划分分布(训练集、验证集和测试集)、类别频率,以及显示目标在图像中出现位置的标注热力图。
Classes 选项卡会按类别细分标注数量,让你更轻松地发现类别不平衡。与此同时,Images 选项卡会显示图像级别的详细信息,例如尺寸、标注数量,以及标签在各张图像中的分布情况。
这些分析结果有助于你发现类别不平衡、场景缺失或数据分布不均等问题。例如,你可能会发现某些类别的样本很少,或者大多数标注都集中在图像的特定区域。
除了数据分析,平台还支持数据集整理和增强,也就是通过修复或移除有问题的数据来完善数据集,并创建现有数据的变体以提升模型性能。你可以直接在平台中更新标注、添加新数据,或根据分析结果重新划分数据集,从而完成这些改进。
从 Ultralytics Platform 导出数据集#
准备并验证数据集后,你就可以将其导出到不同环境中使用。这样你可以灵活地在自己偏好的环境中使用计算机视觉数据,无论是在本地、云端训练模型,还是在其他工具和工作流中使用。
Ultralytics Platform 支持多种导出格式,包括 YOLO、COCO 和 NDJSON,方便你将数据集集成到不同的训练工作流和工具中。

图 3. 从 Ultralytics Platform 导出数据集(来源)
导出数据集会创建一份特定时间点的数据固定快照,其中包含图像、标注和数据集结构。这很有用,因为数据集往往会随着新数据的添加、标注的更新或数据集划分的调整而发生变化。通过导出快照,你可以保留某次训练所用数据集的确切版本。
这样一来,之后重现结果就更简单了,因为你可以再次使用相同的数据配置训练模型,并比较不同数据集版本的性能。例如,你可以评估添加新图像或修正标注是否真的提升了模型准确率,而不必猜测发生了哪些变化。
导出任务会异步处理,完成后即可下载数据集,并在本地、云端或离线训练环境中使用。
通过在 Ultralytics Platform 上迭代改进数据集质量#
在机器学习和深度学习工作流中,即使模型已经部署,数据集管理仍需继续,因为现实数据往往与训练数据有所不同。
模型接触新的输入数据后,数据集中的缺口(例如缺少低光照环境、不同摄像头角度、遮挡或拥挤场景等情况)以及标注错误会变得更加明显,因此需要随着时间推移不断完善数据。
改进数据集有多种方式。你可以添加新的图像或视频,覆盖低光照环境、不同摄像头角度、遮挡或拥挤场景等缺失情况,从而减少数据中的盲区。
同时,确保标注准确且一致,例如正确标记目标并提供精确的边界框或掩码,有助于模型学习更可靠的模式。
通常可以遵循一个简单的循环:训练模型、评估结果、找出错误、改进数据集,然后重新训练。每个步骤都有助于发现标注错误、数据缺失或代表性不足的案例等问题。
假设你正在开发一套实时零售货架监控系统,用于检测商店中的商品。数据集的早期版本可能未包含某些商品类型、光照条件或拥挤的货架布局。在评估过程中,你可能会发现模型难以检测这些情况下的商品。
为了提升性能,你可以收集涵盖这些缺失场景的新图像,并在需要时更新标注。随着时间推移,重复这一过程有助于模型在现实条件下变得更加准确可靠。
Ultralytics Platform 将数据集更新与训练和评估连接起来,为这一工作流提供支持。借助内置的实验跟踪和性能指标,你可以更轻松地监控进展,并持续改进数据集。
使用 Ultralytics Platform 跟踪数据集更改#
我们简要介绍了数据集如何在模型开发过程中不断演进。随着新数据的加入、标注的完善和类别的更新,跟踪这些更改对于保持数据质量和确保模型性能一致至关重要。
以下是 Ultralytics Platform 中支持数据集跟踪和版本控制的一些关键功能:
- 数据集版本管理:你可以将数据集创建为固定版本,并以 NDJSON 快照的形式保存。每个版本都会记录特定时间点的关键信息,例如图像数量、类别数量、标注数量和数据集大小。这些版本会被保存,之后也可以下载,让你更轻松地重现实验并比较数据集不同状态下的结果。
- **Versions 选项卡:**所有数据集版本都集中显示在 Versions 选项卡中,你可以在其中查看版本历史、为更改添加说明,并跟踪数据集随时间的变化。
- **关联模型:**Models 选项卡会显示在数据集上训练的所有模型,包括 mAP 等指标和训练详情。数据集版本会与训练任务关联,帮助你了解数据变化对模型性能的影响。
- **Errors 选项卡:**Errors 选项卡会突出显示处理失败的文件,并提供错误详情和建议。这样你就能在训练前发现并修复损坏文件或不受支持的格式等问题。
- **数据集界面(Images 和 Classes 选项卡):**这些视图允许你浏览图像、检查标注、管理类别标签并分析类别分布。筛选、排序和查找未标注图像等功能,让你更轻松地持续监控数据集质量。
- **统计信息和图表:**内置的数据可视化功能(例如划分分布、类别频率和标注热力图)有助于跟踪数据分布的变化,并在数据集不断演进时发现不平衡问题。

图 4. 在 Ultralytics Platform 上分析数据集类别分布的示例(来源)
在 Ultralytics Platform 中将数据集连接到训练和部署#
Ultralytics Platform 将 AI 模型开发的不同阶段连接到一条流水线中,简化了从原始数据到可投入生产的视觉 AI 应用的整个过程。
准备并标注好数据集后,你可以直接在平台中使用数据集训练计算机视觉模型,例如 Ultralytics YOLO26。训练期间,你可以使用内置仪表板监控性能指标、跟踪实验,并评估模型的学习效果。

图 5. 在 Ultralytics Platform 上查看模型训练指标(来源)
训练完成后,你可以直接在浏览器中使用新图像测试模型,评估预测结果,并在部署前找出需要改进的地方。模型表现良好后,就可以将其部署到生产环境中。
平台支持将模型导出为多种格式,也支持通过推理服务和专用端点进行部署,让模型可以在不同环境中运行。
部署后,内置监控工具可以帮助你持续跟踪系统性能,包括使用情况和模型行为相关的指标。这样一来,你就可以更轻松地维护和改进在现实应用中运行的视觉 AI 系统。
使用 Ultralytics Platform 管理数据集的最佳实践#
使用 Ultralytics Platform 管理数据集时,请留意以下关键事项:
- **使用筛选器查找缺口:**使用筛选工具找出未标注或代表性不足的数据,从而更轻松地完成标注并扩大数据覆盖范围。
- **尽早修复错误:**使用 Errors 选项卡进行质量控制,在训练前发现上传失败、文件损坏或格式不受支持等问题。
- **持续更新数据集:**随着新数据和边缘案例的出现,及时添加数据并修正标注。这有助于扩大覆盖范围,并确保模型在现实场景中可靠运行。
- **谨慎管理数据集划分:**确保训练集、验证集和测试集之间保持良好平衡。你可以手动重新划分数据,也可以在需要时使用自动重新分配功能。
如需进一步了解 Ultralytics Platform,请参阅官方 Ultralytics 文档。
要点回顾#
随着计算机视觉项目规模不断扩大,有效管理数据集变得与模型开发同样重要。结构化的数据集管理方法有助于提高数据质量、简化工作流,并随着时间推移提升模型性能。
Ultralytics Platform 将数据集管理、训练和部署整合到一个工作流中,简化了这一过程。采用结构化的数据集管理方法后,团队可以降低复杂性、提高效率,并构建更具扩展性和可靠性的计算机视觉系统。
加入不断壮大的社区,并访问我们的 GitHub 仓库,获取 AI 资源。立即开始构建视觉 AI 应用,请查看我们的许可选项。访问我们的解决方案页面,了解 AI 如何应用于农业,推动农业转型,以及医疗健康领域的视觉 AI如何塑造未来。









