Ultralytics YOLO27:
指南

探索 2025 年最佳计算机视觉数据集

和我们一起深入了解 2025 年最佳计算机视觉数据集。了解多样且高质量的数据集如何推动更智能的视觉 AI 解决方案。

ABAbirami Vina8 min read
用于训练模型的计算机视觉数据集

你知道吗,数据几乎参与了你每天所做的所有事情?观看视频、拍摄照片或查看 Google 地图,都会为由超过 750 亿台联网设备捕获的信息持续流动贡献数据。这些数据构成了人工智能(AI)的基础。事实上,像 Ultralytics YOLO11 这样的先进计算机视觉模型依赖视觉数据来识别模式、理解图像,并解读我们周围的世界。

有趣的是,数据的价值并不只是数量。数据的组织和准备质量更加重要。如果数据集杂乱或不完整,就可能导致错误。然而,当数据集干净且多样时,无论是识别人群中的物体,还是分析复杂视觉内容,都能帮助计算机视觉模型取得更好的表现。高质量数据集会带来完全不同的效果。

本文将探索 2025 年最佳计算机视觉数据集,并了解它们如何帮助构建更准确、更高效的计算机视觉模型。让我们开始吧!

什么是计算机视觉数据集?#

计算机视觉数据集是图像或视频的集合,可帮助计算机视觉系统学习理解和识别视觉信息。这些数据集带有标签或注释,帮助模型识别数据中的物体、人物、场景和模式。

它们可用于训练计算机视觉模型,帮助模型改进人脸识别、物体检测或场景分析等任务。数据集越好——组织有序、多样且准确——视觉 AI 模型的表现就越好,从而为日常生活带来更智能、更实用的技术。

如何构建计算机视觉数据集#

构建计算机视觉数据集就像准备学习笔记,教会某人如何观察和理解世界。这一过程始于收集与你正在开发的具体应用相匹配的图像和视频。

理想的数据集应包含目标物体的多样化示例,这些示例从不同角度、在各种光照条件下,以及不同背景和环境中采集。这样的多样性可以确保计算机视觉模型准确学习识别模式,并在真实场景中可靠运行。

构建完美视觉数据集的示意图

图 1。构建完美的视觉数据集。图片由作者提供。

收集相关图像和视频后,下一步是进行数据标注。这一过程包括为数据添加标签、注释或描述,使 AI 能够理解每张图像或每段视频包含的内容。

标签可以包括物体名称、位置、边界或其他相关细节,帮助模型准确训练并识别和理解视觉信息。数据标注会将简单的图像集合转换为结构化数据集,可用于训练计算机视觉模型。

模型训练需要高质量数据#

你可能想知道,什么样的数据集才算高质量。准确标注、多样性和一致性等许多因素都会影响数据集质量。例如,如果多名标注人员在标注用于识别猫耳朵的目标检测数据集,其中一人将猫耳朵标注为头部的一部分,而另一人则将其单独标注为耳朵,这种不一致会使模型困惑,并影响其正确学习的能力。

下面快速概览一下理想计算机视觉数据集应具备的特征:

  • 清晰的标签:每张图像都经过准确标注,标签保持一致且精确。
  • 多样化数据:数据集包含不同的物体、背景、光照条件和角度,帮助模型在各种情况下良好运行。
  • 高分辨率图像:清晰、细节丰富的图像能让模型更容易学习和识别特征。

Ultralytics 支持多种数据集#

Ultralytics YOLO 模型(例如 YOLO11)经过设计,可使用特定的 YOLO 文件格式处理数据集。虽然将你自己的数据转换为这种格式很容易,但我们也为希望立即开始实验的用户提供了无繁琐操作的选项。

Ultralytics Python 软件包支持广泛的计算机视觉数据集,让你无需额外设置即可使用目标检测、实例分割或姿态估计等任务开展项目。

用户只需在训练函数中将数据集名称指定为参数之一,即可轻松访问 COCO、DOTA-v2.0、Open Images V7 和 ImageNet 等可直接使用的数据集。执行此操作后,数据集会自动下载并完成预配置,让你可以专注于构建和优化模型。

2025 年排名前五的计算机视觉数据集#

视觉 AI 的进步依赖多样化的大规模数据集,它们推动创新并促成突破。下面来看看由 Ultralytics 支持、正在影响计算机视觉模型的一些重要数据集。

ImageNet 数据集#

ImageNet 由 Fei-Fei Li 及其普林斯顿大学团队于 2007 年创建,并于 2009 年推出,是一个包含超过 1,400 万张带标签图像的大型数据集。它广泛用于训练系统识别和分类不同物体。其结构化设计使其特别适合用于教导模型准确地对图像进行分类。虽然文档完善,但它主要关注图像分类,缺少目标检测等任务所需的详细注释。

下面来看看 ImageNet 的一些主要优势:

  • 多样性: ImageNet 的图像涵盖超过 20,000 个类别,提供了规模庞大且多样化的数据集,有助于提升模型训练效果和泛化能力。
  • 结构化组织: 图像通过 WordNet 层级体系进行精细分类,便于高效检索数据和系统化训练模型。
  • 完善的文档:大量研究和多年的探索使 ImageNet 对初学者和专家都很友好,为计算机视觉项目提供有价值的洞见和指导。

不过,和任何数据集一样,它也存在局限。以下是需要考虑的一些挑战:

  • 计算需求: 其庞大的规模可能给计算资源有限的小型团队带来挑战。
  • 缺少时间序列数据: 由于只包含静态图像,它可能无法满足需要视频或基于时间的数据的应用需求。
  • 图像过时: 数据集中的一些图像年代较早,可能无法反映当前的物体、风格或环境,从而降低其与现代应用的相关性。

DOTA-v2.0 数据集#

DOTA-v2.0 数据集是一个大规模航空图像集合,DOTA 代表航空图像目标检测数据集,专为定向边界框(OBB)目标检测而创建。在 OBB 检测中,旋转边界框用于更准确地与图像中物体的实际方向对齐。这种方法尤其适用于航空影像,因为其中的物体通常以各种角度出现,从而实现更精确的定位和更好的整体检测效果。

该数据集包含超过 11,000 张图像和 18 个物体类别中的 170 多万个定向边界框。图像尺寸范围从 800×800 到 20,000×20,000 像素,包含飞机、船舶和建筑物等物体。

DOTA-v2.0 数据集中的示例图像和注释

图 2。 DOTA-v2.0 数据集中的图像和注释示例。图片由作者提供。

由于注释详细,DOTA-v2.0 已成为遥感和航空监控项目的热门选择。以下是 DOTA-v2.0 的一些主要特征:

  • 多样化的物体类别: 它涵盖车辆、港口和储油罐等多种物体类型,让模型接触各种现实世界中的物体。
  • 高质量注释: 专业标注人员提供了方向精确的边界框,清晰展示物体的形状和方向。
  • 多尺度图像: 数据集包含不同尺寸的图像,帮助模型学习检测小尺度和大尺度物体。

DOTA-v2 具有许多优势,但用户也应注意以下局限:

  • 额外的下载步骤: 由于 DOTA 数据集的维护方式,DOTA-v2.0 需要额外的设置步骤。你需要先下载 DOTA-v1.0 图像,然后添加 DOTA-v2.0 的额外图像和更新后的注释,才能完成数据集。
  • 复杂的注释: 在模型训练期间,处理定向边界框可能需要额外的工作。
  • 范围有限: DOTA-v2 专为航空图像设计,因此在该领域之外的一般目标检测任务中用途较小。

Roboflow 100 数据集#

Roboflow 100(RF100)数据集由 Roboflow 在 Intel 的支持下创建。它可用于测试和评估目标检测模型的表现。该基准数据集包含从超过 90,000 个公共数据集中选出的 100 个不同数据集,其中有超过 224,000 张图像和 800 个物体类别,涵盖医疗保健、航空视图和游戏等领域。

以下是使用 RF100 的一些主要优势:

  • 广泛的领域覆盖: 它包含来自七个领域的数据集,例如医学影像、航空视图和水下探索。
  • 促进模型改进: RF100 中的多样性和特定领域挑战揭示了当前模型的不足,推动研究朝着更具适应性和鲁棒性的目标检测解决方案发展。
  • 统一的图像格式: 所有图像都会调整为 640x640 像素。这有助于用户训练模型,而无需调整图像尺寸。

尽管 RF100 具有优势,但也存在一些需要注意的缺点:

  • 任务范围有限: RF100 专为目标检测设计,因此无法支持分割或分类等任务。
  • 侧重基准评测: RF100 主要作为基准评测工具设计,而不是用于训练面向现实应用的模型,因此其结果可能无法完全反映实际部署场景。
  • 注释差异: 由于 RF100 汇集了众包数据集,注释质量和标注方式可能存在不一致,从而影响模型评估和微调。

COCO(上下文中的常见对象)数据集#

COCO 数据集是最广泛使用的计算机视觉数据集之一,提供超过 330,000 张带有详细图像注释的图像。它专为目标检测、分割和图像字幕生成而设计,是许多项目的宝贵资源。其详细标签包括边界框和分割掩码,可帮助系统精确学习分析图像。

该数据集以灵活性著称,可用于从简单到复杂的各种任务。它已成为视觉 AI 领域的标准,经常用于挑战赛和竞赛,以评估模型性能。

它的一些优势包括:

  • 多样且真实的数据:数据集包含来自现实场景的图像,其中有多个物体、遮挡和不同的光照条件。
  • 强大的社区和研究应用: COCO 数据集用于大型机器学习竞赛和研究,拥有完善的文档、预训练模型以及活跃的社区支持。
  • 丰富且详细的注释: COCO 数据集提供高度详细的注释,包括物体分割、关键点和字幕,非常适合需要精确视觉理解的项目。

同时,也需要注意以下一些限制因素:

  • 较高的计算要求: 由于规模庞大且结构复杂,在 COCO 上训练模型可能需要大量计算资源,这对硬件有限的团队来说颇具挑战。
  • 数据不平衡: 某些物体类别的图像数量明显多于其他类别,可能导致模型训练产生偏差。
  • 复杂的注释结构: 数据集的详细注释虽然很有价值,但对于缺乏结构化视觉 AI 数据集处理经验的初学者或小型团队来说,可能难以掌握。

Open Images V7 数据集#

Open Images V7 是由 Google 整理的大型开源数据集,包含超过 900 万张图像,并提供 600 个物体类别的注释。它包含多种注释类型,非常适合处理复杂的计算机视觉任务。其规模和深度为训练和测试计算机视觉模型提供了全面的资源。

Open Images V7 数据集中的示例图像

图 3。一览 Open Images V7 数据集。图片由作者提供。

此外,Open Images V7 数据集在研究领域广受欢迎,为用户提供了大量可供学习的资源和示例。不过,其庞大的规模可能使下载和处理耗时较长,尤其是对小型团队而言。另一个问题是,部分注释可能不一致,需要额外工作来清理数据;同时,集成过程也不一定顺畅,可能需要进行额外准备。

选择合适的数据集#

选择合适的数据集是确保计算机视觉项目成功的重要环节。最佳选择取决于你的具体任务——找到合适的匹配项有助于模型学习正确的能力。数据集还应能与你的工具轻松集成,让你可以更多地专注于构建模型,而不是排查问题。

选择合适数据集的影响因素示意图

图 4。选择合适数据集的影响因素。图片由作者提供。

要点总结#

高质量数据集是任何计算机视觉模型的基础,可帮助系统准确学习理解图像。多样化且注释完善的数据集尤其重要,因为它们能让模型在真实场景中可靠运行,并减少由数据有限或质量不佳造成的错误。

Ultralytics 简化了访问和使用计算机视觉数据集的流程,让你更容易为项目找到合适的数据。选择合适的数据集是构建高性能模型的关键步骤,能够带来更精确、更具影响力的结果。

加入我们的社区,并探索我们的 GitHub 代码仓库,进一步了解 AI。在我们的解决方案页面上,了解医疗保健领域的计算机视觉自动驾驶汽车中的 AI等最新进展。查看我们的许可选项,立即迈出开始使用计算机视觉的第一步!

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅