Ultralytics YOLO27:
指南

什么是计算机视觉中的合成数据?概览

探索 AI 模型训练的合成数据如何应用于医疗保健、机器人技术等多个行业的计算机视觉场景。

ABAbirami Vina5 min read
展示不同人体姿势和光照变化的合成数据集

数据一直是分析、人工智能(AI)等领域发展的驱动因素。事实上,我们收集、生成和使用数据的方式正在塑造智能系统的未来。例如,自动驾驶汽车依赖数百万张带标注的图像和传感器读数,从街道标志到行人移动轨迹,以学习如何安全地在道路上行驶。

推动这一进步的最重要数据类型之一,尤其是在自动驾驶汽车和安防等领域,就是图像和视频等视觉数据。

具体来说,使机器能够解读这些视觉信息的 AI 领域称为计算机视觉。它帮助系统像人类一样理解和分析视觉输入,支持人脸识别、交通标志检测和医学图像分析等任务。

然而,从现实世界收集大规模、高质量的视觉数据集可能耗时、成本高,而且往往会引发隐私问题。因此,研究人员正在积极探索利用合成数据这一概念。

合成数据是指与现实世界中的图像和视频高度相似的人工生成视觉数据。它通过 3D 建模、计算机模拟以及生成对抗网络(GANs)等生成式 AI 方法创建,这些方法从真实数据中学习模式,以生成逼真的新样本。

预计合成数据很快将在AI 开发中发挥关键作用——Gartner 预测,到 2030 年,合成数据的重要性将超过现实世界数据。本文将探讨计算机视觉语境下的合成数据是什么、如何生成,以及它在现实场景中的应用。现在就开始吧!

计算机视觉中的合成数据是什么?#

假设你想训练一个视觉 AI 模型,使其能够在各种环境和条件下检测物体。如果只依赖现实世界数据,可能会很困难,有时还会让人感到受限。

与此同时,合成数据可以用来创建合适的数据集,其中包含处于各种人工生成条件下的物体。借助3D 建模和模拟等工具,开发者可以精确控制光照、角度和物体位置等因素,生成图像。相比现实世界数据,这为模型训练提供了更大的灵活性。

当现实世界数据难以或无法收集时,合成数据尤其有用。例如,要训练模型识别处于各种姿势的人,如跑步、蹲下或躺下,就需要在许多不同的场景、角度和光照条件下拍摄数千张照片。

另一方面,借助合成数据,开发者可以轻松生成带有准确标注的这些变化,从而节省时间和精力,同时提升模型性能。

包含不同人体姿势和光照变化的合成数据集

图 1. 包含不同人体姿势和光照变化的合成数据集(来源)。

AI 中的合成数据与真实数据#

接下来,让我们更仔细地看看合成数据与真实数据之间的差异。在训练 AI 模型时,两者各有优缺点。

例如,在真实数据难以收集时,合成数据很有用,但它可能无法捕捉现实生活中的每一个细节。同时,真实数据更加真实,但可能难以获取,标注耗时,而且可能无法涵盖所有情况。

通过结合合成数据和真实数据,开发者可以兼得两者的优势。这种平衡有助于 AI 模型更准确地学习,在不同场景中实现更好的泛化,并减少偏差。

AI 中合成数据与真实数据的对比

图 2. AI 中的合成数据与真实数据。图片由作者提供。

计算机视觉模型的数据生成概览#

从使用 3D 工具构建虚拟世界,到使用生成式 AI 生成图像,以下是为计算机视觉模型创建合成训练数据的一些常见方法:

  • 3D 建模:开发者使用 3D 软件创建数字对象和场景。这可以全面控制光照、摄像机角度和物体位置等因素,有助于生成逼真的人物、车辆和环境图像。
  • 模拟:利用基于物理的引擎重现交通或工厂环境等现实世界场景。模拟有助于在机器人和自动驾驶汽车等领域安全地生成训练数据。
  • 生成对抗网络:GANs 是一种由两个网络组成的深度学习模型:一个用于生成图像,另一个用于评估图像。两者协同工作,通过从真实样本中学习,生成高度逼真的图像,例如人脸或街景。
  • 程序化生成:这种技术使用预定义规则或数学模型,自动生成地形、建筑物或纹理等复杂视觉结构。它常用于游戏和模拟平台,可以在极少人工输入的情况下生成大规模、多样化的数据集。
  • 域随机化:它可以随机改变合成场景中的光照、颜色和物体形状等因素。这项技术旨在帮助模型专注于真正重要的内容,使其更能适应现实世界环境。

基于 3D 模型、合成数据集和真实数据集的图像示例

图 3. 数据示例:(a) 基于 3D 模型的图像,(b) 合成的多物体场景,以及 (c) 真实数据集图像(来源)。

使用合成数据训练视觉 AI 模型#

现在我们已经讨论了创建合成数据的一些不同方法,接下来让我们了解它如何用于训练 AI 模型。

生成后,合成数据通常可以像现实世界数据一样直接集成到训练流程中。它通常包含必要的标注,例如物体标签、边界框或分割掩码,这意味着它可以用于监督学习任务。在这类任务中,模型从带标注的输入-输出对中学习,而无需手动标注。

训练期间,模型处理合成图像,学习检测特征、识别模式和分类物体。这些数据可以用于从头构建模型的初始版本,也可以用于丰富现有数据集,从而帮助提升模型性能。

在许多工作流中,合成数据还用于预训练,让模型在使用现实世界样本进行微调之前获得广泛的基础理解。同样,它也用于通过引入受控变化来增强数据集,例如不同的光照条件、角度或罕见物体类别,从而提升泛化能力并减少过拟合。

通过结合合成数据和真实数据,团队可以训练出更稳健的模型,使其在各种条件下都能表现良好,同时减少对耗时且昂贵的手动数据收集工作的依赖。

合成数据在计算机视觉中的现实应用#

随着合成数据变得更加实用且易于获取,我们开始看到它被应用于各种现实世界的视觉 AI 用例。让我们探索一些正在使用合成数据的最具影响力的计算机视觉应用

使用合成数据进行自动驾驶汽车目标检测#

教会自动驾驶汽车安全行驶,需要使用涵盖各种场景的数据训练模型,包括罕见或危险的情况。然而,为这些边缘情况收集现实世界数据可能很有挑战,有时还不安全。合成数据可以创建相应场景,让模型学习在困难情况下检测物体。它还可以模拟不同的传感器配置,这一点很有帮助,因为并非所有自动驾驶汽车都使用相同的硬件。

NVIDIA 的 DRIVE Sim平台就是一个很好的例子。它利用照片级真实感 3D 模型、虚拟环境和传感器模拟来创建高质量的合成数据。它还可以从单张图像生成多个驾驶角度的图像。使用这样的合成数据,有助于减少昂贵现实世界测试的需求,同时仍为模型提供有效学习所需的多样性。

从单张图像创建多个驾驶视角

图 4. 从一张图像创建多个驾驶视角(来源)。

利用合成数据减少医学影像 AI 中的偏差#

支持目标检测和实例分割等任务的计算机视觉模型,例如Ultralytics YOLO11,可以针对医学影像应用进行定制训练。然而,现实世界的训练数据通常包含偏差,因为它可能无法充分代表所有人口群体的患者。

例如,皮肤癌在肤色较深的人群中的诊断频率较低,导致这些人群的数据有限。这种不平衡可能造成误诊和医疗结果不平等,尤其是在组织病理学、胸部 X 光和皮肤病学等领域。

合成图像可以帮助缩小这一数据差距。通过生成更多样化的样本,例如不同的组织异常、广泛的肺部疾病,以及具有不同病变类型的各种肤色,合成数据可以帮助提升模型在代表性不足群体中的性能。

研究人员目前正在开发和验证合成数据集,以支持这些目标。他们还在探索如何利用合成数据测试医疗工具和治疗策略,而不依赖真实患者记录,从而在保护患者隐私的同时加速研究。通过这些工作,合成数据正在为更加包容、准确且符合伦理的医疗 AI 系统铺平道路。

利用合成数据推进精准农业 AI#

构建用于农业应用的视觉 AI 系统,需要获取大量带标注的数据。然而,收集和标注作物、疾病及田间状况的图片速度缓慢、成本高昂,而且常常受天气、生长季节或某些区域难以到达等因素限制。

这些挑战使计算机视觉模型难以处理检测植物疾病、监测作物或预测产量等任务。合成数据可以在这里发挥作用——通过模拟不同的农业环境,生成有用的训练样本。

使用合成图像提升植物疾病检测效果

图 5. 使用合成图像提升疾病检测效果(来源)。

要点总结#

使用合成数据是 AI 模型训练向前迈进的重要一步,尤其适用于现实世界数据有限或难以获取领域中的计算机视觉系统。与完全依赖真实照片或视频不同,后者可能成本高、耗时长或引发隐私问题,合成数据让我们能够按需生成逼真的带标注图像。

它使训练视觉 AI 模型来执行自动驾驶、疾病检测或作物监测等任务变得更加容易。随着 AI 持续发展,合成数据必将在加速创新和提升各行业可及性方面发挥更大的作用。

在我们的GitHub 代码仓库中进一步了解 AI,并加入不断壮大的社区。探索自动驾驶汽车中的 AI农业中的计算机视觉等应用的影响。了解我们的许可选项,让你的视觉 AI 项目落地。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅