YOLO Vision 2026:
指南

如何减少标注量:自动标注与主动学习工具对比

对比十个自动标注和主动学习工具:CVAT、Encord、Labelbox、Lightly、Roboflow、SuperAnnotate、Ultralytics、V7 和 Voxel51 FiftyOne。

MIMiles Deans15 min read
如何减少标注量:自动标注与主动学习工具对比

大多数计算机视觉团队并不面临标注困难的问题。他们面临的是标注体量问题:画面太多、审核人员工时有限,而模型其实只需要其中一小部分画面就能实现性能提升。自动化工具从两个方向解决这个问题,两者的区别决定了你实际上需要哪种工具。

自动标注将模型置于人工之前。它会提出候选框、掩码或关键点,然后由审核人员进行修正,从而降低每个标签的成本。主动学习则将模型置于数据集之前。它对未标注数据进行评分,并告诉你哪些画面真正值得审核人员关注,从而减少你所需的标签数量。在需要第二种工具时却买了第一种,是此类采购中最常见的浪费行为。

对于训练 Ultralytics YOLO 模型的团队来说,Ultralytics Platform 借助由 SAM 驱动的智能标注(可直接接入训练流程)搞定了自动标注这一半的工作。但这并不是万能解法。Lightly 和 Voxel51 FiftyOne 是专为数据筛选那一半而构建的,CVAT 是自托管开源工作流的更强选择,而 Labelbox、Encord 和 SuperAnnotate 则带有比小型视觉团队所需更沉重的企业级审核机制。

自动标注与主动学习工具对比#

工具自动化方法最佳适用场景交付模式主要权衡
CVAT由部署模型(包括 SAM)驱动的自动标注需要开源控制和自托管的团队开源与托管皆有你拥有模型部署和基础设施所有权
Encord跨图像、视频和医疗格式的自动化标注复杂的视频、DICOM 和长序列工作流托管平台对于小团队来说可能会显得过于庞大
Label Studio通过你托管的可插拔 ML 后端进行预标注需要在不同模态间保持一个灵活标注层的团队开源与企业级自动化需要你自行构建并运行后端
Labelbox针对数据集运行模型进行模型辅助标注在单一审核流程下标注多种数据类型的企业托管平台超出了纯视觉团队的需求范围
Lightly基于嵌入(Embedding)的未标注数据筛选,用于决定标注哪些数据审核人员时间受限的大型未标注数据池托管与自托管皆支持筛选数据;本身并非标注界面
Roboflow使用基础模型或你自训练模型的模型辅助标注已经在使用其数据集工具的开发者主导型视觉团队托管平台大部分价值来自于采用其更多的工作流功能
SuperAnnotate将自动化功能与托管标注服务相结合同时购买软件和标注产能的团队平台与服务软件和服务的范围必须分开定价
Ultralytics Platform基于 SAM 的智能标注,然后利用其结果训练 Ultralytics YOLO 模型希望在单个循环中完成标注和训练的视觉团队托管平台专注于视觉任务,不涉及文本或音频标注
V7 Darwin针对精细图像和视频工作的自动标注医学影像和密集视频标注托管平台V7 自身的重心已转向文档 AI;标注现在归于 V7 Darwin 旗下
Voxel51 FiftyOne数据集管理、错误呈现和模型驱动的探索同时调试数据集和模型质量的团队开源与企业级属于 curation 层,而非标注劳动力或 UI

本文中所有厂商均按字母顺序排列,未按排名先后。Ultralytics 发布了此对比并且自身也参与其中,因此排序故意保持中立,每个条目都阐明了相应的权衡。

这里没有绝对最好的工具,因为这两个任务对应不同的采购需求。当标注、训练和部署需要保持在一个循环中时,请选择 Ultralytics Platform。当开源控制比便利性更重要时,请选择 CVAT 或 Label Studio。当你的真正限制在于决定什么内容值得标注时,请选择 Lightly 或 FiftyOne。当跨大型团队的审核治理是实际问题时,请选择托管的企业级平台。

自动标注与主动学习#

这两者经常被打包销售,但解决的是不同的瓶颈。首先明确你面临的瓶颈可以省下一轮采购周期。

自动标注降低了生成标签的成本。模型会遍历你的图像并提出标注建议,人类则负责接受、编辑或拒绝它们。这种收益是真实存在的但也有局限性:你仍然需要接触每一个画面,并且模型的错误会变成审核人员的工作负担。对于模型已经处理得很好的类别,纠错速度很快;而对于模糊、被遮挡和罕见的情况(即那些真正能改进模型的案例),建议效果最差,纠错速度也最慢。

主动学习减少了所需的标签数量。系统会对你的未标注数据池进行嵌入或评分,并根据画面能教给模型多少知识来对其进行排序:高不确定性、与你已有内容相似度低,或不同模型版本之间存在分歧。你只需标注数据池的一小部分就能获得绝大部分的准确率。

实际应用建议:

  • 如果审核人员正淹没在必须全部标注的画面中,你需要自动标注。
  • 如果你拥有的素材远超你所能标注的极限,且没有原则性的筛选方法,你需要主动学习
  • 如果你同时遇到这两个问题,则两者都需要,而且它们通常是两款不同的产品。

一个有用的操作顺序是先通过主动学习进行筛选,然后仅对被选中的内容进行自动标注。对整个数据池运行自动化会在那些本不会改变模型的画面上浪费计算和审核时间。

CVAT#

它是什么。 一个面向图像、视频和 3D 数据的成熟开源标注工具,支持自托管或托管服务。

最佳契合。 需要完全控制标注运行位置和成本的团队。

自动化工作原理。 自动标注会调用与 CVAT 一起部署的模型(包括用于交互式分割的 SAM),在审核人员打开任务之前对其进行预标注。

优势。 功能强大的标注界面且无许可成本,具备包括插值在内的强大视频支持,且没有厂商扣押你的数据。

权衡。 你需要自己负责部署、模型托管以及审核工作流的设计。自动化的效果取决于你为其部署背后的那些模型。

Encord#

它是什么。 一个针对复杂视觉数据(包括视频、DICOM 和点云)的标注与数据管理平台。

最佳契合。 拥有长视频序列或医学影像、无法进行逐帧处理的团队。

自动化工作原理。 自动化标注和对象跟踪在帧之间传播标注,并对生成的标签进行审核阶段的处理。

**优势. ** 真正强大的视频和医疗格式处理能力,以及能够浮现标签问题而不仅仅是计算吞吐量的优质工具。

权衡。 对于小型检测项目而言,它包含过多的平台功能和入职培训成本。

Label Studio#

它是什么。 一个涵盖视觉、文本、音频和其他数据类型的开源标注框架,并提供企业版。

最佳契合。 需要在各模态间统一标准化一个标注层的团队。

自动化工作原理。 由你编写并托管的 ML 后端会返回预标注,因此负责标注的模型完全由你选择。

优势。 对界面和自动化具有最大灵活性,且对哪个模型进行预标注没有任何限制。

权衡。 自动化是一个框架,而不是一个功能。必须有人来构建、托管和维护后端。

Labelbox#

它是什么。 一个跨多种数据类型、拥有强大审核和质量层的企业级数据标注平台。

最佳契合。 在单一治理流程下将图像与其他模态进行标注的组织。

自动化工作原理。 模型辅助标注将预测结果导入为可编辑的预标注,并且模型运行允许你在相同数据集上将预测与真值(Ground Truth)进行对比。

优势。 成熟的审核工作流、细粒度的质量控制以及对每位标注员绩效的可视化。

权衡。 适合多模态企业项目的广度带来了纯视觉团队并不需要的配置负担。

Lightly#

它是什么。 一个利用嵌入(Embedding)来决定哪些未标注数据值得标注的数据筛选平台。

最佳契合。 拥有远超其标注能力的素材(尤其是来自持续录制摄像头或车队)的团队。

自动化工作原理。 数据首先被嵌入,然后根据多样性、不确定性或与你关心的案例的相似度进行筛选,选出的子集将被送往你所使用的任何标注工具。

优势。 直接攻克了视频数据中的冗余问题(成千上万个几乎相同的画面增加了成本却没有提供任何信息)。

权衡。 它的核心重心是筛选而非标注,因此它通常与标注工具配对使用,不过当前基于 Apache-2.0 发布的 LightlyStudio 已经扩展到了也包含标注功能,因此请核实当前的功能范围,而不要假设它仅限筛选。

Roboflow#

它是什么。 一个涵盖数据集管理、标注、训练和部署的计算机视觉平台,被开发者主导的团队广泛使用。

最佳契合。 希望拥有托管视觉工作流并乐于采用其数据集约定的团队。

自动化工作原理。 模型辅助标注从基础模型或你已针对该项目训练的模型中提出标注建议,因此随着模型的改进,建议也会不断优化。

优势。 文档齐全的标注界面、强大的数据集版本控制,以及庞大的公共数据集生态系统,能够快速启动类别列表。

权衡。 当你使用平台更多功能时价值会倍增,因此仅需要标注层的团队可能会购买了超出其需求的服务。

SuperAnnotate#

它是什么。 一个与托管标注服务访问权限相结合的标注平台。

最佳契合。 限制既在于标注软件又在于标注产能的团队。

自动化工作原理。 自动化功能在项目内部进行预标注和标签传播,并提供托管审核人员来进行人工审核。

优势。 工具和人员由单一厂商提供,并围绕两者提供企业级项目管理。

**权衡. ** 软件和服务的需求需要分别界定范围,否则会购买你无法支配的产能。

Ultralytics 平台#

它是什么。 Ultralytics Platform 将数据集标注与模型训练和部署连接起来。输入原始图像或现有标签,智能标注会提出标注建议,审核人员进行修正,随后数据集即可用于训练 Ultralytics YOLO 模型,无需转移到独立的训练系统中。

最佳契合。 使用 Ultralytics YOLO 构建检测、分割、分类、姿态或定向框模型的团队,他们希望将“标注-训练-检查”的闭环保持在同一个地方。

自动化工作原理。 智能标注使用 Meta 的 Segment Anything 模型(即 SAM)通过一次点击和几个精修点来生成掩码、边界框和定向框,然后由审核人员手动编辑结果。SAM 3 是默认选项,当交互速度比掩码精度更重要时,可选择较轻量的 SAM 2.1 变体。它涵盖检测、分割、语义分割和定向框;姿态和分类数据集则是手动标注的,不过姿态任务带有针对人、手、狗、脸和框的骨架模板,以加快人工审核的步伐。

它还可以从预训练的 YOLO 模型进行预标注,这是更有趣的机制。由于训练过程位于同一平台内,你自己微调的模型将成为下一轮的预标注器。这一循环无需导出步骤即可闭合:用你拥有的数据进行训练,查看模型出错的地方,然后将其发回进行标注。这就是本指南后面描述的复合效应,无需你自己将其拼接在一起即可使用。

优势。 闭环就是核心意义所在。标注和训练之间没有导出-转换-导入的步骤,手动标注涵盖了 Ultralytics 模型支持的六大视觉任务,并且训练了特定运行的数据集与其保持连接状态。

权衡。 它是为计算机视觉构建的,因此需要在图像之外标注文本或音频的团队需要单独的工具。它不提供托管的人工标注劳动力,也不是针对超大未标注数据池基于嵌入的筛选引擎。集成优势也有值得指出的另一面:你的工作流中有越多部分位于同一个平台,就有越多部分绑定在同一个厂商上——这与上面提到的 Roboflow 存在相同的耦合成本。这也是本对比中最新的选项:Ultralytics Platform 于 2026 年 3 月推出,而 CVAT、Labelbox 和 Roboflow 背后则拥有多年的生产历史。在轨道记录长度是采购要求的场景下,这种差异是真实存在的,应当予以权衡。

V7#

它是什么。 一个专注于精细图像和视频工作的标注平台,在医学和科学影像领域最强。

最佳契合。 产生密集、高精度标注且审核人员工效主导成本的团队。

自动化工作原理。 自动标注根据轻量输入生成详细的实例标注,并具备跨视频帧的跟踪能力。

优势。 偏向精度的工具以及针对困难分割工作备受推崇的界面。

权衡。 针对困难影像的专业化设计对于直接的对象检测而言是不必要的开销。

Voxel51 FiftyOne#

它是什么。 一个用于探索、整理和调试视觉数据集以及模型预测的开源工具包,带有企业版。

最适用场景。 准确率问题本质上是数据问题,但团队目前还无法看清这些问题的团队。

自动化工作原理。 预测结果和真实标签会加载到同一个视图中,因此你可以按损失排序、查找标签错误和重复项,并导出用于重新标注的目标切片。

优势。 极其善于浮现数据集的问题(如标签错误、重复、类别不平衡),而这些问题是再多额外标注也无法解决的。

权衡。 这是一个整理和分析层。它既不是标注界面,也不是标注服务。

自动标注背后的模型#

供应商将自动化作为一项功能进行营销,但你获得的质量取决于底层的模型,围绕此话题的技术搜索也直接指向了这些模型。

Segment Anything (SAM)。 Meta 的可提示分割模型能够根据点或框提示生成掩码。它是智能标注功能(包括 Ultralytics Platform 的功能)背后的主力,并且在寻找对象边界方面非常出色。它不认识你的类别名称。它只负责分割,而其他机制必须决定该分割是什么。

开放词汇检测器。 Grounding DINO 系列中的模型可根据文本提示检测对象,这让你能够预先标注模型从未训练过的类别。它有助于引导新类别列表,但在你的词汇与公开网络上的任何内容都不匹配的特定领域零件和缺陷上,可靠性较低。

你自己的微调模型。 一旦有了第一个模型,它通常就是你数据的最佳预标注器,因为它见过你的相机、光照和类别。这就是使循环不断复合的机制:每一轮标注都会为下一轮产生更好的预标注器。

其实际意义在于,自动化的效果会随着项目的生命周期而不断提升。如果仅凭通用模型在你的前一百张图像上的预标注效果来判断工具的好坏,会低估它在处理第一万张图像时的能力。

在不损害数据集的情况下运行工作流#

自动化转移了风险,而不是消除了风险。审核员随手放过的一个预标注帧看起来与仔细检查过的帧一模一样,而且当一个框已经画好时,确认偏误往往非常强烈。

在扩展自动化之前值得实施的控制措施:

  • 审查预标注,不要盲目确认。 设定心理预期,让审核员明白他们是在修改草稿,并对高得离谱的接受率进行审计。
  • 保留人工标注的评估集。 如果你的测试集是由你正在评估的同一系列模型自动标注的,那么你的指标衡量的只是契合度,而不是准确率。
  • 抽样并重新检查。 在每一轮中抽取一部分已接受的自动标注切片,并从头开始独立标注。分歧率才是你真正的质量信号。
  • 关注自动化表现最差的类别。 小目标、严重遮挡和罕见类别是算法提案失效的地方,也是隐蔽错误集中的地方。
  • 保持本体稳定,或者对其进行版本控制。 自动化会忠实且快速地传播旧的类别定义。
  • 追踪血缘关系。 知道哪些标签是由机器提出的,哪些是由人工绘制的,可以使之后的质量调查变得切实可行。

当自动化不再产生回报时#

自动化在数据量大、视觉一致且类别定义明确的数据上获得的回报最高。在以下三种尽早识别出来的场景中,它的回报最低。

第一种是真正新颖的类别。如果没有可用的模型包含你的零件、缺陷或事件的概念,预标注就会产生噪音,审核员必须先清除这些噪音才能开始真正的核心工作。先手工标注几百个,训练模型,然后让你的模型来进行预标注。

第二种是专家判断。如果难点在于确定某物是否算作缺陷,那么瓶颈在于做出决策,而不是画框。自动化无法加速两个合格检查员之间的分歧。

第三种是已经足够大的数据集。超过一定程度后,对相同场景进行更多的标注将无法提升准确率,此时的制约因素变成了数据的多样性。这是一个选择问题,向其中添加自动标注能力只会更快地产生冗余标签。

常见问题解答

  • 这取决于你面临的是问题的哪一半。对于训练 Ultralytics YOLO 模型的团队,Ultralytics Platform 将基于 SAM 的智能标注保持在与训练相同的循环中。Roboflow 和 CVAT 分别适用于开发者主导和自托管的工作流,而 Labelbox、Encord、SuperAnnotate 和 V7 则在企业级审核治理或处理困难的视频与医学图像时处于领先地位。

  • Lightly 和 Voxel51 FiftyOne 是专门为此构建的选择:Lightly 用于从大量未标注池中基于嵌入进行选择,FiftyOne 用于数据整理和错误浮现。几个标注平台还在项目中提供基于不确定性或模型驱动的优先级排序,这很有用,但比专用的选择层范围更窄。

  • 通常是用于分割类型提案的 SAM,或者是像 Grounding DINO 系列这样用于通过文本提示引导新类别的开放词汇检测器,亦或是你自己的微调模型(一旦存在这样一个模型)。第三种选择通常会成为你数据的最佳预标注器。

  • 不能。它改变了审核员的工作,使其从“绘制”变为“纠正”。完全省去人工审核步骤意味着模型的错误将在不受挑战的情况下进入训练集,并随后在下一轮中得到强化。

  • 会的,通过一种特定的失效方式:审核员确认看起来合理的提案,而不是去检查它们。应对措施是保留一个自动化从未触碰过的人工标注评估集,并定期对随机样本进行独立的重新标注,以衡量真正的分歧。

  • 通常可以,如果你懂得如何运维的话。运行已部署 SAM 模型的 CVAT 以及带有自定义 ML 后端的 Label Studio 都能提供有能力的预标注。你是在用许可证成本去换取运行模型服务和设计审核工作流的工作量。

  • 先选择,后标注。使用主动学习来挑选值得标注的帧,然后对该子集进行自动标注。在整个未标注池中运行自动化会把计算资源和审核员的时间浪费在那些根本不会改变模型性能的帧上。

Explore solutions

让我们一起构建 AI 的未来!

开启你的机器学习未来之旅