Active Learning
了解主动学习如何优化 AI 训练。学习如何使用 Ultralytics YOLO26 来识别信息量大的数据、降低标注成本并提高准确性。
主动学习是机器学习 (ML)中的一种战略方法,算法会主动选择最具信息量的数据点进行标注,而不是被动接受预先标注的数据集。在传统的监督学习中,模型通常需要大量带注释的数据,而创建这些数据的成本高昂且耗时。主动学习通过识别“不确定”或“困难”的样本——即那些位于决策边界附近或模型缺乏信心的样本——并请求人工标注员仅对这些特定实例进行标注来优化这一过程。这种迭代循环使模型能够以显著较少的带标签样本实现高准确率,从而为预算有限或时间紧迫的项目带来极高的效率。
主动学习周期是如何运作的#
主动学习的核心是一个通常被称为人在回路的反馈循环。模型不再是在静态数据集上训练一次,而是通过查询和更新的循环不断演进。
-
初始化:过程从一小组带标签的训练数据开始,这些数据用于训练初始模型,例如Ultralytics YOLO26。
-
查询选择:模型评估大量未标注的数据池。使用一种查询策略(最常见的是不确定性采样),它会筛选出预测置信度最低的图像或文本。
-
重训练:将新标注的数据添加到训练集中,并对模型进行重训练。更新后的模型随后将具备更强的能力来选择下一批令人困惑的样本。
实际应用#
主动学习在数据丰富但标注需要专业知识或高昂成本的行业中是必不可少的。
- 医学图像分析:在放射学等领域,标注需要经过委员会认证的专家,他们的时间极其宝贵。主动学习系统不是要求医生注释数千张清晰的扫描图,而是可以筛选出模棱两可的病例——例如早期肿瘤或罕见异常——从而让专家能够专注于那些真正能提高模型诊断能力的图像。
- 自动驾驶汽车:自动驾驶汽车会产生拍字节级的视频数据。对每一帧进行标注是不可能的。主动学习帮助工程师识别标准目标检测模型可能漏掉的边缘情况,例如穿着戏服的行人或在大雪中驾驶。通过优先处理这些罕见的场景,企业在不浪费资源在重复的高速公路镜头上的同时提高了安全性。
Python 示例:过滤不确定的预测#
以下示例展示了使用Ultralytics YOLO26的简单“不确定性采样”逻辑。我们加载一个模型,对图像运行推理,并将置信度得分低于特定阈值的图像标记出来以进行人工审查。
from ultralytics import YOLO
# Load the latest YOLO26 model
model = YOLO("yolo26n.pt")
# List of unlabeled image paths
unlabeled_images = ["https://ultralytics.com/images/bus.jpg", "https://ultralytics.com/images/zidane.jpg"]
# Run inference
results = model(unlabeled_images)
# Identify samples with low confidence for active learning
uncertain_threshold = 0.6
for result in results:
# Check if any detection confidence is below the threshold
if result.boxes.conf.numel() > 0 and result.boxes.conf.min() < uncertain_threshold:
print(f"Active Learning Query: {result.path} needs human labeling.")区分相关概念#
区分主动学习与类似的训练范式非常重要:
- 半监督学习:虽然这两种方法都利用未标记的数据,但半监督学习根据模型的高置信度预测自动为数据分配伪标签。相比之下,主动学习明确要求人工对低置信度的预测进行输入。
- 迁移学习:这涉及获取一个预训练模型(例如在ImageNet上训练的模型)并将其适配到新任务中。主动学习侧重于哪些数据需要标注,而迁移学习侧重于复用学到的特征。
- 强化学习:在这里,智能体通过与环境交互并获得奖励来进行学习。主动学习则不同,因为它寻求来自专家的静态真实标签,而不是为了奖励而优化一系列动作。
与 MLOps 的集成#
要有效地实施主动学习,需要强大的机器学习运维 (MLOps)流水线。你需要基础设施来管理数据版本控制、触发再训练作业以及向人类提供标注界面。与Ultralytics 生态系统集成的工具允许用户在推理、数据策划和训练之间无缝切换。例如,使用自定义训练脚本可以让开发者快速将新批次的主动学习数据整合到他们的 YOLO 模型中。
对于采样策略的进一步阅读,研究人员经常参考主动学习文献中的综合综述。此外,理解模型评估指标对于验证主动学习循环是否确实在提高性能至关重要。






