Shortcut Learning
了解捷径学习如何导致机器学习模型依赖虚假模式、削弱泛化能力并在部署中失败,并探索构建健壮的 YOLO 系统的方法。
当机器学习模型通过依赖训练数据中与正确标签相关联但并不代表其应该学习的概念的简单、非预期模式来解决任务时,就会发生捷径学习。例如,图像分类器可能会将雪景背景与狼关联起来,而不是学习动物的视觉特征。只要相关性存在,捷径就会产生准确的预测,然而当背景、相机、位置或工作流发生变化时,性能可能会崩溃。
捷径学习是如何发生的#
模型针对预测性能进行优化,而不是为了人类的理解。如果一个简单的线索持续预测标签,训练过程可能会偏爱它,而不是更难但更有意义的特征。常见的捷径包括背景、水印、图像边框、传感器特性、文本模板、录制设备和采集位置。
捷径学习通常始于数据集偏置。假设训练集中的每个缺陷产品都是在比合格产品更亮的照明下拍摄的。亮度成为一个高度预测性的特征,尽管它与缺陷没有因果关系。这反映了将相关性视为因果关系这一更广泛的问题,正如 Google 关于虚假且不可用的相关性的指南中所述。
神经网络特别擅长发现人们可能会忽略的微妙捷径,例如压缩模式或特定相机的噪声。这些信号在一个数据集中可以在统计上保持可靠,从而使模型在传统评估期间显得很成功。
为什么它在真实系统中很重要#
捷径学习会削弱泛化能力:即在训练分布之外的相关数据上可靠执行的能力。两个具体的例子说明了其后果:
- 医学影像: 诊断模型可能会了解到来自特定扫描仪或医院的图像与某种疾病相关,因为重症病例不成比例地集中在那里。当部署在另一家医院时,扫描仪特征会消失,这可能会增加假阴性或不必要的随访程序。
- 制造检测: 缺陷检测器可能会了解到故障组件出现在红色检测托盘上,而合格组件出现在传送带上。在生产中,它可能会漏掉传送带上的真正缺陷,并标记放置在红色托盘上的正常产品,从而增加浪费并使质量问题不被察觉。
当验证数据与训练数据共享相同的采集过程时,这些失败可能会保持隐藏状态。一个值得信赖的测试集应该代表真实的部署条件,不包含训练重复项,并遵循合理的训练、验证和测试拆分实践。
检测与相关概念#
捷径学习与几种机器学习失败模式有关,但这些术语不能互换:
- 过拟合: 模型过于贴合训练特定的细节。捷径学习会导致过拟合,但当两个拆分都包含相同的误导性相关性时,捷径也可能在普通的验证集上起作用。
- 数据泄漏: 在真实推理过程中不可用的信息进入了训练特征。泄漏是一种特别直接的捷径,例如使用间接揭示诊断结果的医院分配;Google 的标签泄漏示例展示了这种风险。
- 虚假相关性: 这是数据中不可靠的统计关系。捷径学习描述了模型依赖于该关系时的行为。
- 算法偏置: 偏置关乎系统性不平等或倾斜的结果。捷径特征可以产生偏置,但捷径学习也会影响没有群组的任务。
检测需要的不仅仅是一个聚合准确率分数。遵循基于切片的公平性评估指导,评估有意义的切片,如相机、站点、天气、光照和群组。反事实测试还可以在保留目标对象的同时移除或改变可疑的线索。预测的大幅变化表明对修改后的线索存在依赖性。
可解释 AI 工具可能会揭示对无关区域的关注。选项包括用于图像的 Captum 归因算法和用于结构化数据的排列特征重要性。
减少捷径学习#
从具有代表性的数据收集和标注开始。捕获多个站点、相机、背景、季节和操作条件。包括包含可疑捷径但没有目标的困难负样本,以及目标出现而没有捷径的正样本。Ultralytics 平台数据集工具可以帮助团队在训练前检查聚类、重复项、异常值、类别和数据集拆分。
有针对性的 YOLO 数据增强可以改变颜色、尺度、位置和几何形状,但增强必须破坏实际的捷径,而不是产生额外的非现实模式。评估应包括有意移动的挑战集,并在部署后继续进行,这与测量和监控的 NIST AI RMF 指南保持一致。
此可运行的工作流训练 Ultralytics YOLO26,使用验证模式对其进行评估,并保存预测结果以供视觉审查:
from ultralytics import YOLO
# Train a small baseline model
model = YOLO("yolo26n.pt")
model.train(data="coco8.yaml", epochs=3)
# Measure validation performance
metrics = model.val()
print(metrics.box.map)
# Inspect a prediction for suspicious visual dependencies
results = model.predict("https://ultralytics.com/images/bus.jpg")
result = results[0]
result.save(filename="shortcut_review.jpg")可以在单独收集的挑战集上重复相同的工作流。在受控变化下稳定的指标和合理的预测,比来自一个熟悉的数据分布的高分更能提供稳健学习的有力证据。









