Concept Bottleneck Models
了解概念瓶颈模型如何通过人类可理解的概念、专家干预以及实用的 Ultralytics YOLO26 视觉工作流来改进可解释 AI。
概念瓶颈模型(CBM)是一种神经网络,它通过人类可理解概念的中间层来进行预测。CBM 不会将输入直接映射到最终标签,而是先预测有意义的属性(例如“红翼”、“表面裂纹”或“关节狭窄”),然后仅使用这些属性来做出决策。与传统的黑盒模型相比,这种结构使模型更易于检查、调试和纠正。
概念瓶颈模型的工作原理#
标准的神经网络通常在不透明的潜在空间中表示信息。CBM 用一个概念向量替换了该隐藏表示的一部分,该向量的维度具有明确的含义。
其预测流水线包含两个主要阶段:
- 概念预测器将原始输入(例如图像)映射到概念值。
- 目标预测器将这些概念值映射到最终类别或分数。
例如,鸟类分类器在识别物种之前,可能会预测“黑喙”、“白胸”和“长尾”。概念可以是二元的、分类的或连续的。它们通常通过监督学习进行学习,要求每个训练示例都包含目标标签和概念注释。
这两个阶段可以独立、顺序或联合训练。独立训练使分离更加明确,而联合训练则可以平衡概念质量与最终任务性能。在任何情况下,瓶颈都应将目标预测器限制在声明的概念内;否则,隐藏信息可能会绕过预期的解释。
为什么可解释性和干预至关重要#
CBM 是一种内生可解释 AI 的形式:其可解释的结构内置于预测中,而不是事后添加的。这不同于诸如显著图等事后工具,后者用于估计是什么影响了已经训练好的黑盒。
概念层支持几种有用的交互:
- 用户可以检查是哪些概念导致了某项决策。
- 领域专家可以纠正不准确的概念并重新计算输出。
- 开发者可以测试目标预测器是否遵循有效的领域逻辑。
- 团队可以独立于最终任务准确率来衡量概念准确率。
这些功能符合关于可解释 AI 的 NIST 指南以及人机 AI 指南中讨论的以人为本的控制措施。然而,可理解的解释并不自动等于正确的解释。必须对概念保真度进行评估,而不是假设其正确。
实际应用#
-
**医学图像分析:**检查 X 光片的模型可以在对疾病严重程度进行分级之前,先估计骨刺、关节间隙狭窄和硬化等概念。临床医生可以审查或纠正这些中间发现,而不只是接收严重程度评分。这种人机交互与美国食品药品监督管理局(FDA)关于机器学习医疗设备的透明度原则高度相关。
-
**制造视觉检测:**视觉系统可以识别诸如缺失组件、裂纹、变色或对齐不正确等概念,然后利用这些概念来决定产品是通过检测还是需要进行特定维修。目标检测可以定位组件和缺陷,而下游基于概念的分类器则提供可审计的质量决策。
局限性与相关概念#
概念标签会产生额外的数据标注成本,并且可能需要专业知识。定义不清的概念可能是主观的、相关的、不完整的或难以从输入中识别的。团队应制定精确的标注规则并审查标注者之间的分歧。
其他重要风险包括概念预测错误、未校准的分数以及概念泄漏(连续概念值编码了超出其规定含义的非预期信息)。关于概率校准的指南可以帮助确定概念置信度值是否值得信赖。
CBM 也不同于特征工程:工程特征是手动计算的输入,而概念通常是从原始数据中预测出来的并且经过显式监督。它与信息瓶颈原理也不同,后者在不要求每个维度都对人类可读的情况下压缩表示。
应在相关数据切片中检查概念性能,因为有偏见的标注或缺失的概念可能会产生不均等的错误。Google 的识别 ML 偏差指南和美国国家标准与技术研究院(NIST)AI RMF 核心提供了有用的评估和治理实践。
构建实用的视觉流水线#
Ultralytics YOLO26 模型可以充当上游视觉概念提取器。以下预测模式工作流将检测到的目标类别收集为候选概念信号:
from ultralytics import YOLO
# Load a pretrained visual concept extractor
model = YOLO("yolo26n.pt")
# Run inference and select the first result
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Convert detected classes into human-readable concept candidates
concepts = {result.names[int(class_id)] for class_id in result.boxes.cls}
print(sorted(concepts))
result.save(filename="concept_candidates.jpg")这不是一个完整的 CBM:仍必须训练下游模型,以便专门从所选概念中预测最终目标。团队可以使用Ultralytics 平台来标注视觉数据、训练概念提取器、比较实验以及监控已部署的组件。使用结构化的模型评估工作流分别评估概念准确率、目标准确率、校准、干预行为和重要子群。






