Concept Bottleneck Models
了解概念瓶颈模型如何通过人类可理解的概念、专家干预和实用的 Ultralytics YOLO26 视觉工作流,改进可解释 AI。
概念瓶颈模型(CBM)是一种通过人类可理解概念的中间层进行预测的神经网络。CBM 不会将输入直接映射到最终标签,而是先预测有意义的属性,例如“红色翅膀”“表面裂纹”或“关节间隙变窄”,然后仅使用这些属性生成决策。与传统黑盒模型相比,这种结构更易于检查、调试和纠正。
概念瓶颈模型的工作原理#
标准的神经网络通常会在不透明的潜在空间中表示信息。CBM 会将隐藏表示的一部分替换为概念向量,其中每个维度都有明确的含义。
其预测流程包含两个主要阶段:
- 概念预测器将原始输入(例如图像)映射为概念值。
- 目标预测器将这些概念值映射为最终类别或分数。
例如,鸟类分类器可能会先预测“黑色喙”“白色胸部”和“长尾”,然后再识别鸟的物种。概念可以是二值、类别型或连续型的。它们通常通过监督学习进行学习,因此每个训练样本都必须同时包含目标标签和概念标注。
这两个阶段可以独立训练、按顺序训练或联合训练。独立训练能明确体现二者的分离,而联合训练可以在概念质量与最终任务性能之间取得平衡。在所有情况下,瓶颈都应将目标预测器限制在所声明的概念范围内;否则,隐藏信息可能绕过预期的解释路径。
为什么可解释性和干预很重要#
CBM 是一种内生式可解释人工智能:其可解释结构被构建在预测过程中,而不是事后添加。这不同于显著性图等事后分析工具,后者用于估计哪些因素影响了一个已经训练好的黑盒模型。
概念层支持多种有用的交互方式:
- 用户可以检查哪些概念导致了某项决策。
- 领域专家可以纠正不准确的概念并重新计算输出。
- 开发者可以测试目标预测器是否遵循有效的领域逻辑。
- 团队可以将概念准确率与最终任务准确率分开进行衡量。
这些能力与NIST 关于可解释人工智能的指导以及People + AI Guidebook中讨论的以人为本的控制措施相一致。然而,易于理解的解释并不一定是正确的解释。必须评估概念保真度,而不能想当然地认为它是可靠的。
实际应用#
-
医学图像分析: 检查 X 光片的模型可能会先估计骨刺、关节间隙变窄和硬化等概念,然后对疾病严重程度进行分级。临床医生可以审查或纠正这些中间结果,而不是只能获得一个严重程度分数。这种人机交互与FDA 关于机器学习医疗器械的透明度原则尤其相关。
-
制造业视觉检测: 视觉系统可以识别缺失组件、裂纹、变色或对齐错误等概念,然后利用这些概念决定产品是否通过检测,或是否需要特定维修。目标检测可以定位组件和缺陷,而下游的基于概念的分类器则能提供可审计的质量决策。
局限性和相关概念#
概念标签会增加数据标注成本,并且可能需要专业知识。定义不佳的概念可能具有主观性、相关性或不完整性,也可能难以从输入中识别。团队应制定精确的标注规则,并审核标注者之间的分歧。
其他重要风险包括概念预测错误、未校准的分数,以及概念泄漏,即连续概念值编码了超出其声明含义的非预期信息。概率校准方面的指导可以帮助判断概念置信度值是否可信。
CBM 也不同于特征工程:工程化特征是手动计算的输入,而概念通常是从原始数据中预测出来并经过明确监督的。它也不同于信息瓶颈原理,后者会压缩表示,但不要求每个维度都能被人类理解。
应在相关数据切片上检查概念性能,因为有偏差的标注或缺失的概念可能导致不均等的错误。Google 关于识别机器学习偏差的指导和NIST AI RMF Core提供了有用的评估与治理实践。
构建实用的视觉流程#
Ultralytics YOLO26模型可以充当上游视觉概念提取器。以下预测模式工作流会收集检测到的目标类别,作为候选概念信号:
from ultralytics import YOLO
# Load a pretrained visual concept extractor
model = YOLO("yolo26n.pt")
# Run inference and select the first result
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Convert detected classes into human-readable concept candidates
concepts = {result.names[int(class_id)] for class_id in result.boxes.cls}
print(sorted(concepts))
result.save(filename="concept_candidates.jpg")这并不是一个完整的 CBM:下游模型仍必须经过训练,才能仅根据所选概念预测最终目标。团队可以使用Ultralytics 平台来标注视觉数据、训练概念提取器、比较实验并监控已部署的组件。应使用结构化的模型评估工作流,分别评估概念准确率、目标准确率、校准、干预行为和重要子群体。









