YOLO Vision 2026:
返回 Ultralytics 词汇表

Mechanistic Interpretability

探索 Ultralytics 的 AI 机械可解释性。了解如何对神经网络进行逆向工程,并追踪 Ultralytics YOLO26 中的算法电路。

机械可解释性(Mechanistic Interpretability)是机器学习领域的一个先进研究方向,专注于逆向工程训练好的神经网络的内部运作机制。这种方法不再将模型视为黑盒,而是试图理解导致模型产生特定输出的精确数学电路、特定神经元和相连的通路。通过将这些内部结构映射为人类可理解的概念,开发者可以逐层解码人工智能系统是如何处理信息的。

机械可解释性与可解释AI (XAI)#

人们常将机械可解释性与通用的可解释人工智能 (XAI)混淆。XAI 是一个更广泛的术语,包含热力图或显著性图等工具,用于突出显示模型在哪里关注,而机械可解释性则旨在回答模型如何以及为什么计算出其响应。例如,虽然 XAI 可能会显示目标检测模型关注毛皮纹理来识别狗,但机械可解释性旨在定位特定的“毛皮检测”神经元,并追踪它们通往最终预测的算法连接。

实际应用#

理解神经网络精确的内部逻辑对于部署高风险 AI 至关重要。以下是两个具体的应用场景:

  • 审核人工智能安全与对齐:像 AnthropicOpenAI 这样的组织使用机械可解释性来检查 大型语言模型 (LLMs) 中的隐藏偏见、欺骗性行为或与人类价值观潜在的不对齐。通过使用诸如 稀疏自编码器 等技术提取人类可读的特征,研究人员可以在部署前精准编辑或禁用恶意路径,以确保稳健的 人工智能安全
  • 调试医疗诊断:在医疗保健等关键领域,机械可解释性帮助研究人员验证计算机视觉算法在预测疾病时依赖的是真实的生物学标志,而不是伪影(如图像中的医院水印或标尺)。这种细粒度的验证对于医疗 AI 的合规性和信任度至关重要。

提取可解释性特征#

在使用计算机视觉架构时,机械可解释性常见的第一步是提取中间激活。使用 PyTorch forward hooks 等工具,开发者可以在前向传播过程中窥探网络内部。

以下代码片段演示了如何将钩子(hook)附加到 Ultralytics YOLO26 模型的第一个卷积层,以检查推理过程中生成的内部特征图的维度。

from ultralytics import YOLO

# Load the Ultralytics YOLO26 nano model
model = YOLO("yolo26n.pt")


# Define a hook function to capture and inspect intermediate layer activations
def hook_fn(module, input, output):
    print(f"Analyzed Layer: {module.__class__.__name__} | Activation Shape: {output.shape}")


# Attach the hook to the first layer of the model architecture
handle = model.model.model[0].register_forward_hook(hook_fn)

# Run a quick inference to trigger the hook and print the mechanistic features
results = model("https://ultralytics.com/images/bus.jpg")
handle.remove()

通过分析这些激活,ML 工程师可以执行特征可视化并开始映射网络的行为。为了管理训练这些可解释系统所需的大规模数据集,像 Ultralytics Platform 这样的工具提供了强大的端到端管道,简化了模型训练、日志记录和持续监控。随着对AI 透明度的推动加速,机械可解释性将仍然是构建值得信赖且可靠模型的基础学科。

Explore solutions

让我们一起构建 AI 的未来!

开启你的机器学习未来之旅