Mechanistic Interpretability
Ultralytics で AI のメカニスティック解釈可能性(Mechanistic Interpretability)を探ります。ニューラルネットワークをリバースエンジニアリングし、Ultralytics YOLO26 内のアルゴリズム回路を追跡する方法を学びましょう。
Mechanistic Interpretability(機械論的解釈可能性)は、学習済みニューラルネットワークの内部構造をリバースエンジニアリングすることに焦点を当てた、machine learning内の高度な研究分野です。モデルをブラックボックスとして扱う代わりに、このアプローチは、モデルが特定の出力を生成する原因となる正確な数式回路、特定のニューロン、および接続されたパスを理解しようとします。これらの内部構造を人間が理解できる概念にマッピングすることで、開発者はartificial intelligenceシステムが情報をレイヤーごとにどのように処理するかを解読できます。
メカニスティックな解釈可能性と説明可能なAI(XAI)の比較#
Mechanistic Interpretabilityを一般的なExplainable AI (XAI)と混同することはよくあります。XAIは、モデルがどこを見ているかをハイライトするヒートマップやサライーマップなどのツールを含むより広範な用語ですが、Mechanistic Interpretabilityは、モデルがどのようにかつなぜ*その応答を計算するのかに答えることを目指しています。たとえば、XAIはobject detectionモデルが犬を識別するために毛皮のようなテクスチャに注目していることを示すかもしれませんが、Mechanistic Interpretabilityは特定の「毛皮検出」ニューロンの位置を特定し、最終的な予測までのアルゴリズム的な接続をたどることを目指します。
実社会での応用#
neural networksの正確な内部ロジックを理解することは、ハイリスクなAIをデプロイするために不可欠です。以下に2つの具体的な応用例を示します。
- AIの安全性とアライメントの監査: AnthropicやOpenAIなどの組織は、Mechanistic Interpretabilityを使用して、large language models (LLMs)の隠れたバイアス、欺瞞的な動作、または人間の価値観との潜在的な不整合を検査します。sparse autoencodersなどの技術を使用して人間が読める特徴を抽出することにより、研究者はデプロイ前に悪意のあるパスを外科的に編集または無効化し、堅牢なAI safetyを確保できます。
- 医療診断のデバッグ: healthcareなどの重要な分野では、Mechanistic Interpretabilityは、コンピュータビジョンアルゴリズムが疾患を予測する際に、アーティファクト(画像内の病院のウォーターマークや定規など)ではなく、実際のバイオマーカーに依存していることを研究者が検証するのに役立ちます。このきめ細かい検証は、compliance and trust in medical AIにとって不可欠です。
解釈可能性のための特徴抽出#
computer visionアーキテクチャを使用する場合、Mechanistic Interpretabilityにおける一般的な最初のステップは、中間アクティベーションの抽出です。PyTorch forward hooksなどのツールを使用することで、開発者はフォワードパス中にネットワークの内部を覗くことができます。
次のスニペットは、Ultralytics YOLO26モデルの最初の畳み込み層にフックをアタッチして、推論中に生成された内部特徴マップの次元を検査する方法を示しています。
from ultralytics import YOLO
# Load the Ultralytics YOLO26 nano model
model = YOLO("yolo26n.pt")
# Define a hook function to capture and inspect intermediate layer activations
def hook_fn(module, input, output):
print(f"Analyzed Layer: {module.__class__.__name__} | Activation Shape: {output.shape}")
# Attach the hook to the first layer of the model architecture
handle = model.model.model[0].register_forward_hook(hook_fn)
# Run a quick inference to trigger the hook and print the mechanistic features
results = model("https://ultralytics.com/images/bus.jpg")
handle.remove()これらのアクティベーションを分析することで、MLエンジニアはfeature visualizationを実行し、ネットワークの動作のマッピングを開始できます。これらの解釈可能なシステムのトレーニングに必要な大規模データセットを管理するために、Ultralytics Platformなどのツールは、モデルのトレーニング、ロギング、および継続的な監視を簡素化する堅牢なエンドツーエンドのパイプラインを提供します。transparency in AIへの推進が加速するにつれて、Mechanistic Interpretabilityは、信頼性が高く確実なモデルを構築するための基礎的な学問分野であり続けるでしょう。






