Causal Representation Learning
AIモデルが因果関係の要因をエンコードし、汎化性能を向上させ、ロボット工学や製造業の検査を支援できるようにするための因果表現学習 (CRL) について学びます。
因果表現学習(CRL)は、画像、動画、音声、センサーの読み取り値などの複雑な観測データを、基盤となるシステムがどのように因果関係を生み出すかを反映した高レベルの変数に変換することを目指す機械 learning アプローチです。単にラベルを予測する特徴量を学習するのではなく、CRLは、オブジェクトの位置、照明、マシンの状態、人間の行動などの意味のある要因に対応する表現を追求します。
目的は、トレーニング中に観測された相関関係だけに依存するのではなく、要因が変化したときに何が起こるかについてモデルに推論させることです。これは、従来の埋め込みを通じた表現学習と、因果推論のアイデアを組み合わせたものであり、AIシステムが環境を跨いで汎化し、介入、反実仮想の質問、意思決定をサポートするのに役立ちます。
因果表現学習の仕組み#
ニューラルネットワークは通常、高次元の入力を内部の潜在空間にマッピングします。Googleの機械学習埋め込みの紹介で説明されているように、これらのコンパクトなベクトルは、入力の複雑さを軽減しながら有用な関係を維持できます。ただし、通常の埋め込みでは、因果的な特性と偶発的なパターンが混ざり合う可能性があります。
たとえば、野生動物の分類器は、トレーニングセット内のほとんどのオオカミの画像の背景が雪景色であるため、雪とオオカミを関連付ける可能性があります。因果表現は、動物のアイデンティティと背景の条件を分離し、モデルが森林や草原でオオカミを認識できるようにする必要があります。
CRLには通常、3つの関連する目標が含まれます:
- 意味のある潜在変数の復元: 表現は、単に便利な予測上の近道だけでなく、観測を生成する基盤となる要因を捉える必要があります。
- 因果構造のモデル化: 変数間の関係は、因果モデルのフレームワークで説明されている原則に従い、有向グラフを通じて表現される場合があります。
- 介入に対して安定性を維持する: 1つの要因を変更すると、表現において適切で局所的な変更が生じるはずです。DoWhyの介入に関するドキュメントは、介入が観測されたデータに単純に条件付けするのとどのように異なるかを示しています。
介入では、ロボットの速度の変更など、変数が能動的に設定されます。一方、反実仮想では、ロボットがよりゆっくりと移動していた場合に衝突が発生したかどうかなど、異なる設定の下で何が起こっていたかを問いかけます。
関連する概念と主な違い#
CRLはいくつかの機械学習のアイデアと重複していますが、明確な目的を持っています。
- **対照学習**は、関連する例を近づけ、関連のない例を引き離すことで表現を学習します。CRLをサポートできますが、類似性だけでは因果関係は確立されません。
- **自己教師あり学習**は、ラベルなしデータからトレーニング信号を作成します。CRLは、介入、環境、時間、または因果構造に関する仮定を追加しながら、これらの信号を使用する場合があります。
- 因果推論は通常、治療、年齢、回復など、すでに定義されている変数間の効果を推定します。CRLはまず、生の知覚入力から有用な因果変数を発見します。この区別は、より広い因果表現学習の概要の中心となっています。
- **もつれ解消表現学習(Disentangled representation learning)**は、独立した要因に別々の潜在次元を割り当てようとします。分離された要因は影響の方向や介入に対する応答を省略している可能性があるため、もつれが解消された表現が必ずしも因果関係にあるとは限りません。
- **因果探索(Causal discovery)**は、変数間の関係を探索します。CRLはさらに、変数自体を学習します。DoWhyのグラフ反駁で説明されているように、可能な場合は候補構造をテストする必要があります。
マルチビューCRLでは、異なるカメラやセンサーが同じシステムを異なる視点から観測します。部分観測可能性とは、各ビューが一部の因果要因のみを明らかにすることを意味します。異なる環境からの観測がインスタンスごとに対応しないため、ペアになっていないマルチドメインの設定はより困難です。
実社会での応用#
自律型ロボット: 倉庫のロボットは、障害物の位置、照明、床のテクスチャ、および自身の動きに関する情報を含むカメラ、深度、およびモーションデータを受信します。因果表現は、ステアリングなどの制御可能な要因を、影などの環境要因から分離できます。ドメインランダム化を用いたトレーニングにより、システムを制御された変動にさらすことができ、一方、因果構造は、どの変更がナビゲーションの決定に影響を与えるべきかを判断するのに役立ちます。
製造業の検査: 欠陥検出器は、生産ライン、カメラの角度、または材料の色を欠陥のある製品と誤って関連付ける可能性があります。CRLは、欠陥の種類、マシンの設定、および照明を別々の要因として分離するのに役立ちます。これにより、機器や工場が変更されたときのエショートカット学習が減少し、プロセス温度や圧力が単に一緒に現れたのではなく、欠陥に寄与したかどうかを調査しやすくなります。
実践的なワークフローと制限#
Ultralytics YOLOは、開発者が別の因果学習パイプラインを設計する前に検査できる標準的な視覚的埋め込みを生成できます:
from ultralytics import YOLO
# Load a pretrained image classification model
model = YOLO("yolo26n-cls.pt")
# Generate an ordinary visual representation
source = "https://ultralytics.com/images/bus.jpg"
embeddings = model.embed(source)
# Inspect the selected image embedding
embedding = embeddings[0]
print(embedding.shape)この文書化されたUltralytics YOLO26ワークフローは埋め込みを抽出しますが、それ自体で表現が因果関係を持つわけではありません。因果関係を確立するには、適切なデータ、仮定、介入、複数の環境、または時間的証拠が必要です。
実務者は、疑わしい邪魔な要因を変化させ、ドメイン全体でのパフォーマンスを評価し、データセットのバイアスを監査する必要があります。Ultralytics Platformは、データセットのアノテーション、トレーニング、デプロイ、および制御されたデータセットのバージョニングをサポートできます。デプロイ後、安定した検証精度が因果的妥当性を保証するわけではないため、継続的なモデルモニタリングが不可欠です。また、評価は、AIの妥当性と堅牢性に関するより広いNISTガイダンスに従い、Googleのデータセットバイアス特定ガイドに概説されているようなサブグループのチェックを含める必要があります。






