Causal Representation Learning
因果表現学習(CRL)によって、AIモデルが因果関係の要因をエンコードし、汎化性能を向上させ、ロボティクスや製造検査を支援する方法を学びます。
因果表現学習(CRL)は、画像、動画、音声、センサーの読み取り値などの複雑な観測データを、基盤となるシステムが因果関係をどのように生み出すかを反映する高レベルの変数に変換することを目指す機械学習アプローチです。単にラベルを予測する特徴量を学習するのではなく、CRLは、物体の位置、照明、機械の状態、人間の動作など、意味のある要因に対応する表現を求めます。
目標は、学習中に観測された相関だけに依存するのではなく、要因が変化したときに何が起こり得るかをモデルが推論できるようにすることです。これにより、従来の埋め込みによる表現学習と因果推論の考え方を組み合わせ、AIシステムの環境をまたいだ汎化や、介入、反実仮想的な問い、意思決定を支援します。
因果表現学習の仕組み#
ニューラルネットワークは通常、高次元の入力を内部の潜在空間にマッピングします。Googleの機械学習における埋め込みの概要で説明されているように、これらのコンパクトなベクトルは、入力の複雑さを低減しながら有用な関係性を保持できます。ただし、通常の埋め込みでは、因果的な特性と偶然のパターンが混在する可能性があります。
たとえば、野生動物分類器は、学習データセット内のオオカミの画像の大半に雪景色の背景があるため、雪とオオカミを関連付ける可能性があります。因果表現では、動物のアイデンティティと背景条件を分離することで、モデルが森林や草原にいるオオカミも認識できるようにする必要があります。
CRLには通常、相互に関連する次の3つの目標があります。
- 意味のある潜在変数を復元する: 表現は、都合のよい予測上の近道ではなく、観測データを生み出す基盤となる要因を捉える必要があります。
- 因果構造をモデル化する: 変数間の関係は、因果モデルのフレームワークで説明されている原則に従い、有向グラフで表現できます。
- 介入下でも安定性を保つ: 1つの要因を変化させたとき、表現には適切で局所的な変化が生じる必要があります。DoWhyの介入に関するドキュメントでは、介入が観測データによる単純な条件付けとどのように異なるかが示されています。
介入では、ロボットの速度を変更するなど、変数を能動的に設定します。一方、反実仮想では、ロボットがより低速で移動していた場合に衝突が起きていたかどうかなど、異なる設定の下で何が起きていたかを問います。
関連概念と主な違い#
CRLはいくつかの機械学習の概念と重なりますが、独自の目的を持っています。
- **コントラスト学習**は、関連する例を近づけ、関連しない例を引き離すことで表現を学習します。CRLを支援できますが、類似性だけでは因果関係を確立できません。
- **自己教師あり学習**は、ラベルなしデータから学習信号を作成します。CRLでは、これらの信号を利用しながら、介入、環境、時間、因果構造に関する仮定を追加する場合があります。
- 因果推論は通常、処置、年齢、回復など、すでに定義された変数間の効果を推定します。CRLではまず、生の知覚入力から有用な因果変数を発見します。この違いは、より広範な因果表現学習の概要の中心となるものです。
- 分離表現学習は、独立した要因に別々の潜在次元を割り当てることを目指します。分離された要因から影響の方向や介入への応答が欠落している可能性があるため、分離表現が必ずしも因果的であるとは限りません。
- 因果発見は、変数間の関係を探索します。CRLではさらに、変数自体も学習します。DoWhyのグラフ反証で説明されているように、候補となる構造は可能な限り検証する必要があります。
マルチビューCRLでは、異なるカメラやセンサーが同じシステムを異なる視点から観測します。部分的な観測可能性により、各ビューから明らかになる因果要因は一部に限られます。非ペアのマルチドメイン設定では、異なる環境からの観測がインスタンス単位で対応しないため、さらに困難になります。
実世界での利用例#
自律ロボティクス: 倉庫ロボットは、障害物の位置、照明、床のテクスチャ、自身の動きに関する情報を含むカメラ、深度、動作データを受け取ります。因果表現により、ステアリングなどの制御可能な要因と、影などの環境要因を分離できます。ドメインランダム化を用いた学習では、制御された変動にシステムをさらすことができます。一方、因果構造は、どの変化がナビゲーションの意思決定に影響すべきかを判断するのに役立ちます。
製造検査: 欠陥検出器は、生産ライン、カメラの角度、素材の色を欠陥製品と誤って関連付ける可能性があります。CRLは、欠陥の種類、機械設定、照明を別々の要因として分離するのに役立ちます。これにより、設備や工場が変わった際の近道学習を抑制し、工程温度や圧力が欠陥の発生に寄与したのか、それとも単に欠陥と同時に現れただけなのかを調査しやすくなります。
実践的なワークフローと制限事項#
Ultralytics YOLOでは、開発者が別の因果学習パイプラインを設計する前に確認できる、標準的なビジュアル埋め込みを生成できます。
from ultralytics import YOLO
# Load a pretrained image classification model
model = YOLO("yolo26n-cls.pt")
# Generate an ordinary visual representation
source = "https://ultralytics.com/images/bus.jpg"
embeddings = model.embed(source)
# Inspect the selected image embedding
embedding = embeddings[0]
print(embedding.shape)この文書化されたUltralytics YOLO26のワークフローは埋め込みを抽出しますが、それだけで表現が因果的になるわけではありません。因果性を確立するには、適切なデータ、仮定、介入、複数の環境、または時間的な証拠が必要です。
実務担当者は、疑わしい交絡要因を変化させ、ドメイン間でパフォーマンスを評価し、データセットのバイアスを監査する必要があります。Ultralytics Platformは、データセットのアノテーション、学習、デプロイ、管理されたデータセットのバージョン管理を支援できます。デプロイ後も、継続的なモデルモニタリングが不可欠です。検証精度が安定していても、因果的妥当性が保証されるわけではないためです。評価では、より広範なNISTによるAIの妥当性と堅牢性に関するガイダンスにも従い、Googleのデータセットのバイアスを特定するためのガイドで示されているようなサブグループの検証も含める必要があります。









