Causal Representation Learning
인과 표현 학습(CRL)을 학습하여 AI 모델이 인과 관계 요소를 인코딩하고, 일반화 성능을 향상시키며, 로보틱스 및 제조 검사를 지원할 수 있도록 돕습니다.
인과적 표현 학습(CRL)은 이미지, 비디오, 오디오 또는 센서 측정값과 같은 복잡한 관측값을 근본적인 시스템이 인과 관계를 생성하는 방식을 반영하는 고차원 변수로 변환하는 것을 목표로 하는 머신 러닝 접근 방식입니다. 단순히 레이블을 예측하는 피처를 학습하는 대신, CRL은 객체 위치, 조명, 기계 상태 또는 인간의 행동과 같은 의미 있는 요인에 해당하는 표현을 찾습니다.
목표는 모델이 훈련 중에 관측된 상관관계에만 의존하는 대신, 요인이 변경될 때 무슨 일이 발생할 수 있는지 추론하도록 만드는 것입니다. 이는 기존의 임베딩을 통한 표현 학습을 인과 추론의 아이디어와 결합하여 AI 시스템이 환경 전반에 걸쳐 일반화하고 개입, 반사실적 질문 및 의사 결정을 지원하도록 돕습니다.
인과적 표현 학습의 작동 방식#
신경망은 일반적으로 고차원 입력을 내부 잠재 공간으로 매핑합니다. Google의 머신 러닝 임베딩 소개에서 설명한 바와 같이, 이러한 압축된 벡터는 입력 복잡성을 줄이면서 유용한 관계를 보존할 수 있습니다. 그러나 일반적인 임베딩은 인과적 속성을 우연한 패턴과 혼합할 수 있습니다.
예를 들어, 야생동물 분류기는 훈련 세트의 대부분의 늑대 이미지에 눈 덮인 배경이 있다는 이유로 눈을 늑대와 연관시킬 수 있습니다. 인과적 표현은 동물 정체성을 배경 조건과 분리하여 모델이 숲이나 초원에서 늑대를 인식할 수 있도록 해야 합니다.
CRL은 일반적으로 다음과 같은 세 가지 연결된 목표를 포함합니다:
- 의미 있는 잠재 변수 복구: 표현은 단순한 편리한 예측 지름길이 아니라 관측값을 생성하는 근본적인 요소를 포착해야 합니다.
- 인과 구조 모델링: 변수 간의 관계는 인과 모델 프레임워크에 설명된 원칙에 따라 방향성 그래프를 통해 표현될 수 있습니다.
- 개입 시 안정성 유지: 하나의 요인을 변경하면 표현에 적절하고 국소적인 변화가 발생해야 합니다. DoWhy 개입 문서는 개입이 관측된 데이터에 단순히 조건화하는 것과 어떻게 다른지 보여줍니다.
개입은 로봇의 속도 변경과 같이 변수를 적극적으로 설정합니다. 반면에 반사실은 로봇이 더 천천히 이동했다면 충돌이 발생했을지 여부와 같이 다른 설정에서 어떤 일이 일어났을지 묻습니다.
관련 개념 및 주요 차이점#
CRL은 여러 머신 러닝 아이디어와 중복되지만 고유한 목적을 가지고 있습니다.
- **대조 학습**은 관련 예제는 더 가깝게 만들고 관련 없는 예제는 분리하여 표현을 학습합니다. 이는 CRL을 지원할 수 있지만, 유사성만으로는 인과 관계가 성립되지 않습니다.
- **자기 지도 학습**은 레이블이 지정되지 않은 데이터에서 훈련 신호를 생성합니다. CRL은 개입, 환경, 시간 또는 인과 구조에 대한 가정을 추가하면서 이러한 신호를 사용할 수 있습니다.
- 인과 추론은 일반적으로 치료, 연령, 회복과 같이 이미 정의된 변수 간의 효과를 추정합니다. CRL은 원시 지각 입력에서 유용한 인과 변수를 먼저 발견합니다. 이 구분이 더 광범위한 인과적 표현 학습 개요의 핵심입니다.
- 분리된 표현 학습은 독립적인 요인에 별도의 잠재 차원을 할당하려고 시도합니다. 분리된 표현이 반드시 인과적인 것은 아닌데, 분리된 요인이라도 영향력의 방향이나 개입에 대한 반응을 여전히 생략할 수 있기 때문입니다.
- 인과 발견은 변수 간의 관계를 검색합니다. CRL은 추가로 변수 자체를 학습합니다. DoWhy 그래프 반박에 설명된 대로 가능한 경우 후보 구조를 테스트해야 합니다.
다중 뷰 CRL에서는 서로 다른 카메라나 센서가 서로 다른 관점에서 동일한 시스템을 관측합니다. 부분 관측성은 각 뷰가 일부 인과 요인만 드러냄을 의미합니다. 쌍을 이루지 않은 다중 도메인 설정은 서로 다른 환경의 관측값이 인스턴스별로 대응되지 않기 때문에 더 어렵습니다.
실제 애플리케이션 사례#
자율 로보틱스: 창고 로봇은 장애물 위치, 조명, 바닥 질감, 자체 움직임에 대한 정보가 포함된 카메라, 깊이 및 모션 데이터를 받습니다. 인과적 표현은 조향과 같은 제어 가능한 요인을 그림자 같은 환경 요인과 분리할 수 있습니다. 도메인 무작위화를 통한 훈련은 시스템을 제어된 변동에 노출시킬 수 있으며, 인과 구조는 어떤 변경 사항이 탐색 결정에 영향을 미쳐야 하는지 판단하는 데 도움을 줍니다.
제조 검사: 결함 검출기는 생산 라인, 카메라 각도 또는 재료 색상을 결함 제품과 잘못 연관시킬 수 있습니다. CRL은 결함 유형, 기계 설정 및 조명을 별도의 요인으로 격리하는 데 도움을 줍니다. 이는 장비나 공장이 변경될 때 지름길 학습을 줄여주며, 공정 온도나 압력이 단순한 동반 현상이 아니라 결함에 실제로 기여했는지 조사하기 쉽게 만들어 줍니다.
실무 워크플로 및 한계#
Ultralytics YOLO는 개발자가 별도의 인과 학습 파이프라인을 설계하기 전에 검사할 수 있는 표준 시각적 임베딩을 생성할 수 있습니다:
from ultralytics import YOLO
# Load a pretrained image classification model
model = YOLO("yolo26n-cls.pt")
# Generate an ordinary visual representation
source = "https://ultralytics.com/images/bus.jpg"
embeddings = model.embed(source)
# Inspect the selected image embedding
embedding = embeddings[0]
print(embedding.shape)이 문서화된 Ultralytics YOLO26 워크플로는 임베딩을 추출하지만, 그 자체로 표현을 인과적으로 만들지는 않습니다. 인과 관계를 설정하려면 적절한 데이터, 가정, 개입, 다중 환경 또는 시간적 증거가 필요합니다.
실무자는 의심되는 방해 요인을 변경하고, 도메인 간 성능을 평가하며, 데이터셋 편향을 감사해야 합니다. Ultralytics Platform은 데이터셋 주석, 훈련, 배포 및 제어된 데이터셋 버전 관리를 지원할 수 있습니다. 배포 후에는 안정적인 검증 정확도가 인과적 타당성을 보장하지 않으므로 지속적인 모델 모니터링이 필수적입니다. 또한 평가는 AI 타당성 및 견고성에 대한 광범위한 NIST 지침을 따르고 Google의 데이터셋 편향 식별 가이드에 명시된 것과 같은 하위 그룹 검사를 포함해야 합니다.






