Causal Representation Learning
AI 모델이 인과관계 요인을 인코딩하고 일반화 성능을 향상하며 로보틱스와 제조 검사에 기여하도록 돕는 인과 표현 학습 (CRL)을 알아보세요.
인과 표현 학습(CRL)은 이미지, 동영상, 오디오 또는 센서 판독값과 같은 복잡한 관측값을 기본 시스템이 인과 관계를 생성하는 방식을 반영하는 고수준 변수로 변환하는 것을 목표로 하는 머신러닝 접근 방식입니다. CRL은 단순히 레이블을 예측하는 특징을 학습하는 대신 객체 위치, 조명, 기계 상태 또는 인간의 행동과 같은 의미 있는 요인에 대응하는 표현을 찾습니다.
목표는 학습 중 관찰된 상관관계에만 의존하는 것이 아니라 요인이 변할 때 어떤 일이 일어날 수 있는지 모델이 추론하도록 만드는 것입니다. 이를 위해 기존의 임베딩을 통한 표현 학습과 인과 추론의 개념을 결합하여, AI 시스템이 환경 전반에서 일반화하고 개입, 반사실적 질문 및 의사 결정을 지원하도록 합니다.
인과 표현 학습의 작동 방식#
신경망은 일반적으로 고차원 입력을 내부 잠재 공간에 매핑합니다. Google의 머신러닝 임베딩 소개에서 설명하듯이, 이러한 압축 벡터는 입력의 복잡성을 줄이면서 유용한 관계를 보존할 수 있습니다. 그러나 일반적인 임베딩은 인과적 속성과 우연한 패턴을 뒤섞을 수 있습니다.
예를 들어 야생동물 분류기는 학습 데이터 세트에 포함된 늑대 이미지 대부분의 배경이 눈으로 덮여 있기 때문에 눈과 늑대를 연관 지을 수 있습니다. 인과 표현은 동물의 정체성과 배경 조건을 분리하여 모델이 숲이나 초원에서도 늑대를 인식할 수 있도록 해야 합니다.
CRL에는 일반적으로 서로 연결된 세 가지 목표가 포함됩니다.
- 의미 있는 잠재 변수 복원: 표현은 편리한 예측 지름길이 아니라 관측값을 생성하는 기본 요인을 포착해야 합니다.
- 인과 구조 모델링: 변수 간 관계는 인과 모델 프레임워크에 설명된 원칙에 따라 방향성 그래프로 표현할 수 있습니다.
- 개입 상황에서도 안정성 유지: 한 요인을 변경하면 표현에서도 적절하고 국소적인 변화가 발생해야 합니다. DoWhy 개입 문서는 개입이 관측 데이터에 단순히 조건을 지정하는 것과 어떻게 다른지 보여줍니다.
개입은 로봇의 속도를 변경하는 것처럼 변수를 적극적으로 설정하는 것입니다. 반사실은 로봇이 더 느리게 움직였다면 충돌이 발생했을지와 같이 다른 설정에서 어떤 일이 일어났을지를 묻는 것입니다.
관련 개념 및 주요 차이점#
CRL은 여러 머신러닝 개념과 겹치지만 고유한 목표를 가집니다.
- **대조 학습**은 관련된 예시를 서로 가깝게 만들고 관련 없는 예시를 분리하여 표현을 학습합니다. 대조 학습은 CRL을 지원할 수 있지만, 유사성만으로 인과성이 확립되지는 않습니다.
- **자기 지도 학습**은 레이블이 지정되지 않은 데이터에서 학습 신호를 생성합니다. CRL은 이러한 신호를 사용하면서 개입, 환경, 시간 또는 인과 구조에 대한 가정을 추가할 수 있습니다.
- 인과 추론은 일반적으로 처치, 연령 및 회복과 같이 이미 정의된 변수 간의 효과를 추정합니다. CRL은 먼저 원시 지각 입력에서 유용한 인과 변수를 발견합니다. 이러한 차이는 더 광범위한 인과 표현 학습 개요의 핵심입니다.
- 분리 표현 학습은 독립적인 요인에 별도의 잠재 차원을 할당하려고 합니다. 분리된 표현이 반드시 인과적인 것은 아닙니다. 분리된 요인에 영향의 방향이나 개입에 대한 반응이 여전히 포함되지 않을 수 있기 때문입니다.
- 인과 발견은 변수 간의 관계를 탐색합니다. CRL은 여기에 더해 변수 자체도 학습합니다. 가능한 경우 후보 구조는 DoWhy 그래프 반증에 설명된 것처럼 테스트해야 합니다.
다중 뷰 CRL에서는 서로 다른 카메라나 센서가 동일한 시스템을 여러 관점에서 관측합니다. 부분 관측 가능성으로 인해 각 뷰는 일부 인과 요인만 보여줍니다. 서로 짝지어지지 않은 다중 도메인 설정은 서로 다른 환경의 관측값이 인스턴스별로 대응하지 않기 때문에 더 어렵습니다.
실제 적용 사례#
자율 로보틱스: 창고 로봇은 장애물 위치, 조명, 바닥 질감 및 자체 움직임에 대한 정보를 포함하는 카메라, 깊이 및 동작 데이터를 수신합니다. 인과 표현은 조향과 같이 제어 가능한 요인을 그림자와 같은 환경 요인과 분리할 수 있습니다. 도메인 랜덤화를 사용한 학습은 시스템을 제어된 변동에 노출할 수 있으며, 인과 구조는 어떤 변화가 내비게이션 결정에 영향을 미쳐야 하는지 판단하는 데 도움을 줍니다.
제조 검사: 결함 검출기는 생산 라인, 카메라 각도 또는 재료 색상을 결함 제품과 잘못 연관 지을 수 있습니다. CRL은 결함 유형, 기계 설정 및 조명을 별도의 요인으로 분리하는 데 도움을 줄 수 있습니다. 이를 통해 장비나 공장이 변경될 때 지름길 학습을 줄이고, 공정 온도나 압력이 결함에 기여했는지 아니면 단지 결함과 함께 나타났는지를 더 쉽게 조사할 수 있습니다.
실무 워크플로와 한계#
Ultralytics YOLO는 개발자가 별도의 인과 학습 파이프라인을 설계하기 전에 검사할 수 있는 표준 시각 임베딩을 생성합니다.
from ultralytics import YOLO
# Load a pretrained image classification model
model = YOLO("yolo26n-cls.pt")
# Generate an ordinary visual representation
source = "https://ultralytics.com/images/bus.jpg"
embeddings = model.embed(source)
# Inspect the selected image embedding
embedding = embeddings[0]
print(embedding.shape)문서화된 Ultralytics YOLO26 워크플로는 임베딩을 추출하지만, 그 자체로 표현을 인과적으로 만들지는 않습니다. 인과성을 확립하려면 적절한 데이터, 가정, 개입, 여러 환경 또는 시간적 증거가 필요합니다.
실무자는 방해 요인으로 의심되는 요소를 변경하고, 도메인 전반에서 성능을 평가하며, 데이터 세트 편향을 감사해야 합니다. Ultralytics Platform은 데이터 세트 어노테이션, 학습, 배포 및 제어된 데이터 세트 버전 관리를 지원할 수 있습니다. 배포 후에도 지속적인 모델 모니터링이 필수적입니다. 안정적인 검증 정확도가 인과적 타당성을 보장하지는 않기 때문입니다. 또한 평가는 보다 광범위한 AI 타당성 및 견고성에 대한 NIST 지침을 따라야 하며, Google의 데이터 세트 편향 식별 가이드에 설명된 것과 같은 하위 그룹 검사도 포함해야 합니다.









