Causal Representation Learning
Изучи обучение причинных представлений (CRL), помогающее моделям ИИ кодировать причинно-следственные факторы, улучшать обобщение и поддерживать робототехнику и промышленный контроль.
Каузальное обучение представлений (CRL) — это подход к машинному обучению, целью которого является преобразование сложных наблюдений — например, изображений, видео, аудио или показаний датчиков — в высокоуровневые переменные, отражающие то, как исходная система формирует причинно-следственные связи. Вместо обучения признаков, которые лишь предсказывают метки, CRL стремится создавать представления, соответствующие значимым факторам, таким как положение объекта, освещённость, состояние машины или действие человека.
Цель состоит в том, чтобы модели рассуждали о том, что может произойти при изменении фактора, а не полагались только на корреляции, наблюдавшиеся во время обучения. Это объединяет традиционное обучение представлений с помощью эмбеддингов с идеями из области каузального вывода, помогая системам ИИ обобщать знания в разных средах, поддерживать вмешательства, контрфактические вопросы и принятие решений.
Как работает каузальное обучение представлений#
Обычно нейронная сеть отображает многомерные входные данные во внутреннее латентное пространство. Как объясняется в введении Google в эмбеддинги машинного обучения, эти компактные векторы могут сохранять полезные взаимосвязи, одновременно снижая сложность входных данных. Однако обычный эмбеддинг может смешивать каузальные свойства со случайными закономерностями.
Например, классификатор диких животных может связать снег с волками, поскольку на большинстве изображений волков из его обучающего набора есть заснеженный фон. Каузальное представление должно отделять идентичность животного от условий фона, позволяя модели распознавать волков в лесах или на лугах.
CRL обычно включает три взаимосвязанные цели:
- Восстановление значимых латентных переменных: представление должно отражать исходные факторы, порождающие наблюдения, а не только удобные кратчайшие пути для предсказания.
- Моделирование каузальной структуры: отношения между переменными могут быть представлены в виде ориентированного графа в соответствии с принципами, описанными в структурах каузальных моделей.
- Стабильность при вмешательствах: изменение одного фактора должно приводить к соответствующему локальному изменению представления. В документации DoWhy по вмешательствам показано, чем вмешательства отличаются от простого обусловливания на основе наблюдаемых данных.
Вмешательство активно задаёт значение переменной, например изменяет скорость робота. Контрфактический вопрос, напротив, спрашивает, что произошло бы при другой настройке, например произошла бы авария, если бы робот двигался медленнее.
Связанные понятия и ключевые различия#
CRL пересекается с несколькими направлениями машинного обучения, но имеет отдельную цель.
- Контрастивное обучение обучает представления, сближая связанные примеры и разделяя несвязанные. Оно может поддерживать CRL, но одной лишь схожести недостаточно, чтобы установить причинность.
- Самообучение создаёт обучающие сигналы из неразмеченных данных. CRL может использовать эти сигналы, дополняя их предположениями о вмешательствах, средах, времени или каузальной структуре.
- Каузальный вывод обычно оценивает эффекты между уже определёнными переменными, такими как лечение, возраст и выздоровление. CRL сначала выявляет полезные каузальные переменные из исходных перцептивных данных. Это различие является ключевым для более общего обзора каузального обучения представлений.
- Обучение раз disentangled-представлений стремится назначить отдельные латентные измерения независимым факторам. Разделённое представление не обязательно является каузальным, поскольку разделённые факторы всё ещё могут не отражать направление влияния или реакцию на вмешательство.
- Каузальное обнаружение ищет связи между переменными. CRL дополнительно обучается самим переменным. По возможности кандидатные структуры следует проверять, как описано в материале DoWhy о рефутации графов.
В многопредставленческом CRL разные камеры или датчики наблюдают одну и ту же систему с разных точек зрения. Частичная наблюдаемость означает, что каждое представление раскрывает лишь некоторые каузальные факторы. Несопоставленные многодоменные сценарии сложнее, поскольку наблюдения из разных сред не соответствуют друг другу на уровне отдельных экземпляров.
Практические применения#
Автономная робототехника: складской робот получает данные с камеры, данные о глубине и движении, содержащие информацию о положении препятствий, освещении, текстуре пола и собственном движении. Каузальное представление может отделить управляемые факторы, такие как рулевое управление, от факторов среды, таких как тени. Обучение с помощью рандомизации домена может подвергнуть систему контролируемым вариациям, а каузальная структура помогает определить, какие изменения должны влиять на навигационные решения.
Производственная инспекция: детектор дефектов может ошибочно связать производственную линию, угол камеры или цвет материала с дефектной продукцией. CRL может помочь выделить тип дефекта, настройки машины и освещение как отдельные факторы. Это снижает обучение на случайных признаках при изменении оборудования или фабрик и облегчает выяснение того, способствовали ли дефекту температура или давление в процессе, а не просто сопутствовали ему.
Практический рабочий процесс и ограничения#
Ultralytics YOLO может создавать стандартные визуальные эмбеддинги, которые разработчики могут изучить перед проектированием отдельного конвейера каузального обучения:
from ultralytics import YOLO
# Load a pretrained image classification model
model = YOLO("yolo26n-cls.pt")
# Generate an ordinary visual representation
source = "https://ultralytics.com/images/bus.jpg"
embeddings = model.embed(source)
# Inspect the selected image embedding
embedding = embeddings[0]
print(embedding.shape)Этот задокументированный рабочий процесс Ultralytics YOLO26 извлекает эмбеддинг, но сам по себе не делает представление каузальным. Для установления причинности необходимы подходящие данные, предположения, вмешательства, несколько сред или временные свидетельства.
Разработчикам следует изменять предположительно мешающие факторы, оценивать производительность в разных доменах и проверять наличие смещения в наборе данных. Ultralytics Platform может поддерживать аннотирование наборов данных, обучение, развёртывание и контролируемое версионирование наборов данных. После развёртывания необходимо постоянно выполнять мониторинг модели, поскольку стабильная точность на валидации не гарантирует каузальную валидность. Оценивание также должно соответствовать более общим рекомендациям NIST по валидности и устойчивости ИИ и включать проверки подгрупп, например описанные в руководстве Google по выявлению смещения в наборе данных.









