Causal Representation Learning
Aprende el aprendizaje de representación causal (CRL) para ayudar a los modelos de IA a codificar factores de causa y efecto, mejorar la generalización y respaldar la robótica y la inspección de fabricación.
El aprendizaje de representación causal (CRL) es un enfoque de aprendizaje automático que pretende convertir observaciones complejas —como imágenes, vídeos, audio o lecturas de sensores— en variables de alto nivel que reflejan cómo el sistema subyacente produce relaciones de causa y efecto. En lugar de aprender características que simplemente predicen etiquetas, el CRL busca representaciones que se correspondan con factores significativos como la posición del objeto, la iluminación, el estado de la máquina o la acción humana.
El objetivo es conseguir que los modelos razonen sobre lo que puede ocurrir cuando un factor cambia, en lugar de depender únicamente de las correlaciones observadas durante el entrenamiento. Esto combina el aprendizaje de representación convencional mediante incrustaciones con ideas de la inferencia causal, lo que ayuda a los sistemas de inteligencia artificial a generalizar entre entornos y a respaldar intervenciones, preguntas contrafácticas y la toma de decisiones.
Cómo funciona el aprendizaje de representación causal#
Una red neuronal normalmente mapea entradas de alta dimensión en un espacio latente interno. Como se explica en la introducción a las incrustaciones de aprendizaje automático de Google, estos vectores compactos pueden preservar relaciones útiles a la vez que reducen la complejidad de la entrada. Sin embargo, una incrustación ordinaria puede mezclar propiedades causales con patrones accidentales.
Por ejemplo, un clasificador de fauna silvestre podría asociar la nieve con los lobos porque la mayoría de las imágenes de lobos en su conjunto de entrenamiento tienen fondos nevados. Una representación causal debe separar la identidad del animal de las condiciones del fondo, lo que permite al modelo reconocer lobos en bosques o praderas.
El CRL suele implicar tres objetivos conectados:
- Recuperar variables latentes significativas: La representación debe capturar los factores subyacentes que generan las observaciones, no solo atajos predictivos convenientes.
- Modelar la estructura causal: Las relaciones entre las variables se pueden expresar mediante un gráfico dirigido, siguiendo los principios descritos en los marcos de modelos causales.
- Permanece estable ante las intervenciones: Cambiar un factor debe producir un cambio apropiado y localizado en la representación. La documentación sobre intervenciones de DoWhy ilustra cómo difieren las intervenciones de simplemente condicionar los datos observados.
Una intervención establece activamente una variable, como cambiar la velocidad de un robot. En cambio, una pregunta contrafáctica plantea qué habría sucedido bajo un ajuste diferente, como si se habría producido una colisión si el robot se hubiera movido más despacio.
Conceptos relacionados y diferencias clave#
El CRL se solapa con varias ideas de aprendizaje automático, pero tiene un objetivo distinto.
- El aprendizaje contrastivo aprende representaciones acercando ejemplos relacionados y separando los no relacionados. Puede respaldar el CRL, pero la similitud por sí sola no establece la causalidad.
- El aprendizaje autosupervisado crea señales de entrenamiento a partir de datos sin etiquetar. El CRL puede utilizar estas señales al tiempo que añade suposiciones sobre intervenciones, entornos, tiempo o estructura causal.
- La inferencia causal suele estimar efectos entre variables ya definidas, como el tratamiento, la edad y la recuperación. El CRL descubre primero variables causales útiles a partir de datos perceptivos brutos. Esta distinción es fundamental para la descripción general del aprendizaje de representación causal más amplia.
- El aprendizaje de representación disentangled intenta asignar dimensiones latentes separadas a factores independientes. Una representación disentangled no es necesariamente causal porque los factores separados aún pueden omitir su dirección de influencia o su respuesta a la intervención.
- El descubrimiento causal busca relaciones entre variables. El CRL también aprende las propias variables. Las estructuras candidatas deben probarse siempre que sea posible, tal como se describe en la refutación de grafos de DoWhy.
En el CRL de múltiples vistas, diferentes cámaras o sensores observan el mismo sistema desde distintas perspectivas. La observabilidad parcial significa que cada vista revela solo algunos factores causales. Los entornos multimodominio no emparejados son más difíciles porque las observaciones de diferentes entornos no se corresponden instancia por instancia.
Aplicaciones en el mundo real#
Robótica autónoma: Un robot de almacén recibe datos de cámara, profundidad y movimiento que contienen información sobre la posición de los obstáculos, la iluminación, la textura del suelo y su propio desplazamiento. Una representación causal puede separar los factores controlables, como la dirección, de los factores ambientales, como las sombras. El entrenamiento con aleatorización de dominios puede exponer al sistema a una variación controlada, mientras que la estructura causal ayuda a determinar qué cambios deben afectar a las decisiones de navegación.
Inspección de fabricación: Un detector de defectos puede asociar incorrectamente una línea de producción, el ángulo de la cámara o el color del material con productos defectuosos. El CRL puede ayudar a aislar el tipo de defecto, los ajustes de la máquina y la iluminación como factores separados. Esto reduce el aprendizaje de atajos cuando el equipo o las fábricas cambian y facilita investigar si la temperatura o la presión del proceso contribuyeron a un defecto en lugar de aparecer simplemente junto a él.
Flujo de trabajo práctico y limitaciones#
Ultralytics YOLO puede generar incrustaciones visuales estándar que los desarrolladores pueden inspeccionar antes de diseñar una canalización de aprendizaje causal independiente:
from ultralytics import YOLO
# Load a pretrained image classification model
model = YOLO("yolo26n-cls.pt")
# Generate an ordinary visual representation
source = "https://ultralytics.com/images/bus.jpg"
embeddings = model.embed(source)
# Inspect the selected image embedding
embedding = embeddings[0]
print(embedding.shape)Este flujo de trabajo documentado de Ultralytics YOLO26 extrae una incrustación, pero no hace que la representación sea causal por sí misma. Establecer la causalidad requiere datos adecuados, suposiciones, intervenciones, múltiples entornos o evidencia temporal.
Los profesionales deben variar los factores molestos sospechosos, evaluar el rendimiento en todos los dominios y auditar el sesgo del conjunto de datos. La Ultralytics Platform puede respaldar la anotación de conjuntos de datos, el entrenamiento, el despliegue y el control de versiones de conjuntos de datos controlados. Después del despliegue, el seguimiento continuo del modelo es esencial porque una precisión de validación estable no garantiza la validez causal. La evaluación también debe seguir la orientación de NIST sobre la validez y robustez de la IA y más amplia, e incluir comprobaciones de subgrupos como las descritas en la guía para identificar el sesgo en conjuntos de datos de Google.






