Causal Representation Learning
Aprende sobre el aprendizaje de representaciones causales (CRL) para ayudar a los modelos de IA a codificar factores de causa y efecto, mejorar la generalización y dar soporte a la robótica y la inspección industrial.
El aprendizaje de representaciones causales (CRL) es un enfoque de aprendizaje automático que tiene como objetivo convertir observaciones complejas —como imágenes, vídeos, audio o lecturas de sensores— en variables de alto nivel que reflejen cómo el sistema subyacente produce relaciones de causa y efecto. En lugar de aprender características que simplemente predicen etiquetas, el CRL busca representaciones que correspondan a factores significativos, como la posición de un objeto, la iluminación, el estado de una máquina o una acción humana.
El objetivo es que los modelos razonen sobre lo que puede ocurrir cuando cambia un factor, en lugar de basarse únicamente en las correlaciones observadas durante el entrenamiento. Esto combina el aprendizaje convencional de representaciones mediante embeddings con ideas de la inferencia causal, lo que ayuda a los sistemas de IA a generalizar entre entornos y a admitir intervenciones, preguntas contrafactuales y toma de decisiones.
Cómo funciona el aprendizaje de representaciones causales#
Normalmente, una red neuronal transforma una entrada de alta dimensionalidad en un espacio latente interno. Como se explica en la introducción de Google a los embeddings de aprendizaje automático, estos vectores compactos pueden conservar relaciones útiles y, al mismo tiempo, reducir la complejidad de la entrada. Sin embargo, un embedding convencional puede mezclar propiedades causales con patrones accidentales.
Por ejemplo, un clasificador de fauna podría asociar la nieve con los lobos porque la mayoría de las imágenes de lobos de su conjunto de entrenamiento tienen fondos nevados. Una representación causal debería separar la identidad del animal de las condiciones del fondo, de modo que el modelo pueda reconocer lobos en bosques o praderas.
El CRL suele incluir tres objetivos relacionados:
- Recuperar variables latentes significativas: La representación debería captar los factores subyacentes que generan las observaciones, no solo atajos predictivos convenientes.
- Modelar la estructura causal: Las relaciones entre variables pueden expresarse mediante un grafo dirigido, siguiendo los principios descritos en los marcos de modelos causales.
- Mantener la estabilidad bajo intervenciones: Cambiar un factor debería producir un cambio adecuado y localizado en la representación. La documentación de intervenciones de DoWhy muestra en qué se diferencian las intervenciones de condicionarse simplemente a los datos observados.
Una intervención establece activamente una variable, como cambiar la velocidad de un robot. Un contrafactual pregunta qué habría ocurrido con una configuración diferente, por ejemplo, si se habría producido una colisión si el robot se hubiera movido más despacio.
Conceptos relacionados y diferencias clave#
El CRL se solapa con varias ideas del aprendizaje automático, pero tiene un objetivo distinto.
- El aprendizaje contrastivo aprende representaciones acercando los ejemplos relacionados y separando los que no están relacionados. Puede contribuir al CRL, pero la similitud por sí sola no demuestra causalidad.
- El aprendizaje autosupervisado crea señales de entrenamiento a partir de datos sin etiquetar. El CRL puede utilizar estas señales y añadir supuestos sobre intervenciones, entornos, tiempo o estructura causal.
- La inferencia causal suele estimar efectos entre variables ya definidas, como el tratamiento, la edad y la recuperación. El CRL descubre primero variables causales útiles a partir de entradas perceptivas sin procesar. Esta distinción es fundamental para la visión general más amplia del aprendizaje de representaciones causales.
- El aprendizaje de representaciones disentangled intenta asignar dimensiones latentes independientes a factores independientes. Una representación disentangled no es necesariamente causal, porque los factores separados aún pueden omitir la dirección de su influencia o su respuesta a una intervención.
- El descubrimiento causal busca relaciones entre variables. El CRL también aprende las propias variables. Las estructuras candidatas deberían ponerse a prueba siempre que sea posible, tal como se describe en la refutación de grafos de DoWhy.
En el CRL con múltiples vistas, distintas cámaras o sensores observan el mismo sistema desde perspectivas diferentes. La observabilidad parcial implica que cada vista revela solo algunos factores causales. Las configuraciones no emparejadas y multidominio son más difíciles porque las observaciones de distintos entornos no se corresponden instancia por instancia.
Aplicaciones en el mundo real#
Robótica autónoma: Un robot de almacén recibe datos de cámara, profundidad y movimiento que contienen información sobre la posición de los obstáculos, la iluminación, la textura del suelo y su propio movimiento. Una representación causal puede separar los factores controlables, como la dirección, de los factores ambientales, como las sombras. El entrenamiento con aleatorización de dominio puede exponer el sistema a variaciones controladas, mientras que la estructura causal ayuda a determinar qué cambios deberían afectar a las decisiones de navegación.
Inspección industrial: Un detector de defectos puede asociar incorrectamente una línea de producción, un ángulo de cámara o el color del material con productos defectuosos. El CRL puede ayudar a aislar el tipo de defecto, los ajustes de la máquina y la iluminación como factores independientes. Esto reduce el aprendizaje basado en atajos cuando cambian los equipos o las fábricas y facilita investigar si la temperatura o la presión del proceso contribuyeron a un defecto, en lugar de limitarse a aparecer junto a él.
Flujo de trabajo práctico y limitaciones#
Ultralytics YOLO puede generar embeddings visuales estándar que los desarrolladores pueden inspeccionar antes de diseñar una canalización independiente de aprendizaje causal:
from ultralytics import YOLO
# Load a pretrained image classification model
model = YOLO("yolo26n-cls.pt")
# Generate an ordinary visual representation
source = "https://ultralytics.com/images/bus.jpg"
embeddings = model.embed(source)
# Inspect the selected image embedding
embedding = embeddings[0]
print(embedding.shape)Este flujo de trabajo documentado de Ultralytics YOLO26 extrae un embedding, pero no convierte la representación en causal por sí mismo. Establecer la causalidad requiere datos adecuados, supuestos, intervenciones, múltiples entornos o evidencias temporales.
Los profesionales deberían variar los factores perturbadores sospechosos, evaluar el rendimiento en distintos dominios y auditar el sesgo del conjunto de datos. La Ultralytics Platform puede contribuir a la anotación de conjuntos de datos, el entrenamiento, la implementación y el control de versiones de conjuntos de datos. Tras la implementación, la supervisión continua del modelo es esencial, porque una precisión de validación estable no garantiza la validez causal. La evaluación también debería seguir las directrices más amplias del NIST sobre validez y solidez de la IA e incluir comprobaciones por subgrupos, como las descritas en la guía de Google para identificar el sesgo de los conjuntos de datos.









