Concept Bottleneck Models
Aprende cómo los modelos de cuello de botella conceptual mejoran la IA explicable con conceptos comprensibles para los humanos, intervención de expertos y flujos de trabajo de visión prácticos de Ultralytics YOLO26.
Los modelos de cuello de botella conceptual (CBM) son redes neuronales que realizan una predicción a través de una capa intermedia de conceptos comprensibles para los humanos. En lugar de asignar una entrada directamente a una etiqueta final, un CBM predice primero atributos significativos —como “ala roja”, “grieta superficial” o “estrechamiento articular”— y luego utiliza únicamente dichos atributos para generar su decisión. Esta estructura hace que el modelo sea más fácil de inspeccionar, depurar y corregir que un modelo de caja negra convencional.
Cómo funcionan los modelos de cuello de botella conceptual#
Una red neuronal estándar representa a menudo la información en un espacio latente opaco. Un CBM sustituye una parte de esa representación oculta por un vector de conceptos cuyas dimensiones tienen significados definidos.
Su canalización de predicción consta de dos etapas principales:
- Un predictor de conceptos asigna la entrada sin procesar, como una imagen, a valores de concepto.
- Un predictor de objetivos asigna dichos valores de concepto a la clase o puntuación final.
Por ejemplo, un clasificador de aves puede predecir “pico negro”, “pecho blanco” y “cola larga” antes de identificar la especie. Los conceptos pueden ser binarios, categóricos o continuos. Por lo general, se aprenden mediante aprendizaje supervisado, lo que requiere que cada ejemplo de entrenamiento incluya tanto etiquetas de destino como anotaciones de conceptos.
Las dos etapas se pueden entrenar de forma independiente, secuencial o conjunta. El entrenamiento independiente hace que la separación sea explícita, mientras que el entrenamiento conjunto puede equilibrar la calidad del concepto frente al rendimiento en la tarea final. En cualquier caso, el cuello de botella debe restringir el predictor de objetivos a los conceptos declarados; de lo contrario, la información oculta podría eludir la explicación prevista.
Por qué importan la interpretabilidad y la intervención#
Los CBM son una forma de IA explicable intrínseca: su estructura interpretable está integrada en la predicción en lugar de añadirse a posteriori. Esto difiere de las herramientas posteriores al evento como los mapas de saliencia, que estiman qué influyó en una caja negra ya entrenada.
La capa de conceptos admite varias interacciones útiles:
- Los usuarios pueden inspeccionar qué conceptos provocaron una decisión.
- Los expertos en la materia pueden corregir un concepto impreciso y volver a calcular la salida.
- Los desarrolladores pueden comprobar si el predictor de objetivos sigue una lógica de dominio válida.
- Los equipos pueden medir la precisión de los conceptos de forma independiente a la precisión de la tarea final.
Estas capacidades se alinean con la guía del NIST sobre IA explicable y los controles centrados en las personas analizados en la Guía de Personas + IA. Sin embargo, una explicación comprensible no es automáticamente una explicación correcta. La fidelidad de los conceptos debe evaluarse en lugar de darse por sentada.
Aplicaciones en el mundo real#
-
Análisis de imágenes médicas: Un modelo que examine una radiografía puede estimar conceptos como espolones óseos, estrechamiento del espacio articular y esclerosis antes de calificar la gravedad de la enfermedad. Un clínico puede revisar o corregir estos hallazgos intermedios en lugar de recibir únicamente una puntuación de gravedad. Esta interacción entre humano y modelo es especialmente relevante para los principios de transparencia de la FDA para dispositivos médicos de aprendizaje automático.
-
Inspección visual de fabricación: Un sistema de visión puede identificar conceptos como componentes faltantes, grietas, decoloración o alineación incorrecta, y luego utilizarlos para decidir si un producto pasa la inspección o requiere una reparación concreta. La detección de objetos puede localizar componentes y defectos, mientras que el clasificador basado en conceptos posterior proporciona una decisión de calidad auditable.
Limitaciones y conceptos relacionados#
Las etiquetas de conceptos generan costes adicionales de anotación de datos y pueden requerir conocimientos especializados. Los conceptos mal definidos pueden ser subjetivos, estar correlacionados, ser incompletos o difíciles de reconocer a partir de la entrada. Los equipos deben crear reglas de etiquetado precisas y auditar los desacuerdos entre los anotadores.
Otros riesgos importantes incluyen errores de predicción de conceptos, puntuaciones no calibradas y la fuga de conceptos, donde los valores de conceptos continuos codifican información no intencionada más allá de su significado declarado. Las directrices sobre la calibración de probabilidades pueden ayudar a determinar si los valores de confianza de los conceptos son fiables.
Un CBM también es diferente de la ingeniería de características: las características diseñadas son entradas calculadas manualmente, mientras que los conceptos se suelen predecir a partir de datos sin procesar y se supervisan explícitamente. Tampoco es lo mismo que el principio del cuello de botella de información, que comprime las representaciones sin exigir que cada dimensión sea legible por humanos.
El rendimiento de los conceptos debe comprobarse en las porciones de datos relevantes, ya que las anotaciones sesgadas o los conceptos faltantes pueden producir errores desiguales. La guía de Google para identificar sesgos en ML y el marco NIST AI RMF Core proporcionan prácticas útiles de evaluación y gobernanza.
Construcción de una canalización de visión práctica#
Un modelo Ultralytics YOLO26 puede actuar como extractor de conceptos visuales ascendente. El siguiente flujo de trabajo del modo Predict recopila las clases de objetos detectados como señales de conceptos candidatos:
from ultralytics import YOLO
# Load a pretrained visual concept extractor
model = YOLO("yolo26n.pt")
# Run inference and select the first result
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Convert detected classes into human-readable concept candidates
concepts = {result.names[int(class_id)] for class_id in result.boxes.cls}
print(sorted(concepts))
result.save(filename="concept_candidates.jpg")Esto no es un CBM completo: aún se debe entrenar un modelo posterior para predecir el objetivo final exclusivamente a partir de los conceptos seleccionados. Los equipos pueden usar Ultralytics Platform para anotar datos visuales, entrenar extractores de conceptos, comparar experimentos y supervisar componentes implementados. Evalúe la precisión de los conceptos, la precisión de los objetivos, la calibración, el comportamiento de intervención y los subgrupos importantes por separado utilizando un flujo de trabajo de evaluación de modelos estructurado.






