Constitutional AI
Explora cómo la IA constitucional alinea los modelos con los valores humanos mediante principios éticos. Aprende a implementar comprobaciones de seguridad en visión por ordenador con Ultralytics YOLO26.
La IA constitucional es un método para entrenar sistemas de inteligencia artificial con el fin de alinearlos con los valores humanos, proporcionándoles un conjunto de principios de alto nivel —una «constitución»— en lugar de depender únicamente de una gran cantidad de comentarios humanos sobre resultados individuales. Este enfoque enseña esencialmente al modelo de IA a criticar y revisar su propio comportamiento basándose en un conjunto predefinido de reglas, como «ser útil», «no causar daño» y «evitar la discriminación». Al incorporar estas directrices éticas directamente en el proceso de entrenamiento, los desarrolladores pueden crear sistemas más seguros, transparentes y fáciles de escalar que los que dependen del aprendizaje por refuerzo a partir de comentarios humanos (RLHF) manuales.
El mecanismo de la IA constitucional#
La principal innovación de la IA constitucional reside en su proceso de entrenamiento en dos fases, que automatiza el alineamiento de los modelos. A diferencia del aprendizaje supervisado tradicional, en el que los humanos deben etiquetar cada respuesta correcta, la IA constitucional utiliza el propio modelo para generar datos de entrenamiento.
-
Fase de aprendizaje supervisado: El modelo genera respuestas a las indicaciones y, a continuación, critica sus propios resultados basándose en los principios constitucionales. Revisa la respuesta para ajustarla mejor a las reglas. Este conjunto de datos refinado se utiliza después para ajustar el modelo, enseñándole a seguir las directrices de forma inherente.
-
Fase de aprendizaje por refuerzo: Esta fase, denominada a menudo aprendizaje por refuerzo a partir de comentarios de la IA (RLAIF), sustituye al etiquetador humano. La IA genera pares de respuestas y selecciona la que mejor cumple la constitución. Estos datos de preferencias entrenan un modelo de recompensa, que posteriormente refuerza los comportamientos deseados mediante técnicas estándar de aprendizaje por refuerzo.
Relevancia para la visión artificial#
Aunque la IA constitucional se originó en el contexto de los modelos de lenguaje de gran tamaño (LLM) desarrollados por organizaciones como Anthropic, sus principios son cada vez más relevantes para tareas de aprendizaje automático más amplias, incluida la visión artificial (CV).
- Generación ética de imágenes: Las herramientas de IA generativa para crear imágenes pueden entrenarse de forma «constitucional» para rechazar indicaciones que generarían imágenes violentas, que inciten al odio o estén protegidas por derechos de autor. Esto garantiza que los propios pesos del modelo incorporen restricciones de seguridad, evitando la creación de contenido visual perjudicial.
- Sistemas de visión críticos para la seguridad: En los vehículos autónomos, un enfoque «constitucional» puede definir reglas jerárquicas para la toma de decisiones. Por ejemplo, una regla que establezca que «la seguridad humana prevalece sobre la eficiencia del tráfico» puede guiar al modelo al analizar escenas viales complejas, garantizando que los resultados de la detección de objetos se interpreten priorizando la seguridad.
Implementación de comprobaciones de políticas en la IA de visión#
Aunque el entrenamiento completo de la IA constitucional implica ciclos de comentarios complejos, los desarrolladores pueden aplicar el concepto de «comprobaciones constitucionales» durante la inferencia para filtrar los resultados en función de políticas de seguridad. El siguiente ejemplo muestra cómo utilizar Ultralytics YOLO26 para detectar objetos y aplicar una regla de seguridad que filtre las detecciones con un nivel de confianza bajo, imitando una constitución de fiabilidad.
from ultralytics import YOLO
# Load the YOLO26 model (latest stable Ultralytics release)
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Apply a "constitutional" safety check: Only accept high-confidence detections
for result in results:
# Filter boxes with confidence > 0.5 to ensure reliability
safe_boxes = [box for box in result.boxes if box.conf > 0.5]
print(f"Safety Check Passed: {len(safe_boxes)} reliable objects detected.")
# Further processing would only use 'safe_boxes'IA constitucional frente a RLHF convencional#
Es importante distinguir la IA constitucional del aprendizaje por refuerzo a partir de comentarios humanos (RLHF) estándar.
- Escalabilidad: RLHF requiere grandes cantidades de trabajo humano para valorar los resultados del modelo, lo que resulta caro y lento. La IA constitucional automatiza este proceso mediante agentes de IA, lo que la hace altamente escalable.
- Transparencia: En RLHF, el modelo aprende a partir de una «señal de recompensa» opaca —una puntuación—, por lo que resulta difícil saber por qué se ha preferido un comportamiento. En la IA constitucional, el prompting de cadena de pensamiento utilizado durante la fase de crítica hace explícito el razonamiento y permite rastrearlo hasta principios escritos específicos.
- Coherencia: Los evaluadores humanos pueden ser incoherentes o estar sesgados. Una constitución escrita proporciona una base estable para la ética de la IA, reduciendo la subjetividad en el proceso de alineamiento.
El futuro del alineamiento#
A medida que los modelos evolucionan hacia la inteligencia artificial general (AGI), aumenta la importancia de contar con estrategias de alineamiento sólidas, como la IA constitucional. Estos métodos son esenciales para cumplir las normas emergentes de organismos como el Instituto de Seguridad de la IA del NIST.
La Plataforma de Ultralytics ofrece herramientas para gestionar la gobernanza de datos y la supervisión de modelos, facilitando la creación de sistemas de IA responsables. Al integrar estas consideraciones éticas en el ciclo de vida del desarrollo de la IA —desde la recopilación de datos hasta la implementación del modelo—, las organizaciones pueden mitigar los riesgos y garantizar que sus tecnologías contribuyan positivamente a la sociedad.









