Constitutional AI
Explore comment l'IA constitutionnelle aligne les modèles sur les valeurs humaines en utilisant des principes éthiques. Apprends à implémenter des contrôles de sécurité en vision par ordinateur avec Ultralytics YOLO26.
L'intelligence artificielle constitutionnelle est une méthode permettant d'entraîner des systèmes d'intelligence artificielle à s'aligner sur les valeurs humaines en leur fournissant un ensemble de principes de haut niveau — une « constitution » — plutôt que de s'appuyer uniquement sur de nombreux retours humains concernant des sorties individuelles. Cette approche enseigne essentiellement au modèle d'intelligence artificielle à critiquer et à réviser son propre comportement sur la base d'un ensemble de règles prédéfinies, telles que « sois utile », « sois inoffensif » et « évite la discrimination ». En intégrant ces directives éthiques directement dans le processus d'entraînement, les développeurs peuvent créer des systèmes qui sont plus sûrs, plus transparents et plus faciles à mettre à l'échelle que ceux qui dépendent d'un apprentissage par renforcement à partir de rétroaction humaine manuel Reinforcement Learning from Human Feedback (RLHF).
Le mécanisme de l'IA constitutionnelle#
L'innovation principale de l'intelligence artificielle constitutionnelle réside dans son processus d'entraînement en deux phases, qui automatise l'alignement des modèles. Contrairement à l'apprentissage supervisé traditionnel, où les humains doivent étiqueter chaque réponse correcte, l'intelligence artificielle constitutionnelle utilise le modèle lui-même pour générer des données d'entraînement.
-
Phase d'apprentissage supervisé : Le modèle génère des réponses à des invites, puis critique son propre résultat en fonction des principes constitutionnels. Il révise la réponse pour mieux s'aligner sur les règles. Cet ensemble de données affiné est ensuite utilisé pour affiner le modèle, lui apprenant à suivre intrinsèquement les directives.
-
Phase d'apprentissage par renforcement : Cette phase, souvent appelée Reinforcement Learning from AI Feedback (RLAIF), remplace l'évaluateur humain. L'intelligence artificielle génère des paires de réponses et sélectionne celle qui respecte le mieux la constitution. Ces données de préférence entraînent un modèle de récompense, qui renforce ensuite les comportements souhaités via des techniques d'apprentissage par renforcement standard.
Pertinence pour la vision par ordinateur#
Bien que l'intelligence artificielle constitutionnelle trouve son origine dans le contexte des grands modèles de langage (LLM) développés par des organisations telles que Anthropic, ses principes sont de plus en plus pertinents pour des tâches d'apprentissage automatique plus larges, y compris la vision par ordinateur (CV).
- Génération d'images éthique : Les outils d'intelligence artificielle générative permettant de créer des images peuvent être entraînés de manière « constitutionnelle » pour refuser des invites qui généreraient du contenu visuel violent, haineux ou protégé par le droit d'auteur. Cela garantit que les poids du modèle encodent eux-mêmes les contraintes de sécurité, empêchant la création de contenus visuels nuisibles.
- Systèmes de vision critiques pour la sécurité : Dans les véhicules autonomes, une approche « constitutionnelle » peut définir des règles hiérarchiques pour la prise de décision. Par exemple, une règle stipulant que « la sécurité humaine prime sur l'efficacité du trafic » peut guider le modèle lors de l'analyse de scènes routières complexes, garantissant que les résultats de la détection d'objets sont interprétés en faisant de la sécurité la priorité.
Mise en œuvre de contrôles de politique dans l'IA de vision#
Bien que l'entraînement complet en Constitutional AI implique des boucles de rétroaction complexes, tu peux appliquer le concept de "contrôles constitutionnels" lors de l'inference pour filtrer les sorties en fonction de politiques de sécurité. L'exemple suivant montre comment utiliser Ultralytics YOLO26 pour détecter des objets et appliquer une règle de sécurité pour filtrer les détections à faible confiance, imitant ainsi une constitution de fiabilité.
from ultralytics import YOLO
# Load the YOLO26 model (latest stable Ultralytics release)
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Apply a "constitutional" safety check: Only accept high-confidence detections
for result in results:
# Filter boxes with confidence > 0.5 to ensure reliability
safe_boxes = [box for box in result.boxes if box.conf > 0.5]
print(f"Safety Check Passed: {len(safe_boxes)} reliable objects detected.")
# Further processing would only use 'safe_boxes'IA constitutionnelle vs RLHF conventionnel#
Il est important de distinguer l'intelligence artificielle constitutionnelle de l'apprentissage par renforcement à partir de rétroaction humaine Reinforcement Learning from Human Feedback (RLHF) standard.
- Évolutivité : Le RLHF nécessite une quantité considérable de travail humain pour évaluer les sorties du modèle, ce qui est coûteux et lent. L'intelligence artificielle constitutionnelle automatise cela avec des agents d'intelligence artificielle, la rendant hautement évolutive.
- Transparence : Dans le cadre du RLHF, le modèle apprend à partir d'un « signal de récompense » opaque (un score), ce qui rend difficile de savoir pourquoi un comportement a été préféré. Dans l'intelligence artificielle constitutionnelle, l'incitation par chaîne de pensée utilisée pendant la phase de critique rend le raisonnement explicite et traçable à des principes écrits spécifiques.
- Cohérence : Les évaluateurs humains peuvent être incohérents ou biaisés. Une constitution écrite fournit une base stable pour l'éthique de l'intelligence artificielle, réduisant la subjectivité dans le processus d'alignement.
L'avenir de l'alignement#
À mesure que les modèles évoluent vers l'intelligence artificielle générale (AGI), l'importance de stratégies d'alignement robustes telles que l'intelligence artificielle constitutionnelle augmente. Ces méthodes sont essentielles pour se conformer aux normes émergentes émanant d'organismes tels que l'Institut de sécurité de l'IA du NIST.
La plateforme Ultralytics offre des outils pour gérer la gouvernance des données et la surveillance des modèles, facilitant ainsi la création de systèmes d'intelligence artificielle responsables. En intégrant ces considérations éthiques dans le cycle de vie du développement de l'intelligence artificielle — de la collecte de données au déploiement de modèles — les organisations peuvent atténuer les risques et veiller à ce que leurs technologies contribuent positivement à la société.






