Constitutional AI
Esplora come la Constitutional AI allinea i modelli ai valori umani usando principi etici. Impara a implementare controlli di sicurezza nella computer vision con Ultralytics YOLO26.
L'IA costituzionale è un metodo per addestrare i sistemi di intelligenza artificiale ad allinearsi ai valori umani fornendo loro un insieme di principi di alto livello, una "costituzione", invece di affidarsi esclusivamente a un ampio feedback umano sui singoli output. Questo approccio insegna essenzialmente al modello di IA a criticare e rivedere il proprio comportamento sulla base di un insieme predefinito di regole, come "essere utile", "non arrecare danno" ed "evitare la discriminazione". Incorporando queste linee guida etiche direttamente nel processo di addestramento, gli sviluppatori possono creare sistemi più sicuri, trasparenti e facili da scalare rispetto a quelli che dipendono dal Reinforcement Learning from Human Feedback (RLHF) manuale.
Il meccanismo dell'IA costituzionale#
L'innovazione principale dell'IA costituzionale risiede nel suo processo di addestramento in due fasi, che automatizza l'allineamento dei modelli. A differenza del tradizionale apprendimento supervisionato, in cui gli esseri umani devono etichettare ogni risposta corretta, l'IA costituzionale utilizza il modello stesso per generare i dati di addestramento.
-
Fase di apprendimento supervisionato: il modello genera risposte ai prompt, quindi critica il proprio output sulla base dei principi costituzionali. Rivede la risposta per allinearla meglio alle regole. Questo set di dati perfezionato viene quindi utilizzato per il fine-tuning del modello, insegnandogli a seguire intrinsecamente le linee guida.
-
Fase di apprendimento per rinforzo: questa fase, spesso chiamata Reinforcement Learning from AI Feedback (RLAIF), sostituisce l'annotatore umano. L'IA genera coppie di risposte e seleziona quella che aderisce meglio alla costituzione. Questi dati sulle preferenze addestrano un modello di ricompensa, che quindi rafforza i comportamenti desiderati tramite tecniche standard di apprendimento per rinforzo.
Rilevanza per la computer vision#
Sebbene l'IA costituzionale sia nata nel contesto dei modelli linguistici di grandi dimensioni (LLM) sviluppati da organizzazioni come Anthropic, i suoi principi sono sempre più rilevanti per attività di machine learning più ampie, tra cui la visione artificiale (CV).
- Generazione etica di immagini: gli strumenti di IA generativa per la creazione di immagini possono essere addestrati in modo "costituzionale" a rifiutare prompt che genererebbero immagini violente, d'odio o protette da copyright. In questo modo, gli stessi pesi del modello incorporano vincoli di sicurezza, impedendo la creazione di contenuti visivi dannosi.
- Sistemi di visione critici per la sicurezza: nei veicoli autonomi, un approccio "costituzionale" può definire regole gerarchiche per il processo decisionale. Ad esempio, una regola secondo cui "la sicurezza delle persone prevale sull'efficienza del traffico" può guidare il modello nell'analisi di scene stradali complesse, garantendo che i risultati del rilevamento degli oggetti vengano interpretati dando priorità alla sicurezza.
Implementazione dei controlli delle policy nell'IA per la visione#
Sebbene l'addestramento completo dell'IA costituzionale comporti complessi cicli di feedback, gli sviluppatori possono applicare il concetto di "controlli costituzionali" durante l'inferenza per filtrare gli output sulla base delle policy di sicurezza. L'esempio seguente mostra come utilizzare Ultralytics YOLO26 per rilevare gli oggetti e applicare una regola di sicurezza per filtrare i rilevamenti con bassa confidenza, imitando una costituzione dell'affidabilità.
from ultralytics import YOLO
# Load the YOLO26 model (latest stable Ultralytics release)
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Apply a "constitutional" safety check: Only accept high-confidence detections
for result in results:
# Filter boxes with confidence > 0.5 to ensure reliability
safe_boxes = [box for box in result.boxes if box.conf > 0.5]
print(f"Safety Check Passed: {len(safe_boxes)} reliable objects detected.")
# Further processing would only use 'safe_boxes'IA costituzionale a confronto con il RLHF convenzionale#
È importante distinguere l'IA costituzionale dal Reinforcement Learning from Human Feedback (RLHF) standard.
- Scalabilità: il RLHF richiede una grande quantità di lavoro umano per valutare gli output del modello, il che è costoso e lento. L'IA costituzionale automatizza questo processo con gli agenti di IA, rendendolo altamente scalabile.
- Trasparenza: nel RLHF, il modello apprende da un "segnale di ricompensa" opaco, ovvero un punteggio, rendendo difficile capire perché un comportamento sia stato preferito. Nell'IA costituzionale, il prompting della catena di pensiero utilizzato durante la fase di critica rende esplicito il ragionamento e lo riconduce a specifici principi scritti.
- Coerenza: i valutatori umani possono essere incoerenti o prevenuti. Una costituzione scritta fornisce una base stabile per l'etica dell'IA, riducendo la soggettività nel processo di allineamento.
Il futuro dell'allineamento#
Man mano che i modelli evolvono verso l'intelligenza artificiale generale (AGI), aumenta l'importanza di strategie di allineamento solide come l'IA costituzionale. Questi metodi sono essenziali per rispettare gli standard emergenti degli enti come il NIST AI Safety Institute.
La Ultralytics Platform offre strumenti per gestire la governance dei dati e il monitoraggio dei modelli, facilitando la creazione di sistemi di IA responsabili. Integrando queste considerazioni etiche nel ciclo di vita dello sviluppo dell'IA, dalla raccolta dei dati alla distribuzione del modello, le organizzazioni possono mitigare i rischi e garantire che le loro tecnologie contribuiscano positivamente alla società.









