Constitutional AI
Explora como a IA Constitucional alinha os modelos com os valores humanos usando princípios éticos. Aprende a implementar verificações de segurança em Visão Computacional com o Ultralytics YOLO26.
A IA Constitucional é um método para treinar sistemas de inteligência artificial de modo a alinhá-los com os valores humanos, fornecendo-lhes um conjunto de princípios de alto nível — uma "constituição" — em vez de depender exclusivamente de feedback humano extensivo sobre resultados individuais. Essa abordagem ensina essencialmente o modelo de IA a criticar e rever o seu próprio comportamento com base num conjunto predefinido de regras, como "ser útil", "não causar danos" e "evitar a discriminação". Ao incorporar diretamente estas diretrizes éticas no processo de treino, os programadores podem criar sistemas mais seguros, transparentes e fáceis de escalar do que aqueles que dependem de Aprendizagem por Reforço a partir de Feedback Humano (RLHF) manual.
O mecanismo da IA Constitucional#
A principal inovação da IA Constitucional está no seu processo de treino em duas fases, que automatiza o alinhamento dos modelos. Ao contrário da aprendizagem supervisionada tradicional, na qual os humanos têm de identificar cada resposta correta, a IA Constitucional utiliza o próprio modelo para gerar dados de treino.
-
Fase de Aprendizagem Supervisionada: O modelo gera respostas a prompts e, em seguida, critica o seu próprio resultado com base nos princípios constitucionais. Depois, revê a resposta para a alinhar melhor com as regras. Este conjunto de dados refinado é então utilizado para ajustar o modelo, ensinando-o a seguir as diretrizes de forma inerente.
-
Fase de Aprendizagem por Reforço: Esta fase, frequentemente chamada de Aprendizagem por Reforço a partir de Feedback de IA (RLAIF), substitui o avaliador humano. A IA gera pares de respostas e seleciona aquela que melhor respeita a constituição. Estes dados de preferências treinam um modelo de recompensa, que reforça os comportamentos desejados através de técnicas padrão de aprendizagem por reforço.
Relevância para a Visão Computacional#
Embora a IA Constitucional tenha surgido no contexto de Modelos de Linguagem de Grande Escala (LLM) desenvolvidos por organizações como a Anthropic, os seus princípios são cada vez mais relevantes para tarefas de aprendizagem automática mais amplas, incluindo a Visão Computacional (CV).
- Geração Ética de Imagens: As ferramentas de IA Generativa para criar imagens podem ser treinadas de forma "constitucional" para recusarem prompts que gerariam imagens violentas, odiosas ou protegidas por direitos de autor. Isto garante que os próprios pesos do modelo codificam restrições de segurança, impedindo a criação de conteúdos visuais prejudiciais.
- Sistemas de Visão Críticos para a Segurança: Em veículos autónomos, uma abordagem "constitucional" pode definir regras hierárquicas para a tomada de decisões. Por exemplo, uma regra que estabeleça que "a segurança humana se sobrepõe à eficiência do trânsito" pode orientar o modelo ao analisar cenas rodoviárias complexas, garantindo que os resultados da deteção de objetos sejam interpretados dando prioridade à segurança.
Implementação de Verificações de Políticas em IA de Visão#
Embora o treino completo de IA Constitucional envolva ciclos de feedback complexos, os programadores podem aplicar o conceito de "verificações constitucionais" durante a inferência para filtrar resultados com base em políticas de segurança. O exemplo seguinte demonstra a utilização do Ultralytics YOLO26 para detetar objetos e a aplicação de uma regra de segurança para filtrar deteções com baixa confiança, imitando uma constituição de fiabilidade.
from ultralytics import YOLO
# Load the YOLO26 model (latest stable Ultralytics release)
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Apply a "constitutional" safety check: Only accept high-confidence detections
for result in results:
# Filter boxes with confidence > 0.5 to ensure reliability
safe_boxes = [box for box in result.boxes if box.conf > 0.5]
print(f"Safety Check Passed: {len(safe_boxes)} reliable objects detected.")
# Further processing would only use 'safe_boxes'IA Constitucional vs. RLHF Convencional#
É importante distinguir a IA Constitucional da Aprendizagem por Reforço a partir de Feedback Humano (RLHF) padrão.
- Escalabilidade: O RLHF requer grandes quantidades de trabalho humano para avaliar os resultados do modelo, o que é dispendioso e lento. A IA Constitucional automatiza este processo com agentes de IA, tornando-o altamente escalável.
- Transparência: No RLHF, o modelo aprende a partir de um "sinal de recompensa" opaco (uma pontuação), o que dificulta compreender por que razão um comportamento foi preferido. Na IA Constitucional, o prompting de cadeia de pensamento utilizado durante a fase de crítica torna o raciocínio explícito e rastreável até princípios escritos específicos.
- Consistência: Os avaliadores humanos podem ser inconsistentes ou tendenciosos. Uma constituição escrita fornece uma base estável para a ética da IA, reduzindo a subjetividade no processo de alinhamento.
O futuro do alinhamento#
À medida que os modelos evoluem em direção à Inteligência Artificial Geral (AGI), aumenta a importância de estratégias de alinhamento robustas, como a IA Constitucional. Estes métodos são essenciais para cumprir as normas emergentes de entidades como o Instituto de Segurança da IA do NIST.
A Plataforma Ultralytics oferece ferramentas para gerir a governação de dados e a monitorização de modelos, facilitando a criação de sistemas de IA responsáveis. Ao integrar estas considerações éticas no ciclo de vida do desenvolvimento de IA — desde a recolha de dados até à implementação de modelos — as organizações podem mitigar riscos e garantir que as suas tecnologias contribuem positivamente para a sociedade.









