Reinforcement Learning with Verifiable Rewards (RLVR)
Descobre o Aprendizado por Reforço com Recompensas Verificáveis (RLVR). Aprende a treinar IA avançada usando feedback determinístico e o Ultralytics YOLO26.
A Aprendizagem por Reforço com Recompensas Verificáveis (RLVR) é um paradigma de treino avançado utilizado para melhorar as capacidades de raciocínio e resolução de problemas dos modelos de inteligência artificial (AI). Ao contrário dos métodos de treino tradicionais que dependem de dados de preferência anotados por humanos, o RLVR utiliza sistemas baseados em regras determinísticos para avaliar a saída de um modelo. Ao fornecer uma recompensa binária objetiva — tal como verificar se um pedaço de código gerado compila ou se uma equação matemática é resolvida corretamente —, o RLVR permite que os modelos aprendam através de exploração sem restrições. Este ciclo de feedback objetivo é um motor fundamental por trás dos recentes avanços em modelos de raciocínio altamente capazes, permitindo-lhes descobrir caminhos lógicos ótimos e complexos sem intervenção humana contínua.
Princípios Fundamentais do RLVR#
Em ambientes de aprendizagem automática (ML) padrão, um agente de AI aprende maximizando um sinal de recompensa. No RLVR, este sinal de recompensa é gerado por um sistema de programação rígido em vez de julgamento humano subjetivo. O processo de aprendizagem baseia-se em alguns passos fundamentais:
- Estratégia de Exploração: O modelo gera múltiplas soluções potenciais ou caminhos de raciocínio para um determinado prompt, utilizando frequentemente prompts de cadeia de pensamento (chain-of-thought) para decompor tarefas complexas.
- Verificação Determinística: Uma ferramenta externa — tal como um compilador Python, uma calculadora ou um sistema de perceção de visão computacional (CV) — verifica a saída final face a critérios de sucesso objetivos.
- Otimização de Política: Se a saída for comprovadamente correta, o modelo recebe uma recompensa positiva. A política do modelo é então atualizada utilizando algoritmos de otimização como o Group Relative Policy Optimization (GRPO) ou o Proximal Policy Optimization (PPO) para favorecer caminhos de raciocínio bem-sucedidos.
Esta abordagem melhora significativamente a eficiência da latência de inferência de um modelo no momento do treino e incentiva capacidades de raciocínio emergentes, uma técnica recentemente utilizada para treinar modelos altamente capazes como o DeepSeek-R1.
RLVR vs. RLHF e PRMs#
É importante diferenciar o RLVR de outros paradigmas de alinhamento e treinamento no ecossistema de IA:
- vs. Aprendizagem por Reforço a partir de Feedback Humano (RLHF): O RLHF baseia-se num sistema de modelagem de recompensa aprendido treinado com base em preferências humanas subjetivas. O RLVR elimina o estrangulamento do humano no circuito (human-in-the-loop) ao apoiar-se estritamente em verdades programáticas e objetivas, tornando-o altamente escalável para tarefas com respostas definitivas certas ou erradas.
- vs. Modelo de Recompensa de Processo (PRM): Enquanto os PRMs fornecem feedback granular, passo a passo, ao longo da trajetória de raciocínio de um modelo, o RLVR foca-se tipicamente no resultado verificável no final de um processo. No entanto, investigações recentes de 2025 indicam que a otimização para uma recompensa final verificável no RLVR incentiva implicitamente passos de raciocínio intermédios corretos também.
Aplicações no Mundo Real#
O RLVR está transformando a forma como sistemas complexos de IA são treinados em vários domínios determinísticos:
- Raciocínio Matemático: Grandes modelos de raciocínio, como a série o da OpenAI, tiram partido do RLVR para resolver teoremas matemáticos complexos. O verificador atua como um motor que prova definitivamente se a resposta derivada do modelo está correta, impulsionando significativamente o desempenho do conjunto de dados de benchmark.
- Engenharia de Software e Geração de Código: Os assistentes de código de AI utilizam o RLVR para escrever, depurar e otimizar código. A recompensa verificável é alcançada quando o código gerado compila com sucesso e passa num conjunto de testes unitários automatizados.
- Agentes de Visão Autónomos: Em ambientes físicos, os agentes autónomos recebem recompensas verificáveis ao alcançar um destino-alvo ou ao manipular com sucesso um objeto. Os modelos de visão atuam como o verificador de condições verificáveis nestes espaços.
Implementando uma Recompensa Verificável em Visão por IA#
Em ambientes físicos e visuais, os modelos de perceção como o Ultralytics YOLO26 podem servir como verificador programático num ciclo RLVR. Por exemplo, se o objetivo de um agente de AI for mover um objeto para uma zona específica, o modelo YOLO pode verificar o sucesso detetando a presença do objeto nessa zona.
O seguinte snippet em Python demonstra um verificador programático conceptual utilizando o pacote ultralytics.
from ultralytics import YOLO
# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")
def get_verifiable_reward(image_path: str, target_class: int) -> float:
"""Returns a verifiable reward of 1.0 if the target object is detected."""
results = verifier_model(image_path)
# Check if the desired class (e.g., 0 for 'person') exists in the detections
detected_classes = results[0].boxes.cls.tolist()
if target_class in detected_classes:
return 1.0 # Verifiable success
return 0.0 # Verifiable failure
# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")Ao tirar partido de plataformas em nuvem como a Ultralytics Platform para implementar estes verificadores de perceção, os programadores podem construir pipelines RLVR robustos e escaláveis que treinam a próxima geração de agentes autónomos e de raciocínio.






