Reinforcement Learning with Verifiable Rewards (RLVR)
Descobre o aprendizado por reforço com recompensas verificáveis (RLVR). Aprende como treinar IA avançada usando feedback determinístico e o Ultralytics YOLO26.
A Aprendizagem por Reforço com Recompensas Verificáveis (RLVR) é um paradigma avançado de treinamento usado para aprimorar a capacidade de raciocínio e resolução de problemas de modelos de inteligência artificial (AI). Ao contrário dos métodos tradicionais de treinamento, que dependem de dados de preferências anotados por humanos, o RLVR utiliza sistemas baseados em regras determinísticos para avaliar a saída de um modelo. Ao fornecer uma recompensa binária objetiva — como verificar se um trecho de código gerado compila ou se uma equação matemática foi resolvida corretamente —, o RLVR permite que os modelos aprendam por meio de exploração irrestrita. Esse ciclo de feedback objetivo é um dos principais fatores por trás dos avanços recentes em modelos de raciocínio altamente capazes, permitindo-lhes descobrir caminhos lógicos complexos e ideais sem intervenção humana contínua.
Princípios fundamentais do RLVR#
Em ambientes padrão de aprendizagem automática (ML), um agente de IA aprende maximizando um sinal de recompensa. No RLVR, esse sinal de recompensa é gerado por um sistema de programação rígido, em vez de depender do julgamento subjetivo de humanos. O processo de aprendizagem baseia-se em algumas etapas fundamentais:
- Estratégia de exploração: O modelo gera várias soluções ou linhas de raciocínio possíveis para um determinado prompt, recorrendo frequentemente a prompts de cadeia de pensamento para decompor tarefas complexas.
- Verificação determinística: Uma ferramenta externa — como um compilador Python, uma calculadora ou um sistema de percepção de visão computacional (CV) — verifica a saída final em relação a critérios objetivos de sucesso.
- Otimização de política: Se a saída for comprovadamente correta, o modelo recebe uma recompensa positiva. Em seguida, a política do modelo é atualizada usando algoritmos de otimização como a Otimização de Política Relativa em Grupo (GRPO) ou a Otimização de Política Proximal (PPO) para favorecer linhas de raciocínio bem-sucedidas.
Essa abordagem melhora significativamente a eficiência da latência de inferência de um modelo durante o treinamento e incentiva capacidades emergentes de raciocínio; a técnica foi usada recentemente para treinar modelos altamente capazes como o DeepSeek-R1.
RLVR vs. RLHF e PRMs#
É importante distinguir o RLVR de outros paradigmas de alinhamento e treinamento no ecossistema de IA:
- vs. Aprendizagem por Reforço com Feedback Humano (RLHF): O RLHF depende de um sistema de modelagem de recompensa aprendido com preferências humanas subjetivas. O RLVR elimina o gargalo da participação humana ao depender estritamente de verdades programáticas objetivas, o que o torna altamente escalável para tarefas com respostas definitivamente certas ou erradas.
- vs. Modelo de Recompensa de Processo (PRM): Enquanto os PRMs fornecem feedback granular, etapa por etapa, ao longo da trajetória de raciocínio de um modelo, o RLVR costuma focar no resultado verificável ao final do processo. No entanto, pesquisas recentes de 2025 indicam que otimizar uma recompensa final verificável no RLVR também incentiva implicitamente etapas intermediárias de raciocínio corretas.
Aplicações no mundo real#
O RLVR está transformando a forma como sistemas complexos de IA são treinados em vários domínios determinísticos:
- Raciocínio matemático: Grandes modelos de raciocínio, como os da série o da OpenAI, recorrem ao RLVR para resolver teoremas matemáticos complexos. O verificador funciona como um mecanismo que comprova de forma conclusiva se a resposta deduzida pelo modelo está correta, aumentando significativamente o desempenho em conjuntos de dados de benchmark.
- Engenharia de software e geração de código: Os assistentes de programação com IA usam RLVR para escrever, depurar e otimizar código. A recompensa verificável é obtida quando o código gerado compila corretamente e passa por um conjunto de testes unitários automatizados.
- Agentes autónomos de visão: Em ambientes físicos, os agentes autónomos recebem recompensas verificáveis ao chegar a um destino ou manipular um objeto com sucesso. Os modelos de visão atuam como verificadores das condições nesses ambientes.
Implementação de uma recompensa verificável em IA de visão#
Em ambientes físicos e visuais, modelos de percepção como a Ultralytics YOLO26 podem atuar como verificadores programáticos num ciclo RLVR. Por exemplo, se o objetivo de um agente de IA for mover um objeto para uma zona específica, o modelo YOLO pode verificar o sucesso detetando a presença do objeto nessa zona.
O seguinte trecho de Python demonstra um verificador programático conceitual usando o pacote ultralytics.
from ultralytics import YOLO
# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")
def get_verifiable_reward(image_path: str, target_class: int) -> float:
"""Returns a verifiable reward of 1.0 if the target object is detected."""
results = verifier_model(image_path)
# Check if the desired class (e.g., 0 for 'person') exists in the detections
detected_classes = results[0].boxes.cls.tolist()
if target_class in detected_classes:
return 1.0 # Verifiable success
return 0.0 # Verifiable failure
# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")Ao recorrer a plataformas na nuvem como a Ultralytics Platform para implementar estes verificadores de percepção, os desenvolvedores podem criar pipelines RLVR robustos e escaláveis para treinar a próxima geração de agentes autónomos e de raciocínio.









