YOLO Vision 2026:
Voltar para o Glossário da Ultralytics

Reinforcement Learning with Verifiable Rewards (RLVR)

Descobre o Aprendizado por Reforço com Recompensas Verificáveis (RLVR). Aprende a treinar IA avançada usando feedback determinístico e o Ultralytics YOLO26.

A Aprendizagem por Reforço com Recompensas Verificáveis (RLVR) é um paradigma de treino avançado utilizado para melhorar as capacidades de raciocínio e resolução de problemas dos modelos de inteligência artificial (AI). Ao contrário dos métodos de treino tradicionais que dependem de dados de preferência anotados por humanos, o RLVR utiliza sistemas baseados em regras determinísticos para avaliar a saída de um modelo. Ao fornecer uma recompensa binária objetiva — tal como verificar se um pedaço de código gerado compila ou se uma equação matemática é resolvida corretamente —, o RLVR permite que os modelos aprendam através de exploração sem restrições. Este ciclo de feedback objetivo é um motor fundamental por trás dos recentes avanços em modelos de raciocínio altamente capazes, permitindo-lhes descobrir caminhos lógicos ótimos e complexos sem intervenção humana contínua.

Princípios Fundamentais do RLVR#

Em ambientes de aprendizagem automática (ML) padrão, um agente de AI aprende maximizando um sinal de recompensa. No RLVR, este sinal de recompensa é gerado por um sistema de programação rígido em vez de julgamento humano subjetivo. O processo de aprendizagem baseia-se em alguns passos fundamentais:

  • Estratégia de Exploração: O modelo gera múltiplas soluções potenciais ou caminhos de raciocínio para um determinado prompt, utilizando frequentemente prompts de cadeia de pensamento (chain-of-thought) para decompor tarefas complexas.
  • Verificação Determinística: Uma ferramenta externa — tal como um compilador Python, uma calculadora ou um sistema de perceção de visão computacional (CV) — verifica a saída final face a critérios de sucesso objetivos.
  • Otimização de Política: Se a saída for comprovadamente correta, o modelo recebe uma recompensa positiva. A política do modelo é então atualizada utilizando algoritmos de otimização como o Group Relative Policy Optimization (GRPO) ou o Proximal Policy Optimization (PPO) para favorecer caminhos de raciocínio bem-sucedidos.

Esta abordagem melhora significativamente a eficiência da latência de inferência de um modelo no momento do treino e incentiva capacidades de raciocínio emergentes, uma técnica recentemente utilizada para treinar modelos altamente capazes como o DeepSeek-R1.

RLVR vs. RLHF e PRMs#

É importante diferenciar o RLVR de outros paradigmas de alinhamento e treinamento no ecossistema de IA:

  • vs. Aprendizagem por Reforço a partir de Feedback Humano (RLHF): O RLHF baseia-se num sistema de modelagem de recompensa aprendido treinado com base em preferências humanas subjetivas. O RLVR elimina o estrangulamento do humano no circuito (human-in-the-loop) ao apoiar-se estritamente em verdades programáticas e objetivas, tornando-o altamente escalável para tarefas com respostas definitivas certas ou erradas.
  • vs. Modelo de Recompensa de Processo (PRM): Enquanto os PRMs fornecem feedback granular, passo a passo, ao longo da trajetória de raciocínio de um modelo, o RLVR foca-se tipicamente no resultado verificável no final de um processo. No entanto, investigações recentes de 2025 indicam que a otimização para uma recompensa final verificável no RLVR incentiva implicitamente passos de raciocínio intermédios corretos também.

Aplicações no Mundo Real#

O RLVR está transformando a forma como sistemas complexos de IA são treinados em vários domínios determinísticos:

  • Raciocínio Matemático: Grandes modelos de raciocínio, como a série o da OpenAI, tiram partido do RLVR para resolver teoremas matemáticos complexos. O verificador atua como um motor que prova definitivamente se a resposta derivada do modelo está correta, impulsionando significativamente o desempenho do conjunto de dados de benchmark.
  • Engenharia de Software e Geração de Código: Os assistentes de código de AI utilizam o RLVR para escrever, depurar e otimizar código. A recompensa verificável é alcançada quando o código gerado compila com sucesso e passa num conjunto de testes unitários automatizados.
  • Agentes de Visão Autónomos: Em ambientes físicos, os agentes autónomos recebem recompensas verificáveis ao alcançar um destino-alvo ou ao manipular com sucesso um objeto. Os modelos de visão atuam como o verificador de condições verificáveis nestes espaços.

Implementando uma Recompensa Verificável em Visão por IA#

Em ambientes físicos e visuais, os modelos de perceção como o Ultralytics YOLO26 podem servir como verificador programático num ciclo RLVR. Por exemplo, se o objetivo de um agente de AI for mover um objeto para uma zona específica, o modelo YOLO pode verificar o sucesso detetando a presença do objeto nessa zona.

O seguinte snippet em Python demonstra um verificador programático conceptual utilizando o pacote ultralytics.

from ultralytics import YOLO

# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")


def get_verifiable_reward(image_path: str, target_class: int) -> float:
    """Returns a verifiable reward of 1.0 if the target object is detected."""
    results = verifier_model(image_path)

    # Check if the desired class (e.g., 0 for 'person') exists in the detections
    detected_classes = results[0].boxes.cls.tolist()
    if target_class in detected_classes:
        return 1.0  # Verifiable success
    return 0.0  # Verifiable failure


# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")

Ao tirar partido de plataformas em nuvem como a Ultralytics Platform para implementar estes verificadores de perceção, os programadores podem construir pipelines RLVR robustos e escaláveis que treinam a próxima geração de agentes autónomos e de raciocínio.

Explore solutions

Real-time AI that works with your team

IA em robótica

Potencialize máquinas mais inteligentes com modelos Ultralytics YOLO. A IA de visão em robótica impulsiona a navegação autônoma, percepção, rastreamento de objetos e controle em tempo real.
Sabe mais
Real-time AI that works with your team

IA na Logística

Otimize a logística com modelos Ultralytics YOLO. A IA de visão permite a inspeção de pacotes, triagem, rastreamento de veículos e monitoramento de segurança em armazéns em tempo real.
Sabe mais
Real-time AI that works with your team

IA no varejo

Reinvente o varejo com modelos Ultralytics YOLO. A IA de visão impulsiona o rastreamento de inventário, monitoramento de prateleiras, gerenciamento de filas e percepções mais inteligentes sobre o cliente.
Sabe mais
Real-time AI that works with your team

IA na Saúde

Constrói soluções de saúde com modelos Ultralytics YOLO. A visão AI na saúde impulsiona imagens médicas mais rápidas, diagnósticos mais inteligentes e monitorização do paciente.
Sabe mais
Real-time AI that works with your team

IA na Fabricação

Otimize a fabricação com modelos Ultralytics YOLO. A IA de visão impulsiona o controle de qualidade, detecção de defeitos, conformidade com EPI e automação de linhas de montagem.
Sabe mais
Real-time AI that works with your operation

IA no Setor Automóvel

Aplica visão computacional no setor automóvel com modelos Ultralytics YOLO. A visão AI eleva a segurança rodoviária, a assistência ao condutor e a automação de veículos para estradas mais inteligentes.
Sabe mais
Real-time AI tailored to your operation

IA na Agricultura

Leva a visão AI para a agricultura inteligente com os modelos Ultralytics YOLO. Potencia a monitorização de culturas, o seguimento de gado e a agricultura de precisão para colheitas maiores e mais inteligentes.
Sabe mais
Real-time AI that works with your team

IA em robótica

Potencialize máquinas mais inteligentes com modelos Ultralytics YOLO. A IA de visão em robótica impulsiona a navegação autônoma, percepção, rastreamento de objetos e controle em tempo real.
Sabe mais
Real-time AI that works with your team

IA na Logística

Otimize a logística com modelos Ultralytics YOLO. A IA de visão permite a inspeção de pacotes, triagem, rastreamento de veículos e monitoramento de segurança em armazéns em tempo real.
Sabe mais
Real-time AI that works with your team

IA no varejo

Reinvente o varejo com modelos Ultralytics YOLO. A IA de visão impulsiona o rastreamento de inventário, monitoramento de prateleiras, gerenciamento de filas e percepções mais inteligentes sobre o cliente.
Sabe mais
Real-time AI that works with your team

IA na Saúde

Constrói soluções de saúde com modelos Ultralytics YOLO. A visão AI na saúde impulsiona imagens médicas mais rápidas, diagnósticos mais inteligentes e monitorização do paciente.
Sabe mais
Real-time AI that works with your team

IA na Fabricação

Otimize a fabricação com modelos Ultralytics YOLO. A IA de visão impulsiona o controle de qualidade, detecção de defeitos, conformidade com EPI e automação de linhas de montagem.
Sabe mais
Real-time AI that works with your operation

IA no Setor Automóvel

Aplica visão computacional no setor automóvel com modelos Ultralytics YOLO. A visão AI eleva a segurança rodoviária, a assistência ao condutor e a automação de veículos para estradas mais inteligentes.
Sabe mais
Real-time AI tailored to your operation

IA na Agricultura

Leva a visão AI para a agricultura inteligente com os modelos Ultralytics YOLO. Potencia a monitorização de culturas, o seguimento de gado e a agricultura de precisão para colheitas maiores e mais inteligentes.
Sabe mais
Real-time AI that works with your team

IA em robótica

Potencialize máquinas mais inteligentes com modelos Ultralytics YOLO. A IA de visão em robótica impulsiona a navegação autônoma, percepção, rastreamento de objetos e controle em tempo real.
Sabe mais
Real-time AI that works with your team

IA na Logística

Otimize a logística com modelos Ultralytics YOLO. A IA de visão permite a inspeção de pacotes, triagem, rastreamento de veículos e monitoramento de segurança em armazéns em tempo real.
Sabe mais
Real-time AI that works with your team

IA no varejo

Reinvente o varejo com modelos Ultralytics YOLO. A IA de visão impulsiona o rastreamento de inventário, monitoramento de prateleiras, gerenciamento de filas e percepções mais inteligentes sobre o cliente.
Sabe mais
Real-time AI that works with your team

IA na Saúde

Constrói soluções de saúde com modelos Ultralytics YOLO. A visão AI na saúde impulsiona imagens médicas mais rápidas, diagnósticos mais inteligentes e monitorização do paciente.
Sabe mais
Real-time AI that works with your team

IA na Fabricação

Otimize a fabricação com modelos Ultralytics YOLO. A IA de visão impulsiona o controle de qualidade, detecção de defeitos, conformidade com EPI e automação de linhas de montagem.
Sabe mais
Real-time AI that works with your operation

IA no Setor Automóvel

Aplica visão computacional no setor automóvel com modelos Ultralytics YOLO. A visão AI eleva a segurança rodoviária, a assistência ao condutor e a automação de veículos para estradas mais inteligentes.
Sabe mais
Real-time AI tailored to your operation

IA na Agricultura

Leva a visão AI para a agricultura inteligente com os modelos Ultralytics YOLO. Potencia a monitorização de culturas, o seguimento de gado e a agricultura de precisão para colheitas maiores e mais inteligentes.
Sabe mais

Vamos construir o futuro da IA juntos!

Começa a tua jornada com o futuro da aprendizagem automática