YOLO Vision 2026:
Voltar para o Glossário da Ultralytics

Reward Modeling

Explore a modelagem de recompensa em machine learning. Aprenda como ela usa feedback humano para alinhar agentes de IA e modelos Ultralytics YOLO26 para um desempenho mais seguro e preciso.

A modelagem de recompensa é uma técnica de aprendizado de máquina usada para ensinar sistemas de inteligência artificial a avaliar e priorizar seus próprios comportamentos com base em preferências humanas. Em ambientes tradicionais de reinforcement learning, um AI agent aprende maximizando uma função de recompensa predefinida e rigidamente matemática, como a pontuação em um videogame. No entanto, para tarefas complexas do mundo real em que o comportamento "bom" é subjetivo ou sutil — como escrever um e-mail educado ou navegar em um cruzamento com segurança —, escrever uma função de recompensa perfeita à mão é quase impossível. A modelagem de recompensa resolve isso treinando uma neural network secundária (o modelo de recompensa) para agir como um proxy para o julgamento humano. Esse modelo avalia as saídas da IA principal e atribui pontuações escalares, guiando dinamicamente o modelo principal em direção a comportamentos seguros, úteis e precisos.

Como a Modelagem de Recompensa Funciona#

O pipeline para construir um modelo de recompensa depende fortemente da coleta de feedback humano de alta qualidade.

  • Data Labeling e Preferências: Os anotadores humanos recebem prompts juntamente com múltiplas respostas geradas por um modelo de IA. Os avaliadores classificam essas respostas da melhor para a pior com base em critérios como utilidade, inocuidade e precisão. O gerenciamento desses fluxos de trabalho de anotação em grande escala pode ser tratado perfeitamente usando a Ultralytics Platform.
  • Treinando a Rede Proxy: Uma rede neural especializada é treinada neste conjunto de dados de comparações humanas. Por meio de um processo de otimização, ela aprende a prever qual saída um humano preferiria, mapeando os embeddings de uma ação ou resposta de texto para um único valor de recompensa escalar. Você pode ler mais sobre a construção de arquiteturas de redes neurais na PyTorch API documentation.
  • Otimização de Política: O modelo principal usa o feedback contínuo do modelo de recompensa para refinar suas ações, normalmente utilizando algoritmos como Proximal Policy Optimization (PPO). Esta etapa alinha iterativamente a política do modelo com a intenção humana aprendida.

Modelagem de Recompensa vs. RLHF#

É importante diferenciar a modelagem de recompensa de Reinforcement Learning from Human Feedback (RLHF). Embora os dois termos sejam discutidos com frequência juntos, eles não são sinônimos. O RLHF é o pipeline completo de ponta a ponta usado para alinhas modelos, abrangendo fine-tuning supervisionado, coleta de dados e atualizações de políticas. A modelagem de recompensa é um componente específico e crucial dentro do pipeline RLHF. Ela serve como a ponte que traduz classificações humanas discretas em um sinal matemático contínuo que o algoritmo de aprendizado por reforço pode otimizar.

Aplicações no Mundo Real#

A modelagem de recompensa é fundamental no desenvolvimento de sistemas de IA modernos que interagem diretamente com humanos e com o mundo físico.

  • Large Language Models (LLMs): Assistentes de IA conversacional dependem de modelos de recompensa para garantir que suas respostas não sejam apenas factualmente corretas, mas também educadas, relevantes e livres de linguagem tóxica. Organizações que exploram AI safety avançam continuamente na modelagem de recompensa para construir sistemas que refletem o helpful and harmless AI alignment.
  • Autonomous Vehicles e Robótica: Na automação física, os modelos de recompensa ajudam os robôs a entender etiquetas de direção complexas ou estratégias de manipulação de objetos. Um sistema de percepção alimentado por Ultralytics YOLO26 pode detectar pedestres e placas de trânsito, enquanto um modelo de recompensa avalia a trajetória planejada do veículo, garantindo que a IA priorize o conforto e a segurança do passageiro em vez de uma navegação de ponto a ponto puramente agressiva.

Implementando um Conceito de Modelo de Recompensa Básico#

O exemplo em Python a seguir usa torch para demonstrar a estrutura fundamental de um modelo de recompensa. Na prática, esta rede aprende a atribuir uma pontuação escalar mais alta a uma saída que se alinha com as preferências humanas.

import torch
import torch.nn as nn


# Define a simplified reward model architecture
class SimpleRewardModel(nn.Module):
    def __init__(self):
        super().__init__()
        # Maps the AI's output embedding to a single reward score
        self.fc = nn.Linear(768, 1)

    def forward(self, embeddings):
        return self.fc(embeddings)


# Initialize the model
reward_model = SimpleRewardModel()

# Simulated embeddings for a human-preferred action and a rejected action
chosen_action = torch.randn(1, 768)
rejected_action = torch.randn(1, 768)

# The model predicts scalar scores to guide the primary agent
print(f"Chosen Action Reward: {reward_model(chosen_action).item():.4f}")
print(f"Rejected Action Reward: {reward_model(rejected_action).item():.4f}")

Para um mergulho mais profundo em como o alinhamento impacta os modelos de fundação de código aberto, explore pesquisas fundamentais sobre como alinhar modelos de linguagem com a intenção humana e aprenda como os sistemas de computer vision (CV) aproveitam loops de feedback avançados para interagir com segurança com ambientes dinâmicos.

Explore solutions

Real-time AI that works with your team

Visão computacional em robótica

Potencialize máquinas mais inteligentes com modelos Ultralytics YOLO. A IA de visão em robótica impulsiona a navegação autônoma, percepção, rastreamento de objetos e controle em tempo real.
Sabe mais
Real-time AI that works with your team

Visão computacional em logística

Otimize a logística com modelos Ultralytics YOLO. A IA de visão permite a inspeção de pacotes, triagem, rastreamento de veículos e monitoramento de segurança em armazéns em tempo real.
Sabe mais
Real-time AI that works with your team

Visão computacional no varejo

Reinvente o varejo com modelos Ultralytics YOLO. A IA de visão impulsiona o rastreamento de inventário, monitoramento de prateleiras, gerenciamento de filas e percepções mais inteligentes sobre o cliente.
Sabe mais
Real-time AI that works with your team

Visão computacional nos cuidados de saúde

Constrói soluções de saúde com modelos Ultralytics YOLO. A visão AI na saúde impulsiona imagens médicas mais rápidas, diagnósticos mais inteligentes e monitorização do paciente.
Sabe mais
Real-time AI that works with your team

Visão computacional na fabricação

Otimize a fabricação com modelos Ultralytics YOLO. A IA de visão impulsiona o controle de qualidade, detecção de defeitos, conformidade com EPI e automação de linhas de montagem.
Sabe mais
Real-time AI that works with your operation

Visão computacional no setor automóvel

Aplica visão computacional no setor automóvel com modelos Ultralytics YOLO. A visão AI eleva a segurança rodoviária, a assistência ao condutor e a automação de veículos para estradas mais inteligentes.
Sabe mais
Real-time AI tailored to your operation

Visão computacional na agricultura

Leva a visão AI para a agricultura inteligente com os modelos Ultralytics YOLO. Potencia a monitorização de culturas, o seguimento de gado e a agricultura de precisão para colheitas maiores e mais inteligentes.
Sabe mais
Real-time AI that works with your team

Visão computacional em robótica

Potencialize máquinas mais inteligentes com modelos Ultralytics YOLO. A IA de visão em robótica impulsiona a navegação autônoma, percepção, rastreamento de objetos e controle em tempo real.
Sabe mais
Real-time AI that works with your team

Visão computacional em logística

Otimize a logística com modelos Ultralytics YOLO. A IA de visão permite a inspeção de pacotes, triagem, rastreamento de veículos e monitoramento de segurança em armazéns em tempo real.
Sabe mais
Real-time AI that works with your team

Visão computacional no varejo

Reinvente o varejo com modelos Ultralytics YOLO. A IA de visão impulsiona o rastreamento de inventário, monitoramento de prateleiras, gerenciamento de filas e percepções mais inteligentes sobre o cliente.
Sabe mais
Real-time AI that works with your team

Visão computacional nos cuidados de saúde

Constrói soluções de saúde com modelos Ultralytics YOLO. A visão AI na saúde impulsiona imagens médicas mais rápidas, diagnósticos mais inteligentes e monitorização do paciente.
Sabe mais
Real-time AI that works with your team

Visão computacional na fabricação

Otimize a fabricação com modelos Ultralytics YOLO. A IA de visão impulsiona o controle de qualidade, detecção de defeitos, conformidade com EPI e automação de linhas de montagem.
Sabe mais
Real-time AI that works with your operation

Visão computacional no setor automóvel

Aplica visão computacional no setor automóvel com modelos Ultralytics YOLO. A visão AI eleva a segurança rodoviária, a assistência ao condutor e a automação de veículos para estradas mais inteligentes.
Sabe mais
Real-time AI tailored to your operation

Visão computacional na agricultura

Leva a visão AI para a agricultura inteligente com os modelos Ultralytics YOLO. Potencia a monitorização de culturas, o seguimento de gado e a agricultura de precisão para colheitas maiores e mais inteligentes.
Sabe mais
Real-time AI that works with your team

Visão computacional em robótica

Potencialize máquinas mais inteligentes com modelos Ultralytics YOLO. A IA de visão em robótica impulsiona a navegação autônoma, percepção, rastreamento de objetos e controle em tempo real.
Sabe mais
Real-time AI that works with your team

Visão computacional em logística

Otimize a logística com modelos Ultralytics YOLO. A IA de visão permite a inspeção de pacotes, triagem, rastreamento de veículos e monitoramento de segurança em armazéns em tempo real.
Sabe mais
Real-time AI that works with your team

Visão computacional no varejo

Reinvente o varejo com modelos Ultralytics YOLO. A IA de visão impulsiona o rastreamento de inventário, monitoramento de prateleiras, gerenciamento de filas e percepções mais inteligentes sobre o cliente.
Sabe mais
Real-time AI that works with your team

Visão computacional nos cuidados de saúde

Constrói soluções de saúde com modelos Ultralytics YOLO. A visão AI na saúde impulsiona imagens médicas mais rápidas, diagnósticos mais inteligentes e monitorização do paciente.
Sabe mais
Real-time AI that works with your team

Visão computacional na fabricação

Otimize a fabricação com modelos Ultralytics YOLO. A IA de visão impulsiona o controle de qualidade, detecção de defeitos, conformidade com EPI e automação de linhas de montagem.
Sabe mais
Real-time AI that works with your operation

Visão computacional no setor automóvel

Aplica visão computacional no setor automóvel com modelos Ultralytics YOLO. A visão AI eleva a segurança rodoviária, a assistência ao condutor e a automação de veículos para estradas mais inteligentes.
Sabe mais
Real-time AI tailored to your operation

Visão computacional na agricultura

Leva a visão AI para a agricultura inteligente com os modelos Ultralytics YOLO. Potencia a monitorização de culturas, o seguimento de gado e a agricultura de precisão para colheitas maiores e mais inteligentes.
Sabe mais

Vamos construir o futuro da IA juntos!

Começa a tua jornada com o futuro da aprendizagem automática