Ultralytics YOLO27:
Voltar ao Glossário da Ultralytics

Reinforcement Learning from Human Feedback (RLHF)

Aprende como a aprendizagem por reforço a partir de feedback humano (RLHF) alinha a IA com os valores humanos. Explora os seus componentes fundamentais e a integração com o Ultralytics YOLO26.

A Aprendizagem por Reforço com Feedback Humano (RLHF) é uma técnica avançada de aprendizagem automática que aperfeiçoa modelos de inteligência artificial ao incorporar contributos humanos diretos no ciclo de treino. Ao contrário da aprendizagem supervisionada padrão, que depende exclusivamente de conjuntos de dados estáticos e anotados, a RLHF introduz um mecanismo de feedback dinâmico no qual avaliadores humanos classificam ou avaliam as saídas do modelo. Este processo permite à IA captar objetivos complexos, subjetivos ou subtis — como "utilidade", "segurança" ou "criatividade" — que são difíceis de definir com uma simples função de perda matemática. A RLHF tornou-se fundamental no desenvolvimento de modelos de linguagem de grande escala (LLMs) modernos e de IA generativa, garantindo que modelos fundacionais avançados se alinhem eficazmente com os valores humanos e a intenção do utilizador.

Os componentes principais da RLHF#

O processo de RLHF segue geralmente um pipeline de três etapas, concebido para colmatar a diferença entre as capacidades preditivas brutas e um comportamento alinhado com as pessoas.

  1. Ajuste fino supervisionado (SFT): O fluxo de trabalho começa normalmente com um modelo de base pré-treinado. Os programadores realizam um ajuste fino inicial utilizando um conjunto de dados mais pequeno e de alta qualidade, composto por demonstrações (por exemplo, pares de perguntas e respostas escritos por especialistas). Esta etapa estabelece uma política de base, ensinando ao modelo o formato geral e o tom esperados para a tarefa.

  2. Treino do modelo de recompensa: Esta fase é a característica distintiva da RLHF. Anotadores humanos analisam várias saídas geradas pelo modelo para a mesma entrada e ordenam-nas da melhor para a pior. Este esforço de anotação de dados gera um conjunto de dados de preferências. Uma rede neuronal separada, denominada modelo de recompensa, é treinada com estes dados de comparação para prever uma pontuação escalar que reflita o julgamento humano. As ferramentas disponíveis na Ultralytics Platform podem simplificar a gestão destes fluxos de trabalho de anotação.

  3. Otimização por aprendizagem por reforço: Por fim, o modelo original atua como um agente de IA num ambiente de aprendizagem por reforço. Utilizando o modelo de recompensa como orientação, algoritmos de otimização como a Otimização de Política Proximal (PPO) ajustam os parâmetros do modelo para maximizar a recompensa esperada. Esta etapa alinha a política do modelo com as preferências humanas aprendidas, incentivando comportamentos úteis e seguros e desencorajando saídas tóxicas ou sem sentido.

Aplicações no mundo real#

A RLHF revelou-se fundamental para implementar sistemas de IA que exigem elevados padrões de segurança e uma compreensão subtil da interação humana.

  • IA conversacional e chatbots: A aplicação mais proeminente da RLHF consiste em alinhar chatbots para que sejam úteis, inofensivos e honestos. Ao penalizar saídas tendenciosas, factualmente incorretas ou perigosas, a RLHF ajuda a mitigar as alucinações em LLMs e reduz o risco de enviesamento algorítmico. Isto garante que os assistentes virtuais possam recusar instruções prejudiciais, mantendo-se úteis para consultas legítimas.
  • Robótica e controlo físico: A RLHF vai além do texto e estende-se à IA na robótica, onde é difícil definir uma função de recompensa perfeita para tarefas físicas complexas. Por exemplo, um robô que aprenda a deslocar-se num armazém movimentado pode receber feedback de supervisores humanos sobre quais as trajetórias seguras e quais as que causaram perturbações. Este feedback aperfeiçoa a política de controlo do robô de forma mais eficaz do que a simples aprendizagem profunda por reforço baseada exclusivamente na conclusão de objetivos.

RLHF vs. aprendizagem por reforço padrão#

É útil distinguir a RLHF da aprendizagem por reforço (RL) tradicional para compreender a sua utilidade específica.

  • RL padrão: Em contextos tradicionais, a função de recompensa é frequentemente definida de forma rígida pelo ambiente. Por exemplo, num videojogo, o ambiente fornece um sinal claro (+1 por uma vitória, -1 por uma derrota). O agente otimiza as suas ações dentro deste Processo de Decisão de Markov (MDP) definido.
  • RLHF: Em muitos cenários do mundo real, como escrever uma história criativa ou conduzir educadamente, o "sucesso" é subjetivo. A RLHF resolve este problema substituindo a recompensa definida de forma rígida por um modelo de recompensa aprendido, derivado das preferências humanas. Isto permite otimizar conceitos abstratos como "qualidade" ou "adequação", que é impossível programar explicitamente.

Integração da perceção com ciclos de feedback#

Em aplicações visuais, os agentes alinhados por RLHF dependem frequentemente da visão computacional (CV) para perceber o estado do ambiente antes de agir. Um detetor robusto, como o YOLO26, funciona como camada de perceção, fornecendo observações estruturadas (por exemplo, "obstáculo detetado a 3 metros") que a rede de políticas utiliza para selecionar uma ação.

O exemplo seguinte em Python ilustra um conceito simplificado no qual um modelo YOLO fornece o estado do ambiente. Num ciclo de RLHF completo, o sinal de "recompensa" viria de um modelo treinado com feedback humano sobre as decisões do agente com base nestes dados de deteção.

from ultralytics import YOLO

# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")

# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")

# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)

print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.

Ao combinar modelos de perceção avançados com políticas aperfeiçoadas através de feedback humano, os programadores podem criar sistemas que não são apenas inteligentes, mas também rigorosamente alinhados com os princípios de segurança da IA. A investigação contínua sobre supervisão escalável, como a IA Constitucional, continua a desenvolver este campo, procurando reduzir o estrangulamento causado pela anotação humana em grande escala e, simultaneamente, manter um elevado desempenho dos modelos.

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática