YOLO Vision 2026:
Voltar para o Glossário da Ultralytics

Direct Preference Optimization (DPO)

Aprenda como a Direct Preference Optimization (DPO) simplifica o alinhamento de IA. Descubra como esse método eficiente substitui o RLHF para melhorar a segurança e o desempenho do modelo.

A Otimização Direta de Preferência (Direct Preference Optimization - DPO) é uma técnica algorítmica estável e eficiente usada para ajustar modelos de inteligência artificial, garantindo que eles se aliem aos desejos humanos, padrões de segurança e diretrizes éticas. Ao contrário dos métodos tradicionais que exigem pipelines complexos e de múltiplos estágios para capturar feedback humano, a DPO simplifica matematicamente o processo de alinhamento tratando o aprendizado de preferências diretamente como uma classification task in machine learning padrão. Ao otimizar diretamente o modelo com base em um conjunto de dados de preferências humanas — onde os anotadores selecionam uma resposta "vencedora" em detrimento de uma "perdedora" —, os desenvolvedores podem melhorar significativamente a utilidade, a honestidade e a segurança de foundation models em grande escala e de generative AI systems modernos.

Como a DPO simplifica o alinhamento de modelos#

A principal inovação da Direct Preference Optimization reside na remoção do "intermediário" arquitetônico. Historicamente, alinhar um Large Language Model (LLM) ou um Vision-Language Model envolvia um processo complexo conhecido como Reinforcement Learning from Human Feedback (RLHF). O RLHF exige o treinamento de um modelo de recompensa separado para aproximar a pontuação humana, seguido pelo uso de um algoritmo de aprendizado por reforço propenso a instabilidades, como a Proximal Policy Optimization, para atualizar o modelo principal.

A DPO elimina matematicamente a necessidade desse modelo de recompensa separado. Em vez disso, ela depende de uma loss function derivada que aumenta a probabilidade de gerar saídas "preferidas", enquanto diminui simultaneamente a probabilidade de saídas "rejeitadas". Ela usa um modelo de referência para limitar a Kullback-Leibler divergence, garantindo que o modelo atualizado não se desvie muito de sua distribuição original de training data. Essa simplificação matemática faz com que o processo se comporte de forma muito mais próxima ao supervised learning padrão, resultando em uma convergência mais rápida e menor uso de memória em GPU hardware. Isso reduz inerentemente o risco de model collapse e elimina o extenso hyperparameter tuning.

Aplicações no Mundo Real#

A Direct Preference Optimization está remodelando fundamentalmente a forma como os sistemas de IA interativos são construídos e implantados em vários setores de alto risco em busca de uma AI Safety robusta.

  • Aprimorando Agentes Conversacionais: No domínio de chatbots e assistentes virtuais, a DPO é usada para reduzir a toxicidade e alinhar as respostas com rígidas OpenAI safety best practices e pesquisas da Anthropic research on AI alignment. Anotadores humanos revisam duas respostas a um comando, marcando a resposta educada e factual como "escolhida". A DPO então atualiza os pesos do modelo para favorecer esse estilo conversacional específico enquanto penaliza alucinações.
  • Refinando Modelos de Visão e Linguagem: À medida que o image recognition evolui, os modelos são cada vez mais solicitados a explicar o que veem para operadores humanos. Para aplicações como perguntas e respostas visuais, a DPO permite que os pesquisadores alinhem a saída textual do modelo com preferências humanas detalhadas. Por exemplo, se um usuário solicitar a um sistema de robótica alimentado por Ultralytics YOLO26 que descreva um objeto, a DPO treina o modelo para priorizar descrições factuais e concisas em detrimento de interpretações vagas, aderindo estritamente às diretrizes de AI Ethics.

A DPO na prática#

A implementação da DPO requer dados pareados de alta qualidade. Os fluxos de trabalho modernos utilizam ferramentas abrangentes como a Ultralytics Platform para gerenciar esses conjuntos de dados perfeitamente, garantindo que o processo de data annotation produza exemplos claros de "vencedores" e "perdedores". Você pode explorar a pesquisa fundamental por trás disso no artigo Direct Preference Optimization: Your Language Model is Secretly a Reward Model ou ler sobre Alignment and Human Preferences da Stanford HAI.

O trecho em Python a seguir demonstra a estrutura de dados fundamental necessária para um cálculo de perda no estilo DPO usando funções encontradas na PyTorch API reference.

import torch
import torch.nn.functional as F


def dpo_loss(chosen_logps, rejected_logps, beta=0.1):
    # DPO maximizes the margin between chosen and rejected log probabilities
    logits = beta * (chosen_logps - rejected_logps)
    # The loss minimizes the negative log sigmoid of this margin
    return -F.logsigmoid(logits).mean()


print(f"DPO Loss: {dpo_loss(torch.tensor([-0.5]), torch.tensor([-2.5])):.4f}")

Explore solutions

Real-time AI that works with your team

Visão computacional em robótica

Potencialize máquinas mais inteligentes com modelos Ultralytics YOLO. A IA de visão em robótica impulsiona a navegação autônoma, percepção, rastreamento de objetos e controle em tempo real.
Sabe mais
Real-time AI that works with your team

Visão computacional em logística

Otimize a logística com modelos Ultralytics YOLO. A IA de visão permite a inspeção de pacotes, triagem, rastreamento de veículos e monitoramento de segurança em armazéns em tempo real.
Sabe mais
Real-time AI that works with your team

Visão computacional no varejo

Reinvente o varejo com modelos Ultralytics YOLO. A IA de visão impulsiona o rastreamento de inventário, monitoramento de prateleiras, gerenciamento de filas e percepções mais inteligentes sobre o cliente.
Sabe mais
Real-time AI that works with your team

Visão computacional nos cuidados de saúde

Constrói soluções de saúde com modelos Ultralytics YOLO. A visão AI na saúde impulsiona imagens médicas mais rápidas, diagnósticos mais inteligentes e monitorização do paciente.
Sabe mais
Real-time AI that works with your team

Visão computacional na fabricação

Otimize a fabricação com modelos Ultralytics YOLO. A IA de visão impulsiona o controle de qualidade, detecção de defeitos, conformidade com EPI e automação de linhas de montagem.
Sabe mais
Real-time AI that works with your operation

Visão computacional no setor automóvel

Aplica visão computacional no setor automóvel com modelos Ultralytics YOLO. A visão AI eleva a segurança rodoviária, a assistência ao condutor e a automação de veículos para estradas mais inteligentes.
Sabe mais
Real-time AI tailored to your operation

Visão computacional na agricultura

Leva a visão AI para a agricultura inteligente com os modelos Ultralytics YOLO. Potencia a monitorização de culturas, o seguimento de gado e a agricultura de precisão para colheitas maiores e mais inteligentes.
Sabe mais
Real-time AI that works with your team

Visão computacional em robótica

Potencialize máquinas mais inteligentes com modelos Ultralytics YOLO. A IA de visão em robótica impulsiona a navegação autônoma, percepção, rastreamento de objetos e controle em tempo real.
Sabe mais
Real-time AI that works with your team

Visão computacional em logística

Otimize a logística com modelos Ultralytics YOLO. A IA de visão permite a inspeção de pacotes, triagem, rastreamento de veículos e monitoramento de segurança em armazéns em tempo real.
Sabe mais
Real-time AI that works with your team

Visão computacional no varejo

Reinvente o varejo com modelos Ultralytics YOLO. A IA de visão impulsiona o rastreamento de inventário, monitoramento de prateleiras, gerenciamento de filas e percepções mais inteligentes sobre o cliente.
Sabe mais
Real-time AI that works with your team

Visão computacional nos cuidados de saúde

Constrói soluções de saúde com modelos Ultralytics YOLO. A visão AI na saúde impulsiona imagens médicas mais rápidas, diagnósticos mais inteligentes e monitorização do paciente.
Sabe mais
Real-time AI that works with your team

Visão computacional na fabricação

Otimize a fabricação com modelos Ultralytics YOLO. A IA de visão impulsiona o controle de qualidade, detecção de defeitos, conformidade com EPI e automação de linhas de montagem.
Sabe mais
Real-time AI that works with your operation

Visão computacional no setor automóvel

Aplica visão computacional no setor automóvel com modelos Ultralytics YOLO. A visão AI eleva a segurança rodoviária, a assistência ao condutor e a automação de veículos para estradas mais inteligentes.
Sabe mais
Real-time AI tailored to your operation

Visão computacional na agricultura

Leva a visão AI para a agricultura inteligente com os modelos Ultralytics YOLO. Potencia a monitorização de culturas, o seguimento de gado e a agricultura de precisão para colheitas maiores e mais inteligentes.
Sabe mais
Real-time AI that works with your team

Visão computacional em robótica

Potencialize máquinas mais inteligentes com modelos Ultralytics YOLO. A IA de visão em robótica impulsiona a navegação autônoma, percepção, rastreamento de objetos e controle em tempo real.
Sabe mais
Real-time AI that works with your team

Visão computacional em logística

Otimize a logística com modelos Ultralytics YOLO. A IA de visão permite a inspeção de pacotes, triagem, rastreamento de veículos e monitoramento de segurança em armazéns em tempo real.
Sabe mais
Real-time AI that works with your team

Visão computacional no varejo

Reinvente o varejo com modelos Ultralytics YOLO. A IA de visão impulsiona o rastreamento de inventário, monitoramento de prateleiras, gerenciamento de filas e percepções mais inteligentes sobre o cliente.
Sabe mais
Real-time AI that works with your team

Visão computacional nos cuidados de saúde

Constrói soluções de saúde com modelos Ultralytics YOLO. A visão AI na saúde impulsiona imagens médicas mais rápidas, diagnósticos mais inteligentes e monitorização do paciente.
Sabe mais
Real-time AI that works with your team

Visão computacional na fabricação

Otimize a fabricação com modelos Ultralytics YOLO. A IA de visão impulsiona o controle de qualidade, detecção de defeitos, conformidade com EPI e automação de linhas de montagem.
Sabe mais
Real-time AI that works with your operation

Visão computacional no setor automóvel

Aplica visão computacional no setor automóvel com modelos Ultralytics YOLO. A visão AI eleva a segurança rodoviária, a assistência ao condutor e a automação de veículos para estradas mais inteligentes.
Sabe mais
Real-time AI tailored to your operation

Visão computacional na agricultura

Leva a visão AI para a agricultura inteligente com os modelos Ultralytics YOLO. Potencia a monitorização de culturas, o seguimento de gado e a agricultura de precisão para colheitas maiores e mais inteligentes.
Sabe mais

Vamos construir o futuro da IA juntos!

Começa a tua jornada com o futuro da aprendizagem automática