YOLO Vision 2026:
Volver al glosario de Ultralytics

Direct Preference Optimization (DPO)

Aprende cómo la optimización de preferencia directa (DPO) simplifica la alineación de la IA. Descubre cómo este método eficiente sustituye al RLHF para mejorar la seguridad y el rendimiento del modelo.

Direct Preference Optimization (DPO) es una técnica algorítmica estable y eficiente que se utiliza para afinar modelos de inteligencia artificial, garantizando que se alineen con los deseos humanos, las normas de seguridad y las directrices éticas. A diferencia de los métodos tradicionales que requieren complejos flujos de trabajo de múltiples etapas para capturar la retroalimentación humana, DPO simplifica matemáticamente el proceso de alineación tratando el aprendizaje de preferencias directamente como una classification task in machine learning estándar. Al optimizar directamente el modelo basándose en un conjunto de datos de preferencias humanas —donde los anotadores seleccionan una respuesta "ganadora" frente a una "perdedora"—, los desarrolladores pueden mejorar significativamente la utilidad, la honestidad y la seguridad de los foundation models a gran escala y de los modernos generative AI systems.

Cómo simplifica DPO la alineación de modelos#

La innovación principal de Direct Preference Optimization radica en la eliminación del "intermediario" arquitectónico. Históricamente, alinear un Large Language Model (LLM) o un Vision-Language Model implicaba un proceso complejo conocido como Reinforcement Learning from Human Feedback (RLHF). El proceso de RLHF requiere entrenar un modelo de recompensa independiente para aproximar la puntuación humana, seguido del uso de un algoritmo de aprendizaje por refuerzo propenso a la inestabilidad como Proximal Policy Optimization para actualizar el modelo principal.

DPO elimina matemáticamente la necesidad de este modelo de recompensa independiente. En su lugar, se basa en una loss function derivada que aumenta la probabilidad de generar resultados "preferidos" y, al mismo tiempo, disminuye la probabilidad de los "rechazados". Utiliza un modelo de referencia para limitar la Kullback-Leibler divergence, garantizando que el modelo actualizado no se desvíe demasiado de su distribución de training data original. Esta simplificación matemática hace que el proceso se comporte de manera muy similar al supervised learning estándar, lo que se traduce en una convergencia más rápida y un menor uso de memoria en GPU hardware. Esto reduce de forma inherente el riesgo de model collapse y elimina el extenso hyperparameter tuning.

Aplicaciones en el mundo real#

DirectPreference Optimization está remodelando fundamentalmente la forma en que se construyen y despliegan los sistemas de IA interactivos en diversas industrias de alto riesgo en la búsqueda de una sólida AI Safety.

  • Mejora de Agentes Conversacionales: En el ámbito de los chatbots y los asistentes virtuales, DPO se utiliza para reducir la toxicidad y alinear las respuestas con las estrictas OpenAI safety best practices y la Anthropic research on AI alignment. Los anotadores humanos revisan dos respuestas a un indicador y marcan la respuesta educada y objetiva como "elegida". A continuación, DPO actualiza los pesos del modelo para favorecer este estilo de conversación específico mientras penaliza las alucinaciones.
  • Refinamiento de Modelos de Visión-Lenguaje: A medida que el image recognition evoluciona, a los modelos se les exige cada vez más que expliquen lo que ven a los operadores humanos. Para aplicaciones como la respuesta a preguntas visuales, DPO permite a los investigadores alinear la salida textual del modelo con las preferencias humanas detalladas. Por ejemplo, si un usuario le pide a un sistema robótico impulsado por Ultralytics YOLO26 que describa un objeto, DPO entrena al modelo para priorizar descripciones fácticas y concisas frente a interpretaciones vagas, adhiriéndose estrictamente a las pautas de AI Ethics.

DPO en la práctica#

La implementación de DPO requiere datos por pares de alta calidad. Los flujos de trabajo modernos utilizan herramientas integrales como la Ultralytics Platform para gestionar estos conjuntos de datos sin problemas, garantizando que el proceso de data annotation genere ejemplos claros de "ganadores" y "perdedores". Puedes explorar la investigación fundamental detrás de esto en el documento Direct Preference Optimization: Your Language Model is Secretly a Reward Model o leer sobre Alignment and Human Preferences de Stanford HAI.

El siguiente fragmento de Python demuestra la estructura de datos fundamental necesaria para un cálculo de pérdida de estilo DPO utilizando funciones que se encuentran en el PyTorch API reference.

import torch
import torch.nn.functional as F


def dpo_loss(chosen_logps, rejected_logps, beta=0.1):
    # DPO maximizes the margin between chosen and rejected log probabilities
    logits = beta * (chosen_logps - rejected_logps)
    # The loss minimizes the negative log sigmoid of this margin
    return -F.logsigmoid(logits).mean()


print(f"DPO Loss: {dpo_loss(torch.tensor([-0.5]), torch.tensor([-2.5])):.4f}")

Explore solutions

Real-time AI that works with your team

Visión por computador en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en el comercio minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

Visión artificial en la sanidad

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

Visión artificial en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

Visión artificial en el sector automotriz

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

Visión artificial en la agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

Visión por computador en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en el comercio minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

Visión artificial en la sanidad

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

Visión artificial en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

Visión artificial en el sector automotriz

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

Visión artificial en la agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

Visión por computador en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en el comercio minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

Visión artificial en la sanidad

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

Visión artificial en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

Visión artificial en el sector automotriz

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

Visión artificial en la agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu viaje con el futuro del aprendizaje automático