YOLO Vision 2026 :
Retour au glossaire Ultralytics

Direct Preference Optimization (DPO)

Apprends comment l'optimisation par préférence directe (DPO) simplifie l'alignement de l'IA. Découvre comment cette méthode efficace remplace le RLHF pour améliorer la sécurité et les performances des modèles.

La Direct Preference Optimization (DPO) est une technique algorithmique stable et efficace utilisée pour affiner les modèles d'intelligence artificielle, garantissant qu'ils s'alignent sur les désirs humains, les normes de sécurité et les directives éthiques. Contrairement aux méthodes traditionnelles qui nécessitent des pipelines complexes en plusieurs étapes pour capturer les retours humains, la DPO simplifie mathématiquement le processus d'alignement en traitant directement l'apprentissage des préférences comme une classification task in machine learning standard. En optimisant directement le modèle sur la base d'un ensemble de données de préférences humaines — où les annotateurs sélectionnent une réponse « gagnante » par rapport à une réponse « perdante » — tu peux améliorer considérablement l'utilité, l'honnêteté et la sécurité des foundation models à grande échelle et des generative AI systems modernes.

Comment la DPO simplifie l'alignement des modèles#

La principale innovation de la Direct Preference Optimization réside dans la suppression de l'« intermédiaire » architectural. Historiquement, l'alignement d'un Large Language Model (LLM) ou d'un Vision-Language Model impliquait un processus complexe connu sous le nom de Reinforcement Learning from Human Feedback (RLHF). Le RLHF nécessite l'entraînement d'un modèle de récompense distinct pour estimer la notation humaine, suivi de l'utilisation d'un algorithme d'apprentissage par renforcement sujet à l'instabilité tel que l'Proximal Policy Optimization pour mettre à jour le modèle principal.

La DPO élimine mathématiquement le besoin de ce modèle de récompense séparé. Au lieu de cela, elle s'appuie sur une loss function dérivée qui augmente la probabilité de générer des sorties « préférées » tout en diminuant simultanément la probabilité de celles « rejetées ». Elle utilise un modèle de référence pour limiter la Kullback-Leibler divergence, garantissant que le modèle mis à jour ne s'éloigne pas trop de sa distribution de training data d'origine. Cette simplification mathématique fait en sorte que le comportement du processus se rapproche beaucoup plus de l'supervised learning standard, ce qui entraîne une convergence plus rapide et une utilisation de la mémoire réduite sur le GPU hardware. Cela réduit intrinsèquement le risque de model collapse et élimine le hyperparameter tuning intensif.

Applications concrètes#

La Direct Preference Optimization redéfinit fondamentalement la manière dont les systèmes d'IA interactifs sont construits et déployés dans divers secteurs à hauts enjeux dans la quête d'une AI Safety robuste.

  • Amélioration des agents conversationnels : Dans le domaine des chatbots et des assistants virtuels, la DPO est utilisée pour réduire la toxicité et aligner les réponses sur les OpenAI safety best practices strictes et sur les Anthropic research on AI alignment. Des annotateurs humains examinent deux réponses à une invite, marquant la réponse polie et factuelle comme « choisie ». La DPO met ensuite à jour les poids du modèle pour favoriser ce style conversationnel spécifique tout en pénalisant les hallucinations.
  • Affinement des modèles vision-langage : À mesure que l'image recognition évolue, les modèles sont de plus en plus sollicités pour expliquer ce qu'ils voient à des opérateurs humains. Pour des applications telles que la réponse visuelle à des questions, la DPO permet aux chercheurs d'aligner la sortie textuelle du modèle avec des préférences humaines détaillées. Par exemple, si tu demandes à un système robotique propulsé par Ultralytics YOLO26 de décrire un objet, la DPO entraîne le modèle à privilégier des descriptions factuelles et concises plutôt que des interprétations vagues, en adhérant étroitement aux directives strictes de l'AI Ethics.

La DPO en pratique#

La mise en œuvre de la DPO nécessite des données par paires de haute qualité. Les flux de travail modernes utilisent des outils complets tels que la Ultralytics Platform pour gérer ces ensembles de données en toute transparence, garantissant que le processus de data annotation produit des exemples « gagnants » et « perdants » clairs. Tu peux explorer la recherche fondamentale derrière cela dans l'article Direct Preference Optimization: Your Language Model is Secretly a Reward Model ou lire des articles sur l'Alignment and Human Preferences de Stanford HAI.

L'extrait Python suivant démontre la structure de données fondamentale requise pour un calcul de perte de type DPO en utilisant les fonctions trouvées dans la PyTorch API reference.

import torch
import torch.nn.functional as F


def dpo_loss(chosen_logps, rejected_logps, beta=0.1):
    # DPO maximizes the margin between chosen and rejected log probabilities
    logits = beta * (chosen_logps - rejected_logps)
    # The loss minimizes the negative log sigmoid of this margin
    return -F.logsigmoid(logits).mean()


print(f"DPO Loss: {dpo_loss(torch.tensor([-0.5]), torch.tensor([-2.5])):.4f}")

Explore solutions

Real-time AI that works with your team

Vision par ordinateur en robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur en logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

Vision par ordinateur dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

Vision par ordinateur en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur en robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur en logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

Vision par ordinateur dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

Vision par ordinateur en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur en robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur en logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

Vision par ordinateur dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

Vision par ordinateur en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble le futur de l'IA !

Commence ton aventure avec le futur de l'apprentissage automatique