YOLO Vision 2026 :
Retour au glossaire Ultralytics

Direct Preference Optimization

Apprends comment l'optimisation par préférence directe (DPO) simplifie l'alignement de l'IA. Découvre comment améliorer la sécurité et les performances des modèles plus efficacement que le RLHF traditionnel.

L'optimisation directe des préférences (DPO) est une technique algorithmique stable et efficace utilisée pour affiner les modèles d'intelligence artificielle, garantissant spécifiquement qu'ils s'alignent sur les désirs humains et les normes de sécurité. Contrairement aux méthodes d'apprentissage par renforcement traditionnelles qui nécessitent une modélisation complexe des récompenses, DPO simplifie le processus d'alignement en traitant le problème d'apprentissage des préférences comme une tâche de classification. En optimisant directement le modèle sur la base d'un ensemble de données de préférences humaines — où les annotateurs choisissent une réponse "gagnante" par rapport à une réponse "perdante" —, les développeurs peuvent considérablement améliorer l'utilité, l'honnêteté et la sécurité des foundation models et des systèmes d'generative AI. Cette approche a connu un essor massif en 2024 et 2025 pour sa capacité à obtenir des résultats de pointe avec bien moins de surcharge de calcul.

Comment la DPO simplifie l'alignement des modèles#

L'innovation principale de l'optimisation par préférence directe (Direct Preference Optimization) réside dans la suppression de l'« intermédiaire » présent dans les anciens pipelines d'alignement. Historiquement, aligner un Large Language Model (LLM) ou un Vision-Language Model impliquait un processus en plusieurs étapes connu sous le nom de Reinforcement Learning from Human Feedback (RLHF). Le RLHF nécessite d'entraîner un modèle de récompense distinct pour estimer les notes humaines, puis d'utiliser un algorithme sujet à l'instabilité comme le PPO (Proximal Policy Optimization) pour mettre à jour le modèle principal.

DPO élimine mathématiquement le besoin de ce modèle de récompense séparé. À la place, il utilise une loss function dérivée qui augmente la probabilité de générer des sorties "préférées" tout en diminuant la probabilité de celles "rejetées". Cela s'appuie sur un modèle de référence pour garantir que le modèle mis à jour ne s'éloigne pas trop de sa distribution de training data d'origine. Cette simplification mathématique fait en sorte que le processus se comporte de manière beaucoup plus proche d'un supervised learning standard, ce qui entraîne une convergence plus rapide et une utilisation de la mémoire plus faible sur le GPU hardware.

Distinction du RLHF#

Bien que DPO et RLHF partagent l'objectif de l'AI Safety et de l'alignement, leur mise en œuvre diffère considérablement :

  • Complexité : Le RLHF implique le maintien de plusieurs modèles (acteur, critique, modèle de récompense, modèle de référence) simultanément pendant l'entraînement. La DPO ne nécessite que le modèle en cours d'entraînement et un modèle de référence figé.
  • Stabilité : L'apprentissage par renforcement est notoirement sensible au hyperparameter tuning. DPO s'exécute généralement avec la stabilité d'une tâche de classification standard, réduisant le risque de model collapse.
  • Efficacité : En supprimant les étapes d'inférence du modèle de récompense, la DPO réduit la charge de calcul, permettant aux organisations d'aligner des modèles plus grands sur des clusters plus petits.

Applications concrètes#

La Direct Preference Optimization est actuellement en train de remodeler la façon dont les systèmes d'IA interactifs sont construits dans diverses industries.

Amélioration des agents conversationnels#

Dans le domaine des chatbots et des assistants virtuels, DPO est utilisé pour réduire la toxicité et améliorer la précision factuelle. Les développeurs sélectionnent des ensembles de données où un annotateur humain examine deux réponses à une invite — l'une hallucinée ou grossière, et l'autre précise et polie. L'humain marque la réponse polie comme "choisie". DPO met ensuite à jour les model weights pour favoriser le style choisi. C'est crucial pour déployer des agents de service client qui respectent des directives strictes d'AI Ethics.

Affinement des modèles vision-langage#

À mesure que la vision par ordinateur évolue, les modèles sont de plus en plus tenus d'expliquer ce qu'ils voient. Pour des applications telles que l'image captioning ou la réponse visuelle aux questions, DPO permet aux chercheurs d'aligner la sortie textuelle du modèle avec des préférences humaines détaillées. Par exemple, si un utilisateur demande à un security system de "décrire l'intrus", DPO peut entraîner le modèle à prioriser les descriptions factuelles (par exemple, "chemise rouge, chapeau bleu") par rapport à celles poétiques ou vagues, améliorant ainsi l'utilité du computer vision system.

La DPO dans le flux de travail IA moderne#

La mise en œuvre de DPO nécessite des données par paires de haute qualité. Les flux de travail modernes utilisent souvent des outils comme la Ultralytics Platform pour gérer les ensembles de données, garantissant que le processus de data annotation génère des exemples clairs de "gagnants" et de "perdants". Bien que DPO ait été pionnier pour le texte, ses principes sont de plus en plus appliqués pour optimiser les object detection architectures et d'autres modalités en formulant les métriques de qualité comme des paires de préférences.

L'extrait Python suivant utilisant torch démontre la structure de données fondamentale requise pour un calcul de perte de type DPO. Il montre comment les réponses "choisies" et "rejetées" sont préparées par lots, un concept crucial pour l'model optimization moderne.

import torch
import torch.nn.functional as F

# Simulate log probabilities for 'chosen' and 'rejected' responses
# In a real scenario, these come from your model (e.g., a VLM or LLM)
chosen_log_probs = torch.tensor([-0.5, -0.8, -0.2], requires_grad=True)
rejected_log_probs = torch.tensor([-2.5, -3.0, -1.5], requires_grad=True)

# DPO aims to maximize the margin between chosen and rejected
# This is a simplified conceptual look at the margin calculation
beta = 0.1  # A hyperparameter controlling deviation from the reference model
logits = beta * (chosen_log_probs - rejected_log_probs)

# The loss minimizes the negative log sigmoid of this margin
loss = -F.logsigmoid(logits).mean()

print(f"DPO Loss: {loss.item()}")
# Output demonstrates the penalty applied if the model doesn't prefer the chosen data

En tirant parti de techniques telles que DPO, les développeurs peuvent repousser les limites des performances dans des modèles tels que Ultralytics YOLO26, garantissant que les décisions automatisées sont non seulement précises mais également alignées sur l'intention humaine. C'est vital pour les environnements à haut risque tels que les autonomous vehicles et la medical image analysis, où la fiabilité est primordiale.

Ressources externes#

Explore solutions

Real-time AI that works with your team

Vision par ordinateur en robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur en logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

Vision par ordinateur dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

Vision par ordinateur en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur en robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur en logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

Vision par ordinateur dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

Vision par ordinateur en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur en robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur en logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

Vision par ordinateur dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

Vision par ordinateur en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble le futur de l'IA !

Commence ton aventure avec le futur de l'apprentissage automatique