YOLO Vision 2026:
Назад к глоссарию Ultralytics

Direct Preference Optimization (DPO)

Узнай, как прямое оптимизационное предпочтение (DPO) упрощает выравнивание ИИ. Узнай, как этот эффективный метод заменяет RLHF для улучшения безопасности и производительности модели.

Direct Preference Optimization (DPO) — это стабильный и эффективный алгоритмический метод, используемый для тонкой настройки моделей искусственного интеллекта, который гарантирует их соответствие человеческим предпочтениям, стандартам безопасности и этическим принципам. В отличие от традиционных методов, требующих сложных многоэтапных конвейеров для сбора отзывов людей, DPO математически упрощает процесс согласования, рассматривая обучение с предпочтениями непосредственно как стандартную classification task in machine learning. Оптимизируя модель напрямую на основе набора данных человеческих предпочтений, где аннотаторы выбирают «выигрышный» ответ вместо «проигрышного», разработчики могут существенно повысить полезность, честность и безопасность крупномасштабных foundation models и современных generative AI systems.

Как DPO упрощает настройку моделей#

Главное нововведение Direct Preference Optimization заключается в устранении архитектурного «посредника». Исторически согласование Large Language Model (LLM) или Vision-Language Model предполагало сложный процесс, известный как Reinforcement Learning from Human Feedback (RLHF). RLHF требует обучения отдельной модели вознаграждения для приближения человеческой оценки с последующим использованием неустойчивого алгоритма обучения с подкреплением вроде Proximal Policy Optimization для обновления основной модели.

DPO математически исключает необходимость в этой отдельной модели вознаграждения. Вместо этого метод опирается на производную loss function, которая увеличивает вероятность генерации «предпочтительных» результатов и одновременно снижает вероятность «отвергнутых». Он использует эталонную модель для ограничения Kullback-Leibler divergence, гарантируя, что обновленная модель не отклонится слишком далеко от исходного распределения training data. Такое математическое упрощение заставляет процесс вести себя гораздо ближе к стандартному supervised learning, что приводит к более быстрой сходимости и меньшему потреблению памяти на GPU hardware. Это закономерно снижает риск model collapse и избавляет от необходимости масштабной hyperparameter tuning.

Реальные приложения#

Direct Preference Optimization коренным образом меняет подход к созданию и развертыванию интерактивных систем ИИ в различных критически важных отраслях в стремлении обеспечить надежную AI Safety.

  • Enhancing Conversational Agents: В сфере chatbots и виртуальных ассистентов DPO используется для снижения токсичности и согласования ответов со строгими OpenAI safety best practices и Anthropic research on AI alignment. Человеческие аннотаторы изучают два ответа на запрос, отмечая вежливый и фактический ответ как «выбранный». Затем DPO обновляет веса модели, чтобы отдавать предпочтение этому конкретному стилю общения и одновременно штрафовать за галлюцинации.
  • Refining Vision-Language Models: По мере развития image recognition от моделей все чаще требуется объяснять операторам-людям то, что они видят. Для таких задач, как визуальные ответы на вопросы, DPO позволяет исследователям сопоставлять текстовый вывод модели с подробными человеческими предпочтениями. Например, если пользователь просит роботизированную систему на базе Ultralytics YOLO26 описать объект, DPO обучает модель ставить во главу угла фактические, лаконичные описания, а не туманные интерпретации, строго придерживаясь руководящих принципов AI Ethics.

DPO на практике#

Реализация DPO требует высококачественных парных данных. Современные рабочие процессы используют комплексные инструменты, такие как Ultralytics Platform, для бесшовного управления этими наборами данных, гарантируя, что процесс data annotation дает четкие примеры «победителей» и «проигравших». Ты можешь изучить базовые исследования по этой теме в статье Direct Preference Optimization: Your Language Model is Secretly a Reward Model или почитать материалы Alignment and Human Preferences от Stanford HAI.

Следующий фрагмент Python демонстрирует базовую структуру данных, необходимую для расчета потерь в стиле DPO с использованием функций из PyTorch API reference.

import torch
import torch.nn.functional as F


def dpo_loss(chosen_logps, rejected_logps, beta=0.1):
    # DPO maximizes the margin between chosen and rejected log probabilities
    logits = beta * (chosen_logps - rejected_logps)
    # The loss minimizes the negative log sigmoid of this margin
    return -F.logsigmoid(logits).mean()


print(f"DPO Loss: {dpo_loss(torch.tensor([-0.5]), torch.tensor([-2.5])):.4f}")

Explore solutions

Real-time AI that works with your team

Компьютерное зрение в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в ритейле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

Компьютерное зрение в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в ритейле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

Компьютерное зрение в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в ритейле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

Компьютерное зрение в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше

Давай строить будущее ИИ вместе!

Начни свой путь в будущее машинного обучения