YOLO Vision 2026:
Назад к глоссарию Ultralytics

Reward Modeling

Изучи моделирование вознаграждения в машинном обучении. Узнай, как оно использует обратную связь от людей для выравнивания агентов ИИ и моделей Ultralytics YOLO26 для обеспечения более безопасной и точной производительности.

Моделирование вознаграждения — это метод машинного обучения, используемый для обучения систем искусственного интеллекта оценивать и расставлять приоритеты в своем собственном поведении на основе человеческих предпочтений. В традиционных средах reinforcement learning AI agent учится, максимизируя предопределенную, математически жесткую функцию вознаграждения, такую как счет в видеоигре. Однако для сложных задач реального мира, где «хорошее» поведение является субъективным или нюансированным — например, написание вежливого электронного письма или безопасный проезд перекрестка — вручную написать безупречную функцию вознаграждения практически невозможно. Моделирование вознаграждения решает эту проблему путем обучения вторичной neural network (модели вознаграждения), которая действует как прокси для человеческого суждения. Эта модель оценивает выходные данные основного ИИ и присваивает скалярные оценки, динамически направляя главную модель к безопасному, полезному и точному поведению.

Как работает моделирование вознаграждения#

Конвейер для построения модели вознаграждения в значительной степени опирается на сбор высококачественной обратной связи от людей.

  • Data Labeling и предпочтения: Людям-аннотаторам предоставляются подсказки наряду с несколькими ответами, сгенерированными моделью ИИ. Оценщики ранжируют эти ответы от лучших к худшим на основе таких критериев, как полезность, безвредность и точность. Управлением этими крупномасштабными рабочими процессами аннотирования можно легко управлять с помощью Ultralytics Platform.
  • Обучение прокси-сети: Специализированная нейронная сеть обучается на этом наборе данных сравнений людей. В процессе оптимизации она учится предсказывать, какому выводу отдал бы предпочтение человек, сопоставляя embeddings действия или текстового ответа с единым скалярным значением вознаграждения. Ты можешь прочитать больше о создании архитектур нейронных сетей в PyTorch API documentation.
  • Оптимизация политики: Основная модель использует непрерывную обратную связь от модели вознаграждения для уточнения своих действий, обычно используя такие алгоритмы, как Proximal Policy Optimization (PPO). Этот шаг итеративно приводит политику модели в соответствие с изученными намерениями человека.

Моделирование вознаграждения против RLHF#

Важно отличать моделирование вознаграждения от Reinforcement Learning from Human Feedback (RLHF). Хотя эти два термина часто обсуждаются вместе, они не синонимичны. RLHF — это комплексный сквозной конвейер, используемый для выравнивания моделей, включающий в себя контролируемую тонкую настройку, сбор данных и обновление политик. Моделирование вознаграждения является конкретным, важнейшим компонентом в конвейере RLHF. Оно служит мостом, который преобразует дискретные рейтинги людей в непрерывный математический сигнал, под который алгоритм обучения с подкреплением может производить оптимизацию.

Реальные приложения#

Моделирование вознаграждения играет важную роль в разработке современных AI-систем, которые взаимодействуют напрямую с людьми и физическим миром.

  • Large Language Models (LLMs): Разговорные ИИ-ассистенты полагаются на модели вознаграждения, чтобы гарантировать, что их ответы не только фактически верны, но и вежливы, релевантны и свободны от токсичного языка. Организации, исследующие AI safety, непрерывно совершенствуют моделирование вознаграждения для создания систем, отражающих helpful and harmless AI alignment.
  • Autonomous Vehicles и робототехника: В физической автоматизации модели вознаграждения помогают роботам понимать сложный этикет вождения или стратегии манипулирования объектами. Система восприятия на базе Ultralytics YOLO26 может обнаруживать пешеходов и дорожные знаки, в то время как модель вознаграждения оценивает запланированную траекторию движения автомобиля, гарантируя, что ИИ отдает приоритет комфорту и безопасности пассажиров, а не чисто агрессивной навигации из точки в точку.

Реализация базовой концепции модели вознаграждения#

Следующий пример на Python использует torch для демонстрации фундаментальной структуры модели вознаграждения. На практике эта сеть учится присваивать более высокий скалярный балл результату, который соответствует человеческим предпочтениям.

import torch
import torch.nn as nn


# Define a simplified reward model architecture
class SimpleRewardModel(nn.Module):
    def __init__(self):
        super().__init__()
        # Maps the AI's output embedding to a single reward score
        self.fc = nn.Linear(768, 1)

    def forward(self, embeddings):
        return self.fc(embeddings)


# Initialize the model
reward_model = SimpleRewardModel()

# Simulated embeddings for a human-preferred action and a rejected action
chosen_action = torch.randn(1, 768)
rejected_action = torch.randn(1, 768)

# The model predicts scalar scores to guide the primary agent
print(f"Chosen Action Reward: {reward_model(chosen_action).item():.4f}")
print(f"Rejected Action Reward: {reward_model(rejected_action).item():.4f}")

Для более глубокого погружения в то, как выравнивание влияет на открытые базовые модели, изучи фундаментальные исследования по выравниванию языковых моделей с намерениями человека и узнай, как системы computer vision (CV) задействуют продвинутые циклы обратной связи для безопасного взаимодействия с динамическими средами.

Explore solutions

Real-time AI that works with your team

Компьютерное зрение в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в ритейле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

Компьютерное зрение в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в ритейле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

Компьютерное зрение в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в ритейле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

Компьютерное зрение в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше

Давай строить будущее ИИ вместе!

Начни свой путь в будущее машинного обучения