YOLO Vision 2026:
Назад к глоссарию Ultralytics

Reinforcement Learning from Human Feedback (RLHF)

Узнай, как обучение с подкреплением на основе отзывов людей (RLHF) выравнивает ИИ с человеческими ценностями. Изучи его ключевые компоненты и интеграцию с Ultralytics YOLO26.

Reinforcement Learning from Human Feedback (RLHF) — это передовой метод машинного обучения, который совершенствует модели искусственного интеллекта путем включения прямой обратной связи от человека в цикл обучения. В отличие от стандартного supervised learning, который опирается исключительно на статические размеченные наборы данных, RLHF вводит механизм динамического отклика, при котором оценщики-люди ранжируют или оценивают результаты работы модели. Этот процесс позволяет ИИ улавливать сложные, субъективные или тонкие цели — такие как «полезность», «безопасность» или «креативность», — которые трудно описать с помощью простой математической функции потерь. RLHF стал краеугольным камнем в разработке современных large language models (LLMs) и генеративного ИИ, гарантируя, что мощные базовые модели эффективно согласуются с человеческими ценностями и намерениями пользователя.

Основные компоненты RLHF#

Процесс RLHF обычно состоит из трехэтапного конвейера, призванного преодолеть разрыв между базовыми прогностическими возможностями и поведением, соответствующим ожиданиям человека.

  1. Supervised Fine-Tuning (SFT): Рабочий процесс обычно начинается с предварительно обученной foundation model. Разработчики выполняют первоначальную fine-tuning, используя небольшой высококачественный набор данных с демонстрациями (например, пары «вопрос-ответ», написанные экспертами). Этот шаг создает базовую политику, обучая модель общему формату и тону, ожидаемым для данной задачи.

  2. Обучение модели вознаграждения: Этот этап является отличительной чертой RLHF. Аннотаторы-люди изучают несколько результатов, созданных моделью для одного и того же входа, и ранжируют их от лучшего к худшему. Эта работа по data labeling создает набор данных предпочтений. Отдельная neural network, называемая моделью вознаграждения, обучается на этих данных сравнения для прогнозирования скалярной оценки, отражающей суждение человека. Инструменты, доступные на Ultralytics Platform, могут упростить управление такими рабочими процессами аннотирования.

  3. Оптимизация на основе обучения с подкреплением: Наконец, исходная модель действует как AI agent в среде обучения с подкреплением. Используя модель вознаграждения в качестве ориентира, алгоритмы оптимизации, такие как Proximal Policy Optimization (PPO), настраивают параметры модели для максимизации ожидаемого вознаграждения. Этот шаг согласовывает политику модели с усвоенными человеческими предпочтениями, поощряя полезное и безопасное поведение и предотвращая токсичные или бессмысленные ответы.

Реальные приложения#

RLHF доказал свою критическую важность при развертывании систем ИИ, требующих высоких стандартов безопасности и глубокого понимания взаимодействия с человеком.

  • Разговорный ИИ и чат-боты: Наиболее заметным применением RLHF является настройка чат-ботов так, чтобы они были полезными, безвредными и честными. Наказывая за предвзятые, фактически неверные или опасные ответы, RLHF помогает снизить hallucination in LLMs и уменьшить риск algorithmic bias. Это гарантирует, что виртуальные ассистенты смогут отклонять вредоносные инструкции, оставаясь при этом полезными для законных запросов.
  • Робототехника и физическое управление: RLHF выходит за рамки текста и применяется для AI in robotics, где определение идеальной функции вознаграждения для сложных физических задач представляет собой трудность. Например, робот, обучающийся навигации по переполненному складу, может получать от человеческих супервайзеров отзывы о том, какие траектории были безопасными, а какие привели к сбоям. Эта обратная связь уточняет политику управления робота эффективнее, чем простое deep reinforcement learning, основанное исключительно на достижении цели.

RLHF против стандартного обучения с подкреплением#

Полезно отличать RLHF от традиционного reinforcement learning (RL), чтобы понять его специфическую пользу.

  • Стандартное RL: В традиционных условиях функция вознаграждения часто жестко кодируется средой. Например, в видеоигре среда дает четкий сигнал (+1 за победу, -1 за поражение). Агент оптимизирует свои действия в рамках этого определенного Markov Decision Process (MDP).
  • RLHF: во многих реальных сценариях, таких как написание творческого рассказа или вежливое вождение, «успех» субъективен. RLHF решает эту проблему, заменяя жестко заданное вознаграждение на модель вознаграждения, полученную на основе человеческих предпочтений. Это позволяет оптимизировать абстрактные понятия, такие как «качество» или «уместность», которые невозможно запрограммировать явно.

Интеграция восприятия с циклами обратной связи#

В визуальных приложениях агенты, настроенные с помощью RLHF, часто полагаются на computer vision (CV) для восприятия состояния своей среды перед совершением действия. Надежный детектор, такой как YOLO26, выполняет роль слоя восприятия, предоставляя структурированные наблюдения (например, «препятствие обнаружено на расстоянии 3 метров»), которые сетевая политика использует для выбора действия.

Следующий пример на Python иллюстрирует упрощенную концепцию, где модель YOLO предоставляет данные о состоянии среды. В полном цикле RLHF сигнал «вознаграждения» исходил бы от модели, обученной на отзывах людей относительно решений агента, принятых на основе данных обнаружения.

from ultralytics import YOLO

# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")

# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")

# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)

print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.

Объединяя мощные модели восприятия с политиками, усовершенствованными с помощью обратной связи от человека, разработчики могут создавать системы, которые не только интеллектуальны, но и строго соответствуют принципам AI safety. Текущие исследования в области масштабируемого надзора, такие как Constitutional AI, продолжают развивать эту область, стремясь снизить узкое место крупномасштабного аннотирования людьми при сохранении высокой производительности модели.

Explore solutions

Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше

Давай строить будущее ИИ вместе!

Начни свой путь в будущее машинного обучения