Reinforcement Learning from Human Feedback (RLHF)
Узнай, как обучение с подкреплением на основе отзывов людей (RLHF) выравнивает ИИ с человеческими ценностями. Изучи его ключевые компоненты и интеграцию с Ultralytics YOLO26.
Reinforcement Learning from Human Feedback (RLHF) — это передовой метод машинного обучения, который совершенствует модели искусственного интеллекта путем включения прямой обратной связи от человека в цикл обучения. В отличие от стандартного supervised learning, который опирается исключительно на статические размеченные наборы данных, RLHF вводит механизм динамического отклика, при котором оценщики-люди ранжируют или оценивают результаты работы модели. Этот процесс позволяет ИИ улавливать сложные, субъективные или тонкие цели — такие как «полезность», «безопасность» или «креативность», — которые трудно описать с помощью простой математической функции потерь. RLHF стал краеугольным камнем в разработке современных large language models (LLMs) и генеративного ИИ, гарантируя, что мощные базовые модели эффективно согласуются с человеческими ценностями и намерениями пользователя.
Основные компоненты RLHF#
Процесс RLHF обычно состоит из трехэтапного конвейера, призванного преодолеть разрыв между базовыми прогностическими возможностями и поведением, соответствующим ожиданиям человека.
-
Supervised Fine-Tuning (SFT): Рабочий процесс обычно начинается с предварительно обученной foundation model. Разработчики выполняют первоначальную fine-tuning, используя небольшой высококачественный набор данных с демонстрациями (например, пары «вопрос-ответ», написанные экспертами). Этот шаг создает базовую политику, обучая модель общему формату и тону, ожидаемым для данной задачи.
-
Обучение модели вознаграждения: Этот этап является отличительной чертой RLHF. Аннотаторы-люди изучают несколько результатов, созданных моделью для одного и того же входа, и ранжируют их от лучшего к худшему. Эта работа по data labeling создает набор данных предпочтений. Отдельная neural network, называемая моделью вознаграждения, обучается на этих данных сравнения для прогнозирования скалярной оценки, отражающей суждение человека. Инструменты, доступные на Ultralytics Platform, могут упростить управление такими рабочими процессами аннотирования.
-
Оптимизация на основе обучения с подкреплением: Наконец, исходная модель действует как AI agent в среде обучения с подкреплением. Используя модель вознаграждения в качестве ориентира, алгоритмы оптимизации, такие как Proximal Policy Optimization (PPO), настраивают параметры модели для максимизации ожидаемого вознаграждения. Этот шаг согласовывает политику модели с усвоенными человеческими предпочтениями, поощряя полезное и безопасное поведение и предотвращая токсичные или бессмысленные ответы.
Реальные приложения#
RLHF доказал свою критическую важность при развертывании систем ИИ, требующих высоких стандартов безопасности и глубокого понимания взаимодействия с человеком.
- Разговорный ИИ и чат-боты: Наиболее заметным применением RLHF является настройка чат-ботов так, чтобы они были полезными, безвредными и честными. Наказывая за предвзятые, фактически неверные или опасные ответы, RLHF помогает снизить hallucination in LLMs и уменьшить риск algorithmic bias. Это гарантирует, что виртуальные ассистенты смогут отклонять вредоносные инструкции, оставаясь при этом полезными для законных запросов.
- Робототехника и физическое управление: RLHF выходит за рамки текста и применяется для AI in robotics, где определение идеальной функции вознаграждения для сложных физических задач представляет собой трудность. Например, робот, обучающийся навигации по переполненному складу, может получать от человеческих супервайзеров отзывы о том, какие траектории были безопасными, а какие привели к сбоям. Эта обратная связь уточняет политику управления робота эффективнее, чем простое deep reinforcement learning, основанное исключительно на достижении цели.
RLHF против стандартного обучения с подкреплением#
Полезно отличать RLHF от традиционного reinforcement learning (RL), чтобы понять его специфическую пользу.
- Стандартное RL: В традиционных условиях функция вознаграждения часто жестко кодируется средой. Например, в видеоигре среда дает четкий сигнал (+1 за победу, -1 за поражение). Агент оптимизирует свои действия в рамках этого определенного Markov Decision Process (MDP).
- RLHF: во многих реальных сценариях, таких как написание творческого рассказа или вежливое вождение, «успех» субъективен. RLHF решает эту проблему, заменяя жестко заданное вознаграждение на модель вознаграждения, полученную на основе человеческих предпочтений. Это позволяет оптимизировать абстрактные понятия, такие как «качество» или «уместность», которые невозможно запрограммировать явно.
Интеграция восприятия с циклами обратной связи#
В визуальных приложениях агенты, настроенные с помощью RLHF, часто полагаются на computer vision (CV) для восприятия состояния своей среды перед совершением действия. Надежный детектор, такой как YOLO26, выполняет роль слоя восприятия, предоставляя структурированные наблюдения (например, «препятствие обнаружено на расстоянии 3 метров»), которые сетевая политика использует для выбора действия.
Следующий пример на Python иллюстрирует упрощенную концепцию, где модель YOLO предоставляет данные о состоянии среды. В полном цикле RLHF сигнал «вознаграждения» исходил бы от модели, обученной на отзывах людей относительно решений агента, принятых на основе данных обнаружения.
from ultralytics import YOLO
# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")
# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")
# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)
print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.Объединяя мощные модели восприятия с политиками, усовершенствованными с помощью обратной связи от человека, разработчики могут создавать системы, которые не только интеллектуальны, но и строго соответствуют принципам AI safety. Текущие исследования в области масштабируемого надзора, такие как Constitutional AI, продолжают развивать эту область, стремясь снизить узкое место крупномасштабного аннотирования людьми при сохранении высокой производительности модели.






