Reinforcement Learning from Human Feedback (RLHF)
Узнай, как обучение с подкреплением на основе обратной связи от человека (RLHF) согласует ИИ с человеческими ценностями. Изучи его основные компоненты и интеграцию с Ultralytics YOLO26.
Обучение с подкреплением на основе обратной связи от человека (RLHF) — это продвинутая методика машинного обучения, которая совершенствует модели искусственного интеллекта, внедряя непосредственный вклад человека в цикл обучения. В отличие от стандартного обучения с учителем, которое полностью опирается на статичные размеченные наборы данных, RLHF вводит динамический механизм обратной связи, в рамках которого люди-оценщики ранжируют или оценивают результаты модели. Этот процесс позволяет AI учитывать сложные, субъективные или неоднозначные цели — такие как «полезность», «безопасность» или «креативность», — которые трудно определить с помощью простой математической функции потерь. RLHF стал одним из ключевых компонентов разработки современных больших языковых моделей (LLMs) и генеративного AI, обеспечивая эффективное соответствие мощных базовых моделей человеческим ценностям и намерениям пользователей.
Ключевые компоненты RLHF#
Процесс RLHF обычно состоит из трех этапов, призванных устранить разрыв между исходными возможностями прогнозирования и поведением, согласованным с человеческими предпочтениями.
-
Обучение с учителем и тонкая настройка (SFT): Обычно рабочий процесс начинается с предварительно обученной базовой модели. Разработчики выполняют первоначальную тонкую настройку на небольшом высококачественном наборе данных с примерами (например, на парах вопросов и ответов, составленных экспертами). Этот этап формирует базовую политику, обучая модель общему формату и тону, ожидаемым для задачи.
-
Обучение модели вознаграждения: Этот этап является отличительной особенностью RLHF. Люди-разметчики проверяют несколько результатов, сгенерированных моделью для одного и того же входа, и ранжируют их от лучших к худшим. В результате такой разметки данных создается набор данных с предпочтениями. Отдельная нейронная сеть, называемая моделью вознаграждения, обучается на этих данных сравнений, чтобы предсказывать скалярную оценку, отражающую человеческое мнение. Инструменты, доступные на платформе Ultralytics, могут упростить управление такими рабочими процессами разметки.
-
Оптимизация с помощью обучения с подкреплением: Наконец, исходная модель выступает в роли AI-агента в среде обучения с подкреплением. Используя модель вознаграждения в качестве ориентира, алгоритмы оптимизации, такие как оптимизация проксимальной политики (PPO), изменяют параметры модели, чтобы максимизировать ожидаемое вознаграждение. Этот этап согласует политику модели с выявленными человеческими предпочтениями, поощряя полезное и безопасное поведение и препятствуя токсичным или бессмысленным результатам.
Практические применения#
RLHF доказал свою критическую важность при развертывании AI-систем, которым необходимы высокие стандарты безопасности и глубокое понимание взаимодействия с людьми.
- Разговорный AI и чат-боты: Наиболее заметное применение RLHF — согласование поведения чат-ботов с принципами полезности, безвредности и честности. Наказывая за предвзятые, фактически неверные или опасные результаты, RLHF помогает смягчить проблему галлюцинаций в LLMs и снизить риск алгоритмической предвзятости. Это позволяет виртуальным помощникам отклонять вредоносные инструкции, оставаясь полезными при обработке законных запросов.
- Робототехника и физическое управление: RLHF выходит за пределы текста и применяется к AI в робототехнике, где определить идеальную функцию вознаграждения для сложных физических задач трудно. Например, робот, обучающийся перемещаться по загруженному складу, может получать от людей-руководителей обратную связь о том, какие траектории были безопасными, а какие привели к сбоям. Такая обратная связь эффективнее уточняет политику управления робота, чем простое глубокое обучение с подкреплением, основанное исключительно на достижении цели.
RLHF и стандартное обучение с подкреплением#
Чтобы понять специфику RLHF, полезно отличать его от традиционного обучения с подкреплением (RL).
- Стандартное RL: В традиционных условиях функция вознаграждения часто жестко задается средой. Например, в видеоигре среда предоставляет четкий сигнал (+1 за победу, -1 за поражение). Агент оптимизирует свои действия в рамках определенного марковского процесса принятия решений (MDP).
- RLHF: Во многих сценариях реального мира, например при написании творческого рассказа или вежливом вождении, «успех» субъективен. RLHF решает эту проблему, заменяя жестко заданное вознаграждение обученной моделью вознаграждения, созданной на основе человеческих предпочтений. Это позволяет оптимизировать такие абстрактные понятия, как «качество» или «уместность», которые невозможно явно запрограммировать.
Интеграция восприятия с циклами обратной связи#
В приложениях, работающих с визуальными данными, агенты, согласованные с RLHF, часто используют компьютерное зрение (CV), чтобы оценить состояние окружающей среды перед совершением действия. Надежный детектор, такой как YOLO26, выполняет роль слоя восприятия и предоставляет структурированные наблюдения (например, «препятствие обнаружено в 3 метрах»), которые политическая сеть использует для выбора действия.
Следующий пример на Python иллюстрирует упрощенную концепцию, в которой модель YOLO предоставляет сведения о состоянии окружающей среды. В полноценном цикле RLHF сигнал «вознаграждения» поступал бы от модели, обученной на обратной связи от людей относительно решений агента, принятых на основе этих данных обнаружения.
from ultralytics import YOLO
# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")
# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")
# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)
print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.Объединяя мощные модели восприятия с политиками, усовершенствованными с помощью обратной связи от людей, разработчики могут создавать системы, которые не только интеллектуальны, но и строго соответствуют принципам безопасности AI. Продолжающиеся исследования масштабируемого надзора, например конституционального AI, способствуют дальнейшему развитию этой области и направлены на устранение узкого места, связанного с масштабной разметкой данных людьми, при сохранении высокой производительности моделей.









