Ultralytics YOLO27:
Назад к глоссарию Ultralytics

Reinforcement Learning from Human Feedback (RLHF)

Узнай, как обучение с подкреплением на основе обратной связи от человека (RLHF) согласует ИИ с человеческими ценностями. Изучи его основные компоненты и интеграцию с Ultralytics YOLO26.

Обучение с подкреплением на основе обратной связи от человека (RLHF) — это продвинутая методика машинного обучения, которая совершенствует модели искусственного интеллекта, внедряя непосредственный вклад человека в цикл обучения. В отличие от стандартного обучения с учителем, которое полностью опирается на статичные размеченные наборы данных, RLHF вводит динамический механизм обратной связи, в рамках которого люди-оценщики ранжируют или оценивают результаты модели. Этот процесс позволяет AI учитывать сложные, субъективные или неоднозначные цели — такие как «полезность», «безопасность» или «креативность», — которые трудно определить с помощью простой математической функции потерь. RLHF стал одним из ключевых компонентов разработки современных больших языковых моделей (LLMs) и генеративного AI, обеспечивая эффективное соответствие мощных базовых моделей человеческим ценностям и намерениям пользователей.

Ключевые компоненты RLHF#

Процесс RLHF обычно состоит из трех этапов, призванных устранить разрыв между исходными возможностями прогнозирования и поведением, согласованным с человеческими предпочтениями.

  1. Обучение с учителем и тонкая настройка (SFT): Обычно рабочий процесс начинается с предварительно обученной базовой модели. Разработчики выполняют первоначальную тонкую настройку на небольшом высококачественном наборе данных с примерами (например, на парах вопросов и ответов, составленных экспертами). Этот этап формирует базовую политику, обучая модель общему формату и тону, ожидаемым для задачи.

  2. Обучение модели вознаграждения: Этот этап является отличительной особенностью RLHF. Люди-разметчики проверяют несколько результатов, сгенерированных моделью для одного и того же входа, и ранжируют их от лучших к худшим. В результате такой разметки данных создается набор данных с предпочтениями. Отдельная нейронная сеть, называемая моделью вознаграждения, обучается на этих данных сравнений, чтобы предсказывать скалярную оценку, отражающую человеческое мнение. Инструменты, доступные на платформе Ultralytics, могут упростить управление такими рабочими процессами разметки.

  3. Оптимизация с помощью обучения с подкреплением: Наконец, исходная модель выступает в роли AI-агента в среде обучения с подкреплением. Используя модель вознаграждения в качестве ориентира, алгоритмы оптимизации, такие как оптимизация проксимальной политики (PPO), изменяют параметры модели, чтобы максимизировать ожидаемое вознаграждение. Этот этап согласует политику модели с выявленными человеческими предпочтениями, поощряя полезное и безопасное поведение и препятствуя токсичным или бессмысленным результатам.

Практические применения#

RLHF доказал свою критическую важность при развертывании AI-систем, которым необходимы высокие стандарты безопасности и глубокое понимание взаимодействия с людьми.

  • Разговорный AI и чат-боты: Наиболее заметное применение RLHF — согласование поведения чат-ботов с принципами полезности, безвредности и честности. Наказывая за предвзятые, фактически неверные или опасные результаты, RLHF помогает смягчить проблему галлюцинаций в LLMs и снизить риск алгоритмической предвзятости. Это позволяет виртуальным помощникам отклонять вредоносные инструкции, оставаясь полезными при обработке законных запросов.
  • Робототехника и физическое управление: RLHF выходит за пределы текста и применяется к AI в робототехнике, где определить идеальную функцию вознаграждения для сложных физических задач трудно. Например, робот, обучающийся перемещаться по загруженному складу, может получать от людей-руководителей обратную связь о том, какие траектории были безопасными, а какие привели к сбоям. Такая обратная связь эффективнее уточняет политику управления робота, чем простое глубокое обучение с подкреплением, основанное исключительно на достижении цели.

RLHF и стандартное обучение с подкреплением#

Чтобы понять специфику RLHF, полезно отличать его от традиционного обучения с подкреплением (RL).

  • Стандартное RL: В традиционных условиях функция вознаграждения часто жестко задается средой. Например, в видеоигре среда предоставляет четкий сигнал (+1 за победу, -1 за поражение). Агент оптимизирует свои действия в рамках определенного марковского процесса принятия решений (MDP).
  • RLHF: Во многих сценариях реального мира, например при написании творческого рассказа или вежливом вождении, «успех» субъективен. RLHF решает эту проблему, заменяя жестко заданное вознаграждение обученной моделью вознаграждения, созданной на основе человеческих предпочтений. Это позволяет оптимизировать такие абстрактные понятия, как «качество» или «уместность», которые невозможно явно запрограммировать.

Интеграция восприятия с циклами обратной связи#

В приложениях, работающих с визуальными данными, агенты, согласованные с RLHF, часто используют компьютерное зрение (CV), чтобы оценить состояние окружающей среды перед совершением действия. Надежный детектор, такой как YOLO26, выполняет роль слоя восприятия и предоставляет структурированные наблюдения (например, «препятствие обнаружено в 3 метрах»), которые политическая сеть использует для выбора действия.

Следующий пример на Python иллюстрирует упрощенную концепцию, в которой модель YOLO предоставляет сведения о состоянии окружающей среды. В полноценном цикле RLHF сигнал «вознаграждения» поступал бы от модели, обученной на обратной связи от людей относительно решений агента, принятых на основе этих данных обнаружения.

from ultralytics import YOLO

# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")

# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")

# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)

print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.

Объединяя мощные модели восприятия с политиками, усовершенствованными с помощью обратной связи от людей, разработчики могут создавать системы, которые не только интеллектуальны, но и строго соответствуют принципам безопасности AI. Продолжающиеся исследования масштабируемого надзора, например конституционального AI, способствуют дальнейшему развитию этой области и направлены на устранение узкого места, связанного с масштабной разметкой данных людьми, при сохранении высокой производительности моделей.

Explore solutions

Компьютерное зрение для аэрофотоснимков

Компьютерное зрение для аэрофотоснимков

Превращай кадры с дронов и аэрофотоснимки в аналитику в реальном времени для сельского хозяйства, аквакультуры, экологического мониторинга, охраны природы и геопространственного анализа с помощью Ultralytics YOLO.
Узнать больше
Компьютерное зрение в аэрокосмической отрасли

Компьютерное зрение в аэрокосмической отрасли

Внедри компьютерное зрение в воздушный мониторинг с моделями Ultralytics YOLO. Обеспечь дроны, аэрокосмические рабочие процессы, задачи охраны природы и геопространственные отрасли решениями на базе компьютерного зрения.
Узнать больше

Защити каждый объект с помощью моделей Ultralytics YOLO. Компьютерное зрение обеспечивает мониторинг периметра, обнаружение угроз, распознавание номерных знаков и безопасность на рабочем месте.
Узнать больше
Компьютерное зрение в робототехнике

Компьютерное зрение в робототехнике

Оснащай более умные машины моделями Ultralytics YOLO. Vision AI в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Компьютерное зрение в логистике

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI обеспечивает инспекцию посылок, сортировку, отслеживание транспорта и мониторинг безопасности на складах в реальном времени.
Узнать больше
Компьютерное зрение в розничной торговле

Компьютерное зрение в розничной торговле

Переосмысли розничную торговлю с помощью моделей Ultralytics YOLO. Vision AI обеспечивает отслеживание запасов, мониторинг полок, управление очередями и более глубокое понимание поведения клиентов.
Узнать больше
Компьютерное зрение в здравоохранении

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с моделями Ultralytics YOLO. Vision AI в здравоохранении обеспечивает более быструю обработку медицинских изображений, более точную диагностику и интеллектуальный мониторинг пациентов.
Узнать больше
Компьютерное зрение в производстве

Компьютерное зрение в производстве

Оптимизируй производство с моделями Ultralytics YOLO. Vision AI обеспечивает контроль качества, обнаружение дефектов, соблюдение требований к PPE и автоматизацию сборочной линии.
Узнать больше
Компьютерное зрение в автомобильной отрасли

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. Vision AI повышает безопасность дорог, эффективность систем помощи водителю и уровень автоматизации автомобилей, делая дороги умнее.
Узнать больше
Компьютерное зрение в сельском хозяйстве

Компьютерное зрение в сельском хозяйстве

Добавь Vision AI в умное сельское хозяйство с моделями Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание поголовья и точное земледелие для более высоких и эффективных урожаев.
Узнать больше
Компьютерное зрение для аэрофотоснимков

Компьютерное зрение для аэрофотоснимков

Превращай кадры с дронов и аэрофотоснимки в аналитику в реальном времени для сельского хозяйства, аквакультуры, экологического мониторинга, охраны природы и геопространственного анализа с помощью Ultralytics YOLO.
Узнать больше
Компьютерное зрение в аэрокосмической отрасли

Компьютерное зрение в аэрокосмической отрасли

Внедри компьютерное зрение в воздушный мониторинг с моделями Ultralytics YOLO. Обеспечь дроны, аэрокосмические рабочие процессы, задачи охраны природы и геопространственные отрасли решениями на базе компьютерного зрения.
Узнать больше

Защити каждый объект с помощью моделей Ultralytics YOLO. Компьютерное зрение обеспечивает мониторинг периметра, обнаружение угроз, распознавание номерных знаков и безопасность на рабочем месте.
Узнать больше
Компьютерное зрение в робототехнике

Компьютерное зрение в робототехнике

Оснащай более умные машины моделями Ultralytics YOLO. Vision AI в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Компьютерное зрение в логистике

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI обеспечивает инспекцию посылок, сортировку, отслеживание транспорта и мониторинг безопасности на складах в реальном времени.
Узнать больше
Компьютерное зрение в розничной торговле

Компьютерное зрение в розничной торговле

Переосмысли розничную торговлю с помощью моделей Ultralytics YOLO. Vision AI обеспечивает отслеживание запасов, мониторинг полок, управление очередями и более глубокое понимание поведения клиентов.
Узнать больше
Компьютерное зрение в здравоохранении

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с моделями Ultralytics YOLO. Vision AI в здравоохранении обеспечивает более быструю обработку медицинских изображений, более точную диагностику и интеллектуальный мониторинг пациентов.
Узнать больше
Компьютерное зрение в производстве

Компьютерное зрение в производстве

Оптимизируй производство с моделями Ultralytics YOLO. Vision AI обеспечивает контроль качества, обнаружение дефектов, соблюдение требований к PPE и автоматизацию сборочной линии.
Узнать больше
Компьютерное зрение в автомобильной отрасли

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. Vision AI повышает безопасность дорог, эффективность систем помощи водителю и уровень автоматизации автомобилей, делая дороги умнее.
Узнать больше
Компьютерное зрение в сельском хозяйстве

Компьютерное зрение в сельском хозяйстве

Добавь Vision AI в умное сельское хозяйство с моделями Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание поголовья и точное земледелие для более высоких и эффективных урожаев.
Узнать больше
Компьютерное зрение для аэрофотоснимков

Компьютерное зрение для аэрофотоснимков

Превращай кадры с дронов и аэрофотоснимки в аналитику в реальном времени для сельского хозяйства, аквакультуры, экологического мониторинга, охраны природы и геопространственного анализа с помощью Ultralytics YOLO.
Узнать больше
Компьютерное зрение в аэрокосмической отрасли

Компьютерное зрение в аэрокосмической отрасли

Внедри компьютерное зрение в воздушный мониторинг с моделями Ultralytics YOLO. Обеспечь дроны, аэрокосмические рабочие процессы, задачи охраны природы и геопространственные отрасли решениями на базе компьютерного зрения.
Узнать больше

Защити каждый объект с помощью моделей Ultralytics YOLO. Компьютерное зрение обеспечивает мониторинг периметра, обнаружение угроз, распознавание номерных знаков и безопасность на рабочем месте.
Узнать больше
Компьютерное зрение в робототехнике

Компьютерное зрение в робототехнике

Оснащай более умные машины моделями Ultralytics YOLO. Vision AI в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Компьютерное зрение в логистике

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI обеспечивает инспекцию посылок, сортировку, отслеживание транспорта и мониторинг безопасности на складах в реальном времени.
Узнать больше
Компьютерное зрение в розничной торговле

Компьютерное зрение в розничной торговле

Переосмысли розничную торговлю с помощью моделей Ultralytics YOLO. Vision AI обеспечивает отслеживание запасов, мониторинг полок, управление очередями и более глубокое понимание поведения клиентов.
Узнать больше
Компьютерное зрение в здравоохранении

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с моделями Ultralytics YOLO. Vision AI в здравоохранении обеспечивает более быструю обработку медицинских изображений, более точную диагностику и интеллектуальный мониторинг пациентов.
Узнать больше
Компьютерное зрение в производстве

Компьютерное зрение в производстве

Оптимизируй производство с моделями Ultralytics YOLO. Vision AI обеспечивает контроль качества, обнаружение дефектов, соблюдение требований к PPE и автоматизацию сборочной линии.
Узнать больше
Компьютерное зрение в автомобильной отрасли

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. Vision AI повышает безопасность дорог, эффективность систем помощи водителю и уровень автоматизации автомобилей, делая дороги умнее.
Узнать больше
Компьютерное зрение в сельском хозяйстве

Компьютерное зрение в сельском хозяйстве

Добавь Vision AI в умное сельское хозяйство с моделями Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание поголовья и точное земледелие для более высоких и эффективных урожаев.
Узнать больше

Давай вместе создавать будущее AI!

Начни свой путь в будущее машинного обучения