Ultralytics YOLO27:
Назад к глоссарию Ultralytics

Reinforcement Learning

Изучи основные концепции обучения с подкреплением (RL). Узнай, как агенты используют обратную связь для освоения задач и как Ultralytics YOLO26 обеспечивает работу систем компьютерного зрения с обучением с подкреплением.

Обучение с подкреплением (RL) — это ориентированное на достижение целей направление машинного обучения (ML), в котором автономная система, известная как агент, учится принимать решения, выполняя действия и получая обратную связь от окружающей среды. В отличие от обучения с учителем, основанного на статических наборах данных с правильными ответами, алгоритмы RL обучаются в динамическом процессе проб и ошибок. Агент взаимодействует с симуляцией или реальным миром, наблюдая за последствиями своих действий, чтобы определить, какие стратегии обеспечивают наибольшие долгосрочные вознаграждения. Такой подход близко имитирует психологическую концепцию оперантного обусловливания, при которой поведение со временем формируется положительным подкреплением (вознаграждениями) и отрицательным подкреплением (наказаниями).

Основные понятия цикла RL#

Чтобы понять, как работает RL, полезно представить его как непрерывный цикл взаимодействия. Эта структура часто формализуется математически как марковский процесс принятия решений (MDP), который организует принятие решений в ситуациях, где результаты частично случайны, а частично зависят от лица, принимающего решения.

Основные компоненты этого цикла обучения включают:

  • ИИ-агент: Сущность, отвечающая за обучение и принятие решений. Она воспринимает окружающую среду и выполняет действия, чтобы максимизировать совокупный результат.
  • Окружающая среда: Внешний мир, в котором работает агент. Это может быть сложная видеоигра, симуляция финансового рынка или физический склад в области ИИ в логистике.
  • Состояние: Снимок или представление текущей ситуации. В приложениях, работающих с визуальными данными, это часто включает обработку изображений с камер с помощью компьютерного зрения (CV) для обнаружения объектов и препятствий.
  • Действие: Конкретный шаг или выбор, который делает агент. Полный набор всех возможных действий называется пространством действий.
  • Вознаграждение: Числовой сигнал, который окружающая среда отправляет агенту после выполнения действия. Хорошо спроектированная функция вознаграждения назначает положительные значения полезным действиям и штрафы вредным.
  • Политика: Стратегия или набор правил, которые агент использует для определения следующего действия на основе текущего состояния. Алгоритмы, такие как Q-learning, определяют, как эта политика обновляется и оптимизируется.

Практические применения#

Обучение с подкреплением вышло за рамки теоретических исследований и стало применяться на практике в значимых проектах различных отраслей.

  • Продвинутая робототехника: В области ИИ в робототехнике RL позволяет машинам осваивать сложные двигательные навыки, которые трудно задать в коде вручную. Роботы могут учиться захватывать предметы неправильной формы или перемещаться по неровной местности, обучаясь в физических движках, таких как NVIDIA Isaac Sim, прежде чем перейти к работе в реальном мире.
  • Автономные системы: Автономные транспортные средства используют RL для принятия решений в реальном времени в непредсказуемых дорожных ситуациях. В то время как модели обнаружения объектов распознают пешеходов и дорожные знаки, алгоритмы RL помогают определять безопасные политики управления для перестроения и проезда перекрёстков.
  • Стратегическая оптимизация: RL привлёк мировое внимание, когда такие системы, как AlphaGo от Google DeepMind, победили чемпионов мира среди людей в сложных настольных играх. Помимо игр, эти агенты оптимизируют промышленную логистику, например управляют системами охлаждения в центрах обработки данных, чтобы снизить энергопотребление.

Интеграция зрения с RL#

Во многих современных приложениях наблюдаемое агентом «состояние» является визуальным. Высокопроизводительные модели, такие как YOLO26, выступают в роли слоя восприятия для агентов RL, преобразуя исходные изображения в структурированные данные. Эта обработанная информация — например, расположение и класс объектов — становится состоянием, которое политика RL использует для выбора действия.

В следующем примере показано, как использовать пакет ultralytics для обработки кадра окружающей среды и создания представления состояния (например, количества объектов) для теоретического цикла RL.

from ultralytics import YOLO

# Load the YOLO26 model to serve as the agent's vision system
model = YOLO("yolo26n.pt")

# Simulate the agent observing the environment (an image frame)
observation_frame = "https://ultralytics.com/images/bus.jpg"

# Process the frame to extract the current 'state'
results = model(observation_frame)

# The agent uses detection data to inform its next action
# For example, an autonomous delivery robot might stop if it sees people
num_objects = len(results[0].boxes)
print(f"Agent Observation: {num_objects} objects detected. Calculating next move...")

Различия между связанными терминами#

Важно отличать обучение с подкреплением от других парадигм машинного обучения:

  • В сравнении с обучением с учителем: Обучение с учителем требует знающего внешнего наставника, который предоставляет размеченные обучающие данные (например: «на этом изображении есть кошка»). В отличие от него, RL обучается на последствиях собственных действий без явных меток, находя оптимальные пути посредством исследования.
  • В сравнении с обучением без учителя: Обучение без учителя сосредоточено на поиске скрытых структур или закономерностей в неразмеченных данных (например, на кластеризации клиентов). RL отличается тем, что явно ориентировано на достижение цели и сосредоточено на максимизации сигнала вознаграждения, а не просто на описании структуры данных.

По мере роста вычислительных мощностей такие методы, как обучение с подкреплением на основе обратной связи от человека (RLHF), позволяют дополнительно совершенствовать процесс обучения агентов, теснее согласуя их цели со сложными человеческими ценностями и стандартами безопасности. Исследователи часто используют стандартизированные среды, такие как Gymnasium, для сравнения и улучшения этих алгоритмов. Командам, которым требуется управлять наборами данных для слоёв восприятия таких агентов, Ultralytics Platform предлагает комплексные инструменты для аннотирования и управления моделями.

Explore solutions

Компьютерное зрение для аэрофотоснимков

Компьютерное зрение для аэрофотоснимков

Превращай кадры с дронов и аэрофотоснимки в аналитику в реальном времени для сельского хозяйства, аквакультуры, экологического мониторинга, охраны природы и геопространственного анализа с помощью Ultralytics YOLO.
Узнать больше
Компьютерное зрение в аэрокосмической отрасли

Компьютерное зрение в аэрокосмической отрасли

Внедри компьютерное зрение в воздушный мониторинг с моделями Ultralytics YOLO. Обеспечь дроны, аэрокосмические рабочие процессы, задачи охраны природы и геопространственные отрасли решениями на базе компьютерного зрения.
Узнать больше

Защити каждый объект с помощью моделей Ultralytics YOLO. Компьютерное зрение обеспечивает мониторинг периметра, обнаружение угроз, распознавание номерных знаков и безопасность на рабочем месте.
Узнать больше
Компьютерное зрение в робототехнике

Компьютерное зрение в робототехнике

Оснащай более умные машины моделями Ultralytics YOLO. Vision AI в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Компьютерное зрение в логистике

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI обеспечивает инспекцию посылок, сортировку, отслеживание транспорта и мониторинг безопасности на складах в реальном времени.
Узнать больше
Компьютерное зрение в розничной торговле

Компьютерное зрение в розничной торговле

Переосмысли розничную торговлю с помощью моделей Ultralytics YOLO. Vision AI обеспечивает отслеживание запасов, мониторинг полок, управление очередями и более глубокое понимание поведения клиентов.
Узнать больше
Компьютерное зрение в здравоохранении

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с моделями Ultralytics YOLO. Vision AI в здравоохранении обеспечивает более быструю обработку медицинских изображений, более точную диагностику и интеллектуальный мониторинг пациентов.
Узнать больше
Компьютерное зрение в производстве

Компьютерное зрение в производстве

Оптимизируй производство с моделями Ultralytics YOLO. Vision AI обеспечивает контроль качества, обнаружение дефектов, соблюдение требований к PPE и автоматизацию сборочной линии.
Узнать больше
Компьютерное зрение в автомобильной отрасли

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. Vision AI повышает безопасность дорог, эффективность систем помощи водителю и уровень автоматизации автомобилей, делая дороги умнее.
Узнать больше
Компьютерное зрение в сельском хозяйстве

Компьютерное зрение в сельском хозяйстве

Добавь Vision AI в умное сельское хозяйство с моделями Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание поголовья и точное земледелие для более высоких и эффективных урожаев.
Узнать больше
Компьютерное зрение для аэрофотоснимков

Компьютерное зрение для аэрофотоснимков

Превращай кадры с дронов и аэрофотоснимки в аналитику в реальном времени для сельского хозяйства, аквакультуры, экологического мониторинга, охраны природы и геопространственного анализа с помощью Ultralytics YOLO.
Узнать больше
Компьютерное зрение в аэрокосмической отрасли

Компьютерное зрение в аэрокосмической отрасли

Внедри компьютерное зрение в воздушный мониторинг с моделями Ultralytics YOLO. Обеспечь дроны, аэрокосмические рабочие процессы, задачи охраны природы и геопространственные отрасли решениями на базе компьютерного зрения.
Узнать больше

Защити каждый объект с помощью моделей Ultralytics YOLO. Компьютерное зрение обеспечивает мониторинг периметра, обнаружение угроз, распознавание номерных знаков и безопасность на рабочем месте.
Узнать больше
Компьютерное зрение в робототехнике

Компьютерное зрение в робототехнике

Оснащай более умные машины моделями Ultralytics YOLO. Vision AI в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Компьютерное зрение в логистике

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI обеспечивает инспекцию посылок, сортировку, отслеживание транспорта и мониторинг безопасности на складах в реальном времени.
Узнать больше
Компьютерное зрение в розничной торговле

Компьютерное зрение в розничной торговле

Переосмысли розничную торговлю с помощью моделей Ultralytics YOLO. Vision AI обеспечивает отслеживание запасов, мониторинг полок, управление очередями и более глубокое понимание поведения клиентов.
Узнать больше
Компьютерное зрение в здравоохранении

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с моделями Ultralytics YOLO. Vision AI в здравоохранении обеспечивает более быструю обработку медицинских изображений, более точную диагностику и интеллектуальный мониторинг пациентов.
Узнать больше
Компьютерное зрение в производстве

Компьютерное зрение в производстве

Оптимизируй производство с моделями Ultralytics YOLO. Vision AI обеспечивает контроль качества, обнаружение дефектов, соблюдение требований к PPE и автоматизацию сборочной линии.
Узнать больше
Компьютерное зрение в автомобильной отрасли

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. Vision AI повышает безопасность дорог, эффективность систем помощи водителю и уровень автоматизации автомобилей, делая дороги умнее.
Узнать больше
Компьютерное зрение в сельском хозяйстве

Компьютерное зрение в сельском хозяйстве

Добавь Vision AI в умное сельское хозяйство с моделями Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание поголовья и точное земледелие для более высоких и эффективных урожаев.
Узнать больше
Компьютерное зрение для аэрофотоснимков

Компьютерное зрение для аэрофотоснимков

Превращай кадры с дронов и аэрофотоснимки в аналитику в реальном времени для сельского хозяйства, аквакультуры, экологического мониторинга, охраны природы и геопространственного анализа с помощью Ultralytics YOLO.
Узнать больше
Компьютерное зрение в аэрокосмической отрасли

Компьютерное зрение в аэрокосмической отрасли

Внедри компьютерное зрение в воздушный мониторинг с моделями Ultralytics YOLO. Обеспечь дроны, аэрокосмические рабочие процессы, задачи охраны природы и геопространственные отрасли решениями на базе компьютерного зрения.
Узнать больше

Защити каждый объект с помощью моделей Ultralytics YOLO. Компьютерное зрение обеспечивает мониторинг периметра, обнаружение угроз, распознавание номерных знаков и безопасность на рабочем месте.
Узнать больше
Компьютерное зрение в робототехнике

Компьютерное зрение в робототехнике

Оснащай более умные машины моделями Ultralytics YOLO. Vision AI в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Компьютерное зрение в логистике

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI обеспечивает инспекцию посылок, сортировку, отслеживание транспорта и мониторинг безопасности на складах в реальном времени.
Узнать больше
Компьютерное зрение в розничной торговле

Компьютерное зрение в розничной торговле

Переосмысли розничную торговлю с помощью моделей Ultralytics YOLO. Vision AI обеспечивает отслеживание запасов, мониторинг полок, управление очередями и более глубокое понимание поведения клиентов.
Узнать больше
Компьютерное зрение в здравоохранении

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с моделями Ultralytics YOLO. Vision AI в здравоохранении обеспечивает более быструю обработку медицинских изображений, более точную диагностику и интеллектуальный мониторинг пациентов.
Узнать больше
Компьютерное зрение в производстве

Компьютерное зрение в производстве

Оптимизируй производство с моделями Ultralytics YOLO. Vision AI обеспечивает контроль качества, обнаружение дефектов, соблюдение требований к PPE и автоматизацию сборочной линии.
Узнать больше
Компьютерное зрение в автомобильной отрасли

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. Vision AI повышает безопасность дорог, эффективность систем помощи водителю и уровень автоматизации автомобилей, делая дороги умнее.
Узнать больше
Компьютерное зрение в сельском хозяйстве

Компьютерное зрение в сельском хозяйстве

Добавь Vision AI в умное сельское хозяйство с моделями Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание поголовья и точное земледелие для более высоких и эффективных урожаев.
Узнать больше

Давай вместе создавать будущее AI!

Начни свой путь в будущее машинного обучения