YOLO Vision 2026:
Назад к глоссарию Ultralytics

Reinforcement Learning

Изучи основные концепции обучения с подкреплением (RL). Узнай, как агенты используют обратную связь для освоения задач, и посмотри, как Ultralytics YOLO26 питает системы машинного зрения на основе RL.

Обучение с подкреплением (RL) — это ориентированное на достижение целей подмножество machine learning (ML), в котором автономная система, известная как агент, учится принимать решения путем выполнения действий и получения обратной связи от окружающей среды. В отличие от supervised learning, которое опирается на статичные наборы данных с правильными ответами, алгоритмы RL учатся через динамический процесс проб и ошибок. Агент взаимодействует с симуляцией или реальным миром, наблюдая за последствиями своих действий, чтобы определить, какие стратегии приносят наибольшую долгосрочную награду. Этот подход тесно имитирует психологическую концепцию operant conditioning, где поведение формируется с помощью положительного подкрепления (наград) и отрицательного подкрепления (наказаний) с течением времени.

Основные концепции цикла RL#

Чтобы понять, как работает RL, полезно представить его в виде непрерывного цикла взаимодействия. Эта структура часто математически формализуется как Markov Decision Process (MDP), который упорядочивает принятие решений в ситуациях, когда результаты частично случайны и частично контролируются лицом, принимающим решения.

Основные компоненты этого цикла обучения включают:

  • AI Agent: Сущность, отвечающая за обучение и принятие решений. Она воспринимает окружающую среду и предпринимает действия для максимизации своего совокупного успеха.
  • Среда: Внешний мир, в котором действует агент. Это может быть сложная видеоигра, симуляция финансового рынка или физический склад в контексте AI in logistics.
  • Состояние: Снимок или представление текущей ситуации. В визуальных приложениях это часто включает обработку потоков с камер с помощью computer vision (CV) для обнаружения объектов и препятствий.
  • Действие: Конкретный ход или выбор, который делает агент. Полный набор всех возможных ходов называется action space.
  • Награда: Числовой сигнал, отправляемый из окружающей среды агенту после действия. Хорошо спроектированная reward function присваивает положительные значения полезным действиям и штрафы вредным.
  • Политика: Стратегия или набор правил, которые агент использует для определения следующего действия на основе текущего состояния. Такие алгоритмы, как Q-learning, определяют, как эта политика обновляется и оптимизируется.

Реальные приложения#

Обучение с подкреплением вышло за рамки теоретических исследований и перешло в практическое высокоэффективное внедрение в различных отраслях.

  • Продвинутая робототехника: В области AI in robotics RL позволяет машинам осваивать сложные моторные навыки, которые трудно запрограммировать вручную. Роботы могут научиться захватывать нерегулярные объекты или перемещаться по неровной местности, обучаясь в физических движках, таких как NVIDIA Isaac Sim, перед развертыванием в реальном мире.
  • Автономные системы: Autonomous vehicles используют RL для принятия решений в реальном времени в непредсказуемых дорожных сценариях. В то время как модели object detection идентифицируют пешеходов и знаки, алгоритмы RL помогают определить безопасные правила вождения для слияния полос и проезда перекрестков.
  • Стратегическая оптимизация: RL привлек глобальное внимание, когда такие системы, как Google DeepMind's AlphaGo, победили человеческих чемпионов мира в сложных настольных играх. Помимо игр, эти агенты оптимизируют промышленную логистику, например, управляя системами охлаждения в дата-центрах для снижения энергопотребления.

Интеграция зрения с RL#

Во многих современных приложениях «состояние», которое наблюдает агент, является визуальным. Высокопроизводительные модели, такие как YOLO26, действуют как уровень восприятия для агентов RL, преобразуя необработанные изображения в структурированные данные. Эта обработанная информация — такая как местоположение и класс объектов — становится состоянием, которое политика RL использует для выбора действия.

Следующий пример демонстрирует, как использовать пакет ultralytics для обработки кадра среды, создавая представление состояния (например, количество объектов) для теоретического цикла RL.

from ultralytics import YOLO

# Load the YOLO26 model to serve as the agent's vision system
model = YOLO("yolo26n.pt")

# Simulate the agent observing the environment (an image frame)
observation_frame = "https://ultralytics.com/images/bus.jpg"

# Process the frame to extract the current 'state'
results = model(observation_frame)

# The agent uses detection data to inform its next action
# For example, an autonomous delivery robot might stop if it sees people
num_objects = len(results[0].boxes)
print(f"Agent Observation: {num_objects} objects detected. Calculating next move...")

Разграничение похожих терминов#

Важно отличать обучение с подкреплением от других парадигм машинного обучения:

  • по сравнению с Supervised Learning: Обучение с учителем требует знающего внешнего супервайзера для предоставления размеченных обучающих данных (например, «это изображение содержит кота»). В отличие от этого, RL учится на последствиях собственных действий без явных меток, находя оптимальные пути посредством исследования.
  • по сравнению с Unsupervised Learning: Обучение без учителя сосредоточено на поиске скрытых структур или паттернов в неразмеченных данных (например, кластеризация клиентов). RL отличается тем, что он явно ориентирован на достижение цели, фокусируясь на максимизации сигнала награды, а не просто на описании структуры данных.

По мере роста вычислительной мощности такие методы, как Reinforcement Learning from Human Feedback (RLHF), еще больше совершенствуют то, как учатся агенты, теснее согласовывая их цели со сложными человеческими ценностями и стандартами безопасности. Исследователи часто используют стандартизированные среды, такие как Gymnasium, для бенчмаркинга и улучшения этих алгоритмов. Для команд, стремящихся управлять наборами данных, необходимыми для уровней восприятия этих агентов, Ultralytics Platform предлагает комплексные инструменты для аннотирования и управления моделями.

Explore solutions

Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше

Давай строить будущее ИИ вместе!

Начни свой путь в будущее машинного обучения