Deep Reinforcement Learning
Изучи глубокое обучение с подкреплением (DRL) и узнай, как оно объединяет принятие решений AI с глубоким обучением. Научись использовать Ultralytics YOLO26 в качестве слоя восприятия уже сегодня.
Глубокое обучение с подкреплением (DRL) — это продвинутая разновидность искусственного интеллекта (AI), объединяющая возможности принятия решений обучения с подкреплением с возможностями восприятия глубокого обучения (DL). В то время как традиционное обучение с подкреплением использует табличные методы для сопоставления ситуаций с действиями, эти методы испытывают трудности в сложной или визуальной среде. DRL решает эту проблему с помощью нейронных сетей, интерпретирующих многомерные входные данные, например видеокадры или показания датчиков, что позволяет машинам обучаться эффективным стратегиям непосредственно на основе собственного опыта без явных инструкций человека.
Основной механизм DRL#
В системе DRL агент AI взаимодействует со средой в дискретные моменты времени. На каждом шаге агент наблюдает текущее «состояние», выбирает действие на основе политики и получает сигнал вознаграждения, указывающий на успех или неудачу этого действия. Основная цель — максимизировать совокупное вознаграждение с течением времени.
«Глубокий» компонент подразумевает использование глубоких нейронных сетей для аппроксимации политики (стратегии действий) или функции ценности (оценки будущего вознаграждения). Это позволяет агенту обрабатывать неструктурированные данные, используя компьютерное зрение (CV), чтобы «видеть» среду подобно человеку. Эта возможность обеспечивается такими фреймворками, как PyTorch и TensorFlow, которые упрощают обучение этих сложных сетей.
Практические применения#
DRL вышло за рамки теоретических исследований и нашло практическое применение с высокой отдачей в различных отраслях:
- Продвинутая робототехника: В области AI в робототехнике DRL позволяет машинам осваивать сложные двигательные навыки, которые трудно задать вручную в коде. Роботы могут учиться захватывать предметы неправильной формы или перемещаться по неровной поверхности, совершенствуя свои движения в физических симуляторах, таких как NVIDIA Isaac Sim. Часто это предполагает обучение на синтетических данных перед переносом политики на физическое оборудование.
- Автономное вождение: Автономные транспортные средства используют DRL для принятия решений в реальном времени в непредсказуемых дорожных ситуациях. В то время как модели обнаружения объектов распознают пешеходов и дорожные знаки, алгоритмы DRL используют эту информацию для определения безопасных политик вождения при перестроении, проезде перекрёстков и регулировании скорости, эффективно учитывая необходимую для безопасности задержку инференса.
Зрение как наблюдатель состояния#
Во многих приложениях DRL «состояние» является визуальным. Высокоскоростные модели выступают в роли глаз агента, преобразуя исходные изображения в структурированные данные, с которыми может работать сеть политики. В следующем примере показано, как модель YOLO26 служит уровнем восприятия агента, извлекая из среды наблюдения (например, количество препятствий).
from ultralytics import YOLO
# Load YOLO26n to serve as the perception layer for a DRL agent
model = YOLO("yolo26n.pt")
# Simulate an observation from the environment (e.g., a robot's camera feed)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Perform inference to extract the state (detected objects)
results = model(observation_frame)
# The detection count serves as a simplified state feature for the agent's policy
print(f"State Observation: {len(results[0].boxes)} objects detected.")Отличия DRL от смежных концепций#
Чтобы понять уникальное место глубокого обучения с подкреплением в сфере AI, полезно отличать его от схожих терминов:
- Обучение с подкреплением (RL): Стандартное RL — это базовая концепция, но обычно она опирается на таблицы поиска (например, Q-таблицы), которые становятся непрактичными при больших пространствах состояний. DRL решает эту проблему, используя глубокое обучение для аппроксимации функций, что позволяет обрабатывать сложные входные данные, такие как изображения.
- Обучение с подкреплением на основе обратной связи от человека (RLHF): В то время как DRL обычно оптимизируется по математически заданной функции вознаграждения (например, количеству очков в игре), RLHF уточняет модели — в частности, большие языковые модели (LLMs) — с использованием субъективных предпочтений людей, чтобы согласовать поведение AI с человеческими ценностями. Этот метод получил популярность благодаря исследовательским группам, таким как OpenAI.
- Обучение без учителя: Методы обучения без учителя ищут скрытые закономерности в данных без явной обратной связи. В отличие от них, DRL ориентировано на достижение цели и управляется сигналом вознаграждения, который активно направляет агента к определённой цели, как обсуждается в фундаментальных трудах Саттона и Барто.
Разработчики, которым необходимо управлять наборами данных для уровней восприятия систем DRL, могут использовать Ultralytics Platform, упрощающую аннотирование и облачные процессы обучения. Кроме того, исследователи часто используют стандартизированные среды, такие как Gymnasium, чтобы сравнивать свои алгоритмы DRL с общепринятыми базовыми решениями.









