Deep Reinforcement Learning
Исследуй глубокое обучение с подкреплением (DRL) и то, как оно сочетает принятие решений ИИ с глубоким обучением. Научись использовать Ultralytics YOLO26 в качестве слоя восприятия уже сегодня.
Глубокое обучение с подкреплением (DRL) — это передовая подмножество искусственного интеллекта (AI), которое объединяет возможности принятия решений обучения с подкреплением с перцептивной мощью глубокого обучения (DL). В то время как традиционное обучение с подкреплением опирается на табличные методы для сопоставления ситуаций с действиями, эти методы сталкиваются с трудностями в сложных или визуальных средах. DRL преодолевает это, используя нейронные сети для интерпретации высокоразмерных входных данных, таких как видеокадры или показания датчиков, позволяя машинам изучать эффективные стратегии напрямую из необработанного опыта без явных инструкций человека.
Основной механизм DRL#
В системе DRL AI-агент взаимодействует со средой в дискретные моменты времени. На каждом шаге агент наблюдает текущее «состояние», выбирает действие на основе политики и получает сигнал вознаграждения, указывающий на успех или неудачу этого действия. Основная цель заключается в максимизации совокупного вознаграждения с течением времени.
Компонент «глубокого» относится к использованию глубоких нейронных сетей для аппроксимации политики (стратегии действия) или функции ценности (оцениваемого будущего вознаграждения). Это позволяет агенту обрабатывать неструктурированные данные, используя компьютерное зрение (CV), чтобы «видеть» среду почти так же, как это делает человек. Эта возможность обеспечивается такими фреймворками, как PyTorch или TensorFlow, которые облегчают обучение этих сложных сетей.
Реальные приложения#
DRL вышло за рамки теоретических исследований и применяется в практических задачах с высокой отдачей в различных отраслях:
- Продвинутая робототехника: В области ИИ в робототехнике DRL позволяет машинам осваивать сложные моторные навыки, которые трудно запрограммировать вручную. Роботы могут научиться захватывать нестандартные объекты или передвигаться по неровной местности, совершенствуя свои движения в физических движках, таких как NVIDIA Isaac Sim. Это часто включает в себя обучение на синтетических данных перед развертыванием политики на физическом оборудовании.
- Автономное вождение: Автономные транспортные средства используют DRL для принятия решений в реальном времени в непредсказуемых дорожных сценариях. В то время как модели обнаружения объектов идентифицируют пешеходов и знаки, алгоритмы DRL используют эту информацию для определения безопасных политик вождения при слиянии полос, проезде перекрестков и управлении скоростью, эффективно контролируя задержку инференса, необходимую для безопасности.
Зрение как наблюдатель состояния#
Для многих приложений DRL «состояние» является визуальным. Высокоскоростные модели выступают в роли глаз агента, преобразуя исходные изображения в структурированные данные, с которыми может работать сетевая политика. Следующий пример иллюстрирует, как модель YOLO26 служит слоем восприятия для агента, извлекая наблюдения (например, количество препятствий) из среды.
from ultralytics import YOLO
# Load YOLO26n to serve as the perception layer for a DRL agent
model = YOLO("yolo26n.pt")
# Simulate an observation from the environment (e.g., a robot's camera feed)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Perform inference to extract the state (detected objects)
results = model(observation_frame)
# The detection count serves as a simplified state feature for the agent's policy
print(f"State Observation: {len(results[0].boxes)} objects detected.")Отличие DRL от связанных концепций#
Полезно различать глубинное обучение с подкреплением и похожие термины, чтобы понять его уникальное положение в ландшафте ИИ:
- Обучение с подкреплением (RL): Стандартное RL является фундаментальной концепцией, но обычно опирается на таблицы поиска (например, Q-таблицы), которые становятся непрактичными для больших пространств состояний. DRL решает эту проблему, используя глубокое обучение для аппроксимации функций, что позволяет ему обрабатывать сложные входные данные, такие как изображения.
- Обучение с подкреплением на основе отзывов человека (RLHF): В то время как DRL обычно оптимизирует математически определенную функцию вознаграждения (например, очки в игре), RLHF дорабатывает модели — в частности, большие языковые модели (LLMs) — используя субъективные предпочтения человека для согласования поведения ИИ с человеческими ценностями, метод, популяризированный такими исследовательскими группами, как OpenAI.
- Обучение без учителя: Методы без учителя ищут скрытые паттерны в данных без явной обратной связи. В отличие от них, DRL ориентирован на цель, управляем сигналом вознаграждения, который активно направляет агента к конкретной задаче, как обсуждается в фундаментальных текстах Саттона и Барто.
Разработчики, желающие управлять наборами данных, необходимыми для слоев восприятия систем DRL, могут использовать платформу Ultralytics, которая упрощает аннотирование и рабочие процессы облачного обучения. Кроме того, исследователи часто используют стандартизированные среды, такие как Gymnasium, для оценки своих алгоритмов DRL по сравнению с установленными базовыми показателями.






