Deep Reinforcement Learning
探索深度强化学习(DRL),了解它如何将 AI 决策与深度学习相结合。立即学习如何将 Ultralytics YOLO26 用作感知层。
深度强化学习(DRL)是人工智能(AI)的一个高级分支,它将强化学习的决策能力与深度学习(DL)的感知能力相结合。传统强化学习依赖表格方法将情境映射为动作,但当环境复杂或包含视觉信息时,这些方法往往难以应对。DRL 通过使用神经网络解释高维输入数据(例如视频帧或传感器读数)克服了这一问题,使机器能够直接从原始经验中学习有效策略,而无需明确的人工指导。
DRL 的核心机制#
在 DRL 系统中,AI 智能体以离散的时间步长与环境交互。在每个时间步,智能体都会观察当前的“状态”,根据策略选择一个动作,并接收表示该动作成功或失败的奖励信号。其主要目标是最大化一段时间内的累积奖励。
“深度”部分指的是使用深度神经网络来近似策略(行动策略)或价值函数(预估的未来奖励)。这使智能体能够处理非结构化数据,并利用计算机视觉(CV)像人类一样“看见”环境。这项能力由 PyTorch 或 TensorFlow 等框架提供支持,可促进这些复杂网络的训练。
实际应用#
DRL 已从理论研究走向实践,在各个行业中实现了高影响力的应用:
- **先进机器人技术:**在机器人领域的 AI 应用中,DRL 使机器能够掌握难以通过硬编码实现的复杂运动技能。机器人可以在 NVIDIA Isaac Sim 等物理引擎中不断改进动作,从而学会抓取不规则物体或穿越崎岖地形。这通常包括先使用合成数据进行训练,再将策略部署到实体硬件上。
- 自动驾驶:自动驾驶车辆利用 DRL 在不可预测的交通场景中进行实时决策。目标检测模型负责识别行人和交通标志,而 DRL 算法则利用这些信息确定车道合流、路口通行和速度控制的安全驾驶策略,从而有效管理安全所需的推理延迟。
将视觉作为状态观测器#
对于许多 DRL 应用而言,“状态”是视觉信息。高速模型充当智能体的眼睛,将原始图像转换为策略网络可以利用的结构化数据。下面的示例说明了 YOLO26 模型如何作为智能体的感知层,从环境中提取观测结果(例如障碍物数量)。
from ultralytics import YOLO
# Load YOLO26n to serve as the perception layer for a DRL agent
model = YOLO("yolo26n.pt")
# Simulate an observation from the environment (e.g., a robot's camera feed)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Perform inference to extract the state (detected objects)
results = model(observation_frame)
# The detection count serves as a simplified state feature for the agent's policy
print(f"State Observation: {len(results[0].boxes)} objects detected.")区分 DRL 与相关概念#
为了理解深度强化学习在 AI 领域中的独特定位,有必要将其与相似术语区分开来:
- **强化学习(RL):**标准 RL 是基础概念,但通常依赖查找表(如 Q 表),而查找表在状态空间较大时会变得不切实际。DRL 通过使用深度学习近似函数解决了这一问题,使其能够处理图像等复杂输入。
- **基于人类反馈的强化学习(RLHF):**DRL 通常针对数学定义的奖励函数进行优化(例如游戏中的得分),而 RLHF 则利用主观的人类偏好来优化模型——尤其是大型语言模型(LLMs)——使 AI 行为与人类价值观保持一致。这项技术由 OpenAI 等研究团队推广。
- **无监督学习:**无监督方法在没有明确反馈的情况下寻找数据中的隐藏模式。相比之下,DRL 以目标为导向,由奖励信号驱动,主动引导智能体朝特定目标前进,正如 Sutton 和 Barto 的基础著作中所讨论的那样。
需要管理 DRL 系统感知层所需数据集的开发者可以使用 Ultralytics Platform,简化标注和云训练工作流。此外,研究人员通常使用 Gymnasium 等标准化环境,将其 DRL 算法与已建立的基线进行基准测试。









