Deep Reinforcement Learning
探索深度强化学习 (DRL) 以及它如何将 AI 决策与深度学习相结合。学习今天将 Ultralytics YOLO26 用作感知层。
深度强化学习(DRL)是人工智能(AI)的一个高级子集,它将强化学习的决策能力与深度学习(DL)的感知能力结合起来。虽然传统的强化学习依赖表格方法将情况映射到动作,但当环境复杂或呈视觉化时,这些方法就会遇到困难。DRL通过使用神经网络来解释高维输入数据(如视频帧或传感器读数)克服了这一点,使机器能够直接从原始经验中学习有效的策略,而无需显式的人类指令。
DRL 的核心机制#
在DRL系统中,AI智能体在离散的时间步长中与环境交互。在每个步骤中,智能体观察当前的“状态”,根据策略选择动作,并接收指示该动作成功或失败的奖励信号。主要目标是最大化随时间推移的累积奖励。
“深度”部分指的是使用深度神经网络来近似策略(行动策略)或价值函数(估计的未来奖励)。这允许智能体处理非结构化数据,利用计算机视觉(CV)像人类一样“看”环境。这一能力由诸如PyTorch或TensorFlow等框架提供支持,这些框架促进了这些复杂网络的训练。
实际应用#
DRL 已超越理论研究,在各行各业中实现了具有高影响力的实际应用:
- **先进机器人技术:**在机器人领域的AI领域,DRL使机器能够掌握难以通过硬编码实现的复杂运动技能。机器人可以通过在诸如NVIDIA Isaac Sim等物理引擎中完善其运动来学习抓取不规则物体或穿越不平坦的地形。这通常涉及在将策略部署到物理硬件之前对合成数据进行训练。
- 自动驾驶:自动驾驶汽车利用DRL在不可预测的交通场景中做出实时决策。虽然目标检测模型识别行人和路标,但DRL算法利用该信息来确定用于车道合并、路口导航和速度控制的安全驾驶策略,从而有效地管理安全性所需的推理延迟。
视觉作为状态观察者#
对于许多DRL应用而言,“状态”是视觉的。高速模型充当智能体的眼睛,将原始图像转换为策略网络可以据此行动的结构化数据。以下示例说明了YOLO26模型如何作为智能体的感知层,从环境中提取观测值(例如障碍物计数)。
from ultralytics import YOLO
# Load YOLO26n to serve as the perception layer for a DRL agent
model = YOLO("yolo26n.pt")
# Simulate an observation from the environment (e.g., a robot's camera feed)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Perform inference to extract the state (detected objects)
results = model(observation_frame)
# The detection count serves as a simplified state feature for the agent's policy
print(f"State Observation: {len(results[0].boxes)} objects detected.")区分 DRL 与相关概念#
为了理解深度强化学习在 AI 领域中的独特地位,区分它与相似术语是很有帮助的:
- **强化学习(RL):**标准RL是基础概念,但通常依赖于查找表(如Q表),这对于大型状态空间变得不切实际。DRL通过使用深度学习近似函数来解决这个问题,使其能够处理诸如图像之类的复杂输入。
- **人类反馈强化学习(RLHF):**虽然DRL通常针对数学定义的奖励功能(例如游戏中的得分)进行优化,但RLHF使用主观的人类偏好来精炼模型——特别是大型语言模型(LLMs)——以将AI行为与人类价值观对齐,这是一项由诸如OpenAI等研究小组推广的技术。
- **无监督学习:**无监督方法在没有显式反馈的情况下寻找数据中的隐藏模式。相比之下,DRL是面向目标的,由主动引导智能体实现特定目标的奖励信号驱动,正如Sutton和Barto的基础著作中所讨论的那样。
希望管理DRL系统感知层所需数据集的开发者可以利用Ultralytics Platform,它简化了标注和云端训练工作流程。此外,研究人员经常使用标准化环境(例如Gymnasium)来对照既定基准评估其DRL算法。






