Ultralytics YOLO27:
返回 Ultralytics 术语表

Deep Reinforcement Learning

探索深度强化学习(DRL),了解它如何将 AI 决策与深度学习相结合。立即学习如何将 Ultralytics YOLO26 用作感知层。

深度强化学习(DRL)是人工智能(AI)的一个高级分支,它将强化学习的决策能力与深度学习(DL)的感知能力相结合。传统强化学习依赖表格方法将情境映射为动作,但当环境复杂或包含视觉信息时,这些方法往往难以应对。DRL 通过使用神经网络解释高维输入数据(例如视频帧或传感器读数)克服了这一问题,使机器能够直接从原始经验中学习有效策略,而无需明确的人工指导。

DRL 的核心机制#

在 DRL 系统中,AI 智能体以离散的时间步长与环境交互。在每个时间步,智能体都会观察当前的“状态”,根据策略选择一个动作,并接收表示该动作成功或失败的奖励信号。其主要目标是最大化一段时间内的累积奖励。

“深度”部分指的是使用深度神经网络来近似策略(行动策略)或价值函数(预估的未来奖励)。这使智能体能够处理非结构化数据,并利用计算机视觉(CV)像人类一样“看见”环境。这项能力由 PyTorchTensorFlow 等框架提供支持,可促进这些复杂网络的训练。

实际应用#

DRL 已从理论研究走向实践,在各个行业中实现了高影响力的应用:

  • **先进机器人技术:**在机器人领域的 AI 应用中,DRL 使机器能够掌握难以通过硬编码实现的复杂运动技能。机器人可以在 NVIDIA Isaac Sim 等物理引擎中不断改进动作,从而学会抓取不规则物体或穿越崎岖地形。这通常包括先使用合成数据进行训练,再将策略部署到实体硬件上。
  • 自动驾驶:自动驾驶车辆利用 DRL 在不可预测的交通场景中进行实时决策。目标检测模型负责识别行人和交通标志,而 DRL 算法则利用这些信息确定车道合流、路口通行和速度控制的安全驾驶策略,从而有效管理安全所需的推理延迟

将视觉作为状态观测器#

对于许多 DRL 应用而言,“状态”是视觉信息。高速模型充当智能体的眼睛,将原始图像转换为策略网络可以利用的结构化数据。下面的示例说明了 YOLO26 模型如何作为智能体的感知层,从环境中提取观测结果(例如障碍物数量)。

from ultralytics import YOLO

# Load YOLO26n to serve as the perception layer for a DRL agent
model = YOLO("yolo26n.pt")

# Simulate an observation from the environment (e.g., a robot's camera feed)
observation_frame = "https://ultralytics.com/images/bus.jpg"

# Perform inference to extract the state (detected objects)
results = model(observation_frame)

# The detection count serves as a simplified state feature for the agent's policy
print(f"State Observation: {len(results[0].boxes)} objects detected.")

区分 DRL 与相关概念#

为了理解深度强化学习在 AI 领域中的独特定位,有必要将其与相似术语区分开来:

  • **强化学习(RL):**标准 RL 是基础概念,但通常依赖查找表(如 Q 表),而查找表在状态空间较大时会变得不切实际。DRL 通过使用深度学习近似函数解决了这一问题,使其能够处理图像等复杂输入。
  • **基于人类反馈的强化学习(RLHF):**DRL 通常针对数学定义的奖励函数进行优化(例如游戏中的得分),而 RLHF 则利用主观的人类偏好来优化模型——尤其是大型语言模型(LLMs)——使 AI 行为与人类价值观保持一致。这项技术由 OpenAI 等研究团队推广。
  • **无监督学习:**无监督方法在没有明确反馈的情况下寻找数据中的隐藏模式。相比之下,DRL 以目标为导向,由奖励信号驱动,主动引导智能体朝特定目标前进,正如 Sutton 和 Barto 的基础著作中所讨论的那样。

需要管理 DRL 系统感知层所需数据集的开发者可以使用 Ultralytics Platform,简化标注和云训练工作流。此外,研究人员通常使用 Gymnasium 等标准化环境,将其 DRL 算法与已建立的基线进行基准测试。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅