Ultralytics YOLO27:
返回 Ultralytics 术语表

Reinforcement Learning

探索强化学习(RL)的核心概念。了解智能体如何利用反馈掌握任务,以及 Ultralytics YOLO26 如何为强化学习视觉系统提供支持。

强化学习(RL)是机器学习(ML)的一个目标导向子领域。在这一领域中,被称为智能体的自主系统通过执行动作并接收来自环境的反馈来学习做出决策。不同于依赖带有正确答案标签的静态数据集的监督学习,RL 算法通过动态的试错过程进行学习。智能体与模拟环境或现实世界交互,观察其动作产生的后果,从而确定哪些策略能够带来最高的长期奖励。这种方法与操作性条件反射这一心理学概念高度相似,在操作性条件反射中,行为会随着时间推移通过正强化(奖励)和负强化(惩罚)得到塑造。

RL 循环的核心概念#

要理解 RL 的工作方式,可以将其视为一个持续的交互循环。这一框架通常会以数学形式表示为马尔可夫决策过程(MDP),用于构建决策过程,适用于结果部分具有随机性、部分受决策者控制的情形。

这一学习循环的主要组成部分包括:

  • **AI 智能体:**负责学习和做出决策的实体。它感知环境并采取行动,以最大化累积收益。
  • **环境:**智能体运行所处的外部世界。它可以是复杂的视频游戏、金融市场模拟环境,也可以是物流领域的 AI中的实体仓库。
  • **状态:**对当前情形的快照或表示。在视觉应用中,这通常包括使用计算机视觉(CV)处理摄像头画面,以检测对象和障碍物。
  • **动作:**智能体执行的具体移动或选择。所有可能移动的完整集合称为动作空间
  • **奖励:**动作执行后由环境发送给智能体的数值信号。设计良好的奖励函数会为有益动作分配正值,并对有害动作施加惩罚。
  • **策略:**智能体根据当前状态确定下一步动作时所使用的策略或规则集合。Q-learning等算法定义了如何更新和优化这一策略。

实际应用#

强化学习已经从理论研究走向实践,并在各个行业实现了具有重要影响的应用。

  • **高级机器人技术:**在机器人领域的 AI中,RL 使机器能够掌握难以通过硬编码实现的复杂运动技能。机器人可以先在NVIDIA Isaac Sim等物理引擎中训练,然后部署到现实世界,从而学会抓取不规则物体或在崎岖地形中导航。
  • 自主系统:自动驾驶车辆利用 RL 在不可预测的交通场景中实时做出决策。目标检测模型可以识别行人和交通标志,而 RL 算法则有助于确定车道合流和路口通行的安全驾驶策略。
  • **策略优化:**当Google DeepMind 的 AlphaGo等系统在复杂棋类游戏中击败人类世界冠军时,RL 获得了全球关注。除了游戏之外,这些智能体还可以优化工业物流,例如控制数据中心的冷却系统以降低能耗。

将视觉与 RL 集成#

在许多现代应用中,智能体观察到的“状态”是视觉信息。YOLO26等高性能模型充当 RL 智能体的感知层,将原始图像转换为结构化数据。这些经过处理的信息(例如对象的位置和类别)会成为 RL 策略用于选择动作的状态。

以下示例演示了如何使用 ultralytics 软件包处理环境帧,为理论上的 RL 循环创建状态表示(例如对象数量)。

from ultralytics import YOLO

# Load the YOLO26 model to serve as the agent's vision system
model = YOLO("yolo26n.pt")

# Simulate the agent observing the environment (an image frame)
observation_frame = "https://ultralytics.com/images/bus.jpg"

# Process the frame to extract the current 'state'
results = model(observation_frame)

# The agent uses detection data to inform its next action
# For example, an autonomous delivery robot might stop if it sees people
num_objects = len(results[0].boxes)
print(f"Agent Observation: {num_objects} objects detected. Calculating next move...")

区分相关术语#

区分强化学习与其他机器学习范式非常重要:

  • **与监督学习相比:**监督学习需要一位具备相关知识的外部监督者提供带标签的训练数据(例如“这张图像中有一只猫”)。相比之下,RL 无需显式标签,而是从自身动作产生的后果中学习,并通过探索发现最优路径。
  • **与无监督学习相比:**无监督学习侧重于在无标签数据中寻找隐藏的结构或模式(例如对客户进行聚类)。RL 则有所不同,因为它明确以目标为导向,专注于最大化奖励信号,而不仅仅是描述数据结构。

随着计算能力不断提升,基于人类反馈的强化学习(RLHF)等技术正在进一步改进智能体的学习方式,使其目标更加贴近复杂的人类价值观和安全标准。研究人员经常使用Gymnasium等标准化环境来对这些算法进行基准测试和改进。对于希望管理这些智能体感知层所需数据集的团队,Ultralytics Platform提供了用于标注和模型管理的综合工具。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅