YOLO Vision 2026:
返回 Ultralytics 词汇表

Reinforcement Learning

探索强化学习 (RL) 的核心概念。了解智能体如何利用反馈来掌握任务,并查看 Ultralytics YOLO26 如何赋能 RL 视觉系统。

强化学习(RL)是机器学习(ML)的一个以目标为导向的分支,其中被称为智能体的自主系统通过执行动作并从环境中接收反馈来学习做出决策。与依赖带有正确答案的静态数据集的监督学习不同,RL算法通过动态的试错过程进行学习。智能体与模拟环境或现实世界进行交互,观察其动作的后果,从而确定哪些策略能带来最高的长期回报。这种方法密切模仿了操作性条件反射这一心理学概念,即随着时间的推移,行为通过正强化(奖励)和负强化(惩罚)来塑造。

RL 循环的核心概念#

为了理解RL是如何工作的,将其可视化为一个连续的交互循环会很有帮助。这个框架在数学上通常被形式化为马尔可夫决策过程(MDP),它为结果部分随机且部分由决策者控制的情况下的决策提供结构。

此学习循环的主要组成部分包括:

  • AI智能体 负责学习和做出决策的实体。它感知环境并采取行动以最大化其累积成功率。
  • 环境: 智能体在其中运作的外部世界。这可以是一个复杂的视频 game、金融市场模拟,或者是物流中的AI中的实体仓库。
  • 状态: 对当前形势的快照或表征。在视觉应用中,这通常涉及使用计算机视觉(CV)处理摄像头画面来检测物体和障碍物。
  • 动作: 智能体做出的具体移动或选择。所有可能移动的完整集合被称为动作空间
  • 奖励: 动作执行后从环境发送给智能体的数值信号。设计良好的奖励函数会为有益的动作分配正值,为有害的动作分配惩罚。
  • 策略: 智能体根据当前状态决定下一个动作所使用的策略或规则集。像Q-learning这样的算法定义了如何更新和优化此策略。

实际应用#

强化学习已经从理论研究走向了各行各业的实际高影响力部署。

  • 先进机器人学:机器人中的AI领域,RL使机器能够掌握难以通过硬编码实现的复杂运动技能。机器人可以在部署到现实世界之前,在诸如NVIDIA Isaac Sim等物理引擎中进行训练,从而学会抓取不规则物体或在不平坦的地形上导航。
  • 自主系统: 自动驾驶汽车利用RL在不可预测的交通场景中做出实时决策。虽然目标检测模型可以识别行人和标志,但RL算法有助于确定用于车道合并和路口导航的安全驾驶策略。
  • 战略优化: 当诸如Google DeepMind的AlphaGo之类的系统在复杂的棋盘游戏中击败人类世界冠军时,RL在全球范围内受到了关注。除了游戏之外,这些智能体还优化工业物流,例如控制数据中心中的冷却系统以降低能耗。

将视觉与 RL 集成#

在许多现代应用中,智能体观察到的“状态”是视觉上的。像YOLO26这样高性能的模型充当RL智能体的感知层,将原始图像转换为结构化数据。这些经过处理的信息(例如物体的位置和类别)成为RL策略用来选择动作的状态。

以下示例演示了如何使用 ultralytics 软件包处理环境帧,为理论RL循环创建状态表示(例如,物体数量)。

from ultralytics import YOLO

# Load the YOLO26 model to serve as the agent's vision system
model = YOLO("yolo26n.pt")

# Simulate the agent observing the environment (an image frame)
observation_frame = "https://ultralytics.com/images/bus.jpg"

# Process the frame to extract the current 'state'
results = model(observation_frame)

# The agent uses detection data to inform its next action
# For example, an autonomous delivery robot might stop if it sees people
num_objects = len(results[0].boxes)
print(f"Agent Observation: {num_objects} objects detected. Calculating next move...")

区分相关术语#

将强化学习与其他机器学习范式区分开来非常重要:

  • vs. 监督学习 监督学习需要知识渊博的外部监督员来提供带标签的训练数据(例如,“这张图片包含一只猫”)。相比之下,RL从其自身行为的后果中学习,无需显式标签,通过探索发现最优路径。
  • vs. 无监督学习 无监督学习侧重于在未标记的数据中寻找隐藏的结构或模式(如对客户进行聚类)。RL的不同之处在于它是明确以目标为导向的,专注于最大化奖励信号,而不仅仅是描述数据结构。

随着计算能力的提高,诸如人类反馈强化学习(RLHF)等技术正在进一步完善智能体的学习方式,使其目标与复杂的价值观和安全标准更加紧密地结合。研究人员经常使用标准化的环境(如Gymnasium)来对这些算法进行基准测试和改进。对于希望管理这些智能体感知层所需数据集的团队,Ultralytics Platform提供了用于标注和模型管理的全面工具。

Explore solutions

Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多
Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多
Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多

让我们一起构建 AI 的未来!

开启你的机器学习未来之旅