Reinforcement Learning
探索强化学习(RL)的核心概念。了解智能体如何利用反馈掌握任务,以及 Ultralytics YOLO26 如何为强化学习视觉系统提供支持。
强化学习(RL)是机器学习(ML)的一个目标导向子领域。在这一领域中,被称为智能体的自主系统通过执行动作并接收来自环境的反馈来学习做出决策。不同于依赖带有正确答案标签的静态数据集的监督学习,RL 算法通过动态的试错过程进行学习。智能体与模拟环境或现实世界交互,观察其动作产生的后果,从而确定哪些策略能够带来最高的长期奖励。这种方法与操作性条件反射这一心理学概念高度相似,在操作性条件反射中,行为会随着时间推移通过正强化(奖励)和负强化(惩罚)得到塑造。
RL 循环的核心概念#
要理解 RL 的工作方式,可以将其视为一个持续的交互循环。这一框架通常会以数学形式表示为马尔可夫决策过程(MDP),用于构建决策过程,适用于结果部分具有随机性、部分受决策者控制的情形。
这一学习循环的主要组成部分包括:
- **AI 智能体:**负责学习和做出决策的实体。它感知环境并采取行动,以最大化累积收益。
- **环境:**智能体运行所处的外部世界。它可以是复杂的视频游戏、金融市场模拟环境,也可以是物流领域的 AI中的实体仓库。
- **状态:**对当前情形的快照或表示。在视觉应用中,这通常包括使用计算机视觉(CV)处理摄像头画面,以检测对象和障碍物。
- **动作:**智能体执行的具体移动或选择。所有可能移动的完整集合称为动作空间。
- **奖励:**动作执行后由环境发送给智能体的数值信号。设计良好的奖励函数会为有益动作分配正值,并对有害动作施加惩罚。
- **策略:**智能体根据当前状态确定下一步动作时所使用的策略或规则集合。Q-learning等算法定义了如何更新和优化这一策略。
实际应用#
强化学习已经从理论研究走向实践,并在各个行业实现了具有重要影响的应用。
- **高级机器人技术:**在机器人领域的 AI中,RL 使机器能够掌握难以通过硬编码实现的复杂运动技能。机器人可以先在NVIDIA Isaac Sim等物理引擎中训练,然后部署到现实世界,从而学会抓取不规则物体或在崎岖地形中导航。
- 自主系统:自动驾驶车辆利用 RL 在不可预测的交通场景中实时做出决策。目标检测模型可以识别行人和交通标志,而 RL 算法则有助于确定车道合流和路口通行的安全驾驶策略。
- **策略优化:**当Google DeepMind 的 AlphaGo等系统在复杂棋类游戏中击败人类世界冠军时,RL 获得了全球关注。除了游戏之外,这些智能体还可以优化工业物流,例如控制数据中心的冷却系统以降低能耗。
将视觉与 RL 集成#
在许多现代应用中,智能体观察到的“状态”是视觉信息。YOLO26等高性能模型充当 RL 智能体的感知层,将原始图像转换为结构化数据。这些经过处理的信息(例如对象的位置和类别)会成为 RL 策略用于选择动作的状态。
以下示例演示了如何使用 ultralytics 软件包处理环境帧,为理论上的 RL 循环创建状态表示(例如对象数量)。
from ultralytics import YOLO
# Load the YOLO26 model to serve as the agent's vision system
model = YOLO("yolo26n.pt")
# Simulate the agent observing the environment (an image frame)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Process the frame to extract the current 'state'
results = model(observation_frame)
# The agent uses detection data to inform its next action
# For example, an autonomous delivery robot might stop if it sees people
num_objects = len(results[0].boxes)
print(f"Agent Observation: {num_objects} objects detected. Calculating next move...")区分相关术语#
区分强化学习与其他机器学习范式非常重要:
- **与监督学习相比:**监督学习需要一位具备相关知识的外部监督者提供带标签的训练数据(例如“这张图像中有一只猫”)。相比之下,RL 无需显式标签,而是从自身动作产生的后果中学习,并通过探索发现最优路径。
- **与无监督学习相比:**无监督学习侧重于在无标签数据中寻找隐藏的结构或模式(例如对客户进行聚类)。RL 则有所不同,因为它明确以目标为导向,专注于最大化奖励信号,而不仅仅是描述数据结构。
随着计算能力不断提升,基于人类反馈的强化学习(RLHF)等技术正在进一步改进智能体的学习方式,使其目标更加贴近复杂的人类价值观和安全标准。研究人员经常使用Gymnasium等标准化环境来对这些算法进行基准测试和改进。对于希望管理这些智能体感知层所需数据集的团队,Ultralytics Platform提供了用于标注和模型管理的综合工具。









