Reinforcement Learning
探索强化学习 (RL) 的核心概念。了解智能体如何利用反馈来掌握任务,并查看 Ultralytics YOLO26 如何赋能 RL 视觉系统。
强化学习(RL)是机器学习(ML)的一个以目标为导向的分支,其中被称为智能体的自主系统通过执行动作并从环境中接收反馈来学习做出决策。与依赖带有正确答案的静态数据集的监督学习不同,RL算法通过动态的试错过程进行学习。智能体与模拟环境或现实世界进行交互,观察其动作的后果,从而确定哪些策略能带来最高的长期回报。这种方法密切模仿了操作性条件反射这一心理学概念,即随着时间的推移,行为通过正强化(奖励)和负强化(惩罚)来塑造。
RL 循环的核心概念#
为了理解RL是如何工作的,将其可视化为一个连续的交互循环会很有帮助。这个框架在数学上通常被形式化为马尔可夫决策过程(MDP),它为结果部分随机且部分由决策者控制的情况下的决策提供结构。
此学习循环的主要组成部分包括:
- AI智能体: 负责学习和做出决策的实体。它感知环境并采取行动以最大化其累积成功率。
- 环境: 智能体在其中运作的外部世界。这可以是一个复杂的视频 game、金融市场模拟,或者是物流中的AI中的实体仓库。
- 状态: 对当前形势的快照或表征。在视觉应用中,这通常涉及使用计算机视觉(CV)处理摄像头画面来检测物体和障碍物。
- 动作: 智能体做出的具体移动或选择。所有可能移动的完整集合被称为动作空间。
- 奖励: 动作执行后从环境发送给智能体的数值信号。设计良好的奖励函数会为有益的动作分配正值,为有害的动作分配惩罚。
- 策略: 智能体根据当前状态决定下一个动作所使用的策略或规则集。像Q-learning这样的算法定义了如何更新和优化此策略。
实际应用#
强化学习已经从理论研究走向了各行各业的实际高影响力部署。
- 先进机器人学: 在机器人中的AI领域,RL使机器能够掌握难以通过硬编码实现的复杂运动技能。机器人可以在部署到现实世界之前,在诸如NVIDIA Isaac Sim等物理引擎中进行训练,从而学会抓取不规则物体或在不平坦的地形上导航。
- 自主系统: 自动驾驶汽车利用RL在不可预测的交通场景中做出实时决策。虽然目标检测模型可以识别行人和标志,但RL算法有助于确定用于车道合并和路口导航的安全驾驶策略。
- 战略优化: 当诸如Google DeepMind的AlphaGo之类的系统在复杂的棋盘游戏中击败人类世界冠军时,RL在全球范围内受到了关注。除了游戏之外,这些智能体还优化工业物流,例如控制数据中心中的冷却系统以降低能耗。
将视觉与 RL 集成#
在许多现代应用中,智能体观察到的“状态”是视觉上的。像YOLO26这样高性能的模型充当RL智能体的感知层,将原始图像转换为结构化数据。这些经过处理的信息(例如物体的位置和类别)成为RL策略用来选择动作的状态。
以下示例演示了如何使用 ultralytics 软件包处理环境帧,为理论RL循环创建状态表示(例如,物体数量)。
from ultralytics import YOLO
# Load the YOLO26 model to serve as the agent's vision system
model = YOLO("yolo26n.pt")
# Simulate the agent observing the environment (an image frame)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Process the frame to extract the current 'state'
results = model(observation_frame)
# The agent uses detection data to inform its next action
# For example, an autonomous delivery robot might stop if it sees people
num_objects = len(results[0].boxes)
print(f"Agent Observation: {num_objects} objects detected. Calculating next move...")区分相关术语#
将强化学习与其他机器学习范式区分开来非常重要:
- vs. 监督学习: 监督学习需要知识渊博的外部监督员来提供带标签的训练数据(例如,“这张图片包含一只猫”)。相比之下,RL从其自身行为的后果中学习,无需显式标签,通过探索发现最优路径。
- vs. 无监督学习: 无监督学习侧重于在未标记的数据中寻找隐藏的结构或模式(如对客户进行聚类)。RL的不同之处在于它是明确以目标为导向的,专注于最大化奖励信号,而不仅仅是描述数据结构。
随着计算能力的提高,诸如人类反馈强化学习(RLHF)等技术正在进一步完善智能体的学习方式,使其目标与复杂的价值观和安全标准更加紧密地结合。研究人员经常使用标准化的环境(如Gymnasium)来对这些算法进行基准测试和改进。对于希望管理这些智能体感知层所需数据集的团队,Ultralytics Platform提供了用于标注和模型管理的全面工具。






