返回 Ultralytics 术语表
Markov Decision Process (MDP)
探索马尔可夫决策过程(MDP)的基础知识。了解 MDPs 如何驱动强化学习,以及 Ultralytics YOLO26 如何提供实时状态数据。
马尔可夫决策过程 (MDP) 是一种数学框架,用于对结果部分随机、部分受决策者控制的情境中的决策过程进行建模。它是强化学习 (RL)的基础蓝图,为AI 智能体与环境交互以实现特定目标提供了结构化方法。与依赖静态标注数据集的标准监督学习不同,MDP 专注于序列决策,其中当前行动会影响未来的可能性。
MDP 的核心组件#
要理解 MDP 的运行方式,可以将其想象为智能体与环境之间的交互循环。该循环由五个关键组件定义:
- 状态: 环境当前的情况或配置。在自动驾驶汽车中,状态可能包括汽车的速度、位置,以及由计算机视觉 (CV)传感器检测到的附近障碍物。
- 动作: 智能体可执行的所有可能移动或选择的集合。这通常称为动作空间,可以是离散的(例如向左移动、向右移动),也可以是连续的(例如调整转向角)。
- 状态转移概率: 定义在执行特定动作后从一个状态转移到另一个状态的可能性。它反映了现实世界的不确定性和动态特征,使 MDP 与确定性系统区别开来。
- 奖励: 每次执行动作后接收到的数值信号。奖励函数至关重要,因为它会引导智能体的行为——正奖励鼓励理想动作,而负奖励(惩罚)则抑制错误。
- 折扣因子: 用于确定未来奖励相对于即时奖励重要性的数值。它帮助智能体优先进行长期规划,而不是追求短期满足,这是战略优化的核心概念。
实际应用#
MDP 充当许多先进技术背后的决策引擎,使系统能够在复杂、动态的环境中导航。
- 机器人控制: 在机器人领域的 AI中,MDP 使机器能够学习复杂的运动技能。例如,机械臂使用 MDP 确定抓取物体时的最优路径,同时避免碰撞。状态是关节角度和物体位置,这些信息源自3D 目标检测;奖励则根据抓取成功的速度确定。
- 库存管理: 零售商使用 MDP 进行库存优化。在此场景中,状态表示当前库存水平,动作是补货决策,而奖励则根据利润率减去存储成本和缺货成本计算。
- 医疗治疗: 在个性化医疗中,MDP 有助于设计动态治疗方案。通过将患者健康指标建模为状态、将药物建模为动作,医生可以使用预测建模来最大限度地改善患者的长期健康结果。
与强化学习的关系#
虽然 MDP 与强化学习密切相关,但区分二者十分重要。MDP 是形式化的问题定义——即环境的数学模型。强化学习是用于解决该问题的方法,适用于内部动态(状态转移概率)并不完全已知的情况。诸如Q-learning之类的 RL 算法与 MDP 交互,通过试错学习最佳策略。
MDP 中的视觉观测#
在现代 AI 应用中,MDP 的“状态”通常源自视觉数据。高速感知模型充当系统的眼睛,将原始摄像头画面转换为 MDP 可以处理的结构化数据。例如,Ultralytics YOLO26可以提供实时目标坐标,这些坐标将作为决策智能体的状态输入。
以下示例演示如何使用 Python 从图像中提取状态表示(边界框),然后将其输入 MDP 策略。
from ultralytics import YOLO
# Load the YOLO26 model to serve as the perception layer
model = YOLO("yolo26n.pt")
# Perform inference to observe the current 'state' of the environment
results = model("https://ultralytics.com/images/bus.jpg")
# Extract bounding box coordinates to form the state vector
# This structured data tells the agent where objects are located
for box in results[0].boxes:
print(f"State Object: Class {int(box.cls)} at {box.xywh.tolist()}")通过将稳健的视觉模型与 MDP 框架相结合,开发者可以构建不仅能够感知世界,还能在其中做出智能、自适应决策的系统。这种协同对于自主系统和智能制造的发展至关重要。









