Markov Decision Process (MDP)
Изучи основы марковских процессов принятия решений (MDP). Узнай, как MDP управляют обучением с подкреплением и как Ultralytics YOLO26 предоставляет данные о состоянии в реальном времени.
Марковский процесс принятия решений (MDP) — это математическая структура, используемая для моделирования принятия решений в ситуациях, когда результаты частично случайны, а частично находятся под контролем лица, принимающего решения. Это фундаментальная основа для обучения с подкреплением (RL), предоставляющая структурированный способ для ИИ-агента взаимодействовать со средой для достижения определенной цели. В отличие от стандартного обучения с учителем, которое опирается на статичные размеченные наборы данных, MDP фокусируется на последовательном принятии решений, где текущие действия влияют на будущие возможности.
Основные компоненты MDP#
Чтобы понять, как работает MDP, полезно представить его как цикл взаимодействия между агентом и средой. Этот цикл определяется пятью ключевыми компонентами:
- Состояние: Текущая ситуация или конфигурация среды. В автономных транспортных средствах состояние может включать скорость автомобиля, его местоположение и близлежащие препятствия, обнаруженные датчиками компьютерного зрения (CV).
- Действие: Набор всех возможных ходов или вариантов выбора, доступных агенту. Это часто называют пространством действий, которое может быть дискретным (например, шаг влево, шаг вправо) или непрерывным (например, регулировка угла поворота руля).
- Вероятность перехода: определяет вероятность перехода из одного состояния в другое после выполнения определенного действия. Она учитывает неопределенность и динамику реального мира, отличая MDP от детерминированных систем.
- Награда: Числовой сигнал, получаемый после каждого действия. Функция вознаграждения имеет решающее значение, поскольку она направляет поведение агента: положительные награды поощряют желательные действия, в то время как отрицательные награды (штрафы) препятствуют ошибкам.
- Коэффициент дисконтирования: Значение, определяющее важность будущих наград по сравнению с немедленными. Он помогает агенту расставлять приоритеты в пользу долгосрочного планирования, а не сиюминутной выгоды, что является концепцией, центральной для стратегической оптимизации.
Реальные приложения#
MDP выступают в роли механизма принятия решений во многих передовых технологиях, позволяя системам ориентироваться в сложных и динамичных средах.
- Управление робототехникой: В ИИ в робототехнике MDP позволяют машинам изучать сложные моторные навыки. Например, робот-манипулятор использует MDP для определения оптимального пути подбора объекта при одновременном избежании столкновений. Состояние представляет собой углы суставов и положение объекта, полученные на основе 3D-обнаружения объектов, а награда основана на скорости успешного захвата.
- Управление запасами: Розничные продавцы используют MDP для оптимизации запасов. Здесь состояние представляет текущие уровни запасов, действия — это решения о повторном заказе, а награды рассчитываются на основе нормы прибыли за вычетом затрат на хранение и дефицит.
- Лечение в здравоохранении: В персонализированной медицине MDP помогают разрабатывать динамичные планы лечения. Моделируя показатели здоровья пациента как состояния, а медикаменты как действия, врачи могут использовать прогнозирующее моделирование для максимизации долгосрочных результатов для здоровья пациента.
Связь с обучением с подкреплением#
Будучи тесно связанными, важно различать MDP и обучение с подкреплением. MDP — это формальная постановка задачи — математическая модель среды. Обучение с подкреплением — это метод, используемый для решения этой задачи, когда внутренняя динамика (вероятности переходов) полностью не известна. Алгоритмы RL, такие как Q-обучение, взаимодействуют с MDP, чтобы изучить наилучшую политику методом проб и ошибок.
Визуальное наблюдение в MDP#
В современных приложениях ИИ «состояние» MDP часто выводится из визуальных данных. Высокоскоростные модели восприятия действуют как глаза системы, преобразуя сырые потоки с камер в структурированные данные, которые MDP может обрабатывать. Например, Ultralytics YOLO26 может предоставлять координаты объектов в реальном времени, которые служат входными данными о состоянии для агента принятия решений.
Следующий пример демонстрирует, как извлечь представление состояния (ограничивающие рамки) из изображения с помощью Python, что затем можно подать в политику MDP.
from ultralytics import YOLO
# Load the YOLO26 model to serve as the perception layer
model = YOLO("yolo26n.pt")
# Perform inference to observe the current 'state' of the environment
results = model("https://ultralytics.com/images/bus.jpg")
# Extract bounding box coordinates to form the state vector
# This structured data tells the agent where objects are located
for box in results[0].boxes:
print(f"State Object: Class {int(box.cls)} at {box.xywh.tolist()}")Интегрируя надежные модели видения с фреймворками MDP, разработчики могут создавать системы, которые не только воспринимают мир, но и принимают интеллектуальные, адаптивные решения внутри него. Эта синергия имеет важное значение для развития автономных систем и умного производства.






