Markov Decision Process (MDP)
Изучи основы марковских процессов принятия решений (MDP). Узнай, как MDP лежат в основе обучения с подкреплением и как Ultralytics YOLO26 предоставляет данные о состоянии в реальном времени.
Марковский процесс принятия решений (MDP) — это математическая модель, используемая для моделирования принятия решений в ситуациях, где результаты частично случайны, а частично зависят от лица, принимающего решения. Это фундаментальная основа для обучения с подкреплением (RL), предоставляющая структурированный способ взаимодействия AI-агента с окружающей средой для достижения определённой цели. В отличие от стандартного обучения с учителем, которое опирается на статические размеченные наборы данных, MDP сосредоточен на последовательном принятии решений, при котором текущие действия влияют на будущие возможности.
Основные компоненты MDP#
Чтобы понять, как работает MDP, удобно представить его в виде цикла взаимодействия между агентом и окружающей средой. Этот цикл определяется пятью ключевыми компонентами:
- Состояние: текущая ситуация или конфигурация окружающей среды. В автономных транспортных средствах состояние может включать скорость и местоположение автомобиля, а также близлежащие препятствия, обнаруженные датчиками компьютерного зрения (CV).
- Действие: множество всех возможных движений или вариантов выбора, доступных агенту. Это часто называют пространством действий, которое может быть дискретным (например, движение влево или вправо) или непрерывным (например, изменение угла поворота).
- Вероятность перехода: определяет вероятность перехода из одного состояния в другое после выполнения определённого действия. Она учитывает неопределённость и динамику реального мира, отличая MDP от детерминированных систем.
- Вознаграждение: числовой сигнал, получаемый после каждого действия. Функция вознаграждения имеет критическое значение, поскольку направляет поведение агента: положительные вознаграждения поощряют желательные действия, а отрицательные вознаграждения (штрафы) препятствуют ошибкам.
- Коэффициент дисконтирования: значение, определяющее важность будущих вознаграждений по сравнению с немедленными. Он помогает агенту отдавать приоритет долгосрочному планированию, а не краткосрочному удовлетворению, что является центральной концепцией стратегической оптимизации.
Практические применения#
MDP служат механизмом принятия решений для многих передовых технологий, позволяя системам ориентироваться в сложных динамических средах.
- Управление роботами: В области AI в робототехнике MDP позволяют машинам осваивать сложные двигательные навыки. Например, роботизированная рука использует MDP для определения оптимальной траектории захвата объекта с предотвращением столкновений. Состоянием являются углы сочленений и положение объекта, полученные с помощью 3D-детекции объектов, а вознаграждение зависит от скорости успешного захвата.
- Управление запасами: розничные продавцы используют MDP для оптимизации запасов. В этом случае состояние отражает текущие уровни запасов, действия представляют собой решения о повторном заказе, а вознаграждения рассчитываются на основе маржи прибыли за вычетом затрат на хранение и дефицит товаров.
- Лечение в здравоохранении: в персонализированной медицине MDP помогают разрабатывать динамические планы лечения. Моделируя показатели здоровья пациента как состояния, а лекарства как действия, врачи могут использовать предиктивное моделирование, чтобы максимизировать долгосрочные результаты для здоровья пациента.
Связь с обучением с подкреплением#
Хотя MDP и обучение с подкреплением тесно связаны, важно различать эти понятия. MDP — это формальная постановка задачи, то есть математическая модель окружающей среды. Обучение с подкреплением — это метод, используемый для решения этой задачи, когда внутренняя динамика (вероятности переходов) известна не полностью. Алгоритмы RL, такие как Q-learning, взаимодействуют с MDP, чтобы методом проб и ошибок выучить наилучшую стратегию.
Визуальное наблюдение в MDP#
В современных приложениях AI «состояние» MDP часто выводится из визуальных данных. Быстродействующие модели восприятия служат системе глазами, преобразуя необработанные видеопотоки с камер в структурированные данные, которые MDP может обрабатывать. Например, Ultralytics YOLO26 может предоставлять координаты объектов в реальном времени, которые служат входными данными состояния для агента, принимающего решения.
В следующем примере показано, как с помощью Python извлечь из изображения представление состояния (ограничивающие рамки), которое затем можно передать в стратегию MDP.
from ultralytics import YOLO
# Load the YOLO26 model to serve as the perception layer
model = YOLO("yolo26n.pt")
# Perform inference to observe the current 'state' of the environment
results = model("https://ultralytics.com/images/bus.jpg")
# Extract bounding box coordinates to form the state vector
# This structured data tells the agent where objects are located
for box in results[0].boxes:
print(f"State Object: Class {int(box.cls)} at {box.xywh.tolist()}")Интегрируя надёжные модели компьютерного зрения с фреймворками MDP, разработчики могут создавать системы, которые не только воспринимают окружающий мир, но и принимают в нём интеллектуальные адаптивные решения. Такая синергия необходима для развития автономных систем и умного производства.






