Hidden Markov Model (HMM)
Изучи скрытые марковские модели (HMM) для статистического ИИ. Узнай, как HMM работают с Ultralytics YOLO26 для распознавания действий, анализа последовательностей и временной логики.
Скрытая марковская модель (HMM) — это статистическая модель, используемая для моделирования систем, в которых внутренний процесс напрямую не виден — отсюда и слово «скрытая», — но может быть выведен по последовательности наблюдаемых событий. Хотя современное глубокое обучение научилось работать со сложными последовательностями, HMM остаётся фундаментальной концепцией в статистическом ИИ и теории вероятностей. Она особенно эффективна для анализа данных временных рядов, где порядок событий даёт важный контекст, опираясь на основной принцип: вероятность будущего состояния зависит только от текущего состояния, а не от предшествующей истории.
Основные механизмы HMM#
Чтобы понять, как работает HMM, важно различать два отдельных уровня модели: невидимые состояния и видимые выходные данные. Модель предполагает, что система переходит между скрытыми состояниями согласно определённым вероятностям, выдавая наблюдение на каждом шаге.
HMM определяется набором параметров, управляющих этими переходами и эмиссиями:
- Скрытые состояния: Они представляют лежащую в основе системы реальность в определённый момент времени. В речевой модели скрытое состояние может соответствовать конкретной фонеме или слову.
- Наблюдаемые события: Это точки данных, фактически собираемые датчиками или входными источниками. В примере с речью наблюдением будет звуковая волна или данные спектрограммы.
- Вероятности переходов: Эта матрица описывает вероятность перехода из одного скрытого состояния в другое. Например, вероятность изменения погоды с «дождливой» на «солнечную».
- Вероятности эмиссии: Они определяют вероятность наблюдения конкретного события при заданном текущем скрытом состоянии.
- Начальные вероятности: Распределение, определяющее состояние, в котором система, скорее всего, начнёт работу.
Обучение HMM обычно включает применение алгоритма Баум—Велша для оценки этих параметров по обучающим данным. После обучения алгоритм Витерби обычно используется для декодирования наиболее вероятной последовательности скрытых состояний по новому набору наблюдений.
HMM и другие модели последовательностей#
Хотя HMM имеют сходства с другими инструментами обработки последовательностей, они значительно отличаются архитектурой и применением:
- HMM и рекуррентные нейронные сети (RNN): RNN и сети с долговременной краткосрочной памятью (LSTM) — это модели глубокого обучения, способные учитывать долгосрочные зависимости и нелинейные закономерности, тогда как HMM — более простые вероятностные модели, ограниченные марковским допущением (краткосрочной памятью). Однако HMM требуют значительно меньше данных и намного лучше поддаются интерпретации.
- HMM и фильтр Калмана (KF): Оба метода используются для оценки состояния. Однако фильтры Калмана предназначены для непрерывных состояний (например, для отслеживания точного местоположения движущегося автомобиля), тогда как HMM применяются для дискретных состояний (например, чтобы определить, припаркован ли автомобиль, движется или остановлен).
Практические применения#
Несмотря на распространение глубокого обучения (DL), скрытые марковские модели по-прежнему широко используются в задачах, требующих вероятностного вывода по последовательностям.
Распознавание речи и рукописного текста#
Исторически HMM были основой систем распознавания речи. В этом контексте произносимые слова являются «скрытыми» состояниями, а записанные микрофоном звуковые сигналы — наблюдениями. HMM помогают определить наиболее вероятную последовательность слов, породившую звуковой сигнал. Аналогичным образом они помогают расшифровывать рукописный текст, моделируя переходы между штрихами символов.
Анализ биологических последовательностей#
В области биоинформатики HMM играют важную роль в предсказании генов и выравнивании белков. Они анализируют последовательности ДНК или аминокислот, чтобы выявлять функциональные области, например гены внутри генома. «Скрытые» состояния могут представлять кодирующие или некодирующие области, а конкретные нуклеотиды (A, C, G, T) выступают в качестве наблюдений.
Распознавание действий в компьютерном зрении#
В современном компьютерном зрении HMM можно объединять с моделями, такими как YOLO26, для выполнения распознавания действий. YOLO обнаруживает объекты или позы в отдельных кадрах, а HMM может анализировать последовательность этих поз во времени, чтобы классифицировать действие, например «ходьбу», «бег» или «падение».
Интеграция анализа изображений и состояний#
Разработчикам, использующим Ultralytics Platform для управления датасетами и моделями, важно понимать последовательную логику. Модель компьютерного зрения предоставляет исходные наблюдения (детекции), которые затем можно передать в модель пространства состояний, например HMM, чтобы вывести временной контекст.
В следующем примере показано, как с помощью оценки позы YOLO26 сгенерировать последовательность наблюдений. Эти ключевые точки могут служить входными «наблюдаемыми событиями» для последующей HMM или аналогичной логики, классифицирующей поведение во времени.
from ultralytics import YOLO
# Load the YOLO26n-pose model for efficient keypoint detection
model = YOLO("yolo26n-pose.pt")
# Run inference on a video source (the 'observable' sequence)
# stream=True creates a generator for memory efficiency
results = model.predict(source="path/to/video.mp4", stream=True)
# Iterate through frames to extract observations
for result in results:
# Each 'keypoints' object is an observation for a potential HMM
keypoints = result.keypoints.xyn.cpu().numpy()
if keypoints.size > 0:
print(f"Observation (Normalized Keypoints): {keypoints[0][:5]}...")
# In a full pipeline, these points would be fed into an HMM decoderЗначение в современном ИИ#
Хотя трансформеры и большие языковые модели (LLMs) вытеснили HMM в таких задачах, как обработка естественного языка (NLP), HMM по-прежнему актуальны для граничных вычислений и сред с низкой задержкой. Их вычислительная эффективность делает их идеальными для систем с ограниченными ресурсами, где интенсивное использование GPU невозможно. Кроме того, поскольку они основаны на прозрачных матрицах вероятностей, они обеспечивают более высокую наблюдаемость по сравнению с природой «чёрного ящика», характерной для многих нейронных сетей.









