Hidden Markov Model (HMM)
Khám phá Hidden Markov Models (HMM) cho AI thống kê. Tìm hiểu cách HMMs hoạt động cùng Ultralytics YOLO26 trong nhận dạng hành động, phân tích chuỗi và logic theo thời gian.
Mô hình Markov ẩn (HMM) là một framework thống kê được sử dụng để mô hình hóa các hệ thống trong đó quy trình bên trong không thể quan sát trực tiếp—do đó được gọi là "ẩn"—nhưng có thể được suy luận thông qua một chuỗi các sự kiện quan sát được. Mặc dù deep learning hiện đại đã phát triển để xử lý các chuỗi phức tạp, HMM vẫn là một khái niệm nền tảng trong AI thống kê và lý thuyết xác suất. HMM đặc biệt hiệu quả khi phân tích dữ liệu chuỗi thời gian, trong đó thứ tự của các sự kiện cung cấp ngữ cảnh quan trọng, dựa trên nguyên tắc cốt lõi rằng xác suất của trạng thái tương lai chỉ phụ thuộc vào trạng thái hiện tại, không phụ thuộc vào lịch sử trước đó.
Các cơ chế cốt lõi của HMM#
Để hiểu cách HMM hoạt động, cần phân biệt hai lớp riêng biệt của model: các trạng thái không nhìn thấy và các đầu ra có thể quan sát. Model giả định rằng hệ thống chuyển đổi giữa các trạng thái ẩn theo những xác suất cụ thể, đồng thời phát ra một quan sát ở mỗi bước.
HMM được xác định bởi một tập hợp các tham số chi phối những quá trình chuyển đổi và phát xạ này:
- Trạng thái ẩn: Những trạng thái này biểu thị thực tế nền tảng của hệ thống tại một thời điểm nhất định. Trong một model giọng nói, trạng thái ẩn có thể biểu thị một âm vị hoặc từ cụ thể.
- Sự kiện quan sát được: Đây là các điểm dữ liệu thực tế được thu thập bởi cảm biến hoặc đầu vào. Trong ví dụ về giọng nói, quan sát sẽ là dạng sóng âm thanh hoặc dữ liệu spectrogram.
- Xác suất chuyển trạng thái: Ma trận này mô tả khả năng chuyển từ một trạng thái ẩn này sang trạng thái ẩn khác. Ví dụ, xác suất thời tiết chuyển từ "Mưa" sang "Nắng".
- Xác suất phát xạ: Các xác suất này xác định khả năng quan sát thấy một quan sát cụ thể khi biết trạng thái ẩn hiện tại.
- Xác suất ban đầu: Phân phối xác định trạng thái mà hệ thống có khả năng bắt đầu ở đó nhất.
Việc training HMM thường sử dụng thuật toán Baum-Welch để ước tính các tham số này từ dữ liệu training. Sau khi được training, thuật toán Viterbi thường được sử dụng để giải mã chuỗi trạng thái ẩn có khả năng cao nhất từ một tập hợp quan sát mới.
HMM so với các model chuỗi khác#
Mặc dù HMM có những điểm tương đồng với các công cụ xử lý chuỗi khác, chúng khác biệt đáng kể về kiến trúc và ứng dụng:
- HMM so với Mạng nơ-ron hồi quy (RNN): RNN và các mạng bộ nhớ dài-ngắn hạn (LSTM) là những model deep learning có thể nắm bắt các phụ thuộc dài hạn và các pattern phi tuyến, trong khi HMM là các model xác suất đơn giản hơn, bị giới hạn bởi giả định Markov (bộ nhớ ngắn hạn). Tuy nhiên, HMM cần ít dữ liệu hơn đáng kể và dễ diễn giải hơn nhiều.
- HMM so với Bộ lọc Kalman (KF): Cả hai đều được sử dụng để ước tính trạng thái. Tuy nhiên, Bộ lọc Kalman được thiết kế cho các trạng thái liên tục (chẳng hạn như theo dõi vị trí chính xác của một chiếc xe đang di chuyển), trong khi HMM được sử dụng cho các trạng thái rời rạc (chẳng hạn như xác định xe đang "đỗ", "chạy" hay "dừng").
Các ứng dụng trong thực tế#
Bất chấp sự phát triển của deep learning (DL), Mô hình Markov ẩn vẫn được sử dụng rộng rãi trong các tình huống cần suy luận xác suất trên các chuỗi.
Nhận dạng giọng nói và chữ viết tay#
Trong lịch sử, HMM là nền tảng của các hệ thống nhận dạng giọng nói. Trong ngữ cảnh này, các từ được nói là các trạng thái "ẩn", còn tín hiệu âm thanh do microphone ghi lại là các quan sát. HMM giúp xác định chuỗi từ có khả năng cao nhất đã tạo ra tín hiệu âm thanh. Tương tự, HMM hỗ trợ giải mã chữ viết tay nét liền bằng cách mô hình hóa quá trình chuyển đổi giữa các nét ký tự.
Phân tích chuỗi sinh học#
Trong lĩnh vực tin sinh học, HMM đóng vai trò quan trọng trong dự đoán gene và alignment protein. HMM phân tích các chuỗi DNA hoặc amino acid để xác định những vùng chức năng, chẳng hạn như gene bên trong một genome. Các trạng thái "ẩn" có thể biểu thị các vùng mã hóa hoặc không mã hóa, trong khi các nucleotide cụ thể (A, C, G, T) đóng vai trò là các quan sát.
Nhận dạng hành động trong thị giác máy tính#
Trong thị giác máy tính hiện đại, HMM có thể được kết hợp với các model như YOLO26 để thực hiện nhận dạng hành động. Trong khi YOLO phát hiện các object hoặc pose trong từng frame riêng lẻ, HMM có thể phân tích chuỗi các pose này theo thời gian để phân loại một hành động, chẳng hạn như "đi bộ", "chạy" hoặc "ngã".
Tích hợp phân tích thị giác và trạng thái#
Đối với các developer sử dụng Ultralytics Platform để quản lý dataset và model, việc hiểu logic tuần tự là rất quan trọng. Một model thị giác cung cấp các quan sát thô (các detection), sau đó có thể đưa chúng vào một state-space model như HMM để suy luận ngữ cảnh theo thời gian.
Ví dụ sau minh họa cách tạo một chuỗi quan sát bằng tính năng ước tính pose của YOLO26. Các keypoint này có thể đóng vai trò là đầu vào "sự kiện quan sát được" cho một HMM downstream hoặc logic tương tự nhằm phân loại hành vi theo thời gian.
from ultralytics import YOLO
# Load the YOLO26n-pose model for efficient keypoint detection
model = YOLO("yolo26n-pose.pt")
# Run inference on a video source (the 'observable' sequence)
# stream=True creates a generator for memory efficiency
results = model.predict(source="path/to/video.mp4", stream=True)
# Iterate through frames to extract observations
for result in results:
# Each 'keypoints' object is an observation for a potential HMM
keypoints = result.keypoints.xyn.cpu().numpy()
if keypoints.size > 0:
print(f"Observation (Normalized Keypoints): {keypoints[0][:5]}...")
# In a full pipeline, these points would be fed into an HMM decoderTầm quan trọng trong AI hiện đại#
Mặc dù Transformer và các mô hình ngôn ngữ lớn (LLMs) đã vượt qua HMM trong những tác vụ như xử lý ngôn ngữ tự nhiên (NLP), HMM vẫn phù hợp với điện toán biên và các môi trường yêu cầu độ trễ thấp. Hiệu quả tính toán của HMM khiến chúng trở nên lý tưởng cho các hệ thống có tài nguyên hạn chế, nơi việc sử dụng GPU ở mức cao là không khả thi. Ngoài ra, vì dựa trên các ma trận xác suất minh bạch, HMM mang lại khả năng quan sát cao hơn so với bản chất "hộp đen" của nhiều mạng nơ-ron.









