Action Recognition
Khám phá cách nhận dạng hành động xác định hành vi trong video. Tìm hiểu cách sử dụng Ultralytics YOLO26 cho ước tính pose và xây dựng các hệ thống AI thông minh phục vụ các tác vụ HAR.
Nhận diện hành động, còn thường được gọi là Nhận diện Hoạt động của Con người (HAR), là một phân ngành năng động của thị giác máy tính (CV), tập trung vào việc xác định và phân loại các hành vi hoặc chuyển động cụ thể do các đối tượng thực hiện trong dữ liệu video. Trong khi phát hiện đối tượng truyền thống trả lời câu hỏi "có gì trong ảnh?", nhận diện hành động giải quyết câu hỏi phức tạp hơn: "điều gì đang diễn ra theo thời gian?". Bằng cách phân tích các chuỗi khung hình thay vì ảnh tĩnh, các model machine learning (ML) có thể phân biệt những hoạt động phức tạp như "đi bộ", "đạp xe", "ngã" hoặc "bắt tay", khiến đây trở thành một thành phần quan trọng để xây dựng các hệ thống thông minh có khả năng hiểu ý định và ngữ cảnh của con người.
Các khái niệm và kỹ thuật cốt lõi#
Nhận diện hành động yêu cầu model xử lý cả thông tin không gian (hình dạng của các đối tượng hoặc con người) và thông tin thời gian (cách chúng di chuyển theo thời gian). Để đạt được điều này, các hệ thống trí tuệ nhân tạo (AI) hiện đại thường sử dụng các kiến trúc chuyên biệt, vượt xa mạng nơ-ron tích chập (CNNs) tiêu chuẩn.
- Ước tính tư thế: Một kỹ thuật mạnh mẽ trong đó model theo dõi các keypoint cụ thể trên cơ thể người, chẳng hạn như khuỷu tay, đầu gối và vai. Những thay đổi hình học của các keypoint này theo thời gian cung cấp tín hiệu mạnh để phân loại hành động, không phụ thuộc vào nhiễu của nền.
- Mô hình hóa theo thời gian: Các thuật toán sử dụng những cấu trúc như Mạng nơ-ron hồi quy (RNNs) hoặc mạng Long Short-Term Memory (LSTM) để ghi nhớ các khung hình trước đó và dự đoán hành động trong tương lai. Gần đây hơn, Transformer cho video ngày càng phổ biến nhờ khả năng xử lý các phụ thuộc tầm xa trong luồng video.
- Mạng hai luồng: Phương pháp này xử lý song song các đặc trưng không gian (khung hình RGB) và đặc trưng thời gian (thường sử dụng luồng quang học), sau đó hợp nhất dữ liệu để đưa ra phân loại cuối cùng.
Các ứng dụng trong thực tế#
Khả năng tự động diễn giải chuyển động của con người có tiềm năng tạo ra những thay đổi lớn trong nhiều ngành, góp phần nâng cao độ an toàn, hiệu quả và trải nghiệm người dùng.
- AI trong chăm sóc sức khỏe: Nhận diện hành động đóng vai trò quan trọng trong các hệ thống theo dõi bệnh nhân. Ví dụ, công nghệ này cho phép tự động phát hiện té ngã tại các cơ sở dưỡng lão và lập tức cảnh báo nhân viên nếu bệnh nhân bị ngã. Công nghệ này cũng được sử dụng trong phục hồi chức năng từ xa, nơi các hệ thống AI phân tích tư thế tập luyện của bệnh nhân để đảm bảo họ thực hiện động tác đúng và an toàn.
- Giám sát và an ninh thông minh: Vượt xa việc phát hiện chuyển động đơn thuần, các hệ thống an ninh tiên tiến sử dụng nhận diện hành động để xác định những hành vi đáng ngờ, chẳng hạn như đánh nhau, trộm đồ trong cửa hàng hoặc xâm nhập trái phép, đồng thời bỏ qua các hoạt động vô hại. Điều này làm giảm cảnh báo giả và cải thiện giám sát an ninh theo thời gian thực.
Triển khai Phân tích Hành động với Ultralytics#
Một quy trình phổ biến là trước tiên phát hiện con người và tư thế bộ xương của họ, sau đó phân tích chuyển động của các khớp đó. Model Ultralytics YOLO26 cung cấp tốc độ và độ chính xác hiện đại cho bước ước tính tư thế ban đầu, vốn là nền tảng của nhiều pipeline nhận diện hành động.
Ví dụ sau minh họa cách trích xuất các keypoint của bộ xương từ một khung hình video bằng Python:
from ultralytics import YOLO
# Load the YOLO26 pose estimation model
model = YOLO("yolo26n-pose.pt")
# Run inference on an image to detect person keypoints
results = model("https://ultralytics.com/images/bus.jpg")
# Process results
for result in results:
# Access the keypoints (x, y, visibility)
if result.keypoints is not None:
print(f"Detected keypoints shape: {result.keypoints.data.shape}")Phân biệt các thuật ngữ liên quan#
Điều quan trọng là phải phân biệt nhận diện hành động với các tác vụ thị giác máy tính tương tự để đảm bảo áp dụng đúng phương pháp.
- Nhận diện hành động so với Theo dõi đối tượng: Theo dõi đối tượng tập trung vào việc duy trì danh tính của một đối tượng hoặc một người cụ thể khi họ di chuyển qua các khung hình (ví dụ: "Người A ở tọa độ X"). Nhận diện hành động diễn giải hành vi của đối tượng được theo dõi đó (ví dụ: "Người A đang chạy").
- Nhận diện hành động so với Hiểu video: Trong khi nhận diện hành động xác định các hành động thể chất cụ thể, hiểu video là một khái niệm rộng hơn, bao gồm việc nắm bắt toàn bộ diễn biến, ngữ cảnh và các mối quan hệ nhân quả trong một cảnh video.
Thách thức và xu hướng tương lai#
Việc phát triển các model nhận diện hành động mạnh mẽ đặt ra nhiều thách thức, đặc biệt liên quan đến nhu cầu sử dụng các bộ dữ liệu video lớn có chú thích như Kinetics-400 hoặc UCF101. Gắn nhãn dữ liệu video tốn nhiều thời gian hơn đáng kể so với gắn nhãn ảnh tĩnh. Để giải quyết vấn đề này, các công cụ như Ultralytics Platform giúp tinh gọn quy trình chú thích và training.
Hơn nữa, hiệu quả tính toán đóng vai trò then chốt. Xử lý video độ phân giải cao theo thời gian thực đòi hỏi tài nguyên phần cứng đáng kể. Ngành này ngày càng hướng đến Edge AI, tối ưu hóa các model để chạy trực tiếp trên camera và thiết bị di động nhằm giảm độ trễ và mức sử dụng băng thông. Những tiến bộ trong tương lai hướng đến việc cải thiện khả năng khái quát hóa của model, cho phép các hệ thống nhận diện hành động ngay cả từ những góc nhìn mà chúng chưa được huấn luyện trực tiếp.









