Ultralytics YOLO26 và các model Ultralytics YOLO khác để pose estimation
Khám phá cách Ultralytics YOLO26 cải thiện pose estimation nhờ hỗ trợ tốt hơn cho keypoint không phải người, hội tụ nhanh hơn, xử lý occlusion tốt hơn và triển khai real-time hiệu quả.

Khi quan sát tư thế của một người, bạn dễ dàng nhận ra họ đang khom lưng, nghiêng người về phía trước hay đứng thẳng. Con người có thể nhanh chóng hiểu mối quan hệ giữa các bộ phận khác nhau của cơ thể.
Đây là một phần tự nhiên trong cách chúng ta diễn giải chuyển động và ngôn ngữ cơ thể trong đời sống hằng ngày. Tuy nhiên, với máy móc, kiểu hiểu biết trực quan này không tự động có sẵn. Việc huấn luyện một hệ thống nhận biết chuyển động và cấu trúc đòi hỏi các kỹ thuật học sâu và thị giác máy tính tiên tiến, cho phép hệ thống diễn giải hình ảnh theo cách có ý nghĩa.
Cụ thể, ước tính tư thế là một kỹ thuật AI thị giác giúp model computer vision xây dựng cách hiểu tương tự. Thay vì chỉ phát hiện một object trong hình ảnh, model dự đoán các keypoint biểu thị những mốc cấu trúc quan trọng.
Các keypoint này có thể tương ứng với khớp cơ thể, chi động vật, bộ phận máy móc hoặc thậm chí các điểm cố định như góc sân. Bằng cách xác định và theo dõi những điểm này, hệ thống có thể hiểu vị trí, sự căn chỉnh và chuyển động theo cách có cấu trúc, có thể đo lường.
Khi ước tính tư thế được áp dụng cho nhiều tình huống thực tế hơn, các model phải xử lý keypoint không phải của con người, cảnh phức tạp và dataset tùy chỉnh hiệu quả hơn. Chẳng hạn, các model hiện đại như Ultralytics YOLO26 hỗ trợ các tác vụ computer vision như ước tính tư thế và phát triển từ những model YOLO cho tư thế trước đó với các cải tiến về kiến trúc và huấn luyện nhằm nâng cao tính linh hoạt cũng như hiệu năng tổng thể.

Hình 1. Ví dụ về ước tính tư thế được hỗ trợ bởi YOLO (Nguồn)
Trong bài viết này, chúng ta sẽ so sánh YOLO26-pose với các model YOLO cho tư thế trước đây của Ultralytics và tìm hiểu cách model này cải thiện tính linh hoạt, tốc độ hội tụ và hiệu năng trong những cảnh phức tạp. Hãy bắt đầu!
Ước tính tư thế là gì?#
Trước khi đi sâu vào việc so sánh các model YOLO cho tư thế của Ultralytics YOLO, hãy cùng xem xét kỹ hơn ước tính tư thế thực sự có nghĩa là gì trong bối cảnh computer vision.
Ước tính tư thế là kỹ thuật dùng để phát hiện và theo dõi các keypoint cụ thể trong hình ảnh hoặc một frame video. Những keypoint này có thể biểu thị các mốc cấu trúc quan trọng, chẳng hạn như khớp trên cơ thể người, chi của động vật, bộ phận máy móc hoặc các điểm tham chiếu cố định trong một cảnh.

Hình 2. Ước tính tư thế của công nhân bằng ước tính tư thế người (Nguồn)
Bằng cách xác định tọa độ của các điểm này, model có thể hiểu một object được định vị như thế nào và chuyển động ra sao theo thời gian. Không giống image classification, vốn gán một nhãn duy nhất cho toàn bộ hình ảnh, hoặc các model object detection, vốn tập trung vẽ bounding box quanh các object, ước tính tư thế cung cấp thông tin không gian chi tiết hơn về cấu trúc và chuyển động.
Tổng quan về Ultralytics YOLO26-pose#
YOLO26-pose có nhiều biến thể hoặc kích thước model, bao gồm các tùy chọn nhẹ như YOLO26n-pose và các model lớn hơn như YOLO26m-pose, YOLO26l-pose và YOLO26x-pose. Điều này cho phép các đội ngũ lựa chọn sự cân bằng phù hợp giữa tốc độ và độ chính xác tùy theo phần cứng và nhu cầu hiệu năng.
Ultralytics cũng cung cấp các model pose pretrained được huấn luyện trên những dataset lớn, tổng quát như dataset COCO, cụ thể là các annotation COCO-Pose (COCO keypoints) cho ước tính tư thế người, để bạn không phải bắt đầu từ đầu. Trong hầu hết trường hợp, các đội ngũ fine-tune những model này trên dataset riêng để thích ứng với các keypoint, bố cục hoặc môi trường cụ thể.
Quy trình này thường bao gồm việc chuẩn bị các file annotation tùy chỉnh, trong đó định nghĩa tọa độ keypoint và nhãn class theo một định dạng có cấu trúc. Các annotation này ánh xạ keypoint tới những tọa độ pixel cụ thể trong từng hình ảnh, cho phép model học các mối quan hệ không gian chính xác trong quá trình huấn luyện.
Sử dụng model pretrained giúp huấn luyện nhanh hơn, giảm yêu cầu về dữ liệu và hỗ trợ đưa dự án vào production hiệu quả hơn.
Các ứng dụng thực tế của ước tính tư thế người#
Dưới đây là một số trường hợp sử dụng thực tế mà ước tính tư thế đóng vai trò quan trọng:
- Chăm sóc sức khỏe và phục hồi chức năng: Bác sĩ lâm sàng có thể sử dụng model pose để đánh giá tư thế, theo dõi tiến độ hồi phục và phân tích các kiểu chuyển động trong quá trình vật lý trị liệu.
- Hệ thống tự hành: Drone và camera thông minh có thể sử dụng thông tin về tư thế để hiểu rõ hơn hướng và chuyển động của object trong các cảnh động.
- An toàn nơi làm việc: Các tổ chức có thể theo dõi vị trí cơ thể và những chuyển động lặp đi lặp lại để hỗ trợ xác định các rủi ro an toàn tiềm ẩn.
- Thể hình và huấn luyện cá nhân: Ứng dụng thể hình sử dụng ước tính tư thế để theo dõi form tập luyện, đếm số lần lặp và cung cấp phản hồi theo thời gian thực về tư thế cũng như chuyển động được duy trì trong các bài hướng dẫn thể hình.

Hình 3. Ước tính tư thế có thể hỗ trợ theo dõi các điểm chính trên cơ thể trong chuyển động thể thao. (Nguồn)
Tìm hiểu khả năng hỗ trợ ước tính tư thế của Ultralytics YOLO26#
Ultralytics YOLO26 phát triển từ các model Ultralytics YOLO trước đây với những cập nhật nhằm giúp việc huấn luyện và triển khai trở nên thực tế hơn.
Tương tự các phiên bản trước, model này hỗ trợ ước tính tư thế như một phần của framework hợp nhất. Điểm khác biệt chính là Ultralytics YOLO26 được xây dựng để linh hoạt và ổn định hơn trong nhiều trường hợp sử dụng thực tế hơn.

Hình 4. Đánh giá YOLO26 (Nguồn)
Các model YOLO cho tư thế trước đây của Ultralytics phần lớn chịu ảnh hưởng từ dataset pose người, nghĩa là một số thành phần của các phương pháp cũ được tối ưu xoay quanh cấu trúc khớp của con người. YOLO26 loại bỏ những giả định dành riêng cho con người này.
Nhờ đó, model phù hợp hơn với các keypoint không phải của con người, chẳng hạn như phát hiện các góc sân tennis hoặc những mốc cấu trúc tùy chỉnh khác. Điều này quan trọng vì các model Ultralytics YOLO26-pose pretrained, dùng ngay sau khi cài đặt, được huấn luyện trên các dataset như COCO-pose và dự đoán các keypoint người được định nghĩa trong annotation của dataset.
Tuy nhiên, khi các đội ngũ muốn phát hiện những loại mốc khác, chẳng hạn như bộ phận máy móc, marker trên sân thể thao hoặc các điểm hạ tầng, model thường cần được fine-tune trên một dataset tùy chỉnh, trong đó các keypoint cụ thể đó đã được annotation.
Vì Ultralytics YOLO26 không bị ràng buộc bởi các giả định về cấu trúc khớp của con người, model có thể thích ứng hiệu quả hơn trong quá trình fine-tune. Tính linh hoạt này cho phép model học các bố cục keypoint tùy chỉnh đáng tin cậy hơn, từ đó cải thiện các metric đánh giá khi validation trên những dataset có cấu hình keypoint riêng biệt.
Ultralytics YOLO26-pose cũng được thiết kế để cải thiện khả năng định vị keypoint khi các bộ phận của object bị che khuất một phần hoặc xuất hiện ở quy mô rất nhỏ. Trong các cảnh thực tế có đối tượng ở xa, footage từ drone hoặc tình huống với object nhỏ, điều này có thể tạo ra dự đoán keypoint chính xác hơn so với các model pose trước đây.
Một cập nhật quan trọng khác là formulation của loss được cải thiện trong quá trình huấn luyện. Hàm loss xác định cách model sửa lỗi trong khi học.
Đối với Ultralytics YOLO26-pose, quy trình này hiệu quả hơn, giúp model học nhanh hơn và đạt độ chính xác cao chỉ với ít epoch hơn, trong đó epoch là một lượt chạy đầy đủ qua dataset huấn luyện.
Nhìn chung, YOLO26-pose phát triển từ các model YOLO cho tư thế trước đây của Ultralytics với những cải tiến rõ rệt về khả năng hỗ trợ keypoint không phải của con người và độ hội tụ trong huấn luyện, đồng thời duy trì workflow quen thuộc.
So sánh YOLO26-pose với Ultralytics YOLOv5#
Phiên bản đầu tiên của các model Ultralytics YOLO, Ultralytics YOLOv5, chủ yếu được xây dựng cho object detection. Mặc dù YOLOv5 sau đó được mở rộng để hỗ trợ instance segmentation, model này không bao gồm pose estimation head chuyên biệt, native trong framework Ultralytics chính thức.
Các đội ngũ cần phát hiện keypoint thường phải dựa vào những implementation riêng biệt hoặc các chỉnh sửa tùy chỉnh. Ultralytics YOLO26 tích hợp ước tính tư thế như một task tích hợp sẵn, với một head kiến trúc chuyên dụng được thiết kế riêng để dự đoán keypoint.
Điều này có nghĩa là các model Ultralytics YOLO26-pose có thể được huấn luyện, validation và triển khai trong cùng workflow hợp nhất với detection và segmentation. Đối với các dự án tập trung vào phát hiện keypoint có cấu trúc, YOLO26 cung cấp hỗ trợ pose native và kiến trúc dành riêng cho task mà YOLOv5 không có sẵn.
Các điểm khác biệt chính: YOLO26-pose so với Ultralytics YOLOv8-pose#
Ultralytics YOLOv8 giới thiệu khả năng ước tính tư thế native trong framework Ultralytics hợp nhất, giúp dễ dàng huấn luyện và triển khai các model keypoint bằng cùng workflow như detection và segmentation. Model này sử dụng pipeline hậu xử lý truyền thống với non-maximum suppression (NMS) và các formulation loss trước đây cho hồi quy bounding box và huấn luyện.
Ultralytics YOLO26 phát triển từ nền tảng này với các cập nhật về kiến trúc và huấn luyện tác động trực tiếp đến ước tính tư thế. Một khác biệt lớn là thiết kế end-to-end. YOLO26 loại bỏ nhu cầu sử dụng NMS bên ngoài trong quá trình inference, giúp đơn giản hóa việc triển khai và cải thiện tính nhất quán của latency, đặc biệt trên CPU và các thiết bị edge.
Một cải tiến quan trọng khác nằm ở phương pháp huấn luyện. Ultralytics YOLO26 giới thiệu optimizer MuSGD cùng các chiến lược loss được cập nhật. Đối với các task pose, model tích hợp Residual Log-Likelihood Estimation, giúp cải thiện cách mô hình hóa độ bất định của keypoint. Kết hợp lại, những thay đổi này có thể giúp hội tụ nhanh hơn và dự đoán keypoint ổn định hơn, đặc biệt trong các cảnh phức tạp hoặc bị che khuất một phần.
Tóm lại, Ultralytics YOLOv8-pose đã thiết lập một baseline mạnh và linh hoạt. YOLO26-pose cải tiến baseline đó với hiệu quả huấn luyện cao hơn, khả năng xử lý tình trạng che khuất tốt hơn và tính linh hoạt lớn hơn cho các ứng dụng pose thực tế, không phải của con người.
YOLO26-pose so với Ultralytics YOLO11-pose: Những gì đã được cải thiện?#
Ultralytics YOLO11 phát triển từ Ultralytics YOLOv8 bằng cách tinh chỉnh backbone và các layer trích xuất feature. Model này giảm FLOPs, cải thiện hiệu quả sử dụng parameter và đạt mAP cao hơn trong khi vẫn duy trì hiệu năng real-time mạnh. Đối với các task pose, điều này mang lại độ chính xác keypoint tốt hơn với kiến trúc nhẹ hơn.
YOLO26-pose tiếp tục tiến trình đó với một thay đổi kiến trúc mang tính nền tảng hơn. Nói đơn giản, YOLO11 tinh chỉnh hiệu quả và độ chính xác của YOLOv8, còn YOLO26 phát triển từ nền tảng đó với các cập nhật về kiến trúc và huấn luyện nhằm hội tụ nhanh hơn, inference ổn định hơn và cải thiện độ chính xác pose trong các tình huống phức tạp.
Tại sao bạn nên bắt đầu sử dụng model Ultralytics YOLO26 cho ước tính tư thế?#
Khi tìm hiểu sự khác biệt giữa các model Ultralytics YOLO, bạn có thể tự hỏi liệu có nên chuyển sang YOLO26-pose hay không.
Câu trả lời ngắn gọn là đây là một bản nâng cấp dễ dàng. Nếu bạn đang sử dụng Ultralytics YOLOv8-pose hoặc Ultralytics YOLO11-pose, việc chuyển sang YOLO26-pose thường chỉ có nghĩa là thay đổi phiên bản model, không phải xây dựng lại pipeline.
Bạn có thể hưởng lợi từ khả năng hỗ trợ tốt hơn cho các keypoint không phải của con người, tốc độ hội tụ nhanh hơn trong quá trình huấn luyện và khả năng xử lý các điểm bị che khuất được cải thiện, đồng thời vẫn làm việc trong cùng framework Ultralytics. Đối với hầu hết dự án pose mới và hiện có, chuyển sang YOLO26-pose là cách đơn giản để nhận được những cải tiến này với rất ít trở ngại.
Ngoài ra, YOLO26-pose được hỗ trợ đầy đủ trong package Ultralytics Python, được xây dựng trên PyTorch và giúp đơn giản hóa việc huấn luyện, validation cũng như triển khai. Model có thể được export sang các format như ONNX, TensorRT, OpenVINO, CoreML và TFLite, giúp triển khai dễ dàng hơn trên GPU, CPU và các thiết bị edge mà không cần thay đổi workflow tổng thể.
Những điểm chính#
Ultralytics YOLO26-pose giúp ước tính tư thế trở nên linh hoạt và đáng tin cậy hơn, đặc biệt khi làm việc với các keypoint không phải của con người hoặc những cảnh phức tạp. Model huấn luyện nhanh hơn, xử lý tình trạng che khuất tốt hơn và mang lại kết quả nhất quán hơn trên nhiều dataset khác nhau. Đối với các đội ngũ đang sử dụng model YOLO cho tư thế của Ultralytics, YOLO26 cung cấp những cải tiến rõ rệt mà không cần thay đổi workflow hiện có.
Bạn muốn tìm hiểu thêm về AI? Hãy xem cộng đồng và repository GitHub của chúng tôi. Khám phá các trang giải pháp để tìm hiểu về AI trong robotics và thị giác máy tính trong nông nghiệp. Tìm hiểu các lựa chọn cấp phép của chúng tôi và bắt đầu xây dựng với thị giác máy tính ngay hôm nay!






