Tất tần tật về các tác vụ computer vision
Tìm hiểu cách các tác vụ computer vision như theo dõi đối tượng, instance segmentation và phân loại ảnh hoạt động, cũng như cách Ultralytics YOLO11 hỗ trợ các tác vụ này.

Nhờ camera và những tiến bộ trong trí tuệ nhân tạo (AI), máy tính và máy móc giờ đây có thể nhìn thế giới theo cách tương tự con người. Ví dụ, chúng có thể nhận diện người, theo dõi đối tượng và thậm chí hiểu bối cảnh của những gì đang diễn ra trong video.
Cụ thể, thị giác máy tính là một nhánh của AI cho phép máy móc hiểu và diễn giải thông tin hình ảnh từ thế giới xung quanh. Thị giác máy tính bao gồm nhiều tác vụ khác nhau, mỗi tác vụ được thiết kế để trích xuất một loại thông tin chuyên biệt từ hình ảnh hoặc video. Chẳng hạn, phát hiện đối tượng giúp xác định và định vị các vật thể khác nhau trong một bức ảnh, trong khi những tác vụ khác như tracking, segmentation và pose estimation giúp máy móc hiểu chuyển động, hình dạng và vị trí chính xác hơn.
Tác vụ thị giác máy tính được sử dụng cho một ứng dụng cụ thể phụ thuộc vào loại thông tin bạn cần. Các model thị giác máy tính như Ultralytics YOLO11 hỗ trợ nhiều tác vụ thị giác máy tính khác nhau, trở thành lựa chọn đáng tin cậy để xây dựng các hệ thống Vision AI trong thực tế.
Trong hướng dẫn này, chúng ta sẽ tìm hiểu kỹ hơn về các tác vụ thị giác máy tính được những model như YOLO11 hỗ trợ. Chúng ta sẽ khám phá cách từng tác vụ hoạt động và cách chúng đang được sử dụng trong nhiều ngành khác nhau. Hãy bắt đầu!
Các tác vụ thị giác máy tính là gì?#
Các tác vụ thị giác máy tính nhằm tái hiện khả năng nhìn của con người theo nhiều cách khác nhau. Những tác vụ này có thể giúp máy móc phát hiện đối tượng, theo dõi chuyển động, ước tính tư thế và thậm chí phác thảo từng thành phần riêng lẻ trong hình ảnh và video. Thông thường, các tác vụ thị giác máy tính được thực hiện bởi những model phân tách dữ liệu hình ảnh thành các phần nhỏ hơn để diễn giải rõ hơn những gì đang diễn ra.
Các model Vision AI như model Ultralytics YOLO hỗ trợ nhiều tác vụ, chẳng hạn như detection, tracking và segmentation, trong cùng một framework. Nhờ tính linh hoạt này, các model YOLO11 dễ dàng được áp dụng cho nhiều use case khác nhau.

Hình 1. Các tác vụ thị giác máy tính được Ultralytics YOLO11 hỗ trợ.
Một ví dụ điển hình là phân tích thể thao. YOLO11 có thể được sử dụng để phát hiện từng cầu thủ trên sân bằng tính năng phát hiện đối tượng, sau đó theo dõi họ trong suốt trận đấu bằng object tracking. Trong khi đó, khả năng pose estimation của YOLO11 có thể giúp phân tích chuyển động và kỹ thuật của cầu thủ, còn instance segmentation có thể tách từng cầu thủ khỏi nền, nâng cao độ chính xác của quá trình phân tích.
Kết hợp lại, các tác vụ thị giác máy tính được YOLO11 hỗ trợ này tạo nên bức tranh toàn diện về những gì đang diễn ra trong trận đấu, cung cấp cho các đội những thông tin chuyên sâu hơn về hiệu suất cầu thủ, chiến thuật và chiến lược tổng thể.
Tổng quan về các tác vụ thị giác máy tính được Ultralytics YOLO11 hỗ trợ#
Sau khi tìm hiểu các tác vụ thị giác máy tính là gì, hãy cùng đi sâu vào từng tác vụ được YOLO11 hỗ trợ bằng các ví dụ thực tế.
Khả năng hỗ trợ image classification của Ultralytics YOLO11#
Khi nhìn vào một bức ảnh, hầu hết mọi người đều có thể dễ dàng nhận ra ảnh đó thể hiện một con chó, ngọn núi hay biển báo giao thông, vì chúng ta đều đã học được hình dạng điển hình của những vật này. Image classification giúp máy móc làm điều tương tự bằng cách hướng dẫn chúng phân loại và gắn nhãn cho một hình ảnh dựa trên đối tượng chính, chẳng hạn như "car", "banana" hoặc "x-ray with fracture". Nhãn này giúp các hệ thống thị giác máy tính hiểu nội dung hình ảnh để có thể phản hồi hoặc đưa ra quyết định phù hợp.
Một ứng dụng thú vị của tác vụ thị giác máy tính này là giám sát động vật hoang dã. Image classification có thể được sử dụng để xác định các loài động vật khác nhau từ những bức ảnh chụp trong tự nhiên. Bằng cách tự động gắn nhãn hình ảnh, các nhà nghiên cứu có thể theo dõi quần thể, giám sát mô hình di cư và dễ dàng xác định các loài có nguy cơ tuyệt chủng hơn để hỗ trợ công tác bảo tồn.

Hình 2. Ví dụ về việc sử dụng YOLO11 cho image classification.
Khả năng object detection của Ultralytics YOLO11#
Mặc dù image classification hữu ích để có được cái nhìn tổng quan về nội dung của một hình ảnh, phương pháp này chỉ gán một nhãn cho toàn bộ hình ảnh. Trong những tình huống cần thông tin chi tiết, chẳng hạn như vị trí chính xác và danh tính của nhiều đối tượng, object detection trở nên thiết yếu.
Object detection là quá trình xác định và định vị từng đối tượng riêng lẻ trong một hình ảnh, thường bằng cách vẽ các bounding box xung quanh chúng. Ultralytics YOLO11 đặc biệt hiệu quả trong object detection theo thời gian thực, phù hợp với nhiều ứng dụng.
Ví dụ, hãy xem các giải pháp thị giác máy tính được sử dụng trong các cửa hàng bán lẻ để bổ sung hàng lên kệ. Object detection có thể giúp đếm trái cây, rau củ và các mặt hàng khác, bảo đảm kiểm kê chính xác. Trên các cánh đồng nông nghiệp, cùng công nghệ này có thể giám sát độ chín của cây trồng để giúp nông dân xác định thời điểm thu hoạch tốt nhất, thậm chí phân biệt nông sản chín và chưa chín.
Hình 3. Phát hiện trái cây bằng Ultralytics YOLO11.
Sử dụng YOLO11 cho instance segmentation#
Object detection sử dụng bounding box để xác định và định vị đối tượng trong một hình ảnh, nhưng không thể hiện chính xác hình dạng của chúng. Đây là lúc instance segmentation phát huy tác dụng. Thay vì vẽ một chiếc hộp quanh đối tượng, instance segmentation lần theo đường viền chính xác của đối tượng đó.
Bạn có thể hình dung như sau: thay vì chỉ cho biết "có một quả táo trong khu vực này", phương pháp này cẩn thận phác thảo và tô đầy hình dạng chính xác của quả táo. Quy trình chi tiết này giúp các hệ thống AI hiểu rõ ranh giới của đối tượng, đặc biệt khi các đối tượng nằm gần nhau.
Instance segmentation có thể được áp dụng cho nhiều ứng dụng, từ kiểm tra cơ sở hạ tầng đến khảo sát địa chất. Chẳng hạn, dữ liệu từ các cuộc khảo sát địa chất có thể được phân tích bằng YOLO11 để phân đoạn cả những vết nứt hoặc bất thường lớn và nhỏ trên bề mặt. Bằng cách vẽ ranh giới chính xác quanh các điểm bất thường này, kỹ sư có thể xác định cụ thể vấn đề và xử lý chúng trước khi dự án bắt đầu.

Hình 4. Phân đoạn vết nứt bằng YOLO11.
Object tracking: Theo dõi đối tượng qua các frame bằng YOLO11#
Cho đến nay, các tác vụ thị giác máy tính mà chúng ta đã xem xét tập trung vào những gì có trong một hình ảnh đơn lẻ. Tuy nhiên, với video, chúng ta cần những thông tin vượt ra ngoài một frame. Tác vụ object tracking có thể được sử dụng cho mục đích này.
Khả năng object tracking của YOLO11 có thể theo dõi một đối tượng cụ thể, chẳng hạn như một người hoặc một chiếc xe, khi đối tượng di chuyển qua một chuỗi frame video. Ngay cả khi góc camera thay đổi hoặc các đối tượng khác xuất hiện, hệ thống vẫn tiếp tục theo dõi cùng mục tiêu đó.
Điều này rất quan trọng đối với các ứng dụng cần giám sát theo thời gian, chẳng hạn như theo dõi xe cộ trong giao thông. Trên thực tế, YOLO11 có thể theo dõi phương tiện một cách chính xác, bám theo từng chiếc xe để giúp ước tính tốc độ theo thời gian thực. Vì vậy, object tracking là một thành phần quan trọng trong các hệ thống như giám sát giao thông.

Hình 5. Khả năng hỗ trợ object tracking của YOLO11 có thể được sử dụng để ước tính tốc độ.
Phát hiện oriented bounding box (OBB) bằng YOLO11#
Các đối tượng trong thế giới thực không phải lúc nào cũng được căn chỉnh hoàn hảo — chúng có thể bị nghiêng, nằm ngang hoặc nằm ở những góc bất thường. Chẳng hạn, trong ảnh vệ tinh, tàu thuyền và tòa nhà thường xuất hiện ở trạng thái xoay.
Các phương pháp object detection truyền thống sử dụng những hộp chữ nhật cố định không điều chỉnh theo hướng của đối tượng, khiến việc nắm bắt chính xác các hình dạng xoay trở nên khó khăn. Phát hiện hộp giới hạn định hướng (OBB) giải quyết vấn đề này bằng cách sử dụng các hộp xoay để ôm sát đối tượng, căn chỉnh theo góc của đối tượng nhằm phát hiện chính xác hơn.
Đối với việc giám sát cảng, khả năng hỗ trợ OBB detection của YOLO11 có thể giúp xác định và theo dõi chính xác các tàu thuyền bất kể hướng của chúng, bảo đảm mọi tàu ra vào cảng đều được giám sát đầy đủ. Khả năng phát hiện chính xác này cung cấp thông tin theo thời gian thực về vị trí và chuyển động của tàu, điều rất quan trọng để quản lý các cảng nhộn nhịp và ngăn ngừa va chạm.

Hình 6. Phát hiện thuyền bằng OBB detection và YOLO11.
Pose estimation và YOLO11: Theo dõi các keypoint#
Pose estimation là một kỹ thuật thị giác máy tính theo dõi các keypoint, chẳng hạn như khớp, chi hoặc các điểm đánh dấu khác, để hiểu cách một đối tượng chuyển động. Thay vì xem toàn bộ đối tượng hoặc cơ thể như một đơn vị hoàn chỉnh, phương pháp này phân tách nó thành các bộ phận chính. Nhờ đó, có thể phân tích chi tiết chuyển động, cử chỉ và tương tác.
Một ứng dụng phổ biến của công nghệ này là human pose estimation. Bằng cách theo dõi vị trí của các bộ phận cơ thể khác nhau theo thời gian thực, công nghệ này cung cấp bức tranh rõ ràng về cách một người đang chuyển động. Thông tin này có thể được sử dụng cho nhiều mục đích, từ nhận diện cử chỉ và giám sát hoạt động đến phân tích hiệu suất trong thể thao.
Tương tự, trong phục hồi chức năng, các chuyên viên trị liệu có thể sử dụng human pose estimation và YOLO11 để giám sát chuyển động của bệnh nhân trong khi tập luyện. Điều này giúp bảo đảm mỗi động tác được thực hiện chính xác, đồng thời theo dõi tiến trình theo thời gian.

Hình 7. YOLO11 có thể giám sát bài tập bằng pose estimation.
Khám phá cách YOLO11 hỗ trợ nhiều tác vụ thị giác máy tính#
Sau khi tìm hiểu chi tiết tất cả các tác vụ thị giác máy tính được YOLO11 hỗ trợ, hãy cùng xem YOLO11 hỗ trợ chúng như thế nào.
YOLO11 không chỉ là một model duy nhất — đây là một bộ các biến thể model chuyên biệt, mỗi biến thể được thiết kế cho một tác vụ thị giác máy tính cụ thể. Nhờ đó, YOLO11 trở thành một công cụ linh hoạt có thể thích ứng với nhiều ứng dụng. Bạn cũng có thể fine-tune các model này trên các dataset tùy chỉnh để giải quyết những thách thức riêng trong dự án của mình.
Dưới đây là các biến thể model YOLO11 được pre-trained cho những tác vụ thị giác cụ thể:
- YOLO11: Model này phát hiện và gắn nhãn nhiều đối tượng theo thời gian thực, phù hợp với nhận diện hình ảnh tốc độ cao.
- YOLO11-seg: Biến thể này tập trung vào segmentation bằng cách sử dụng các mask chi tiết để tách đối tượng khỏi nền.
- YOLO11-obb: Model này được thiết kế để phát hiện các đối tượng xoay bằng cách vẽ bounding box căn chỉnh theo hướng của từng đối tượng.
- YOLO11-cls: Biến thể này phân loại hình ảnh bằng cách gán một nhãn danh mục duy nhất dựa trên nội dung tổng thể.
- YOLO11-pose: Model này ước tính các keypoint trên cơ thể để theo dõi tư thế, vị trí các chi và chuyển động.
Mỗi biến thể có nhiều kích thước khác nhau, cho phép người dùng lựa chọn sự cân bằng phù hợp giữa tốc độ và độ chính xác theo nhu cầu cụ thể.
Những điểm chính#
Các tác vụ thị giác máy tính đang thay đổi cách máy móc hiểu và tương tác với thế giới. Bằng cách phân tách hình ảnh và video thành các thành phần chính, những công nghệ này giúp việc phân tích đối tượng, chuyển động và tương tác trở nên dễ dàng hơn.
Từ việc nâng cao an toàn giao thông và hiệu suất thể thao đến tối ưu hóa các quy trình công nghiệp, những model như YOLO11 có thể cung cấp thông tin chuyên sâu theo thời gian thực để thúc đẩy đổi mới. Khi Vision AI tiếp tục phát triển, công nghệ này có thể sẽ đóng vai trò ngày càng quan trọng trong cách chúng ta diễn giải và sử dụng dữ liệu hình ảnh hằng ngày.
Tham gia cộng đồng của chúng tôi và truy cập repository GitHub của chúng tôi để xem AI hoạt động trong thực tế. Khám phá các tùy chọn cấp phép của chúng tôi và tìm hiểu thêm về AI trong nông nghiệp và thị giác máy tính trong sản xuất trên các trang giải pháp của chúng tôi.









