Cách sử dụng Ultralytics YOLO11 cho instance segmentation
Tìm hiểu cách model Ultralytics YOLO11 mới có thể được sử dụng cho instance segmentation để đạt độ chính xác cao hơn trong các ứng dụng như quản lý chất thải và giám sát đuốc đốt.

Thị giác máy tính, một lĩnh vực thuộc trí tuệ nhân tạo (AI) giúp máy móc diễn giải và hiểu thông tin hình ảnh, cho phép thực hiện các tác vụ như phân đoạn đối tượng. Phân đoạn đối tượng có thể được sử dụng để phân tích một hình ảnh hoặc khung hình video nhằm đánh dấu ranh giới chính xác của từng đối tượng riêng biệt trong ảnh, ngay cả khi có nhiều đối tượng cùng loại. Với độ chính xác cao, phân đoạn đối tượng có nhiều ứng dụng, từ hỗ trợ xe tự lái phát hiện chướng ngại vật trên đường đến nhận diện khối u trong ảnh chụp y khoa.
Trong nhiều năm qua, phân đoạn đối tượng đã phát triển đáng kể. Một bước tiến gần đây được giới thiệu tại sự kiện thường niên kết hợp trực tiếp và trực tuyến của Ultralytics, YOLO Vision 2024 (YV24), dưới dạng model Ultralytics YOLO11. Model mới hỗ trợ các tác vụ thị giác máy tính giống như model Ultralytics YOLOv8, bao gồm phân đoạn đối tượng, vì vậy người dùng đã quen với các phiên bản trước có thể chuyển sang model mới một cách liền mạch.

Hình 1. Ví dụ về việc sử dụng model Ultralytics YOLO11 để phân đoạn đối tượng.
Trong bài viết này, chúng ta sẽ tìm hiểu phân đoạn đối tượng và sự khác biệt của nó so với các tác vụ thị giác máy tính khác như phân đoạn ngữ nghĩa, đồng thời thảo luận về một số ứng dụng của phương pháp này. Chúng ta cũng sẽ hướng dẫn cách sử dụng model phân đoạn đối tượng YOLO11 bằng gói Python của Ultralytics và nền tảng Ultralytics HUB. Hãy bắt đầu!
Phân đoạn instance là gì?#
Phân đoạn đối tượng có thể được sử dụng để nhận diện các đối tượng trong ảnh và phác thảo chúng ở cấp độ pixel. Quy trình này thường bắt đầu bằng việc phát hiện đối tượng và vẽ bounding box xung quanh chúng. Sau đó, một thuật toán phân đoạn sẽ phân loại từng pixel bên trong bounding box để tạo mask chính xác cho mỗi đối tượng.
Phân đoạn đối tượng cũng khác với các tác vụ như phân đoạn ngữ nghĩa và phân đoạn toàn cảnh. Phân đoạn ngữ nghĩa gán nhãn cho từng pixel dựa trên nhóm tổng quát của đối tượng mà không phân biệt các instance riêng lẻ. Trong khi đó, phân đoạn toàn cảnh kết hợp cả phân đoạn đối tượng và phân đoạn ngữ nghĩa bằng cách gán cho mỗi pixel cả class và ID instance, qua đó nhận diện từng đối tượng riêng lẻ trong mỗi nhóm.

Hình 2. Sử dụng YOLO11 để phát hiện và phân đoạn một người và một chú chó.
Các khả năng của phân đoạn đối tượng có thể được áp dụng trong nhiều tình huống khác nhau, với yêu cầu về model cũng khác nhau. Ví dụ, một model nhẹ có thể lý tưởng cho xử lý theo thời gian thực trong các ứng dụng di động, trong khi một model phức tạp hơn có thể được sử dụng cho các tác vụ yêu cầu độ chính xác cao như kiểm soát chất lượng trong sản xuất.
Giống như các model trước, model phân đoạn đối tượng YOLO11 cũng có một số biến thể tùy theo nhu cầu của bạn. Các biến thể này gồm YOLO11n-seg (Nano), YOLO11s-seg (Small), YOLO11m-seg (Medium), YOLO11l-seg (Large) và YOLO11x-seg (Extra Large). Các model này khác nhau về kích thước, tốc độ xử lý, độ chính xác và lượng năng lực tính toán cần thiết. Dựa trên yêu cầu cụ thể, bạn có thể chọn model phù hợp nhất với ứng dụng của mình.
Ứng dụng phân đoạn của YOLO11#
Các khả năng phân đoạn đối tượng nâng cao của YOLO11 mở ra nhiều ứng dụng trong 다양한 ngành công nghiệp. Hãy cùng xem xét kỹ hơn một số ứng dụng này.
Sử dụng phân đoạn YOLO11 trong ngành dầu khí#
Hoạt động khai thác dầu khí liên quan đến việc kiểm soát các biến động áp suất cực kỳ lớn. Những kỹ thuật như đốt khí giúp đốt lượng khí tự nhiên sinh ra trong quá trình khai thác dầu. Đây là việc cần thiết vì lý do an toàn. Ví dụ, trong khai thác dầu thô, áp suất tăng đột ngột hoặc đáng kể có thể gây ra vụ nổ. Mặc dù hiếm xảy ra, các sự cố công nghiệp trong lĩnh vực sản xuất dầu khí có thể gây ra những đám cháy dữ dội, khó ngăn chặn và kiểm soát. Đốt khí giúp người vận hành giảm áp thiết bị một cách an toàn và kiểm soát các biến động áp suất lớn, khó dự đoán bằng cách đốt lượng khí dư.
Các hệ thống AI có thể cải thiện quy trình giám sát này, đồng thời giảm nguy cơ tai nạn bằng cách sử dụng hệ thống giám sát đuốc đốt dựa trên phân đoạn đối tượng. Giám sát hoạt động đốt khí cũng rất quan trọng vì lý do môi trường, bởi việc đốt quá nhiều có thể gây tác động tiêu cực đến môi trường.
Các model phân đoạn đối tượng Ultralytics YOLO11 có thể được sử dụng để giám sát lượng lửa và khói do hoạt động đốt khí tạo ra. Có thể tính toán diện tích pixel của đuốc lửa và khói được phát hiện và phân đoạn. Dựa trên thông tin này, người vận hành có thể nắm được thông tin chi tiết theo thời gian thực về đuốc lửa và khói do hoạt động đốt khí tạo ra, từ đó giúp ngăn ngừa tai nạn và các tác động tiêu cực đến môi trường.

Hình 3. Ví dụ về giám sát đuốc lửa bằng YOLO11 trong ngành sản xuất dầu khí.
Phân đoạn đối tượng với YOLO11 để quản lý rác thải nhựa#
Nhân viên tại các cơ sở quản lý chất thải và tái chế có thể sử dụng các hệ thống dựa trên phân đoạn đối tượng YOLO11 để nhận diện vật liệu rác thải nhựa. YOLO11 có thể được tích hợp với hệ thống phân loại robot để nhận diện chính xác các loại vật liệu thải khác nhau, chẳng hạn như bìa carton và nhựa (để xử lý riêng). Điều này đặc biệt quan trọng khi trên 7 tỷ tấn rác thải nhựa được tạo ra trên toàn cầu, chỉ khoảng 10% được tái chế.
Tự động hóa việc nhận diện và phân loại rác thải nhựa giúp giảm đáng kể thời gian cần thiết so với các phương pháp truyền thống, trong đó nhân viên phải phân loại vật phẩm bằng tay. Các model thị giác máy tính thậm chí có thể phân đoạn các loại nhựa mềm như màng bọc và túi, vốn đặc biệt khó xử lý vì thường bị rối vào nhau. Các model YOLO11 cũng có thể được huấn luyện tùy chỉnh để phân đoạn các loại nhựa khác nhau. Trong các phần tiếp theo, chúng ta sẽ tìm hiểu thêm cách huấn luyện tùy chỉnh một model YOLO11.

Hình 4. Nhận diện rác thải nhựa bằng Ultralytics YOLO11.
Phân đoạn YOLO11 trong xe tự hành#
Một trường hợp sử dụng thú vị khác của phân đoạn đối tượng là trong xe tự hành. YOLO11 giúp xe tự lái nâng cao an toàn cho hành khách và những người khác trên đường bằng cách nhận diện chính xác các đối tượng ở cấp độ pixel. Hệ thống camera tích hợp trên xe có thể chụp ảnh môi trường xung quanh và phân tích chúng bằng YOLO11 cùng phương pháp phân đoạn đối tượng. Mỗi đối tượng (người đi bộ, đèn giao thông, phương tiện khác, v.v.) trong ảnh đều được phân đoạn và gán nhãn. Mức độ chính xác này giúp xe tự hành nhận diện từng đối tượng xung quanh chúng.

Hình 5. Sử dụng YOLO11 và phân đoạn đối tượng để nhận diện phương tiện và người đi bộ trên đường.
Thử phân đoạn đối tượng với model YOLO11#
Sau khi đã tìm hiểu về phân đoạn đối tượng và thảo luận một số ứng dụng của phương pháp này, hãy cùng xem cách bạn có thể dùng thử với model Ultralytics YOLO11.
Có hai cách để thực hiện: bạn có thể sử dụng gói Python của Ultralytics hoặc Ultralytics HUB. Chúng ta sẽ tìm hiểu cả hai cách, bắt đầu với gói Python.
Chạy inference bằng YOLO11#
Chạy một inference là sử dụng model để phân tích dữ liệu mới mà model chưa từng thấy trước đó. Để chạy inference bằng model phân đoạn đối tượng YOLO11 thông qua code, chúng ta cần cài đặt gói Python của Ultralytics bằng pip, conda hoặc docker. Nếu gặp vấn đề trong quá trình cài đặt, bạn có thể tham khảo Hướng dẫn các vấn đề thường gặp để được hỗ trợ khắc phục sự cố. Sau khi cài đặt gói, bạn có thể chạy đoạn code bên dưới để tải model phân đoạn đối tượng YOLO11 và chạy dự đoán trên một hình ảnh.

Hình 6. Chạy inference trên một hình ảnh bằng YOLO11n-seg.
Huấn luyện model YOLO11 tùy chỉnh#
Với cùng thiết lập code, bạn cũng có thể huấn luyện một model YOLO11 tùy chỉnh. Bằng cách fine-tune một model YOLO11, bạn có thể tạo phiên bản tùy chỉnh đáp ứng tốt hơn các yêu cầu của dự án cụ thể. Ví dụ, nhà bán lẻ có thể sử dụng model tùy chỉnh để phân đoạn chính xác đặc điểm hình thể của khách hàng nhằm đề xuất quần áo vừa vặn. Đoạn code bên dưới cho biết cách tải và huấn luyện model YOLO11 để phân đoạn đối tượng. Bạn có thể bắt đầu từ cấu hình YAML hoặc một model đã được huấn luyện trước, chuyển giao các weight và huấn luyện trên một dataset như COCO để đạt hiệu quả phân đoạn tốt.
Sau khi hoàn tất, bạn có thể chạy inference bằng model tùy chỉnh cho các ứng dụng cụ thể. Với tùy chọn export, bạn cũng có thể export model tùy chỉnh sang một định dạng khác.
Phân đoạn đối tượng YOLO11 trên Ultralytics HUB#
Sau khi đã tìm hiểu cách chạy inference và huấn luyện tùy chỉnh model phân đoạn đối tượng YOLO11 bằng code, hãy cùng xem một giải pháp không cần code: Ultralytics HUB. Ultralytics HUB là nền tảng AI thị giác trực quan, giúp đơn giản hóa quy trình huấn luyện và triển khai các model YOLO, bao gồm các model phân đoạn đối tượng YOLO11.
Để chạy inference trên hình ảnh, bạn chỉ cần: tạo tài khoản, đi đến mục ‘Models’ và chọn biến thể model phân đoạn đối tượng YOLO11 mà bạn muốn. Bạn có thể tải lên một hình ảnh và xem kết quả dự đoán trong phần xem trước, như minh họa bên dưới.

Hình 7. Chạy inference trên Ultralytics HUB.
Những điểm chính#
YOLO11 cung cấp khả năng phân đoạn đối tượng đáng tin cậy, mở ra nhiều khả năng trong các ngành công nghiệp khác nhau. Từ nâng cao an toàn trong xe tự hành và giám sát hoạt động đốt khí trong ngành dầu khí đến tự động hóa phân loại chất thải tại các cơ sở tái chế, độ chính xác ở cấp độ pixel của YOLO11 khiến model này trở nên lý tưởng cho các tác vụ phân đoạn phức tạp.
Với tùy chọn huấn luyện tùy chỉnh thông qua gói Python của Ultralytics và thiết lập không cần code bằng Ultralytics HUB, người dùng có thể tích hợp YOLO11 liền mạch vào workflow của mình. Dù được sử dụng trong các ứng dụng công nghiệp, y tế, bán lẻ hay giám sát môi trường, YOLO11 đều mang lại tính linh hoạt và độ chính xác để đáp ứng các nhu cầu phân đoạn đa dạng.
Để tìm hiểu thêm, hãy truy cập repository GitHub và tham gia cộng đồng của chúng tôi. Khám phá các ứng dụng AI trong xe tự lái và nông nghiệp trên các trang giải pháp của chúng tôi. 🚀









