Image Segmentation
Khám phá phân đoạn hình ảnh (image segmentation) trong thị giác máy tính. Tìm hiểu cách Ultralytics YOLO26 cung cấp các mặt nạ cấp độ pixel chính xác cho phân đoạn thực thể, ngữ nghĩa và toàn cảnh.
Phân đoạn ảnh là một kỹ thuật tinh vi trong computer vision (CV) bao gồm việc chia một ảnh kỹ thuật số thành nhiều nhóm nhỏ các pixel, thường được gọi là các phân đoạn ảnh hoặc vùng. Không giống như image classification tiêu chuẩn, vốn gán một nhãn duy nhất cho toàn bộ bức ảnh, quá trình phân đoạn phân tích dữ liệu trực quan ở mức độ chi tiết hơn nhiều bằng cách gán nhãn lớp cụ thể cho từng pixel riêng lẻ. Quá trình này tạo ra một bản đồ cấp pixel chính xác, cho phép các mô hình artificial intelligence (AI) hiểu không chỉ những đối tượng nào có mặt, mà còn chính xác vị trí của chúng và ranh giới cụ thể của chúng là gì.
Cơ chế phân tích cấp độ Pixel#
Để đạt được mức độ hiểu chi tiết cao này, các mô hình phân đoạn thường tận dụng các kiến trúc deep learning (DL), đặc biệt là Convolutional Neural Networks (CNNs). Các mạng này đóng vai trò là các trình trích xuất đặc trưng mạnh mẽ, nhận dạng các mẫu như các cạnh, kết cấu và các hình dạng phức tạp. Các kiến trúc phân đoạn truyền thống, như U-Net kinh điển, thường sử dụng cấu trúc bộ mã hóa-bộ giải mã (encoder-decoder). Bộ mã hóa nén ảnh đầu vào để nắm bắt bối cảnh ngữ nghĩa, trong khi bộ giải mã tái tạo các chi tiết không gian để xuất ra một segmentation mask cuối cùng.
Những tiến bộ hiện đại đã dẫn đến các kiến trúc thời gian thực như YOLO26, được phát hành vào tháng 1 năm 2026. Các mô hình này tích hợp các tính năng phân đoạn trực tiếp vào một pipeline đầu-cuối (end-to-end), cho phép xử lý tốc độ cao trên nhiều phần cứng khác nhau, từ các GPUs trên đám mây đến các thiết bị biên.
Các loại phân đoạn chính#
Tùy thuộc vào mục tiêu cụ thể của một dự án, các nhà phát triển thường chọn giữa ba kỹ thuật phân đoạn chính:
- Semantic Segmentation: Phương pháp này phân loại các pixel dựa trên danh mục của chúng nhưng không phân biệt giữa các đối tượng riêng biệt thuộc cùng một lớp. Ví dụ, trong một phân tích satellite image analysis, tất cả các pixel đại diện cho "rừng" sẽ được tô màu xanh lá cây, coi toàn bộ khu rừng là một thực thể duy nhất.
- Instance Segmentation: Kỹ thuật này nhận diện và tách biệt các đối tượng cụ thể quan tâm. Trong một khung cảnh đường phố đông đúc, phân đoạn thể thực sẽ tạo ra một mask duy nhất cho "Xe A", "Xe B" và "Người đi bộ A", cho phép các hệ thống đếm và theo dõi các thực thể cụ thể. Đây là một tính năng cốt lõi của dòng mô hình Ultralytics YOLO26.
- Panoptic Segmentation: Một phương pháp lai kết hợp độ phủ của phân đoạn ngữ nghĩa với độ chính xác của phân đoạn thể thực. Nó gán nhãn cho mọi pixel, phân biệt các phần tử nền vô định hình (như bầu trời và đường) đồng thời nhận diện duy nhất các đối tượng tiền cảnh có thể đếm được.
Phân biệt với Object Detection#
Việc phân biệt phân đoạn với object detection là rất quan trọng. Trong khi các thuật toán phát hiện định vị các mục bằng cách sử dụng một bounding box hình chữ nhật, chúng không thể tránh khỏi việc bao gồm các pixel nền bên trong hộp đó. Phân đoạn cung cấp một đại diện chặt chẽ và chính xác hơn bằng cách theo dõi chính xác đường viền hoặc đa giác của đối tượng. Sự khác biệt này là cực kỳ quan trọng đối với các ứng dụng như robotic grasping, nơi cánh tay robot phải biết hình học chính xác của một vật phẩm để thao tác mà không gây va chạm.
Các ứng dụng trong thực tế#
Độ chính xác mà phân đoạn hình ảnh mang lại thúc đẩy đổi mới trên nhiều ngành công nghiệp đa dạng:
- Chẩn đoán Y tế: Trong lĩnh vực medical image analysis, phân đoạn là điều cần thiết để phác thảo các cấu trúc giải phẫu. Các thuật toán phân tích các MRI scans để vạch rõ khối u hoặc ranh giới cơ quan, cho phép các bác sĩ phẫu thuật tính toán thể tích chính xác và lên kế hoạch cho các quy trình với độ chính xác cứu mạng.
- Xe tự hành: Các phương tiện tự lái dựa vào phân đoạn để điều hướng an toàn. Bằng cách xử lý các luồng video, máy tính của xe có thể phân biệt drivable lanes với lề đường và chướng ngại vật. Các tổ chức tiêu chuẩn như SAE International xác định các cấp độ tự chủ đòi hỏi nhận thức môi trường có độ trung thực cao này.
- Nông nghiệp chính xác: Trong AI in agriculture, phân đoạn giúp các hệ thống robot nhận diện cỏ dại giữa các loại cây trồng. Bằng cách tạo các mask cho các lá cây cụ thể, các thiết bị phun tự động có thể nhắm mục tiêu chỉ vào các loài xâm lấn, làm giảm đáng kể việc sử dụng thuốc diệt cỏ.
Triển khai Phân đoạn với Ultralytics YOLO26#
Các nhà phát triển có thể triển khai phân đoạn thể thực một cách hiệu quả bằng cách sử dụng gói Python ultralytics. Ví dụ sau đây sử dụng YOLO26 model tiên tiến nhất, được tối ưu hóa cho cả tốc độ và độ chính xác.
from ultralytics import YOLO
# Load a pre-trained YOLO26 segmentation model
# 'n' denotes the nano version, optimized for speed
model = YOLO("yolo26n-seg.pt")
# Run inference on an image to generate masks
# The model identifies objects and outlines their shape
results = model("https://ultralytics.com/images/bus.jpg")
# Display the image with segmentation overlays
results[0].show()Để đạt được hiệu suất cao trên các tác vụ tùy chỉnh, các nhóm thường cần quản lý training data chất lượng cao. Ultralytics Platform đơn giản hóa quy trình này bằng cách cung cấp các công cụ để chú thích hình ảnh bằng các mask đa giác, quản lý tập dữ liệu và huấn luyện các mô hình trên đám mây, đơn giản hóa toàn bộ vòng đời machine learning operations (MLOps). Các thư viện như OpenCV cũng thường được sử dụng song song với các mô hình này để tiền xử lý ảnh và hậu xử lý các mask kết quả.






