Object Detection
Khám phá các nguyên lý cơ bản của phát hiện đối tượng. Tìm hiểu cách Ultralytics YOLO26 xác định và định vị đối tượng theo thời gian thực với tốc độ và độ chính xác vượt trội.
Nhận diện đối tượng là một công nghệ cốt lõi trong lĩnh vực Computer Vision (CV) cho phép các hệ thống máy tính nhận diện và định vị các mục tiêu cụ thể trong dữ liệu trực quan. Khác với các tác vụ image classification đơn giản hơn vốn chỉ gán một nhãn duy nhất cho toàn bộ bức ảnh, nhận diện đối tượng mang lại sự hiểu biết chi tiết bằng cách dự đoán đồng thời lớp của một đối tượng (ví dụ: "người", "xe hơi", "chó") và vị trí không gian của nó. Vị trí này thường được thể hiện bằng một bounding box hình chữ nhật bao quanh đối tượng, đi kèm với một confidence score thể hiện mức độ chắc chắn của model. Khả năng kép này—nhận diện kết hợp định vị—đóng vai trò là nền tảng cảm quan cho các ứng dụng Artificial Intelligence (AI) hiện đại, giúp máy móc tương tác có ý nghĩa với môi trường xung quanh.
Cơ chế phát hiện#
Các bộ dò tìm hiện đại phụ thuộc nhiều vào các kiến trúc Deep Learning (DL), cụ thể là Convolutional Neural Networks (CNNs), để trích xuất các đặc trưng phức tạp từ ảnh đầu vào. Quá trình bắt đầu với training phase, nơi một model học cách nhận diện các mẫu bằng cách sử dụng các bộ dữ liệu lớn có gán nhãn như COCO dataset. Trong giai đoạn này, thuật toán tối ưu hóa model weights của nó để giảm thiểu sai số dự đoán.
Khi model được triển khai để inference, nó quét các bức ảnh mới để đề xuất các đối tượng tiềm năng. Các thuật toán nâng cao sau đó áp dụng Non-Maximum Suppression (NMS) để lọc bỏ các kết quả phát hiện trùng lặp, đảm bảo rằng mỗi thực thể riêng biệt chỉ được đánh dấu một lần. Độ chính xác của các dự đoán này thường được đánh giá bằng chỉ số Intersection over Union (IoU), đo lường mức độ chồng chéo giữa ô được dự đoán và ground truth. Những tiến bộ gần đây đã dẫn đến các kiến trúc end-to-end như YOLO26, giúp đơn giản hóa quy trình này để đạt tốc độ vượt trội và khả năng real-time inference trên các thiết bị edge.
Phân biệt các thuật ngữ chính#
Việc phân biệt phát hiện đối tượng với các khái niệm liên quan là rất quan trọng để chọn công cụ phù hợp cho dự án:
- Nhận diện đối tượng so với Phân loại ảnh: Trong khi image classification trả lời câu hỏi "Có gì trong bức ảnh này?", nhận diện đối tượng trả lời câu hỏi "Cái gì ở đâu?".
- Nhận diện đối tượng so với Phân đoạn thực thể: Quá trình nhận diện vẽ một ô vuông xung quanh một mục. Ngược lại, instance segmentation xác định chính xác đường viền (mask) hoàn hảo từng pixel của mỗi đối tượng.
- Nhận diện đối tượng so với Theo dõi đối tượng: Nhận diện tìm các đối tượng trong một khung hình đơn lẻ. Object tracking liên kết các kết quả nhận diện này qua một chuỗi video để theo dõi chuyển động theo thời gian.
Các ứng dụng trong thực tế#
Tính linh hoạt của nhận diện đối tượng thúc đẩy sự đổi mới trên các ngành công nghiệp lớn. Trong lĩnh vực ô tô, AI in autonomous vehicles phụ thuộc rất nhiều vào các model nhận diện để xác định người đi bộ, biển báo giao thông và các phương tiện khác ngay lập tức nhằm điều hướng an toàn. Bằng cách xử lý các luồng video từ camera trên xe, các hệ thống này đưa ra các quyết định trong tích tắc giúp ngăn ngừa tai nạn.
Một trường hợp sử dụng nổi bật khác được tìm thấy trong AI in Retail. Các hệ thống thanh toán tự động và robot quản lý hàng tồn kho thông minh sử dụng nhận diện đối tượng để quét kệ hàng, nhận diện sản phẩm và phát hiện tình trạng thiếu hụt hàng hóa hoặc đặt nhầm chỗ. Sự tự động hóa này hợp lý hóa chuỗi cung ứng và cải thiện trải nghiệm của khách hàng bằng cách đảm bảo sản phẩm luôn sẵn có.
Triển khai phát hiện đối tượng#
Các lập trình viên có thể dễ dàng triển khai các quy trình nhận diện bằng cách sử dụng gói Python ultralytics. Ví dụ sau đây minh họa cách tải một model YOLO26 đã được huấn luyện trước và thực hiện inference trên một bức ảnh.
from ultralytics import YOLO
# Load the latest YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Run inference on an image from a URL
results = model("https://ultralytics.com/images/bus.jpg")
# Display the results with bounding boxes
results[0].show()Đối với các nhóm muốn mở rộng quy mô hoạt động của họ, Ultralytics Platform cung cấp một môi trường toàn diện để gán nhãn dữ liệu, huấn luyện các model tùy chỉnh trên đám mây và triển khai chúng sang các định dạng khác nhau như ONNX hoặc TensorRT. Việc sử dụng các nền tảng như vậy giúp đơn giản hóa vòng đời MLOps, cho phép các kỹ sư tập trung vào việc tinh chỉnh các ứng dụng của họ thay vì quản lý cơ sở hạ tầng.






