Object Detection Architectures
Khám phá các kiến trúc object detection, từ backbone đến head. Tìm hiểu cách Ultralytics YOLO26 mang lại tốc độ và độ chính xác hàng đầu cho computer vision thời gian thực.
Kiến trúc phát hiện đối tượng là bản thiết kế cấu trúc của các mạng nơ-ron được sử dụng để nhận diện và định vị các vật thể trong dữ liệu hình ảnh. Trong lĩnh vực rộng hơn là thị giác máy tính (CV), các kiến trúc này xác định cách một máy "nhìn thấy" bằng cách xử lý dữ liệu pixel thô thành những thông tin chuyên sâu có ý nghĩa. Không giống các model phân loại cơ bản chỉ gắn nhãn cho một hình ảnh, kiến trúc phát hiện đối tượng được thiết kế để xuất ra một bounding box cùng với nhãn lớp và điểm tin cậy cho mọi đối tượng riêng biệt mà nó tìm thấy. Thiết kế cấu trúc này quyết định tốc độ, độ chính xác và hiệu quả tính toán của model, khiến nó trở thành yếu tố then chốt khi lựa chọn model cho suy luận thời gian thực hoặc phân tích độ chính xác cao.
Các thành phần cốt lõi của một kiến trúc#
Mặc dù các thiết kế cụ thể có thể khác nhau, hầu hết kiến trúc hiện đại đều có chung ba thành phần nền tảng: backbone, neck và head. Backbone hoạt động như bộ trích xuất đặc trưng chính. Thành phần này thường là một Mạng nơ-ron tích chập (CNN) được pre-trained trên một dataset lớn như ImageNet, có nhiệm vụ nhận diện các hình dạng, cạnh và kết cấu cơ bản. Những lựa chọn phổ biến cho backbone gồm ResNet và CSPDarknet.
Neck kết nối backbone với các lớp output cuối cùng. Vai trò của nó là trộn và kết hợp các đặc trưng từ những giai đoạn khác nhau của backbone để đảm bảo model có thể phát hiện các đối tượng với nhiều kích thước khác nhau—một khái niệm được gọi là hợp nhất đặc trưng đa tỷ lệ. Các kiến trúc thường sử dụng Mạng kim tự tháp đặc trưng (FPN) hoặc Mạng tổng hợp đường dẫn (PANet) ở đây để làm giàu thông tin ngữ nghĩa được truyền đến các lớp dự đoán. Cuối cùng, head phát hiện xử lý các đặc trưng đã hợp nhất này để dự đoán lớp cụ thể và vị trí tọa độ của từng đối tượng.
Quá trình phát triển: Hai giai đoạn so với một giai đoạn#
Trước đây, các kiến trúc được chia thành hai nhóm chính. Bộ phát hiện hai giai đoạn, chẳng hạn như họ R-CNN, trước tiên đề xuất các vùng quan tâm (RoIs) nơi đối tượng có thể tồn tại, sau đó phân loại các vùng đó trong bước thứ hai. Mặc dù nhìn chung có độ chính xác cao, chúng thường đòi hỏi quá nhiều tài nguyên tính toán đối với các thiết bị edge.
Ngược lại, bộ phát hiện một giai đoạn xem việc phát hiện như một bài toán hồi quy đơn giản, ánh xạ trực tiếp các pixel hình ảnh thành tọa độ bounding box và xác suất lớp chỉ trong một lượt xử lý. Cách tiếp cận này, do họ YOLO (Bạn Chỉ Nhìn Một Lần) tiên phong, đã cách mạng hóa ngành bằng cách cho phép đạt hiệu năng thời gian thực. Những tiến bộ hiện đại đã đưa đến các model như YOLO26, không chỉ cung cấp tốc độ vượt trội mà còn áp dụng kiến trúc end-to-end không cần NMS. Bằng cách loại bỏ nhu cầu hậu xử lý ức chế phi cực đại (NMS), các kiến trúc mới này làm giảm sự biến thiên độ trễ, yếu tố rất quan trọng đối với các hệ thống an toàn trọng yếu.
Các ứng dụng trong thực tế#
Lựa chọn kiến trúc tác động trực tiếp đến mức độ thành công của các giải pháp AI trong nhiều ngành.
- Tự động hóa bán lẻ: Trong siêu thị thông minh, các kiến trúc một giai đoạn hiệu quả cho phép xây dựng hệ thống thanh toán tự động có thể ngay lập tức nhận diện sản phẩm trên băng chuyền hoặc trong giỏ hàng, giúp giảm thời gian chờ và sai sót của con người.
- Chẩn đoán y khoa: Các kiến trúc có độ chính xác cao được sử dụng trong phân tích hình ảnh y khoa để phát hiện những bất thường như khối u trong ảnh X-quang hoặc ảnh chụp MRI. Trong trường hợp này, khả năng giữ lại các chi tiết ở mức tinh vi của kiến trúc quan trọng hơn tốc độ xử lý thuần túy.
Phân biệt các thuật ngữ liên quan#
Điều quan trọng là phải phân biệt các kiến trúc phát hiện với những tác vụ thị giác máy tính tương tự:
- so với Phân loại hình ảnh: Kiến trúc phân loại hình ảnh (như VGG hoặc EfficientNet) gán một nhãn duy nhất cho toàn bộ hình ảnh (ví dụ: "mèo"). Nó không cho biết con mèo ở đâu hoặc có nhiều con mèo hay không, trong khi đây là chức năng chính của các kiến trúc phát hiện.
- so với Phân đoạn theo instance: Trong khi phát hiện đặt một khung xung quanh đối tượng, phân đoạn theo instance xác định đường viền chính xác đến từng pixel (mask) của mỗi đối tượng. Các kiến trúc phân đoạn thường là phần mở rộng của kiến trúc phát hiện (ví dụ: thêm một nhánh mask vào head phát hiện).
Triển khai với Ultralytics#
Các framework hiện đại đã trừu tượng hóa những phức tạp của các kiến trúc này, cho phép developer tận dụng các thiết kế tiên tiến nhất với lượng code tối thiểu. Bằng cách sử dụng package ultralytics, bạn có thể load một model YOLO26 pre-trained và chạy inference ngay lập tức. Đối với các team muốn quản lý dataset và train các kiến trúc tùy chỉnh trên cloud, Ultralytics Platform đơn giản hóa toàn bộ pipeline MLOps.
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Run inference on an image source
# This uses the model's architecture to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()








