Tác động của thiết kế nhanh hơn, ưu tiên edge của Ultralytics YOLO26
Xem cách Ultralytics YOLO26 nhanh hơn trên edge và lý do điều này quan trọng đối với các ứng dụng thị giác máy tính thế hệ mới yêu cầu latency thấp và hiệu quả cao.

Đầu tuần này, Ultralytics đã chính thức ra mắt Ultralytics YOLO26, một model YOLO nhanh hơn, nhẹ hơn và nhỏ gọn hơn, hướng đến việc định nghĩa lại cách các hệ thống thị giác máy tính hoạt động trên edge. YOLO26 hỗ trợ các tác vụ thị giác cốt lõi giống như những model YOLO trước đây, bao gồm phát hiện đối tượng và phân đoạn instance.

Hình 1. Ví dụ sử dụng Ultralytics YOLO26 để phân đoạn một đối tượng.
Điểm khác biệt mang tính quyết định giữa Ultralytics YOLO26 và các model trước đây là môi trường mà model được thiết kế để hoạt động. Thay vì chủ yếu tối ưu cho các bộ xử lý đồ họa (GPUs) trên cloud hoặc hiệu năng dựa trên benchmark, YOLO26 được thiết kế ngay từ đầu để triển khai trong thực tế trên các thiết bị edge và phần cứng nhúng.
Khi thị giác máy tính chuyển từ nghiên cứu sang production, thực tế về các giới hạn hiệu năng ngày càng rõ ràng hơn. Môi trường edge bị chi phối bởi ngân sách độ trễ thấp, các giới hạn về bộ nhớ, điện năng và nhiệt, cùng nhu cầu duy trì hành vi có thể dự đoán trên nhiều nền tảng khác nhau.
Trong các bối cảnh này, hiệu năng tổng thể của hệ thống không chỉ phụ thuộc vào tốc độ inference thô mà còn vào mức độ hiệu quả của toàn bộ pipeline. Overhead của bước hậu xử lý, áp lực bộ nhớ và các đường thực thi riêng cho từng nền tảng thường là những điểm nghẽn.
Ultralytics YOLO26 giải quyết những thách thức này bằng cách áp dụng phương pháp nhanh hơn, ưu tiên edge, xem xét toàn bộ pipeline inference thay vì các metric riêng lẻ của model. Bằng cách tập trung vào tối ưu hóa edge, đơn giản hóa pipeline inference và loại bỏ các bước hậu xử lý không cần thiết, YOLO26 mang lại cải thiện tốc độ, giúp giảm độ trễ và tăng độ tin cậy của hành vi trong production.
Trong bài viết này, chúng ta sẽ tìm hiểu cách các lựa chọn kiến trúc của Ultralytics YOLO26 chuyển hóa thành những cải thiện hiệu năng trong thực tế, cũng như lý do việc nhanh hơn trên edge về cơ bản thay đổi những khả năng có thể đạt được đối với các ứng dụng thị giác máy tính thế hệ mới.
Thực tế của việc triển khai trên edge#
Chạy các model thị giác máy tính trên edge rất khác với chạy chúng trên cloud. Trong môi trường cloud, hệ thống thường có quyền truy cập vào GPU mạnh, dung lượng bộ nhớ lớn và phần cứng ổn định. Trên edge, những giả định tương tự không còn đúng.
Phần lớn các hệ thống triển khai trên edge chạy trên nhiều kiến trúc phần cứng khác nhau, không phải GPU. Các thiết bị thường sử dụng nhiều bộ xử lý chuyên dụng cho những tác vụ khác nhau, được tối ưu cho hiệu quả và mức tiêu thụ điện thấp thay vì năng lực tính toán thô của GPU trên cloud.
Độ trễ là một giới hạn lớn khác. Các hệ thống edge thường hoạt động dưới những giới hạn thời gian thực nghiêm ngặt, trong đó ngay cả những trì hoãn nhỏ cũng có thể ảnh hưởng đến khả năng phản hồi hoặc độ an toàn. Trong các trường hợp này, độ trễ đầu-cuối quan trọng hơn tốc độ inference thô. Một model có thể nhanh trên lý thuyết nhưng vẫn không đạt yêu cầu sau khi bổ sung hậu xử lý và di chuyển dữ liệu.
Bộ nhớ cũng đóng vai trò quan trọng. Nhiều thiết bị edge có bộ nhớ hạn chế và cache dùng chung. Các tensor trung gian lớn cùng việc sử dụng bộ nhớ không hiệu quả có thể làm hệ thống chậm lại, ngay cả khi bản thân model hoạt động hiệu quả.
Các giới hạn về điện năng và nhiệt tạo thêm nhiều ràng buộc. Thiết bị edge thường hoạt động mà không có hệ thống làm mát chủ động và trong ngân sách điện năng cố định. Hiệu năng cần hiệu quả và bền vững, không chỉ nhanh trong những khoảng thời gian ngắn.
Trên hết, các hệ thống triển khai trên edge đòi hỏi tính nhất quán. Model phải hoạt động giống nhau trên các thiết bị và runtime khác nhau. Code dành riêng cho nền tảng hoặc các bước hậu xử lý phức tạp có thể tạo ra những khác biệt tinh vi, khiến hệ thống khó triển khai và bảo trì hơn.

Hình 2. Tổng quan về các ràng buộc của việc triển khai trên edge. Hình ảnh của tác giả.
Những ràng buộc này định hình ý nghĩa thực sự của hiệu năng trên edge. Nói cách khác, hiệu năng được quyết định bởi toàn bộ pipeline, không phải một metric duy nhất.
Vì sao thị giác trên edge đòi hỏi một mô hình hiệu năng khác#
Vậy các ràng buộc của việc triển khai trên edge liên quan thế nào đến yêu cầu của một model thị giác máy tính được xây dựng cho edge? Mối liên hệ trở nên rõ ràng khi model chuyển từ môi trường nghiên cứu sang các hệ thống thực tế.
Trong môi trường cloud, hiệu năng thường được đo bằng các benchmark như tốc độ inference và độ chính xác. Trên edge, những metric đó chỉ phản ánh một phần câu chuyện. Các hệ thống thị giác thường chạy trên phần cứng không đồng nhất, trong đó inference mạng neural được chuyển cho các bộ tăng tốc chuyên dụng, còn những phần khác của pipeline chạy trên các bộ xử lý đa dụng.
Trong bối cảnh này, tốc độ của model là chưa đủ. Điều quan trọng là toàn bộ hệ thống hoạt động thế nào sau khi model được triển khai. Một model có thể trông nhanh khi chạy độc lập nhưng vẫn không đạt yêu cầu nếu hậu xử lý, di chuyển dữ liệu hoặc các bước riêng cho nền tảng tạo thêm overhead.
Đó là lý do thị giác trên edge cần một mô hình hiệu năng tập trung vào hiệu quả cấp hệ thống thay vì các benchmark riêng lẻ. Ultralytics YOLO26 phản ánh sự chuyển dịch này bằng cách tập trung vào tối ưu hóa ưu tiên edge, inference tinh gọn và thực thi đầu-cuối được xây dựng cho triển khai thực tế.
Nền tảng của tốc độ: Thiết kế ưu tiên edge#
Trên edge, hiệu năng được quyết định bởi mức độ model ánh xạ tốt vào kiến trúc phần cứng thực tế của thiết bị. Thiết kế ưu tiên edge đảm bảo các hệ thống thị giác chạy đáng tin cậy trên những nền tảng thực tế, bất kể tổ hợp các đơn vị xử lý hiện có.
Phương pháp ưu tiên edge đặt việc thực thi có thể dự đoán và hiệu quả trên phần cứng không đồng nhất lên hàng đầu, thay vì điều chỉnh các model vốn được tối ưu cho GPU trên cloud sau khi hoàn tất thiết kế. Nói đơn giản, điều này có nghĩa là ưu tiên các phép toán ánh xạ tốt lên bộ tăng tốc mạng neural, giảm thiểu công việc phi neural bên ngoài model và giảm độ phức tạp không cần thiết có thể làm chậm quá trình thực thi đầu-cuối.
Ultralytics YOLO26 được thiết kế với những ràng buộc này. Kiến trúc của model tập trung vào hiệu năng nhất quán thay vì throughput đỉnh trong điều kiện lý tưởng. Bằng cách đơn giản hóa các đường thực thi và loại bỏ tính toán không cần thiết, YOLO26 giảm overhead trên toàn bộ pipeline inference, đồng thời tận dụng tốt hơn khả năng tăng tốc và hệ phân cấp bộ nhớ sẵn có của thiết bị.
Phương pháp này cũng cải thiện độ tin cậy. Tối ưu hóa ưu tiên edge mang lại thời gian thực thi dễ dự đoán hơn và ít đột biến hiệu năng hơn, điều rất quan trọng đối với các hệ thống thời gian thực. Thay vì dựa vào phần cứng chuyên dụng hoặc hậu xử lý nặng để đạt tốc độ, Ultralytics YOLO26 nhấn mạnh hiệu quả trong toàn bộ pipeline inference.
Inference đầu-cuối và chi phí của hậu xử lý#
Có thể bạn đang thắc mắc việc loại bỏ các bước hậu xử lý không cần thiết có nghĩa là gì. Để hiểu điều này, hãy lùi lại một bước và xem xét cách các hệ thống phát hiện đối tượng truyền thống hoạt động.
Trong nhiều pipeline phát hiện đối tượng, inference không kết thúc khi model tạo ra các dự đoán. Thay vào đó, model xuất ra một số lượng lớn bounding box chồng lấn, sau đó cần được lọc và tinh chỉnh trước khi sử dụng. Công đoạn làm sạch này được thực hiện thông qua các bước hậu xử lý chạy bên ngoài chính model.
Một trong những bước hậu xử lý phổ biến nhất là loại bỏ phi cực đại, hay NMS. NMS so sánh các bounding box chồng lấn và chỉ giữ lại các detection có độ tin cậy cao nhất, loại bỏ những detection trùng lặp cùng tham chiếu đến một đối tượng. Dù hiệu quả, phương pháp này tạo thêm tính toán sau khi inference hoàn tất.

Hình 3. Tìm hiểu về NMS. Hình ảnh của tác giả.
Trên edge, công việc bổ sung này đi kèm một cái giá. Các bước hậu xử lý như NMS không phù hợp với những bộ tăng tốc chuyên dụng dùng cho inference mạng neural, vốn được tối ưu cho tính toán neural dày đặc thay vì các phép toán nặng về điều khiển hoặc bộ nhớ.
Do đó, NMS tạo thêm độ trễ và overhead bộ nhớ, đồng thời chi phí của nó tăng khi số lượng detection tăng. Ngay cả khi bản thân model nhanh, NMS vẫn có thể chiếm một phần đáng kể trong tổng thời gian chạy.
Hậu xử lý cũng làm tăng độ phức tạp của hệ thống. Vì nằm bên ngoài model, nó phải được triển khai riêng cho các runtime và mục tiêu phần cứng khác nhau. Điều này thường dẫn đến các đường code riêng cho từng nền tảng, hành vi không nhất quán giữa các thiết bị và pipeline triển khai kém bền vững hơn.
Quan trọng nhất, hậu xử lý phá vỡ khái niệm hiệu năng đầu-cuối thực sự. Việc đo tốc độ inference của model không phản ánh cách hệ thống hoạt động trong production. Điều cuối cùng quan trọng là tổng thời gian từ input đến output cuối cùng, bao gồm mọi bước trong pipeline.
Trong những tình huống này, hậu xử lý trở thành một điểm nghẽn tiềm ẩn trên edge. Nó làm tăng độ trễ, tiêu tốn tài nguyên CPU và khiến việc triển khai phức tạp hơn, trong khi vẫn nằm bên ngoài chính model.
Cách Ultralytics YOLO26 loại bỏ NMS và lý do điều đó giúp model nhanh hơn#
YOLO26 loại bỏ NMS bằng cách xử lý nguyên nhân gốc của các detection trùng lặp thay vì dọn dẹp chúng sau inference. Thay vì tạo ra nhiều dự đoán chồng lấn cần được lọc, model được huấn luyện để trực tiếp tạo ra một tập nhỏ hơn gồm các detection cuối cùng có độ tin cậy cao.
Điều này có được nhờ thay đổi cách detection được học trong quá trình huấn luyện. Ultralytics YOLO26 khuyến khích mối quan hệ một-một rõ ràng hơn giữa đối tượng và dự đoán, giảm sự dư thừa ngay từ nguồn. Nhờ đó, các detection trùng lặp được xử lý ngay bên trong network thay vì thông qua hậu xử lý bên ngoài.
Việc loại bỏ NMS tác động ngay đến hiệu năng trên edge. Vì NMS không ánh xạ tốt lên các bộ tăng tốc mạng neural, việc loại bỏ nó giúp giảm di chuyển bộ nhớ và tránh các bước xử lý phi neural tốn kém. Điều này làm giảm độ trễ đầu-cuối và giúp hiệu năng dễ dự đoán hơn, đặc biệt trên các thiết bị edge, nơi hậu xử lý nếu không được loại bỏ có thể chiếm một phần đáng kể trong tổng thời gian chạy.
Điều này cũng đơn giản hóa pipeline inference. Với ít bước hơn bên ngoài model, lượng di chuyển dữ liệu và số lần bàn giao giữa các thành phần đều giảm. Output của model đã là kết quả cuối cùng, giúp quá trình thực thi dễ dự đoán hơn.
Loại bỏ DFL để đạt hiệu năng đầu-cuối thực sự#
Một đổi mới khác trong Ultralytics YOLO26 là loại bỏ Distribution Focal Loss, hay DFL, vốn được sử dụng trong các model YOLO trước đây cho hồi quy bounding box. Thay vì dự đoán trực tiếp một tọa độ duy nhất, các model dùng DFL học một phân phối gồm các giá trị khả dĩ rồi suy ra bounding box cuối cùng từ phân phối đó. Phương pháp này giúp cải thiện độ chính xác định vị và là một bước tiến quan trọng trong các thế hệ trước.
Tuy nhiên, theo thời gian, DFL cũng tạo ra những đánh đổi. Việc dự đoán phân phối làm tăng tính toán và độ phức tạp của kiến trúc model, có thể làm chậm inference trên CPU và khiến model khó export sang các định dạng triển khai. DFL cũng áp đặt các phạm vi hồi quy cố định, có thể hạn chế tính linh hoạt khi phát hiện các đối tượng rất lớn.
Ultralytics YOLO26 loại bỏ DFL trong quá trình chuyển sang thiết kế đơn giản hơn, đầu-cuối. Hồi quy bounding box được thiết kế lại theo hướng trực tiếp hơn, giảm tính toán không cần thiết mà vẫn duy trì độ chính xác. Thay đổi này phù hợp với phương pháp không cần NMS của YOLO26.
Nguồn gốc của tốc độ inference trên CPU nhanh hơn 43%#
Trong các benchmark dựa trên CPU, YOLO26 cho thấy cải thiện hiệu năng rõ rệt so với các model YOLO trước đây. So với Ultralytics YOLO11, model nano YOLO26 mang lại tốc độ inference trên CPU nhanh hơn tới 43%, tạo ra khác biệt đáng kể trong các hệ thống triển khai edge thực tế.

Hình 4. Benchmark tốc độ CPU của Ultralytics YOLO26.
Mức tăng này đến từ việc đơn giản hóa toàn bộ pipeline inference thay vì tối ưu một thành phần duy nhất. Thực thi đầu-cuối loại bỏ overhead hậu xử lý, phương pháp hồi quy bounding box trực tiếp hơn giúp giảm tính toán, còn các lựa chọn thiết kế ưu tiên CPU cải thiện hiệu quả thực thi trên các bộ xử lý đa dụng.
Kết hợp lại, những thay đổi này làm giảm độ trễ, giảm tải CPU và mang lại hiệu năng nhanh hơn, nhất quán hơn trên phần cứng edge thực tế.
Tác động của Ultralytics YOLO26 đến việc triển khai và export trên edge#
Các cải thiện hiệu năng của Ultralytics YOLO26 không chỉ dừng ở inference nhanh hơn. Bằng cách đơn giản hóa model và giảm overhead bộ nhớ, model trở nên dễ triển khai hơn và hoạt động đáng tin cậy hơn trong các môi trường edge.
Thiết kế đầu-cuối của Ultralytics YOLO26 cũng đơn giản hóa việc export. Với ít thành phần phụ trợ hơn và không có các bước hậu xử lý bên ngoài, các model đã export hoàn toàn độc lập. Điều này giảm các dependency riêng cho từng nền tảng và giúp đảm bảo hành vi nhất quán trên các runtime và mục tiêu phần cứng khác nhau.
Trong thực tế, điều này có nghĩa là Ultralytics YOLO26 có thể được triển khai dễ dàng hơn lên các thiết bị edge như camera, robot và hệ thống nhúng, sử dụng nhiều định dạng export khác nhau. Những gì bạn export chính là những gì bạn chạy, với ít bước tích hợp hơn và ít rủi ro sai lệch triển khai hơn.
Inference edge nhanh hơn mở ra AI thị giác cho robot và công nghiệp#
Cho đến nay, chúng ta đã xem xét cách thiết kế ưu tiên edge của Ultralytics YOLO26 cải thiện hiệu năng ở cấp hệ thống. Tuy nhiên, tác động thực sự nằm ở việc model giúp tích hợp AI thị giác vào các ứng dụng thực tế dễ dàng hơn.
Ví dụ, trong robotics và môi trường công nghiệp, các hệ thống thị giác thường hoạt động dưới những ràng buộc thời gian thực nghiêm ngặt. Quyết định cần được đưa ra nhanh chóng và nhất quán, với năng lực tính toán hạn chế và không phụ thuộc vào kết nối cloud. Với Ultralytics YOLO26, việc đáp ứng các yêu cầu này trở nên khả thi.
Các ứng dụng như điều hướng robot và thao tác với đối tượng được hưởng lợi từ độ trễ thấp hơn và inference dễ dự đoán hơn, cho phép robot phản hồi mượt mà trước những thay đổi trong môi trường. Tương tự, trong môi trường công nghiệp, các model thị giác có thể chạy trực tiếp trên dây chuyền sản xuất để phát hiện lỗi, theo dõi linh kiện và giám sát quy trình mà không tạo thêm độ trễ hoặc độ phức tạp.
Bằng cách cho phép inference nhanh và đáng tin cậy trên phần cứng edge, Ultralytics YOLO26 giúp AI thị giác trở thành một phần tự nhiên của các hệ thống robotics và công nghiệp, thay vì là một thách thức trong triển khai và bảo trì.
Những điểm chính#
Ultralytics YOLO26 được xây dựng cho edge, nơi các ràng buộc thực tế như độ trễ, bộ nhớ và độ tin cậy quyết định những gì có thể thực hiện. Bằng cách thiết kế model xoay quanh thực thi ưu tiên CPU, inference đầu-cuối và triển khai đơn giản hơn, YOLO26 giúp tích hợp AI thị giác vào các hệ thống thực tế trở nên khả thi. Phương pháp ưu tiên edge này mở ra nhiều ứng dụng, từ robotics và thị giác công nghiệp đến AI nhúng và AI trên thiết bị, nơi hiệu năng và khả năng dự đoán có ý nghĩa quan trọng nhất.
Tham gia cộng đồng đang phát triển của chúng tôi và khám phá repository GitHub để tiếp cận các tài nguyên AI thực hành. Để xây dựng với AI thị giác ngay hôm nay, hãy khám phá các lựa chọn cấp phép của chúng tôi. Tìm hiểu cách AI trong nông nghiệp đang chuyển đổi hoạt động canh tác và cách AI thị giác trong y tế đang định hình tương lai bằng cách truy cập các trang giải pháp của chúng tôi.









