Cách Ultralytics YOLO26 huấn luyện thông minh hơn với ProgLoss, STAL và MuSGD
Tìm hiểu cách Ultralytics YOLO26 huấn luyện đáng tin cậy hơn nhờ Progressive Loss Balancing, Small-Target-Aware Label Assignment và trình tối ưu hóa MuSGD.

Tuần trước, chúng tôi đã phát hành Ultralytics YOLO26, thiết lập một tiêu chuẩn mới cho các mô hình computer vision thời gian thực, hướng tới biên. Tương tự như các Ultralytics YOLO models trước đây, chẳng hạn như Ultralytics YOLO11, YOLO26 hỗ trợ các tác vụ computer vision cốt lõi mà người dùng đã quen thuộc, bao gồm phát hiện đối tượng (object detection), phân đoạn thực thể (instance segmentation) và ước lượng tư thế (pose estimation).

Hình 1. Ví dụ về việc sử dụng Ultralytics YOLO26 để phân đoạn đối tượng trong một hình ảnh.
Tuy nhiên, Ultralytics YOLO26 không chỉ đơn thuần là một bản cập nhật gia tăng. Mặc dù các tác vụ được hỗ trợ có vẻ quen thuộc, mô hình mới này đại diện cho một bước tiến đổi mới trong cách huấn luyện các mô hình computer vision. Với YOLO26, trọng tâm vượt ra ngoài hiệu quả suy luận để giúp quá trình huấn luyện trở nên ổn định hơn.
Ultralytics YOLO26 được thiết kế với toàn bộ vòng đời huấn luyện trong tâm trí. Điều này có nghĩa là quá trình hội tụ nhanh hơn, các đợt huấn luyện đáng tin cậy hơn và hành vi model ổn định. Những cải tiến này đặc biệt quan trọng trong các quy trình làm việc thực tế, nơi độ tin cậy khi huấn luyện ảnh hưởng trực tiếp đến tốc độ lặp lại và triển khai model.
Để thực hiện điều này, Ultralytics YOLO26 giới thiệu một số cải tiến huấn luyện có mục tiêu như Progressive Loss Balancing (ProgLoss), Small-Target-Aware Label Assignment (STAL), và trình tối ưu hóa MuSGD. Cùng nhau, các thay đổi này cải thiện cách cân bằng loss học tập, cách gán nhãn và cách hoạt động tối ưu hóa theo thời gian.
Trong bài viết này, chúng tôi sẽ khám phá cách thức hoạt động của từng cơ chế này và lý do tại sao chúng giúp Ultralytics YOLO26 dễ huấn luyện hơn và đáng tin cậy hơn ở quy mô lớn. Hãy cùng bắt đầu!
Ultralytics YOLO26: Được xây dựng để huấn luyện thông minh hơn, không chỉ chạy nhanh hơn#
Ultralytics YOLO26 tinh giản hóa toàn bộ đường ống (pipeline) inference bằng cách loại bỏ sự phụ thuộc vào các bước hậu xử lý như Non-Maximum Suppression. Thay vì tạo ra nhiều dự đoán chồng chéo và lọc chúng sau đó, YOLO26 tạo ra các kết quả phát hiện cuối cùng trực tiếp từ mạng.
Điều này làm cho YOLO26 thành một end-to-end mô hình, nơi việc dự đoán, giải quyết trùng lặp và các đầu ra cuối cùng đều được học bên trong chính mạng lưới đó. Điều này đơn giản hóa việc triển khai và cải thiện hiệu suất suy luận, đồng thời định hình cách mô hình học trong quá trình huấn luyện.

Hình 2. YOLO26 mang lại khả năng suy luận end-to-end tiên tiến, không cần NMS (Nguồn)
Trong một hệ thống end-to-end như thế này, huấn luyện và inference được kết nối chặt chẽ. Vì không có giai đoạn hậu xử lý bên ngoài để sửa các dự đoán sau đó, mô hình phải học cách đưa ra các quyết định rõ ràng và tự tin ngay trong quá trình huấn luyện.
Điều này làm cho sự căn chỉnh giữa mục tiêu huấn luyện và hành vi inference trở nên đặc biệt quan trọng. Bất kỳ sự không tương thích nào giữa cách mô hình được huấn luyện và cách nó được sử dụng tại thời điểm inference đều có thể dẫn đến việc học không ổn định hoặc hội tụ chậm hơn.
Ultralytics YOLO26 giải quyết vấn đề này bằng cách thiết kế quá trình huấn luyện xoay quanh việc sử dụng trong thế giới thực ngay từ đầu. Thay vì chỉ tập trung vào tốc độ suy luận, hệ thống huấn luyện được xây dựng để hỗ trợ quá trình học tập ổn định trong các lần chạy dài, độ hội tụ nhất quán trên các kích thước model từ Nano đến Extra Large, và hiệu suất mạnh mẽ trên các tập dữ liệu đa dạng.
Cách hai đầu huấn luyện cải thiện khả năng học tập trong Ultralytics YOLO26#
Một trong những cải tiến huấn luyện then chốt trong Ultralytics YOLO26 dựa trên phương pháp huấn luyện hai đầu (two-head) được sử dụng trong các mô hình YOLO trước đây. Trong các mô hình phát hiện đối tượng, một head đề cập đến phần của mạng chịu trách nhiệm đưa ra dự đoán.
Nói cách khác, các đầu phát hiện (detection heads) học cách dự đoán các đối tượng nằm ở đâu trong ảnh và đó là những đối tượng gì. Chúng thực hiện điều này bằng cách hồi quy tọa độ bbox, có nghĩa là chúng học cách ước tính vị trí và kích thước của từng đối tượng trong ảnh đầu vào.
Trong quá trình huấn luyện, mô hình học bằng cách giảm thiểu một giá trị loss, đây là thước đo bằng số về khoảng cách giữa các dự đoán của nó với các câu trả lời đúng hoặc ground truth. Loss thấp hơn có nghĩa là các dự đoán của mô hình gần với ground truth hơn, trong khi loss cao hơn cho thấy sai số lớn hơn. Việc tính toán loss hướng dẫn cách mô hình cập nhật các tham số của nó trong quá trình huấn luyện.
Ultralytics YOLO26 sử dụng hai đầu dò (detection head) trong quá trình huấn luyện, chia sẻ cùng một mô hình nền tảng nhưng phục vụ các mục đích khác nhau. Đầu dò một-đối-một (one-to-one) là đầu dò được sử dụng tại thời điểm suy luận. Nó học cách liên kết mỗi đối tượng với một dự đoán duy nhất, có độ tin cậy cao, điều cần thiết cho thiết kế end-to-end, không cần NMS của YOLO26.
Trong khi đó, đầu one-to-many chỉ được sử dụng trong quá trình huấn luyện. Nó cho phép nhiều dự đoán được liên kết với cùng một đối tượng, cung cấp sự giám sát dày đặc hơn. Tín hiệu học tập phong phú hơn này giúp ổn định quá trình huấn luyện và cải thiện độ chính xác, đặc biệt là trong các giai đoạn đầu.
Trong Ultralytics YOLO26, cả hai đầu ra đều sử dụng cùng một cách tính loss cho việc hồi quy box và phân loại. Các phiên bản trước đây áp dụng một tỷ lệ cân bằng cố định giữa hai tín hiệu loss này trong suốt quá trình huấn luyện.
Tuy nhiên, trong thực tế, tầm quan trọng của mỗi đầu ra thay đổi theo thời gian. Giám sát dày đặc là hữu ích nhất ở giai đoạn đầu, trong khi sự phù hợp với hành vi suy luận trở nên quan trọng hơn ở giai đoạn sau của quá trình huấn luyện. Ultralytics YOLO26 được thiết kế dựa trên góc nhìn này, điều dẫn trực tiếp đến cách hệ thống cân bằng lại các tín hiệu học tập khi quá trình huấn luyện tiến triển.
Ultralytics YOLO26 sử dụng Progressive Loss Balancing#
Vậy, Ultralytics YOLO26 xử lý các nhu cầu học tập thay đổi này như thế nào trong quá trình huấn luyện? Nó sử dụng Progressive Loss Balancing để điều chỉnh cách các tín hiệu học tập được trọng số theo thời gian.
ProgLoss hoạt động bằng cách thay đổi động mức đóng góp của mỗi đầu vào tổng loss khi quá trình huấn luyện tiến triển. Ban đầu, trọng số cao hơn được đặt vào đầu one-to-many để ổn định quá trình học và cải thiện khả năng recall. Khi quá trình huấn luyện tiếp tục, sự cân bằng dần dần chuyển sang đầu one-to-one, căn chỉnh quá trình huấn luyện chặt chẽ hơn với hành vi inference.
Quá trình chuyển đổi dần dần này cho phép Ultralytics YOLO26 học theo đúng thứ tự. Thay vì ép buộc model tối ưu hóa các mục tiêu cạnh tranh cùng một lúc, Progressive Loss Balancing ưu tiên tín hiệu học tập hữu ích nhất ở từng giai đoạn huấn luyện. Kết quả là quá trình hội tụ mượt mà hơn, ít lần huấn luyện không ổn định hơn, và hiệu suất cuối cùng nhất quán hơn.
STAL giúp Ultralytics YOLO26 học từ các đối tượng nhỏ như thế nào#
Một cải tiến huấn luyện thú vị khác trong Ultralytics YOLO26 đến từ cách mô hình gán các mục tiêu huấn luyện cho các dự đoán, một quá trình được gọi là gán nhãn (label assignment). Nó chịu trách nhiệm khớp các đối tượng ground truth với các dự đoán ứng viên, thường được gọi là anchors.
Các phép khớp này xác định dự đoán nào nhận được sự giám sát và đóng góp vào loss. Ultralytics YOLO26 xây dựng dựa trên một phương pháp gán nhãn hiện có gọi là Task Alignment Learning (TAL), được thiết kế để căn chỉnh tốt hơn việc phân loại và định vị trong quá trình huấn luyện.
Mặc dù TAL hoạt động tốt cho hầu hết các đối tượng, nhưng quá trình huấn luyện đã bộc lộ một hạn chế quan trọng. Trong quá trình khớp, các đối tượng rất nhỏ có thể bị bỏ qua hoàn toàn. Trong thực tế, các đối tượng nhỏ hơn khoảng 8 pixel trong ảnh đầu vào 640 pixel thường không nhận được bất kỳ gán anchor nào. Khi điều này xảy ra, mô hình nhận được rất ít hoặc không nhận được sự giám sát nào cho các đối tượng đó, khiến việc học cách phát hiện chúng một cách đáng tin cậy trở nên khó khăn.
Để giải quyết vấn đề này, Ultralytics YOLO26 giới thiệu Small-Target-Aware Label Assignment (STAL). STAL sửa đổi quá trình gán nhãn để đảm bảo rằng các đối tượng nhỏ không bị bỏ qua trong quá trình huấn luyện. Cụ thể, nó áp dụng tối thiểu bốn phép gán neo cho các đối tượng nhỏ hơn 8 pixel. Điều này đảm bảo rằng ngay cả các đối tượng cực nhỏ cũng đóng góp liên tục vào loss huấn luyện.
Bằng cách tăng cường giám sát cho các mục tiêu nhỏ, STAL cải thiện độ ổn định khi học và hiệu suất phát hiện trong các kịch bản mà các đối tượng nhỏ hoặc ở xa rất phổ biến. Cải tiến này đặc biệt quan trọng đối với các ứng dụng edge-first YOLO26 như hình ảnh trên không, người máy (robotics) và các hệ thống Internet of Things (IoT), nơi các đối tượng thường nhỏ, ở xa hoặc chỉ nhìn thấy một phần và việc phát hiện đáng tin cậy là rất quan trọng.
Ultralytics YOLO26 giới thiệu bộ tối ưu hóa MuSGD#
Để hỗ trợ quá trình huấn luyện ổn định và có thể dự đoán được hơn, Ultralytics YOLO26 cũng giới thiệu một bộ tối ưu hóa mới gọi là MuSGD. Bộ tối ưu hóa này được thiết kế để cải thiện sự hội tụ và độ tin cậy trong huấn luyện ở các mô hình phát hiện end-to-end, đặc biệt là khi kích thước mô hình và độ phức tạp huấn luyện tăng lên.
Để một mạng nơ-ron có thể học, và do đó thay đổi trọng số tương ứng trong quá trình huấn luyện, chúng ta tính toán một lỗi (còn gọi là "loss"). Do đó, mô hình đo lường mức độ sai sót của các dự đoán bằng cách sử dụng giá trị loss, tính toán độ dốc (gradient) cho biết các tham số của nó nên thay đổi như thế nào, và sau đó cập nhật các tham số đó để giảm thiểu lỗi. Stochastic Gradient Descent (SGD) là một trình tối ưu hóa được sử dụng rộng rãi thực hiện các cập nhật này, giúp quá trình huấn luyện hiệu quả và có thể mở rộng.

Hình 3. Stochastic gradient descent so với gradient descent (Nguồn)
MuSGD xây dựng trên nền tảng quen thuộc này bằng cách kết hợp các ý tưởng tối ưu hóa lấy cảm hứng từ Muon, một phương pháp được sử dụng trong huấn luyện mô hình ngôn ngữ lớn. Những ý tưởng này chịu ảnh hưởng bởi các tiến bộ gần đây như Kimi K2 của Moonshot AI, vốn đã chứng minh hành vi huấn luyện được cải thiện thông qua các bản cập nhật tham số có cấu trúc hơn.
Ultralytics YOLO26 sử dụng chiến lược cập nhật lai. Một số tham số được cập nhật bằng cách sử dụng kết hợp các bản cập nhật lấy cảm hứng từ Muon và SGD, trong khi các tham số khác chỉ sử dụng SGD. Điều này giúp YOLO26 có thể đưa thêm cấu trúc vào quá trình tối ưu hóa trong khi vẫn duy trì các đặc tính về độ mạnh mẽ và khả năng tổng quát hóa giúp SGD trở nên hiệu quả.
Kết quả là quá trình tối ưu hóa mượt mà hơn, hội tụ nhanh hơn, và hành vi huấn luyện dễ dự đoán hơn trên các kích thước model, làm cho MuSGD trở thành một phần cốt lõi lý giải tại sao Ultralytics YOLO26 dễ huấn luyện hơn và đáng tin cậy hơn ở quy mô lớn.
Ý nghĩa các cải tiến huấn luyện của Ultralytics YOLO26#
Các cải tiến huấn luyện của Ultralytics YOLO26, kết hợp với các tính năng chính như thiết kế end-to-end, không NMS và ưu tiên thiết bị biên, làm cho mô hình dễ huấn luyện hơn và đáng tin cậy hơn ở quy mô lớn. Bạn có thể tự hỏi điều đó thực sự có ý nghĩa gì đối với các ứng dụng thị giác máy tính.

Hình 4. Cái nhìn về các tính năng chính của YOLO26 (Nguồn)
Trong thực tế, nó giúp việc đưa thị giác máy tính đến nơi nó thực sự chạy trở nên dễ dàng hơn nhiều. Các mô hình huấn luyện có thể dự đoán được hơn, mở rộng nhất quán hơn trên các kích thước và đơn giản hơn để thích ứng với các tập dữ liệu mới. Điều này làm giảm ma sát giữa thử nghiệm và triển khai, đặc biệt là trong các môi trường mà độ tin cậy và hiệu suất quan trọng ngang với hiệu năng thô.
Ví dụ, trong các ứng dụng robotics và thị giác máy tính công nghiệp, các model thường cần được huấn luyện lại thường xuyên khi môi trường, cảm biến hoặc tác vụ thay đổi. Với Ultralytics YOLO26, các nhóm có thể lặp lại nhanh hơn mà không phải lo lắng về các lần huấn luyện không ổn định hoặc hành vi thiếu nhất quán giữa các kích thước model.
Các điểm chính cần lưu ý#
Các hệ thống thị giác máy tính đáng tin cậy phụ thuộc vào cách model được huấn luyện cũng nhiều như cách chúng hoạt động tại thời điểm suy luận. Bằng cách cải thiện cách cân bằng các tín hiệu học tập, cách xử lý các đối tượng nhỏ, và cách quá trình tối ưu hóa tiến triển, Ultralytics YOLO26 làm cho việc huấn luyện trở nên ổn định hơn và dễ mở rộng quy mô hơn. Sự tập trung vào việc huấn luyện đáng tin cậy này giúp các nhóm chuyển đổi mượt mà hơn từ thử nghiệm sang triển khai thực tế, đặc biệt là trong các ứng dụng hướng đến edge.
Bạn muốn tìm hiểu về AI? Hãy truy cập GitHub repository của chúng tôi để khám phá thêm. Tham gia cộng đồng năng động của chúng tôi và tìm hiểu về các đổi mới trong các lĩnh vực như AI trong logistics và vision AI trong ngành công nghiệp ô tô. Để bắt đầu với computer vision ngay hôm nay, hãy xem các tùy chọn cấp phép của chúng tôi.






