RTM là công ty AI công nghiệp có trụ sở tại Seoul. Đơn vị thị giác của RTM xây dựng hệ thống giám sát an toàn hỗ trợ bằng AI cho các địa điểm manufacturing: các camera đã được lắp đặt sẵn trên sàn nhà máy được giám sát suốt ngày đêm bởi các mô hình Ultralytics YOLO26 để phát hiện người, các trường hợp té ngã, xâm nhập vùng nguy hiểm, hỏa hoạn hoặc khói, chạy trên bất kỳ PC nào mà khách hàng đang có sẵn, từ đồ họa tích hợp cho đến GPU rời.
Giám sát những chiếc camera không có ai theo dõi#
Các tai nạn công nghiệp thường xảy ra ở khoảng trống không có ai bao quát. Các nhà máy đã có camera trên mọi dây chuyền, nhưng không ai có thể theo dõi mọi luồng dữ liệu vào mọi thời điểm. RTM đã xây dựng một hệ thống để thực hiện việc này liên tục: mỗi kênh camera chạy hai mô hình Ultralytics YOLO26, một mô hình được huấn luyện để phát hiện con người và một mô hình phát hiện hỏa hoạn và khói, cấp dữ liệu cho tầng sự kiện tất định để đưa ra cảnh báo về các trường hợp công nhân té ngã và xâm nhập vùng nguy hiểm.
Trong sáu tháng qua, giải pháp AI an toàn công nghiệp của RTM đã được triển khai 24/7 hoặc đang được đánh giá tại chỗ tại 21 công ty sản xuất trải dài trên các lĩnh vực sản xuất thép, pin, hóa chất và nhựa, thực phẩm và robot. Được kết nối với hệ thống CCTV hiện có, hệ thống phát hiện khi công nhân bước vào vùng nguy hiểm hoặc bị té ngã, đồng thời kích hoạt cảnh báo thông qua các hệ thống nội bộ hoặc, thông qua tích hợp PLC, điều khiển trực tiếp thiết bị nhà máy được kết nối.
Hình 1. Nguồn cấp dữ liệu trực tiếp về việc phát hiện té ngã của RTM tận dụng Ultralytics YOLO. (Nguồn hình ảnh: RTM)
Giải quyết bài toán về phần cứng mà không ai muốn mua#
Giám sát an toàn phải cạnh tranh với lựa chọn không cài đặt bất kỳ thứ gì. Nếu một hệ thống yêu cầu phần cứng máy chủ mới trước khi có thể giám sát dù chỉ một camera, quá trình đánh giá thường dừng lại trước khi bắt đầu. Tình trạng hiện tại đối với các nhà sản xuất là sự lựa chọn giữa phần cứng chuyên dụng đắt tiền và hoàn toàn không có giám sát tự động.
RTM bắt đầu với mục tiêu loại bỏ sự đánh đổi đó: một bản triển khai duy nhất chạy trên bất kỳ PC nào đang có sẵn trong phòng điều khiển, từ đồ họa tích hợp của Intel cho đến card NVIDIA RTX 3090, mà không cần bản dựng riêng cho từng địa điểm.
Để đạt được điều đó, RTM xuất cả hai mô hình YOLO26 sang ONNX ở hình dạng cố định và chạy các mô hình thông qua ONNX Runtime trên năm nhà cung cấp thực thi: TensorRT, CUDA, OpenVINO, DirectML và CPU. Khi khởi động, thư viện suy luận phát hiện nhà cung cấp GPU được cài đặt và tự động chọn chuỗi nhà cung cấp phù hợp, do đó cùng một tệp 36 MB cho mỗi mô hình chạy mà không cần sửa đổi cho dù máy đích không có GPU rời hay sở hữu card cao cấp. Không có sự phụ thuộc vào Python hay PyTorch trong ứng dụng được triển khai và không có luồng phát hành riêng theo từng nhà cung cấp cần duy trì.
Phần đầu dò phát hiện đầu cuối (end-to-end) của YOLO26 đã làm cho phương pháp tiếp cận một cấu phần duy nhất đó trở nên thiết thực: vì mô hình xuất ra các kết quả phát hiện cuối cùng trực tiếp, tầng suy luận C++ của RTM chỉ cần ngưỡng độ tin cậy và phép biến đổi nghịch đảo letterbox, không cần thuật toán NMS để tái triển khai và không có khoảng cách tương thích cần gỡ lỗi giữa đường dẫn huấn luyện Python và đường dẫn triển khai C++, một loại lỗi thường xuất hiện bất cứ khi nào một bộ dò vượt qua ranh giới ngôn ngữ.
Những gì GPU mang lại, được đo lường cụ thể#
RTM đã đo đạc chuẩn cả hai mô hình YOLO26-small (người và hỏa hoạn/khói) ở hai độ phân giải đầu vào trên card NVIDIA RTX 3090 (ONNX Runtime 1.26.0, nhà cung cấp thực thi CUDA, FP32, batch 1, chỉ chạy chuyển tiếp). Ở độ phân giải 640×640, mô hình phát hiện người chạy ở mức 4,20 ms mỗi khung hình và mô hình hỏa hoạn/khói ở mức 4,34 ms; ở độ phân giải 1280×1280, cả hai đều tăng lên khoảng 12,5 ms, với bộ nhớ GPU tăng từ 406 MB lên 1.302 MB. Điều đó làm cho độ phân giải 640×640 có chi phí trên mỗi khung hình rẻ hơn khoảng 2,9 lần và nhẹ hơn 3,2 lần về bộ nhớ, trong khi đầu vào lớn hơn giúp cải thiện khả năng phát hiện các đối tượng nhỏ, ở xa. RTM xuất xưởng 640×640 làm mặc định và giữ cho bản xuất 1280×1280 khả dụng cho các địa điểm có dư lượng GPU để dành cho biên độ phát hiện thay vì số lượng kênh.
Chuyển từ CUDA ở định dạng FP32 sang TensorRT ở định dạng FP16 đã cắt giảm tổng chi phí trên mỗi khung hình cho cả hai mô hình từ 8,68 ms xuống 6,26 ms, tương đương mức giảm 28%, đạt khoảng 39,9 FPS trên bốn kênh trên một GPU duy nhất thay vì 28.8 FPS. RTM đã xác minh rằng việc chuyển đổi sang FP16 không làm giảm độ chính xác trước khi xuất xưởng: chỉ số recall không thay đổi qua mọi nhóm kích thước đối tượng và ở cấp độ sự kiện cho cả hỏa hoạn lẫn khói. Trong ứng dụng được triển khai, một máy đạt thông số kỹ thuật khuyến nghị (Intel Core i7 dòng 16 lõi trở lên, RAM 32GB, RTX 5060 8GB trở lên) duy trì 6 kênh đồng thời, trong khi máy cấu hình thấp chỉ có đồ họa tích hợp vẫn duy trì được 1 kênh, so với mức trần sản phẩm là 10 kênh cho mỗi thiết bị.
Tại sao lại tận dụng Ultralytics YOLO26?#
RTM huấn luyện mô hình phát hiện người và mô hình phát hiện hỏa hoạn/khói thông qua cùng một cơ sở mã huấn luyện Ultralytics, và hai mô hình này chia sẻ 352 dòng mã mà không hề có sự rẽ nhánh theo miền cụ thể nào. Điểm duy nhất thay đổi giữa một bộ dò tìm kiếm con người và một bộ dò tìm kiếm hỏa hoạn là tệp cấu hình: kích thước đầu vào, số vòng lặp (epochs), tốc độ học và thành phần tập dữ liệu. Đó là kết quả trực tiếp từ cách Ultralytics YOLO được xây dựng. Một kiến trúc và API huấn luyện duy nhất, nhất quán trên các detection tasks có nghĩa là một miền phát hiện mới chỉ là một thay đổi cấu hình thay vì một đường ống mới, chính điều này đã cho phép một đội ngũ kỹ thuật nhỏ xây dựng hai mô hình đạt chuẩn sản xuất mà không cần phải duy trì hai cơ sở mã.
Sự nhất quán tương tự đó đã khiến việc chuyển đổi sang YOLO26 có rủi ro thấp. RTM đã áp dụng YOLO26 bốn ngày sau khi bắt đầu dự án, vào tháng 5 năm 2026, và quá trình di chuyển đòi hỏi số dòng mã huấn luyện hiện có phải thay đổi bằng không, chỉ cần một tệp điểm kiểm tra (checkpoint) khác. Vì Ultralytics duy trì giao diện huấn luyện ổn định qua các thế hệ mô hình, việc nâng cấp lên kiến trúc mới nhất không đồng nghĩa với việc phải viết lại một đường ống mà RTM đã xây dựng và thử nghiệm.
"Ngay cả trên cùng một tập dữ liệu, kích thước đầu vào và việc tăng cường dữ liệu vẫn thay đổi hiệu suất của mô hình. Với Ultralytics, tất cả những điều đó nằm trong một tệp cấu hình duy nhất, vì vậy chúng tôi thay đổi một vài giá trị, chạy một số biến thể song song và chọn ra biến thể tốt nhất. Chúng tôi không bao giờ phải chạm vào mã nguồn cho bất kỳ công đoạn nào trong số đó, vì vậy việc xếp hàng mười lần chạy cũng có nhiều công sức tương đương với việc chạy một lần." - Kỹ sư AI, RTM
Sự ổn định đó đã mang lại kết quả xứng đáng về độ chính xác. Việc hợp nhất chương trình huấn luyện tuần tự năm giai đoạn thành một lần chạy chung duy nhất đã cải thiện chỉ số validation mAP50 từ 0,672 lên 0,689 ở ngưỡng hoạt động không đổi, một mức tăng mà RTM có thể đạt được đơn giản bằng cách huấn luyện lại trên cùng kiến trúc YOLO26 thay vì thiết kế lại mô hình. Và vì YOLO26 xuất khẩu gọn gàng thành một cấu phần ONNX có hình dạng cố định với các ngưỡng phát hiện đi kèm dưới dạng tệp phụ trợ thay vì được biên dịch vào ứng dụng, hiện trường đã hấp thụ mức tăng độ chính xác đó bằng cách hoán đổi một tệp ONNX mà không cần bất kỳ thay đổi nào đối với ứng dụng máy chủ. Đó là điều cho phép một đội ngũ kỹ thuật nhỏ đẩy các bản cập nhật mô hình đến mọi địa điểm mà không cần một bản phát hành được phối hợp, và đó là hệ quả trực tiếp của việc xây dựng dựa trên YOLO26 thay vì một kiến trúc tùy chỉnh riêng.
Những gì nằm phía trên quá trình phát hiện#
Các cảnh báo của RTM không phải là kết quả phát hiện thô: một người xuất hiện trong khung hình chưa phải là một sự kiện, nhưng một người đã ngã xuống và nằm bất động thì đúng là một sự kiện. Một tầng sự kiện tất định nằm phía trên hai mô hình YOLO26, kết hợp việc theo dõi, trạng thái tư thế, thành phần vùng và cơ chế bỏ phiếu cửa sổ trượt trước khi bất kỳ cảnh báo nào được kích hoạt. Giữ cho logic đó tách biệt với mô hình chính là yếu tố cho phép một mô hình phát hiện người phục vụ mọi địa điểm, bất chấp chiều cao camera, góc quay và ánh sáng thay đổi rất nhiều giữa các nhà máy khác nhau. Điều này cũng có nghĩa là các hành vi an toàn mới có thể tái sử dụng các kết quả phát hiện hiện có: RTM hiện đang xây dựng hệ thống giám sát tuân thủ thiết bị bảo hộ cá nhân (PPE) trên cùng một đầu ra phát hiện con người, không cần mô hình mới và không yêu cầu phần cứng mới trên các địa điểm được trang bị GPU.
Tác động tổng thể#
Tác động thể hiện rõ nhất ở những khách hàng tích hợp robot cộng tác (cobot) của RTM, những đơn vị cung cấp và lắp đặt cobot khắp các nhà máy và từ lâu đã phải đối mặt với tình trạng công nhân va chạm với robot mặc dù đã có hàng rào an toàn vật lý hoặc bằng laser. Với hệ thống của RTM, việc xâm nhập vùng nguy hiểm được phát hiện và lập tức kích hoạt lệnh dừng được kết nối PLC trên robot mà không có độ trễ, và những nhà tích hợp này kể từ đó đã áp dụng hệ thống này làm thiết bị an toàn mặc định thay cho hàng rào vật lý.
Một khách hàng sản xuất thép báo cáo rằng khả năng điều chỉnh các kịch bản phát hiện cho phù hợp với các địa điểm khác nhau của Ultralytics YOLO đã giúp họ cắt giảm hơn 100 nhân viên giám sát an toàn trước đây thường đi tuần tra trên sàn nhà máy. Nói một cách rộng hơn, các nhà sản xuất mô tả giải pháp của RTM là giải pháp dễ lắp đặt nhất và tiết kiệm chi phí nhất trong số các lựa chọn giám sát an toàn mà họ đã đánh giá, với tính năng phát hiện vùng nguy hiểm, té ngã và hỏa hoạn/khói đáp ứng những gì họ cần nhất.
Mở rộng quy mô xa hơn trên cùng các mô hình#
Bước tiếp theo của RTM là phát hiện tuân thủ PPE, được xây dựng hoàn toàn dựa trên đầu ra phát hiện con người hiện có. Không có mô hình mới nào cần huấn luyện, và tại các địa điểm có dư lượng GPU, không có phần cứng mới nào cần lắp đặt. Khi việc triển khai tiếp tục diễn ra trên các địa điểm sản xuất bổ sung và các tầng phần cứng, bản xuất ONNX đơn lẻ cho mỗi mô hình vẫn tiếp tục gánh vác khối lượng công việc, từ chiếc PC đồ họa tích hợp cấu hình thấp nhất cho đến máy chủ GPU cao cấp nhất trên sàn nhà máy.
Bạn quan tâm đến việc tự xây dựng các giải pháp Thị giác Máy tính (Computer Vision) của riêng mình? Hãy khám phá các Ultralytics YOLO models của chúng tôi, xem cách chúng được sử dụng across industries, bao gồm computer vision in manufacturing, và xem xét các licensing options để bắt đầu.










