RTM — это базирующаяся в Сеуле промышленная компания в сфере ИИ. Ее подразделение компьютерного зрения создает системы мониторинга безопасности на базе ИИ для производственных объектов: камеры, уже установленные на территории завода, круглосуточно просматриваются моделями Ultralytics YOLO26, которые обнаруживают людей, падения, вторжения в опасные зоны, а также огонь или дым, работая на любом ПК, который уже есть у клиента — от интегрированной графики до дискретного GPU.
Наблюдение за камерами, за которыми никто не следит#
Промышленные аварии обычно происходят в слепых зонах, которые никто не контролирует. На заводах уже установлены камеры на каждой линии, но ни один человек не способен следить за всеми трансляциями одновременно. Компания RTM создала систему для непрерывного выполнения этой задачи: каждый канал с камеры задействует две модели Ultralytics YOLO26, одна из которых обучена обнаружению людей, а другая — огня и дыма, передавая данные на детерминированный уровень событий, который поднимает тревогу при падении работников и вторжении в опасные зоны.
За последние шесть месяцев решение RTM для промышленной безопасности на базе ИИ было внедрено в режиме 24/7 или проходит оценку на объектах 21 производственной компании, охватывающих металлургию, производство батарей, химическую и пластиковую промышленность, пищевое производство и робототехнику. Подключенная к существующим системам видеонаблюдения, система обнаруживает момент входа работника в опасную зону или его падение, а также инициирует оповещения через внутренние системы или, посредством интеграции с ПЛК, напрямую управляет подключенным заводским оборудованием.
Рис. 1. Прямая трансляция обнаружения падений RTM с использованием Ultralytics YOLO. (Источник изображения: RTM)
Решение проблемы с аппаратным обеспечением, которое никто не хочет покупать#
Мониторинг безопасности конкурирует с вариантом не устанавливать ничего. Если для работы системы требуется новое серверное оборудование перед началом наблюдения хотя бы за одной камерой, оценка часто прекращается еще до того, как она началась. Статус-кво для производителей долгое время сводился к выбору между дорогим специализированным оборудованием и полным отсутствием автоматизированного мониторинга.
Компания RTM поставила перед собой задачу устранить этот компромисс: единое развертывание, работающее на любом ПК, который уже находится в диспетчерской — от интегрированной графики Intel до NVIDIA RTX 3090, без необходимости создания отдельных сборки под каждый конкретный объект.
Чтобы достичь этого, RTM экспортирует обе модели YOLO26 в формате ONNX с фиксированной формой (static shape) и запускает их через ONNX Runtime на пяти исполнительных провайдерах: TensorRT, CUDA, OpenVINO, DirectML и CPU. При запуске библиотека инференса определяет установленного производителя графического процессора и автоматически выбирает нужную цепочку провайдеров, поэтому один и тот же файл размером 36 МБ для каждой модели работает без модификаций независимо от того, оснащена целевая машина дискретным GPU или высококлассной видеокартой. В развернутом приложении отсутствуют зависимости от Python или PyTorch, а также необходимость поддерживать отдельные релизные ветки для каждого производителя железа.
Детекционная голова end-to-end в YOLO26 сделала такой подход с единственным артефактом практичным: поскольку модель выдает финальные детекции напрямую, C++ слой инференса RTM нуждается лишь в пороге уверенности (confidence threshold) и обратном преобразовании letterbox, без необходимости перереализовывать NMS (Non-Maximum Suppression) и устранять разрывы паритета для отладки между путем обучения на Python и развертыванием на C++, то есть класс ошибок, который обычно возникает при пересечении языковых границ детектором.
Что дает GPU в цифрах#
RTM провела бенчмарки обеих моделей YOLO26-small (для людей и для огня/дыма) при двух входных разрешениях на базе NVIDIA RTX 3090 (ONNX Runtime 1.26.0, исполнительный провайдер CUDA, FP32, batch 1, только прямой проход). При разрешении 640×640 модель для людей работает за 4,20 мс на кадр, а модель для огня и дыма — за 4,34 мс; при 1280×1280 обе модели замедляются примерно до 12,5 мс, при этом потребление памяти GPU возрастает с 406 МБ до 1302 МБ. Это делает разрешение 640×640 примерно в 2,9 раза дешевле в расчете на один кадр и в 3,2 раза менее требовательным к памяти, в то время как более крупный размер входных данных улучшает обнаружение мелких и удаленных объектов. RTM поставляет разрешение 640×640 по умолчанию и сохраняет возможность экспорта в 1280×1280 доступной для объектов, у которых есть запас производительности GPU, направляемый на увеличение точности детекции вместо наращивания числа каналов.
Переход с CUDA на FP32 к TensorRT на FP16 сократил суммарные затраты на кадр для обеих моделей с 8,68 мс до 6,26 мс, что составляет сокращение на 28%, эквивалентное примерно 39,9 кадрам в секунду (FPS) на четырех каналах на одном GPU вместо 28,8 FPS. Компания RTM перед отправкой продукта убедилась, что конвертация в FP16 не стоила ни единого процента точности: показатель полноты (recall) остался неизменным во всех бакетах размеров объектов и на уровне событий как для огня, так и для дыма. В развернутом приложении машина рекомендуемой спецификации (Intel Core i7 16-ядерного класса или выше, 32 ГБ ОЗУ, RTX 5060 8 ГБ или мощнее) поддерживает 6 одновременных каналов, тогда как маломощная машина только со встроенной графикой все еще выдерживает 1 канал при общем пределе продукта в 10 каналов на один блок.
Почему стоит задействовать Ultralytics YOLO26?#
RTM обучает свой детектор людей и детектор огня/дыма через единую кодовую базу обучения Ultralytics, причем обе модели разделяют 352 строки кода вообще без ветвлений под конкретные домены. Единственное, что меняется между детектором для наблюдения за людьми и детектором для наблюдения за огнем — это файл конфигурации: размер входа, эпохи, скорость обучения (learning rate) и состав датасета. Это прямой результат того, как устроена Ultralytics YOLO. Единая и последовательная архитектура и API обучения для задач детекции означают, что новый домен обнаружения сводится к изменению конфига, а не к созданию нового пайплайна, что и позволило небольшой инженерной команде запустить две модели производственного уровня без необходимости поддерживать две раздельные кодовые базы.
Та же последовательность сделала переход на YOLO26 малорискованным. RTM приняла YOLO26 через четыре дня после начала проекта, в мае 2026 года, и миграция потребовала нулевых изменений в существующем коде обучения — понадобился лишь другой файл чекпоинта. Поскольку Ultralytics сохраняет интерфейс обучения стабильным между поколениями моделей, обновление до новейшей архитектуры не означало необходимость переписывания пайплайна, который RTM уже успела построить и протестировать.
"Даже на одном и том же датасете размер входа и аугментация влияют на то, насколько хорошо работает модель. В Ultralytics все это содержится в одном конфигурационном файле, поэтому мы меняем несколько значений, запускаем несколько вариантов параллельно и выбираем лучший. Нам никогда не приходится трогать код для чего-либо из этого, поэтому выстраивание в ряд десяти запусков отнимает примерно столько же сил, сколько запуск одного." — Инженер по ИИ, RTM
Эта стабильность окупилась и в отношении точности. Консолидация пятиэтапного последовательного учебного курса в единый совместный запуск улучшила валидационный mAP50 с 0,672 до 0,689 при неизменном операционном пороге — прирост, который RTM получила просто за счет переобучения на той же архитектуре YOLO26 без редизайна самой модели. А поскольку YOLO26 чисто экспортируется в ONNX-артефакт с фиксированной формой, где пороговые значения детекции поставляются в виде сопутствующего файла, а не компилируются в приложение, эксплуатационная среда поглотила этот прирост точности путем простой замены одного файла ONNX вообще без каких-либо изменений хост-приложения. Именно это позволяет небольшой инженерной команде доставлять обновления моделей на каждый объект без координированного релиза, что является прямым следствием создания продукта на bazie YOLO26, а не заказной архитектуры.
Что находится над детекцией#
Тревоги RTM — это не сырые детекции: человек в кадре сам по себе не является событием, но человек, который упал и не поднялся — да. Детерминированный уровень событий располагается поверх двух моделей YOLO26, объединяя трекинг, состояние позы, принадлежность к зоне и голосование по скользящему окну до того, как сработает какая-либо тревога. Сохранение этой логики отдельно от модели позволяет одному детектору людей обслуживать любой объект, несмотря на колоссальные различия в высоте камер, углах обзора и освещении от завода к заводу. Это также означает, что новые сценарии безопасности могут повторно использовать существующие детекции: сейчас RTM строит мониторинг соблюдения СИЗ на базе того же вывода детекции людей без создания новой модели и без необходимости приобретать новое аппаратное обеспечение на объектах, оснащенных GPU.
Общий эффект#
Наиболее ярко эффект проявляется у клиентов RTM, занимающихся интеграцией коллаборативных роботов, которые поставляют и устанавливают коботы на заводах и долгое время сталкивались с проблемой столкновения работников с роботами вопреки физическим или лазерным защитным ограждениям. С помощью системы RTM вторжение в опасную зону обнаруживается и немедленно инициирует связанную с ПЛК остановку робота без каких-либо задержек, и с тех пор эти интеграторы приняли ее в качестве своего стандартного устройства безопасности вместо физических ограждений.
Клиент из сферы металлургического производства сообщил, что способность Ultralytics YOLO адаптировать сценарии обнаружения под различные площадки позволила сократить более 100 сотрудников мониторинга безопасности, которые ранее патрулировали цеха. В более широком смысле производители описывают решение RTM как самое простое в установке и наиболее экономически эффективное среди оценивавшихся ими вариантов мониторинга безопасности, при этом обнаружение опасных зон, падений, а также огня и дыма покрывает их основные потребности.
Дальнейшее масштабирование на тех же моделях#
Следующим шагом для RTM является обнаружение соблюдения СИЗ, построенное полностью на базе существующего вывода детекции людей. Никаких новых моделей для обучения, а на объектах с запасом производительности GPU — никакого нового оборудования для установки. По мере продолжения развертывания на дополнительных производственных площадках и различных уровнях оборудования тот же единственный экспорт ONNX для каждой модели продолжает справляться с нагрузкой, начиная с ПК с интегрированной графикой нижнего уровня и заканчивая мощнейшим GPU-сервером в цехе.
Хотите создать собственные решения компьютерного зрения? Изучите наши модели Ultralytics YOLO, посмотрите, как они применяются в различных отраслях, включая компьютерное зрение в производстве, и ознакомьтесь с вариантами лицензирования, чтобы начать работу.










