RTM est une entreprise d'IA industrielle basée à Séoul. Son unité de vision construit une surveillance de la sécurité alimentée par l'IA pour les sites de fabrication : des caméras déjà montées sur le sol de l'usine sont surveillées 24 heures sur 24 par des modèles Ultralytics YOLO26 qui détectent les personnes, les chutes, les intrusions en zone dangereuse, ainsi que le feu ou la fumée, en s'exécutant sur n'importe quel PC dont le client dispose déjà, des graphiques intégrés jusqu'à un GPU discret.
Surveiller les caméras que personne ne surveille#
Les accidents industriels ont tendance à se produire dans l'angle mort que personne ne couvre. Les usines ont déjà des caméras sur chaque ligne, mais personne ne peut surveiller chaque flux à tout moment. RTM a construit un système pour le faire en continu : chaque canal de caméra exécute deux modèles Ultralytics YOLO26, l'un entraîné pour la détection des personnes et l'autre pour le feu et la fumée, alimentant une couche d'événements déterministe qui déclenche des alarmes pour les chutes de travailleurs et les intrusions en zone dangereuse.
Au cours des six derniers mois, la solution d'IA de sécurité industrielle de RTM a été déployée 24 h/24 et 7 j/7 ou fait l'objet d'une évaluation sur site dans 21 entreprises manufacturières couvrant la fabrication de l'acier, des batteries, des produits chimiques et plastiques, de l'agroalimentaire et de la robotique. Connecté à la vidéosurveillance existante, le système détecte lorsqu'un travailleur entre dans une zone dangereuse ou chute, et déclenche des alertes par le biais de systèmes internes ou, via une intégration PLC, contrôle directement l'équipement d'usine connecté.
Fig 1. Flux en direct de détection de chute par RTM exploitant Ultralytics YOLO. (Source de l'image : RTM)
Résoudre le problème du matériel que personne ne veut acheter#
La surveillance de la sécurité est en concurrence avec l'option de ne rien installer. Si un système nécessite un nouveau matériel serveur avant de pouvoir surveiller une seule caméra, l'évaluation s'arrête souvent avant même d'avoir commencé. Le statu quo pour les fabricants a longtemps été un choix entre du matériel dédié coûteux et aucune surveillance automatisée.
RTM a entrepris d'éliminer ce compromis : un déploiement unique qui s'exécute sur n'importe quel PC déjà présent dans la salle de contrôle, des graphiques intégrés Intel jusqu'à une carte NVIDIA RTX 3090, sans nécessiter de version spécifique par site.
Pour y parvenir, RTM exporte les deux modèles YOLO26 vers ONNX à une forme statique et les exécute via ONNX Runtime sur cinq fournisseurs d'exécution : TensorRT, CUDA, OpenVINO, DirectML et CPU. Au démarrage, la bibliothèque d'inférence détecte le fournisseur de GPU installé et sélectionne automatiquement la chaîne de fournisseurs appropriée, de sorte que le même fichier de 36 Mo par modèle s'exécute sans modification, que la machine cible ne possède aucun GPU discret ou dispose d'une carte haut de gamme. Il n'y a aucune dépendance Python ou PyTorch dans l'application déployée et aucun cycle de publication par fournisseur à maintenir.
La tête de détection de bout en bout de YOLO26 a rendu cette approche à artefact unique pratique : étant donné que le modèle produit directement les détections finales, la couche d'inférence C++ de RTM a seulement besoin d'un seuil de confiance et d'une transformation inverse letterbox, sans NMS à réimplémenter et sans écart de parité à déboguer entre le chemin d'entraînement Python et le chemin de déploiement C++, un type de bogue qui apparaît généralement chaque fois qu'un détecteur franchit les frontières des langages.
Ce qu'un GPU apporte, mesuré#
RTM a évalué les deux modèles YOLO26 small (personne et feu/fumée) à deux résolutions d'entrée sur une carte NVIDIA RTX 3090 (ONNX Runtime 1.26.0, fournisseur d'exécution CUDA, FP32, batch 1, passe avant uniquement). À 640×640, le modèle de personne s'exécute en 4,20 ms par image et le modèle de feu/fumée en 4,34 ms ; à 1280×1280, les deux passent à environ 12,5 ms, la mémoire du GPU passant de 406 Mo à 1 302 Mo. Cela rend la résolution 640×640 environ 2,9 fois moins coûteuse par image et 3,2 fois plus légère en mémoire, tandis que l'entrée plus grande améliore la détection des petits objets éloignés. RTM propose 640×640 par défaut et maintient l'exportation 1280×1280 disponible pour les sites qui disposent d'une marge de manœuvre GPU à consacrer à la marge de détection plutôt qu'au nombre de canaux.
Passer de CUDA en FP32 à TensorRT en FP16 a réduit le coût combiné par image pour les deux modèles de 8,68 ms à 6,26 ms, soit une réduction de 28 %, ce qui équivaut à environ 39,9 FPS sur quatre canaux avec un seul GPU au lieu de 28,8 FPS. RTM a vérifié que la conversion FP16 n'avait aucun impact sur la précision avant de la déployer : le rappel est resté inchangé pour chaque catégorie de taille d'objet et au niveau des événements pour le feu et la fumée. Dans l'application déployée, une machine aux spécifications recommandées (un processeur Intel Core i7 de 16 cœurs ou supérieur, 32 Go de RAM, RTX 5060 8 Go ou plus) prend en charge 6 canaux simultanés, tandis qu'une machine d'entrée de gamme dotée uniquement de graphiques intégrés en prend tout de même en charge 1, pour un plafond de produit de 10 canaux par boîtier.
Pourquoi exploiter Ultralytics YOLO26 ?#
RTM entraîne son détecteur de personnes et son détecteur de feu/fumée via la même base de code d'entraînement Ultralytics, et les deux partagent 352 lignes de code sans aucune ramification spécifique au domaine. La seule chose qui change entre un détecteur surveillant des personnes et un détecteur surveillant le feu est un fichier de configuration : taille d'entrée, époques, taux d'apprentissage et composition du dataset. C'est le résultat direct de la conception d'Ultralytics YOLO. Une architecture et une API d'entraînement uniques et cohérentes à travers les tâches de détection signifient qu'un nouveau domaine de détection se résume à une modification de configuration plutôt qu'à un nouveau pipeline, ce qui a permis à une petite équipe d'ingénieurs de mettre en place deux modèles de qualité production sans avoir à maintenir deux bases de code.
Cette même cohérence a rendu le passage à YOLO26 lui-même peu risqué. RTM a adopté YOLO26 quatre jours après le début du projet, en mai 2026, et la migration a nécessité de modifier zéro ligne de code d'entraînement existant, simplement un point de contrôle (checkpoint) différent. Étant donné qu'Ultralytics maintient l'interface d'entraînement stable d'une génération de modèles à l'autre, la mise à niveau vers la plus récente architecture n'a pas signifié réécrire un pipeline que RTM avait déjà construit et testé.
"Même sur le même dataset, la taille d'entrée et l'augmentation modifient les performances du modèle. Avec Ultralytics, tout cela se trouve dans un seul fichier de configuration, nous modifions donc quelques valeurs, exécutons plusieurs variations côte à côte et prenons la meilleure. Nous ne touchons jamais au code pour tout cela, donc aligner dix exécutions demande à peu près autant de travail que d'en exécuter une seule." - Ingénieur en IA, RTM
Cette stabilité s'est également avérée payante en termes de précision. La consolidation d'un cursus d'entraînement séquentiel en cinq étapes en une seule exécution conjointe a amélioré le mAP50 de validation de 0,672 à 0,689 à seuil de fonctionnement inchangé, un gain que RTM a pu engranger simplement en réentraînant sur la même architecture YOLO26 plutôt qu'en redessinant le modèle. Et parce que YOLO26 s'exporte proprement vers un artefact ONNX à forme fixe avec des seuils de détection fournis sous forme de fichier annexe plutôt que compilés dans l'application, le terrain a absorbé ce gain de précision en échangeant un seul fichier ONNX, sans aucune modification de l'application hôte. C'est ce qui permet à une petite équipe d'ingénieurs de pousser des mises à jour de modèles sur chaque site sans publication coordonnée, et c'est la conséquence directe d'une construction sur YOLO26 plutôt que sur une architecture sur mesure.
Ce qui se trouve au-dessus de la détection#
Les alarmes de RTM ne sont pas des détections brutes : une personne dans le cadre n'est pas un événement, mais une personne qui est tombée et est restée au sol en est un. Une couche d'événements déterministe se trouve au-dessus des deux modèles YOLO26, combinant le suivi, l'état de la posture, l'appartenance à une zone et un vote à fenêtre glissante avant qu'une alarme ne se déclenche. Garder cette logique séparée du modèle est ce qui permet à un seul détecteur de personnes de servir tous les sites, malgré la hauteur, l'angle et l'éclairage des caméras qui varient énormément d'une usine à l'autre. Cela signifie également que de nouveaux comportements de sécurité peuvent réutiliser les détections existantes : RTM construit actuellement une surveillance de la conformité EPI sur la même sortie de détection de personnes, sans nécessiter de nouveau modèle ni de nouveau matériel sur les sites équipés de GPU.
L'impact global#
L'impact apparaît plus clairement chez les clients d'intégration de robots collaboratifs de RTM, qui fournissent et installent des cobots dans les usines et ont longtemps dû faire face à des travailleurs entrant en collision avec des robots malgré des clôtures de sécurité physiques ou laser. Avec le système de RTM, l'intrusion en zone dangereuse est détectée et déclenche immédiatement un arrêt connecté au PLC sur le robot sans délai, et ces intégrateurs l'ont depuis adopté comme dispositif de sécurité par défaut en remplacement des clôtures physiques.
Un client de fabrication d'acier a signalé que la capacité d'Ultralytics YOLO à adapter les scénarios de détection à différents sites lui a permis de réduire de plus de 100 le nombre d'employés affectés à la surveillance de la sécurité qui patrouillaient auparavant dans l'atelier. Plus largement, les fabricants décrivent la solution de RTM comme la plus facile à installer et la plus rentable parmi les options de surveillance de la sécurité qu'ils ont évaluées, la détection des zones dangereuses, des chutes et du feu/fumée couvrant ce dont ils ont le plus besoin.
Aller plus loin dans le passage à l'échelle sur les mêmes modèles#
La prochaine étape de RTM est la détection de conformité EPI, construite entièrement sur sa sortie de détection de personnes existante. Aucun nouveau modèle à entraîner et, sur les sites disposant d'une marge de manœuvre GPU, aucun nouveau matériel à installer. Alors que le déploiement se poursuit sur d'autres sites de fabrication et niveaux de matériel, la même exportation ONNX unique par modèle continue de porter la charge, du PC à graphiques intégrés le plus bas de gamme au serveur GPU le plus haut de gamme de l'atelier.
Vous souhaitez créer vos propres solutions de vision par IA ? Explorez nos modèles Ultralytics YOLO, découvrez comment ils sont utilisés dans tous les secteurs, y compris la vision par ordinateur dans la fabrication, et consultez les options de licence pour commencer.










