RTM è un'azienda di intelligenza artificiale industriale con sede a Seoul. La sua unità di visione sviluppa sistemi di monitoraggio della sicurezza basati sull'intelligenza artificiale per siti di produzione: le telecamere già installate sul pavimento della fabbrica vengono monitorate 24 ore su 24 dai modelli di Ultralytics YOLO26 che rilevano persone, cadute, intrusioni in zone di pericolo, incendi o fumo, eseguendo il tutto su qualsiasi PC già in possesso del cliente, dalla grafica integrata fino a una GPU discreta.
Sorvegliare telecamere che nessuno sta guardando#
Gli incidenti industriali tendono a verificarsi negli spazi che nessuno copre. Le fabbriche dispongono già di telecamere su ogni linea, ma nessuno può guardare ogni flusso video in ogni momento. RTM ha sviluppato un sistema per farlo continuamente: ogni canale di telecamera esegue due modelli di Ultralytics YOLO26, uno addestrato per il rilevamento delle persone e uno per incendi e fumi, alimentando un livello di eventi deterministico che attiva allarmi per le cadute dei lavoratori e le intrusioni nelle zone di pericolo.
Negli ultimi sei mesi, la soluzione di IA per la sicurezza industriale di RTM è stata distribuita 24 ore su 24, 7 giorni su 7 o è in fase di valutazione in loco presso 21 aziende manifatturiere nei settori dell'acciaio, delle batterie, della chimica e delle materie plastiche, dell'alimentazione e della produzione di robotica. Collegato ai sistemi CCTV esistenti, il sistema rileva quando un lavoratore entra in una zona pericolosa o cade, e attiva avvisi tramite i sistemi interni o, tramite integrazione PLC, controlla direttamente le apparecchiature di fabbrica collegate.
Fig 1. Flusso in tempo reale del rilevamento delle cadute RTM che sfrutta Ultralytics YOLO. (Fonte immagine RTM)
Risolvere il problema dell'hardware che nessuno vuole comprare#
Il monitoraggio della sicurezza compete con l'opzione di non installare nulla. Se un sistema richiede un nuovo hardware per server prima di poter sorvegliare una singola telecamera, la valutazione spesso si interrompe prima ancora di iniziare. Lo status quo per i produttori è stato una scelta tra hardware dedicato costoso e nessun monitoraggio automatizzato.
RTM si è posta l'obiettivo di eliminare questo compromesso: una singola distribuzione che viene eseguita su qualsiasi PC già presente nella sala di controllo, dalla grafica integrata Intel a una NVIDIA RTX 3090, senza alcuna build separata per ogni sito.
Per arrivarci, RTM esporta entrambi i modelli YOLO26 in formato ONNX a forma statica e li esegue tramite ONNX Runtime su cinque provider di esecuzione: TensorRT, CUDA, OpenVINO, DirectML e CPU. All'avvio, la libreria di inferenza rileva il fornitore della GPU installata e seleziona automaticamente la catena di provider corretta, in modo che lo stesso file da 36 MB per modello venga eseguito senza modifiche, indipendentemente dal fatto che la macchina di destinazione non disponga di alcuna GPU discreta o monti una scheda di fascia alta. Non vi sono dipendenze da Python o PyTorch nell'applicazione distribuita e nessun canale di rilascio specifico per fornitore da mantenere.
L'head di rilevamento end-to-end di YOLO26 ha reso praticico questo approccio basato su un singolo artefatto: poiché il modello restituisce direttamente i rilevamenti finali, il livello di inferenza in C++ di RTM richiede solo una soglia di confidenza e una trasformazione inversa letterbox, senza alcun NMS da reimplementare e senza alcun divario di parità da debuggare tra il percorso di addestramento in Python e il percorso di distribuzione in C++, una classe di bug che tipicamente compare ogni volta che un rilevatore attraversa i confini dei linguaggi.
Ciò che una GPU garantisce, misurato#
RTM ha eseguito benchmark su entrambi i modelli YOLO26-small (persona e incendio/fumo) a due risoluzioni di input su una NVIDIA RTX 3090 (ONNX Runtime 1.26.0, provider di esecuzione CUDA, FP32, batch 1, solo forward pass). A 640×640, il modello delle persone viene eseguito a 4,20 ms per fotogramma e il modello di incendi/fumi a 4,34 ms; a 1280×1280, entrambi salgono a circa 12,5 ms, con la memoria della GPU che passa da 406 MB a 1.302 MB. Ciò rende la risoluzione 640×640 circa 2,9 volte più economica per fotogramma e 3,2 volte più leggera in termini di memoria, mentre l'input più grande migliora il rilevamento di oggetti piccoli e distanti. RTM fornisce 640×640 come impostazione predefinita e mantiene l'esportazione a 1280×1280 disponibile per i siti che dispongono di margine di GPU da destinare al margine di rilevamento anziché al conteggio dei canali.
Il passaggio da CUDA in FP32 a TensorRT in FP16 ha ridotto il costo combinato per fotogramma per entrambi i modelli da 8,68 ms a 6,26 ms, con una riduzione del 28%, pari a circa 39,9 FPS su quattro canali su una singola GPU anziché 28,8 FPS. RTM ha verificato che la conversione in FP16 non ha comportato alcuna perdita di accuratezza prima di rilasciarla: il richiamo è rimasto invariato in ogni intervallo di dimensioni degli oggetti e a livello di evento sia per il fuoco che per il fumo. Nell'applicazione distribuita, una macchina con specifiche raccomandate (un Intel Core i7 di classe a 16 core o superiore, 32 GB di RAM, RTX 5060 da 8 GB o superiore) sostiene 6 canali simultanei, mentre una macchina di fascia bassa con sola grafica integrata ne sostiene comunque 1, a fronte di un limite di prodotto di 10 canali per unità.
Perché sfruttare Ultralytics YOLO26?#
RTM addestra il rilevatore di persone e il rilevatore di incendi/fumi tramite la stessa codebase di addestramento di Ultralytics, e i due condividono 352 righe di codice senza alcuna ramificazione specifica del dominio. L'unica cosa che cambia tra un rilevatore che sorveglia le persone e uno che sorveglia gli incendi è un file di configurazione: dimensione dell'input, epoche, tasso di apprendimento e composizione del set di dati. Questo è il risultato diretto di come è costruito Ultralytics YOLO. Un'architettura e un'API di addestramento singole e coerenti tra i compiti di rilevamento significano che un nuovo dominio di rilevamento richiede una modifica della configurazione anziché una nuova pipeline, il che ha permesso a un piccolo team di ingegneri di realizzare due modelli di livello di produzione senza dover mantenere due codebase.
La stessa coerenza ha reso il passaggio a YOLO26 a basso rischio. RTM ha adottato YOLO26 quattro giorni dopo l'inizio del progetto, a maggio 2026, e la migrazione non ha richiesto la modifica di alcuna riga del codice di addestramento esistente, ma solo un checkpoint differente. Poiché Ultralytics mantiene stabile l'interfaccia di addestramento tra le generazioni di modelli, l'aggiornamento all'architettura più recente non ha significato dover riscrivere una pipeline che RTM aveva già costruito e testato.
"Anche sullo stesso set di dati, la dimensione dell'input e l'aumento dei dati modificano le prestazioni del modello. Con Ultralytics tutto questo risiede in un unico file di configurazione, quindi modifichiamo alcuni valori, eseguiamo diverse varianti una accanto all'altra e scegliamo la migliore. Non tocchiamo mai il codice per nessuna di queste operazioni, quindi allineare dieci esecuzioni richiede circa lo stesso lavoro che eseguirne una." - Ingegnere IA, RTM
Tale stabilità ha dato i suoi frutti anche in termini di accuratezza. Il consolidamento di un curriculum di addestramento sequenziale in cinque fasi in un'unica esecuzione congiunta ha migliorato l'mAP50 di convalida da 0,672 a 0,689 a parità di soglia operativa, un guadagno che RTM ha potuto ottenere semplicemente riaddestrando sulla stessa architettura YOLO26 anziché riprogettando il modello. E poiché YOLO26 si esporta in modo pulito in un artefatto ONNX a forma fissa con soglie di rilevamento fornite come file di supporto anziché compilate nell'applicazione, il campo ha assorbito tale guadagno di accuratezza sostituendo un singolo file ONNX, senza alcuna modifica all'applicazione host. Questo è ciò che permette a un piccolo team di ingegneri di rilasciare aggiornamenti dei modelli in ogni sito senza un rilascio coordinato, ed è la conseguenza diretta dell'aver costruito su YOLO26 anziché su un'architettura su misura.
Cosa si trova al di sopra del rilevamento#
Gli allarmi di RTM non sono semplici rilevamenti grezzi: una persona nell'inquadratura non costituisce un evento, ma lo è una persona che è caduta ed è rimasta a terra. Un livello di eventi deterministico si trova al di sopra dei due modelli YOLO26, combinando tracciamento, stato della postura, appartenenza alla zona e una votazione a finestra scorrevole prima che qualsiasi allarme venga attivato. Mantenere questa logica separata dal modello è ciò che consente a un singolo rilevatore di persone di servire ogni sito, nonostante l'altezza, l'angolazione e l'illuminazione della telecamera varino enormemente da fabbrica a fabbrica. Significa anche che i nuovi comportamenti di sicurezza possono riutilizzare i rilevamenti esistenti: RTM sta attualmente sviluppando il monitoraggio della conformità dei DPI sullo stesso output di rilevamento delle persone, senza che siano necessari un nuovo modello o un nuovo hardware nei siti dotati di GPU.
L'impatto complessivo#
L'impatto si manifesta in modo più evidente con i clienti di integrazione di robot collaborativi di RTM, che forniscono e installano cobot nelle fabbriche e che da tempo affrontano il problema dei lavoratori che urtano contro i robot nonostante le recinzioni di sicurezza fisiche o laser. Con il sistema di RTM, l'intrusione nella zona di pericolo viene rilevata e attiva immediatamente un arresto collegato al PLC sul robot senza alcun ritardo, e questi integratori lo hanno conseguentemente adottato come dispositivo di sicurezza predefinito al posto delle recinzioni fisiche.
Un cliente produttore di acciaio ha riferito che la capacità di Ultralytics YOLO di adattare gli scenari di rilevamento a diversi siti ha permesso di ridurre più di 100 addetti al monitoraggio della sicurezza che in precedenza pattugliavano l'area di produzione. Più in generale, i produttori descrivono la soluzione di RTM come la più facile da installare e la più conveniente tra le opzioni di monitoraggio della sicurezza valutate, con il rilevamento delle zone di pericolo, delle cadute e degli incendi/fumi che copre ciò di cui hanno maggiormente bisogno.
Ulteriore scalabilità sugli stessi modelli#
Il passo successivo di RTM è il rilevamento della conformità dei DPI, basato interamente sul suo output di rilevamento delle persone esistente. Nessun nuovo modello da addestrare e, nei siti con margine di GPU, nessun nuovo hardware da installare. Con il proseguire della diffusione in ulteriori siti di produzione e livelli hardware, la stessa singola esportazione ONNX per modello continua a gestire il carico, dal PC con grafica integrata di specifiche inferiori al server GPU di fascia più alta sul campo.
Ti interessa creare le tue soluzioni di visione artificiale? Esplora i nostri modelli Ultralytics YOLO, scopri come vengono utilizzati in tutti i settori, inclusa la visione artificiale nella produzione, e consulta le opzioni di licenza per iniziare.










