A RTM é uma empresa de inteligência artificial industrial sediada em Seul. A unidade de visão da RTM cria monitoramento de segurança alimentado por inteligência artificial para locais de manufatura: câmeras já instaladas no chão de fábrica são supervisionadas vinte e quatro horas por dia por modelos do Ultralytics YOLO26 que detetam pessoas, quedas, invasões de zonas de perigo e fogo ou fumaça, rodando em qualquer PC que o cliente já tenha, desde gráficos integrados até uma GPU dedicada.
Monitorar câmeras que ninguém está assistindo#
Acidentes industriais tendem a acontecer na lacuna que ninguém cobre. As fábricas já têm câmeras em todas as linhas, mas ninguém consegue assistir a cada transmissão o tempo todo. A RTM construiu um sistema para fazer isso continuamente: cada canal de câmera executa dois modelos do Ultralytics YOLO26, um treinado para detecção de pessoas e um para fogo e fumaça, alimentando uma camada de eventos determinística que aciona alarmes para quedas de trabalhadores e invasões de zonas de perigo.
Nos últimos seis meses, a solução de inteligência artificial de segurança industrial da RTM foi implantada 24/7 ou está em avaliação no local em 21 empresas de manufatura abrangendo siderurgia, baterias, produtos químicos e plásticos, alimentos e fabricação de robótica. Conectado ao sistema de CFTV existente, o sistema deteta quando um trabalhador entra em uma zona perigosa ou cai, e aciona alertas por meio de sistemas internos ou, via integração de PLC, controla diretamente o equipamento de fábrica conectado.
Fig 1. Transmissão ao vivo de detecção de quedas da RTM aproveitando o Ultralytics YOLO. (Fonte da imagem: RTM)
Resolvendo o problema do hardware que ninguém quer comprar#
O monitoramento de segurança concorre com a opção de não instalar nada. Se um sistema exige novo hardware de servidor antes de poder monitorar uma única câmera, a avaliação frequentemente para antes de começar. O status quo para os fabricantes tem sido uma escolha entre hardware dedicado caro e nenhum monitoramento automatizado.
A RTM propôs-se a eliminar esse compromisso: uma implantação que roda em qualquer PC que já esteja na sala de controle, desde gráficos integrados da Intel até uma NVIDIA RTX 3090, sem necessidade de uma compilação separada por local.
Para chegar lá, a RTM exporta ambos os modelos do YOLO26 para ONNX em um formato estático e os executa através do ONNX Runtime em cinco provedores de execução: TensorRT, CUDA, OpenVINO, DirectML e CPU. Na inicialização, a biblioteca de inferência deteta o fornecedor de GPU instalado e seleciona automaticamente a cadeia de provedores correta, de modo que o mesmo arquivo de 36 MB por modelo roda sem modificações, quer a máquina de destino não tenha GPU dedicada ou tenha uma placa topo de linha. Não há dependência de Python ou PyTorch no aplicativo implantado e nenhum ciclo de lançamento por fornecedor para manter.
A cabeça de detecção de ponta a ponta do YOLO26 tornou essa abordagem de artefato único prática: como o modelo gera detecções finais diretamente, a camada de inferência em C++ da RTM precisa apenas de um limite de confiança e de uma transformação inversa de letterbox, sem NMS para reimplementar e sem lacuna de paridade para depurar entre o caminho de treinamento em Python e o caminho de implantação em C++, uma classe de bug que tipicamente aparece sempre que um detector cruza limites de linguagem.
O que uma GPU proporciona, medido#
A RTM realizou benchmarks em ambos os modelos YOLO26-small (pessoa e fogo/fumaça) em duas resoluções de entrada em uma NVIDIA RTX 3090 (ONNX Runtime 1.26.0, provedor de execução CUDA, FP32, lote 1, apenas passagem direta). A 640×640, o modelo de pessoa roda a 4,20 ms por quadro e o modelo de fogo/fumaça a 4,34 ms; a 1280×1280, ambos sobem para aproximadamente 12,5 ms, com a memória da GPU subindo de 406 MB para 1.302 MB. Isso torna 640×640 cerca de 2,9x mais barato por quadro e 3,2x mais leve em termos de memória, enquanto a entrada maior melhora a detecção de objetos pequenos e distantes. A RTM fornece 640×640 como padrão e mantém a exportação de 1280×1280 disponível para locais que têm margem de manobra de GPU para gastar em margem de detecção em vez de contagem de canais.
Mudar de CUDA em FP32 para TensorRT em FP16 reduziu o custo combinado por quadro para ambos os modelos de 8,68 ms para 6,26 ms, uma redução de 28%, valendo aproximadamente 39,9 FPS em quatro canais em uma única GPU em vez de 28,8 FPS. A RTM verificou que a conversão para FP16 não custou nada em precisão antes de enviá-la: a revocação permaneceu inalterada em cada faixa de tamanho de objeto e ao nível de eventos tanto para fogo quanto para fumaça. No aplicativo implantado, uma máquina com especificação recomendada (um Intel Core i7 de 16 núcleos ou superior, 32 GB de RAM, RTX 5060 de 8 GB ou superior) sustenta 6 canais concorrentes, enquanto uma máquina de nível inferior apenas com gráficos integrados ainda sustenta 1, contra um limite de produto de 10 canais por caixa.
Por que aproveitar o Ultralytics YOLO26?#
A RTM treina seu detector de pessoas e seu detector de fogo/fumaça através da mesma base de código de treinamento do Ultralytics, e os dois compartilham 352 linhas de código sem qualquer ramificação específica de domínio. A única coisa que muda entre um detector que monitora pessoas e um que monitora fogo é um arquivo de configuração: tamanho da entrada, épocas, taxa de aprendizado e composição do conjunto de dados. Isso é um produto direto de como o Ultralytics YOLO é construído. Uma arquitetura única e consistente e uma API de treinamento em todas as tarefas de detecção significam que um novo domínio de detecção é uma alteração de configuração em vez de um novo pipeline, o que permitiu que uma pequena equipe de engenharia criasse dois modelos de nível de produção sem manter duas bases de código.
Essa mesma consistência tornou a transição para o YOLO26 de baixo risco. A RTM adotou o YOLO26 quatro dias após o início do projeto, em maio de 2026, e a migração exigiu a alteração de zero linhas de código de treinamento existente, apenas um ponto de verificação diferente. Como o Ultralytics mantém a interface de treinamento estável entre as gerações de modelos, atualizar para a arquitetura mais recente não significava reescrever um pipeline que a RTM já havia construído e testado.
"Mesmo no mesmo conjunto de dados, o tamanho da entrada e a aumento de dados mudam o desempenho do modelo. Com o Ultralytics, tudo isso fica em um único arquivo de configuração, então mudamos alguns valores, executamos várias variações lado a lado e pegamos a melhor. Nunca mexemos no código para nada disso, então alinhar dez execuções dá quase o mesmo trabalho que executar uma." - Engenheiro de IA, RTM
Essa estabilidade valeu a pena em precisão também. Consolidar um currículo de treinamento sequencial de cinco estágios em uma única execução conjunta melhorou o mAP50 de validação de 0,672 para 0,689 em um limite operacional inalterado, um ganho que a RTM pôde obter simplesmente retreinando na mesma arquitetura do YOLO26 em vez de redesignar o modelo. E como o YOLO26 é exportado perfeitamente para um artefato ONNX de formato fixo com limites de detecção enviados como um arquivo secundário em vez de compilados no aplicativo, o campo absorveu esse ganho de precisão trocando um arquivo ONNX, sem nenhuma alteração no aplicativo host. É isso que permite que uma pequena equipe de engenharia envie atualizações de modelo para todos os locais sem um lançamento coordenado, e é uma consequência direta de construir sobre o YOLO26 em vez de uma arquitetura sob medida.
O que fica acima da detecção#
Os alarmes da RTM não são detecções brutas: uma pessoa no enquadramento não é um evento, mas uma pessoa que caiu e permaneceu no chão é. Uma camada de eventos determinística fica acima dos dois modelos do YOLO26, combinando rastreamento, estado de postura, pertencimento à zona e uma votação por janela deslizante antes que qualquer alarme disparar. Manter essa lógica separada do modelo é o que permite que um único detector de pessoas atenda a todos os locais, apesar da altura, do ângulo e da iluminação da câmera variarem enormemente de fábrica para fábrica. Isso também significa que novos comportamentos de segurança podem reutilizar detecções existentes: a RTM está agora construindo monitoramento de conformidade de EPI na mesma saída de detecção de pessoas, sem nenhum novo modelo e sem nenhum novo hardware necessário em locais equipados com GPU.
O impacto geral#
O impacto aparece mais claramente com os clientes de integração de robôs colaborativos da RTM, que fornecem e instalam robôs colaborativos em fábricas e lidam há muito tempo com trabalhadores colidindo com robôs, apesar de cercas de segurança físicas ou a laser. Com o sistema da RTM, a invasão de zonas de perigo é detetada e aciona imediatamente uma parada conectada ao PLC no robô sem atraso, e esses integradores desde então adotaram o sistema como seu dispositivo de segurança padrão no lugar de cercas físicas.
Um cliente de fabricação de aço relatou que a capacidade do Ultralytics YOLO de adaptar cenários de detecção a diferentes locais permitiu reduzir mais de 100 funcionários de monitoramento de segurança que patrulhavam anteriormente o chão de fábrica. De forma mais ampla, os fabricantes descrevem a solução da RTM como a mais fácil de instalar e a mais econômica entre as opções de monitoramento de segurança que avaliaram, com a detecção de zonas de perigo, quedas e fogo/fumaça cobrindo o que eles mais precisam.
Expandindo ainda mais com os mesmos modelos#
O próximo passo da RTM é a detecção de conformidade de EPI, construída inteiramente sobre sua saída de detecção de pessoas existente. Nenhum novo modelo para treinar e, em locais com margem de manobra de GPU, nenhum novo hardware para instalar. Conforme a implementação continua em locais de manufatura adicionais e níveis de hardware, a mesma exportação ONNX única por modelo continua sustentando a carga, desde o PC com gráficos integrados de menor especificação até o servidor de GPU de mais alto nível no chão de fábrica.
Tem interesse em construir suas próprias soluções de visão computacional? Explore nossos modelos do Ultralytics YOLO, veja como eles são usados em vários setores, incluindo visão computacional na fabricação, e confira as opções de licenciamento para começar.










