RTM은 서울에 본사를 둔 산업용 AI 기업입니다. RTM의 비전 유닛은 제조 현장을 위한 AI 기반 안전 모니터링 시스템을 구축합니다. 공장 바닥에 이미 설치된 카메라를 통해 Ultralytics YOLO26 모델이 24시간 내내 사람, 낙상, 위험 구역 침입, 화재 및 연기를 감지하며, 통합 그래픽부터 외장 GPU까지 고객이 이미 보유하고 있는 PC에서 구동됩니다.
아무도 지켜보지 않는 카메라를 모니터링하기#
산업 재해는 대개 아무도 주시하지 않는 사각지대에서 발생합니다. 공장마다 모든 생산 라인에 카메라가 설치되어 있지만, 모든 피드를 상시 모니터링할 수는 없습니다. RTM은 이를 지속적으로 수행할 수 있는 시스템을 구축했습니다. 각 카메라 채널은 두 개의 Ultralytics YOLO26 모델(사람 감지용 1개, 화재 및 연기 감지용 1개)을 실행하며, 이 모델들은 작업자 낙상 및 위험 구역 침입에 대한 경보를 발생시키는 결정론적 이벤트 레이어에 데이터를 공급합니다.
지난 6개월 동안 RTM의 산업용 안전 AI 솔루션은 철강, 배터리, 화학 및 플라스틱, 식품, 로봇 제조 분야의 21개 제조 기업에 24시간 연중무휴로 배포되었거나 현장 평가를 진행 중입니다. 기존 CCTV에 연결된 이 시스템은 작업자가 위험 구역에 진입하거나 낙상할 때 이를 감지하고, 내부 시스템을 통해 알림을 트리거하거나 PLC 연동을 통해 연결된 공장 장비를 직접 제어합니다.
그림 1. Ultralytics YOLO를 활용한 RTM의 실시간 낙상 감지 피드. (이미지 출처: RTM)
아무도 구매하고 싶어 하지 않는 하드웨어 문제 해결하기#
안전 모니터링은 아무것도 설치하지 않는 옵션과 경쟁합니다. 단일 카메라를 모니터링하기 위해 새로운 서버 하드웨어가 필요한 경우, 평가 과정은 시작조차 하지 못하고 중단되는 경우가 많습니다. 제조업체들에게 기존의 방식은 고가의 전용 하드웨어를 도입하거나 자동화된 모니터링을 포기하는 것 양자택일에 불과했습니다.
RTM은 이러한 절충안을 없애기로 했습니다. 인텔 통합 그래픽부터 NVIDIA RTX 3090에 이르기까지 제어실에 이미 놓여 있는 어떤 PC에서든 실행할 수 있으며 사이트별로 별도의 빌드가 필요 없는 단일 배포 방식을 구현했습니다.
이를 달성하기 위해 RTM은 두 YOLO26 모델을 고정 셰이프로 ONNX로 내보내고, TensorRT, CUDA, OpenVINO, DirectML, CPU의 5가지 실행 공급자를 통해 ONNX Runtime에서 실행합니다. 시작 시 추론 라이브러리가 설치된 GPU 벤더를 감지하고 올바른 공급자 체인을 자동으로 선택하므로, 대상 기기에 외장 GPU가 전혀 없든 고성능 카드가 장착되어 있든 모델당 동일한 36 MB 파일이 수정 없이 실행됩니다. 배포된 애플리케이션에는 Python이나 PyTorch 종속성이 없으며 벤더별 릴리스 트랙을 유지보수할 필요도 없습니다.
YOLO26의 엔드투엔드 감지 헤드 덕분에 이러한 단일 아티팩트 접근 방식이 실현 가능해졌습니다. 모델이 최종 감지 결과를 직접 출력하므로 RTM의 C++ 추론 레이어는 신뢰도 임계값과 레터박스 역변환만 필요로 합니다. 다시 구현해야 하는 NMS가 없고 Python 학습 경로와 C++ 배포 경로 간에 디버깅해야 할 패리티 격차도 없습니다. 이러한 종류의 버그는 일반적으로 감지기가 언어 경계를 넘나들 때마다 발생합니다.
GPU가 제공하는 성능의 측정#
RTM은 NVIDIA RTX 3090(ONNX Runtime 1.26.0, CUDA 실행 공급자, FP32, 배치 1, 순전파 전용)에서 두 가지 입력 해상도로 YOLO26 소형 모델(사람 및 화재/연기)을 벤치마킹했습니다. 640×640 해상도에서 사람 모델은 프레임당 4.20 ms, 화재/연기 모델은 4.34 ms로 실행되며, 1280×1280 해상도에서는 둘 다 약 12.5 ms로 증가하고 GPU 메모리는 406 MB에서 1,302 MB로 상승합니다. 이로 인해 640×640은 프레임당 비용이 약 2.9배 저렴하고 메모리 사용량은 3.2배 가벼워지며, 더 큰 입력은 작고 먼 객체의 감지 능력을 향상시킵니다. RTM은 640×640을 기본값으로 제공하고, 채널 수 대신 감지 여유 공간에 GPU 성능을 할당할 수 있는 사이트를 위해 1280×1280 내보내기 옵션을 유지합니다.
FP32의 CUDA에서 FP16의 TensorRT로 전환함에 따라 두 모델의 결합된 프레임당 비용이 8.68 ms에서 6.26 ms로 28% 감소했습니다. 이는 단일 GPU에서 28.8 FPS가 아닌 약 39.9 FPS의 성능에 해당합니다. RTM은 제품을 배포하기 전에 FP16 변환으로 인해 정확도가 저하되지 않음을 검증했습니다. 화재와 연기 모두 객체 크기별 버킷 전체와 이벤트 수준에서 재현율(recall)이 동일하게 유지되었습니다. 배포된 애플리케이션에서 권장 사양의 머신(16코어급 인텔 코어 i7 이상, 32GB RAM, RTX 5060 8GB 이상)은 6개의 동시 채널을 유지하며, 통합 그래픽만 탑재된 저사양 머신도 박스당 최대 10개 채널이라는 제품 한계에 대해 1개의 채널을 안정적으로 유지합니다.
Ultralytics YOLO26을 활용하는 이유는 무엇인가요?#
RTM은 동일한 Ultralytics 학습 코드베이스를 통해 사람 감지기와 화재/연기 감지기를 학습시키며, 두 감지기는 도메인별 분기 없이 352줄의 코드를 공유합니다. 사람을 감지하는 감지기와 화재를 감지하는 감지기 사이에서 변경되는 유일한 요소는 입력 크기, 에폭(epoch), 학습률, 데이터셋 구성 등의 설정 파일입니다. 이는 Ultralytics YOLO가 구축된 방식의 직접적인 결과입니다. 감지 작업 전반에 걸쳐 단일하고 일관된 아키텍처와 학습 API를 제공하므로, 새로운 감지 도메인은 새로운 파이프라인이 아닌 설정 변경만으로 구현할 수 있습니다. 이것이 소규모 엔지니어링 팀이 두 개의 코드를 유지보수하지 않고도 두 개의 프로덕션급 모델을 구축할 수 있었던 이유입니다.
이러한 일관성 덕분에 YOLO26으로의 전환 역시 위험 부담 없이 이루어질 수 있었습니다. RTM은 프로젝트 시작 후 4일 만인 2026년 5월에 YOLO26을 도입했으며, 마이그레이션 과정에서 기존 학습 코드를 단 한 줄도 수정할 필요 없이 체크포인트만 교체했습니다. Ultralytics는 모델 세대 간에 학습 인터페이스를 안정적으로 유지하기 때문에 최신 아키텍처로 업그레이드한다고 해서 RTM이 이미 구축하고 테스트한 파이프라인을 다시 작성할 필요가 없었습니다.
"동일한 데이터셋에서조차 입력 크기와 증강 방식은 모델의 성능을 변화시킵니다. Ultralytics를 사용하면 이 모든 것이 하나의 설정 파일에 담기므로 몇 가지 값을 변경하고 여러 변형을 나란히 실행한 후 가장 우수한 결과를 선택합니다. 코드를 직접 수정할 필요가 전혀 없으므로 열 번의 실행을 준비하는 작업은 한 번 실행하는 것과 거의 비슷합니다." - RTM AI 엔지니어
이러한 안정성은 정확도 향상으로도 이어졌습니다. 5단계의 순차적 학습 커리큘럼을 단일 결합 실행으로 통합한 결과, 동일한 작동 임계값에서 검증 mAP50이 0.672에서 0.689로 향상되었습니다. 이 성능 향상은 모델을 재설계할 필요 없이 동일한 YOLO26 아키텍처로 재학습하는 것만으로 얻을 수 있는 이점이었습니다. 또한 YOLO26은 감지 임계값이 애플리케이션에 컴파일되는 대신 사이드카 파일로 제공되는 고정 셰이프 ONNX 아티팩트로 깔끔하게 내보내지므로, 호스트 애플리케이션을 전혀 수정하지 않고도 하나의 ONNX 파일을 교체하는 것만으로 현장에 정확도 향상 효과가 반영되었습니다. 이를 통해 소규모 엔지니어링 팀은 조율된 릴리스 없이도 모든 사이트에 모델 업데이트를 배포할 수 있으며, 이는 맞춤형 아키텍처가 아닌 YOLO26을 기반으로 구축했기에 얻을 수 있는 직접적인 결과입니다.
감지 그 이상의 기능#
RTM의 알람은 단순한 원시 감지 결과가 아닙니다. 프레임 내의 사람은 그 자체로 이벤트가 아니지만, 넘어져서 일어나지 못하는 사람은 이벤트입니다. 알람이 울리기 전에 추적, 자세 상태, 구역 소속, 슬라이딩 윈도우 투표를 결합하는 결정론적 이벤트 레이어가 두 YOLO26 모델 상단에 위치합니다. 이러한 로직을 모델과 분리해 두었기 때문에 공장마다 카메라 높이, 각도, 조명이 크게 다르더라도 단 하나의 사람 감지기로 모든 사이트에 서비스를 제공할 수 있습니다. 또한 새로운전환 없이 기존 감지를 재사용하여 새로운 안전 동작을 구현할 수 있음을 의미합니다. 실제로 RTM은 GPU가 장착된 사이트에 새로운 모델이나 하드웨어를 추가하지 않고도 동일한 사람 감지 출력을 활용하여 개인 보호 장구(PPE) 규정 준수 모니터링을 구축하고 있습니다.
전반적인 영향#
이러한 영향은 공장 전반에 협동로봇을 공급하고 설치하며 물리적 또는 레이저 안전 펜스에도 불구하고 작업자와 로봇 간의 충돌 문제를 오랫동안 겪어왔던 RTM의 협동로봇 연동 고객들 사이에서 가장 명확하게 나타납니다. RTM의 시스템을 도입함으로써 위험 구역 침입이 감지되면 지연 없이 로봇에 PLC 연동 정지가 즉시 트리거되며, 이러한 통합 업체들은 물리적 펜스를 대신하여 기본 안전 장치로 RTM의 시스템을 채택했습니다.
철강 제조 고객은 Ultralytics YOLO를 통해 다양한 현장에 맞게 감지 시나리오를 맞춤화할 수 있게 되면서, 이전에 현장을 순찰하던 100명이 넘는 안전 모니터링 인력을 감축할 수 있었다고 보고했습니다. 보다 폭넓게는, 제조업체들이 RTM의 솔루션을 평가한 안전 모니터링 옵션 중 가장 설치가 간편하고 비용 효율적이며, 위험 구역, 낙상, 화재/연기 감지 기능이 가장 필요한 부분을 충족한다고 평가하고 있습니다.
동일한 모델을 활용한 추가적인 확충#
RTM의 다음 단계는 기존 사람 감지 출력을 기반으로 전적으로 구축되는 PPE 규정 준수 감지입니다. 학습할 새로운 모델이 없으며, GPU 여유 공간이 있는 사이트의 경우 설치할 새로운 하드웨도 없습니다. 추가적인 제조 현장과 하드웨어 계층으로 롤아웃이 계속됨에 따라, 최저 사양의 통합 그래픽 PC부터 최고 사양의 현장 GPU 서버에 이르기까지 모델당 단일 ONNX 내보내기 파일이 계속해서 핵심 역할을 수행하고 있습니다.
나만의 비전 AI 솔루션을 구축하고 싶으신가요? Ultralytics YOLO 모델을 살펴보고, 제조업 분야의 컴퓨터 비전을 포함하여 다양한 산업 분야에서 어떻게 활용되는지 확인한 뒤, 라이선스 옵션을 확인하고 시작해 보세요.










