RTMはソウルを拠点とする産業用AI企業です。RTMのビジョンユニットは、製造現場向けにAIを活用した安全監視を構築しています。工場のフロアにすでに設置されているカメラを、統合グラフィックスからディスクリートGPUに至るまで顧客がすでに保有しているPC上で動作するUltralytics YOLO26モデルが24時間体制で監視し、人物、転倒、危険区域への侵入、火災や煙を検出します。
誰も監視していないカメラを監視する#
労働災害は、誰もカバーしていない隙間で発生しがちです。工場にはすべてのラインにカメラが設置されていますが、すべてのフィードを常に監視できる人はいません。RTMはこれを継続的に行うシステムを構築しました。各カメラチャンネルは2つのUltralytics YOLO26モデル(人物検出用と火災・煙用がそれぞれ1つずつ)を実行し、作業員の転倒や危険区域への侵入に対するアラームを発生させる決定論的なイベント層にデータを供給します。
過去6か月間にわたり、RTMの産業用安全AIソリューションは、鉄鋼、バッテリー、化学・プラスチック、食品、ロボット製造にわたる21の製造企業で24時間365日稼働しているか、現地評価中です。既存のCCTVに接続されたシステムは、作業員が危険区域への立ち入りや転倒をしたときに検知し、内部システムを通じてアラートをトリガーするか、PLC統合を介して接続された工場設備を直接制御します。
図1. Ultralytics YOLOを活用したRTMの転倒検出ライブフィード(画像提供:RTM)
誰も購入したくないハードウェアの解決#
安全監視は、何もインストールしないという選択肢と競合します。システムが1台のカメラを監視する前に新しいサーバーハードウェアを必要とする場合、評価は始まる前に停止することがよくあります。製造業者にとっての現状は、高価な専用ハードウェアか、自動監視の完全な欠如かの選択でした。
RTMは、そのトレードオフを解消することを目指しました。コントロールルームにすでに置かれているPC(Intel内蔵グラフィックスからNVIDIA RTX 3090まで)上で動作し、サイトごとに個別のビルドを必要としない単一のデプロイメントです。
そこに到達するために、RTMは両方のYOLO26モデルを静的形状でONNXにエクスポートし、TensorRT、CUDA、OpenVINO、DirectML、CPUという5つの実行プロバイダーを通じてONNX Runtimeで実行します。起動時に、推論ライブラリはインストールされているGPUベンダーを検出し、適切なプロバイダーチェーンを自動的に選択するため、ターゲットマシンにディスクリートGPUがまったくなくてもハイエンドカードがあっても、モデルごとの同じ36 MBのファイルは変更されずに実行されます。デプロイされたアプリケーションにはPythonやPyTorchの依存関係がなく、メンテナンスすべきベンダーごとのリリース23トラックもありません。
YOLO26のエンドツーエンド検出ヘッドにより、その単一アーティファクトアプローチが実用的になりました。モデルが最終的な検出結果を直接出力するため、RTMのC++推論レイヤーに必要なのは信頼度閾値とレターボックス逆変換のみであり、再実装すべきNMSや、PythonトレーニングパスとC++デプロイメントパスの間でデバッグすべきパリティギャップ(検出器が言語の境界を越えるときに通常現れるバグのクラス)はありません。
GPUがもたらすものの測定#
RTMは、NVIDIA RTX 3090(ONNX Runtime 1.26.0、CUDA実行プロバイダー、FP32、バッチ1、フォワードパスのみ)上で、2つの入力解像度において両方のYOLO26小規模モデル(人物および火災/煙)のベンチマークを実施しました。640×640では、人物モデルはフレームあたり4.20ミリ秒、火災/煙モデルは4.34ミリ秒で実行されます。1280×1280では、両方ともおよそ12.5ミリ秒に増加し、GPUメモリは406 MBから1,302 MBに増加します。これにより、640×640はフレームあたり約2.9倍安く、メモリ消費も3.2倍少なくなりますが、入力が大きいほど、小さくて遠くにあるオブジェクトの検出が向上します。RTMはデフォルトとして640×640を出荷し、チャンネル数ではなく検出マージンにGPUの余裕を割くことができるサイト向けに1280×1280のエクスポートを利用可能にしています。
FP32のCUDAからFP16のTensorRTへ移行することで、両モデルのフレームあたりの合計コストが8.68ミリ秒から6.26ミリ秒に削減され、28%の削減となりました。これは、単一GPU上で4チャンネルにわたり28.8 FPSではなく約39.9 FPSに相当します。RTMは、出荷前にFP16変換コストが精度に影響を与えないことを検証しました。火災と煙の両方において、オブジェクトサイズのバケットごとおよびイベントレベルで再現率は変わりませんでした。デプロイされたアプリケーションでは、推奨仕様のマシン(16コアクラスのIntel Core i7以上、32GB RAM、RTX 5060 8GB以上)で6つの同時チャンネルを維持し、内蔵グラフィックスのみを搭載したローエンドマシンでも1チャンネルを維持します(ボックスあたりの製品上限は10チャンネルです)。
なぜUltralytics YOLO26を活用するのか?#
RTMは、同じUltralyticsトレーニングコードベースを通じて人物検出器と火災/煙検出器をトレーニングしており、両者はドメイン固有の分岐を一切持たずに352行のコードを共有しています。人物を監視する検出器と火災を監視する検出器の間で変化するのは、入力サイズ、エポック、学習率、データセット構成という設定ファイルのみです。それはUltralytics YOLOの構築方法の直接的な結果です。検出タスク全体で単一の一貫したアーティファクトとトレーニングAPIがあることは、新しい検出ドメインが新しいパイプラインではなく設定変更であることを意味し、それが小さなエンジニアリングチームが2つのコードベースを維持することなく2つの本番グレードのモデルを立ち上げることを可能にしました。
その同じ一貫性により、YOLO26自体への移行リスクが低くなりました。RTMはプロジェクト開始から4日目の2026年5月にYOLO26を採用し、移行には既存のトレーニングコードの変更がゼロ行で済み、必要なのは異なるチェックポイントのみでした。Ultralyticsはモデル世代間でトレーニングインターフェースを安定させ続けているため、最新のアーティファクトへのアップグレードは、RTMがすでに構築およびテストしたパイプラインを書き直すことを意味しませんでした。
「同じデータセットであっても、入力サイズとオーギュメンテーションによってモデルのパフォーマンスが変化します。Ultralyticsでは、それらのすべてが1つの設定ファイルに存在するため、いくつかの値を変更し、複数のバリエーションを並行して実行して、最適なものを選択します。どの部分についてもコードに触れることはないため、10回の実行を並べることは、1回実行するのとほぼ同じ手間です。」 - AIエンジニア、RTM
その安定性は精度においても成果を上げました。5段階の順次トレーニングカリキュラムを単一の結合実行に統合することで、変更のない動作閾値での検証mAP50が0.672から0.689に改善されました。この改善は、モデルを再設計するのではなく、同じYOLO26アーティファクトで再トレーニングするだけでRTMが得られた利得です。また、YOLO26は固定形状のONNXアーティファクトにきれいにエクスポートされ、検出閾値がアプリケーションにコンパイルされるのではなくサイドカーファイルとして出荷されるため、フィールドではホストアプリケーションを変更することなく1つのONNXファイルをスワップすることでその精度の利得を吸収しました。それが、小さなエンジニアリングチームが調整されたリリースなしですべてのサイトにモデルのアップデートをプッシュすることを可能にするものであり、特注のアーティファクトではなくYOLO26上に構築することの直接的な結果です。
検出の上に位置するもの#
RTMのアラームは未処理の検出結果ではありません。フレーム内の人物はイベントではありませんが、転倒してそのまま動かない人物はイベントです。決定論的イベント層が2つのYOLO26モデルの上に位置し、トラッキング、姿勢状態、ゾーン所属、およびスライディングウィンドウの投票を組み合わせて、アラームが発生する前に判断します。そのロジックをモデルから分離しておくことが、工場ごとにカメラの高さ、角度、照明が大きく異なるにもかかわらず、1つの人物検出器ですべてのサイトに対応できるようにする理由です。また、新しい安全動作が既存の検出結果を再利用できることも意味します。RTMは現在、GPUを搭載したサイトで新しいモデルや新しいハードウェアを必要とせずに、同じ人物検出出力に基づいてPPEコンプライアンス監視を構築しています。
全体的な影響#
その影響は、工場全体で協働ロボットを供給および設置し、物理的またはレーザーの安全フェンスにもかかわらず作業員がロボットと衝突するという問題に長年対処してきたRTMの協働ロボット統合顧客において最も明確に現れています。RTMのシステムにより、危険区域への侵入が検出され、遅延なくPLCに接続されたロボットの停止が即座にトリガーされます。これらのインテグレーターは、物理的フェンスの代わりにデフォルトの安全デバイスとしてRTMのシステムを採用しています。
ある鉄鋼製造の顧客は、Ultralytics YOLOが異なるサイトに合わせて検出シナリオを調整できる能力により、以前にフロアを巡回していた100名を超える安全監視スタッフを削減できたと報告しています。より広範には、製造業者はRTMのソリューションを評価した安全監視オプションの中で最もインストールが簡単で費用対効果が高いと表現しており、危険区域、転倒、火災/煙の検出が最も必要なニーズをカバーしています。
同じモデルでさらに拡張する#
RTMの次のステップは、既存の人物検出出力に完全に依存して構築されたPPEコンプライアンス検出です。トレーニングすべき新しいモデルはなく、GPUに余裕のあるサイトでは、インストールすべき新しいハードウェアもありません。追加の製造サイトやハードウェア階層にわたってロールアウトが継続するにつれて、モデルごとの同じ単一のONNXエクスポートが、最低仕様の内蔵グラフィックスPCからフロア上の最高仕様のGPUサーバーに至るまで、負荷を支え続けます。
独自のビジョンAIソリューションの構築に興味がありますか?Ultralytics YOLO modelsを探索し、製造業におけるコンピュータビジョンを含む業界全体でどのように使用されているかを確認し、開始するためのライセンスオプションをチェックしてください。










