Edge AIデバイスへのコンピュータビジョンアプリケーションのデプロイ
Edge AIと、Jetson、Triton、TensorRTなどのNVIDIAのイノベーションが、コンピュータビジョンアプリケーションのデプロイを簡素化する方法をご紹介します。

近年のコンピュータビジョンと人工知能(AI)の進歩により、かつては研究分野にすぎなかった技術が、現在では幅広い業界で大きな成果をもたらすアプリケーションを支えています。自動運転車から医療画像、セキュリティまで、コンピュータビジョンシステムは大規模に実際の課題を解決しています。
これらのアプリケーションの多くは、画像や動画をリアルタイムで分析する必要があります。レイテンシ、コスト、プライバシーへの懸念から、クラウドコンピューティングに依存することが必ずしも現実的とは限りません。このような状況では、エッジAIが優れた解決策になります。ビジョンAIモデルをエッジデバイス上で直接実行することで、企業はデータをより高速かつ低コストで、さらに高いセキュリティを確保しながら処理でき、リアルタイムAIをより利用しやすくなります。
Ultralyticsが主催する年次ハイブリッドイベント、YOLO Vision 2024(YV24)では、デプロイをより使いやすく効率的にすることでビジョンAIを民主化することが中心テーマの一つとなりました。NVIDIAのシニアソリューションアーキテクトであるGuy Dahan氏は、エッジコンピューティングデバイス、推論サーバー、最適化フレームワーク、AIデプロイ用SDKなど、NVIDIAのハードウェアおよびソフトウェアソリューションが、開発者によるエッジAIの最適化をどのように支援しているかを説明しました。
この記事では、Guy Dahan氏によるYV24の基調講演から得られる主なポイントと、NVIDIAの最新イノベーションによってビジョンAIのデプロイがより高速かつスケーラブルになっている仕組みを紹介します。
エッジAIとは何ですか?#
Guy Dahan氏は、YV24にオンラインで参加できることへの意気込みと、Ultralytics PythonパッケージおよびUltralyticsのYOLOモデルへの関心を述べ、次のように話して講演を始めました。「リリースされた日からUltralyticsを使っています。Ultralyticsがとても気に入っています。それ以前からYOLOv5も使っていて、このパッケージの大ファンです。」
続いて、同氏はエッジAIの概念を紹介し、データを処理のために遠隔地のクラウドサーバーへ送信するのではなく、カメラ、ドローン、産業用機械などのデバイス上でAI計算を直接実行する仕組みだと説明しました。
画像や動画がアップロードされ、分析され、結果とともに送り返されるのを待つ代わりに、エッジAIではデバイス自体でデータを即座に分析できます。これにより、ビジョンAIシステムはより高速かつ効率的になり、インターネット接続への依存も減少します。エッジAIは、自動運転車、セキュリティカメラ、スマートファクトリーなど、リアルタイムの意思決定を必要とするアプリケーションに特に有用です。
エッジAIの主なメリット#
エッジAIを紹介した後、Guy Dahan氏は効率性、コスト削減、データセキュリティに焦点を当て、その主なメリットを強調しました。同氏は、最大のメリットの一つが低レイテンシであると説明しました。AIモデルがデバイス上でデータを直接処理するため、情報をクラウドへ送信して応答を待つ必要がないからです。
エッジAIは、コストの削減と機密データの保護にも役立ちます。大量のデータ、特に動画ストリームをクラウドへ送信すると、高額な費用が発生する可能性があります。一方、ローカルで処理すれば、帯域幅とストレージのコストを削減できます。
もう一つの重要なメリットはデータプライバシーです。情報が外部サーバーへ転送されず、デバイス上に保持されるためです。これは、データをローカルで安全に保持することが最優先となる医療、金融、セキュリティのアプリケーションで特に重要です。

図1. YV24でエッジAIのメリットについて遠隔でプレゼンテーションを行うGuy Dahan氏。
これらのメリットを踏まえ、Guy Dahan氏はエッジAIの導入拡大について説明しました。同氏によると、NVIDIAが2014年にJetsonを導入して以来、利用は10倍に増加しています。現在、120万人を超える開発者がJetsonデバイスを利用しています。
NVIDIA Jetsonの概要:エッジAIデバイス#
続いてGuy Dahan氏は、高い性能を低消費電力で実現するよう設計されたAIエッジコンピューティングデバイスのシリーズ、NVIDIA Jetsonデバイスに焦点を当てました。Jetsonデバイスは、ロボティクス、農業、医療、産業オートメーションなどの分野におけるコンピュータビジョンアプリケーションに最適です。同氏はさらに、「Jetsonは、AI向けに特別に設計されたエッジAIデバイスです。もともとは主にコンピュータビジョン向けに設計されていたと言ってもよいでしょう」と述べました。
Jetsonデバイスには3つのティアがあり、それぞれ異なるニーズに適しています。
- エントリーレベル:AI性能は毎秒20~40兆回の演算(TOPS)で、消費電力は10~15Wです。エッジアプリケーション向けの手頃な選択肢となります。
- メインストリーム:性能と効率のバランスに優れ、70~200 TOPS、消費電力20~40Wを提供します。中程度のAIワークロードに適しています。
- ハイパフォーマンス:最大275 TOPS、消費電力60~75Wを実現し、ロボティクスやオートメーションなどの負荷の高いAIアプリケーション向けに設計されています。
また、Guy Dahan氏は今年発売予定のJetson AGX Thorについても紹介し、GPU(グラフィックス処理ユニット)性能が8倍、メモリ容量が2倍になり、CPU(中央処理ユニット)性能も向上すると説明しました。これは、ヒューマノイドロボティクスと高度なエッジAIアプリケーション向けに特別に設計されています。
コンピュータビジョンモデルのデプロイに関する課題#
続いてGuy Dahan氏はエッジAIのソフトウェア面に話題を移し、高性能なハードウェアを用いても、モデルを効率的にデプロイすることは難しい場合があると説明しました。
最大の障壁の一つは互換性です。AI開発者は、PyTorchやTensorFlowなど、異なるAIフレームワークを使うことが多いためです。これらのフレームワーク間を移行するのは難しく、すべてが正しく動作するように環境を再構築する必要があります。
スケーラビリティも重要な課題です。AIモデルには大きな計算能力が必要であり、Dahan氏の言葉を借りれば、「必要な計算リソースを減らしたいAI企業は、これまで一社もありません」。AIアプリケーションを複数のデバイスに拡張すると、すぐにコストが増大する可能性があるため、最適化が不可欠です。
さらに、AIパイプラインは複雑で、さまざまな種類のデータ、リアルタイム処理、システム統合が関わることが多くあります。開発者は、モデルが既存のソフトウェアエコシステムとシームレスに連携できるよう、多くの労力を費やしています。これらの課題を克服することは、AIデプロイをより効率的かつスケーラブルにするうえで重要です。

図2. モデルのデプロイにおける課題。
NVIDIAのTriton Inference Serverによるデプロイの簡素化#
次にGuy Dahan氏は、NVIDIAのTriton Inference Serverに注目しました。同氏は、多くの企業やスタートアップがモデルを十分に最適化しないままAI開発を始めていると指摘しました。AIパイプライン全体をゼロから再設計すると、既存業務に大きな影響が生じ、時間もかかるため、効率的なスケーリングが難しくなります。
システム全体の刷新を必要とせず、Tritonを使えば、開発者はAIワークフローを段階的に改善および最適化し、既存の構成を壊すことなく、より効率的なコンポーネントを統合できます。TensorFlow、PyTorch、ONNX、TensorRTなど複数のAIフレームワークをサポートしているため、Tritonでは最小限の調整で、クラウド環境、データセンター、エッジデバイスにわたるシームレスなデプロイが可能です。

図3. NVIDIAのTriton Inference Serverの概要。
NVIDIAのTriton Inference Serverの主なメリットは次のとおりです。
- 自動バッチ処理:Tritonは複数のAIリクエストを処理前にまとめることで、遅延(レイテンシ)を抑え、推論速度(AIモデルが結果を生成するまでの時間)を向上させます。
- Kubernetes統合:Tritonはクラウドネイティブであり、Kubernetes(複数のコンピューターやクラウドサーバーにわたるAIアプリケーションの管理とスケーリングを支援するシステム)とシームレスに連携します。
- オープンソースでカスタマイズ可能:開発者はTritonを特定のニーズに合わせて変更でき、幅広いAIアプリケーションに柔軟に対応できます。
NVIDIA TensorRTによるAI性能の最大化#
さらに高速化したい場合は、NVIDIA TensorRTがAIモデルを最適化するための有力な選択肢になります。Guy Dahan氏は、TensorRTがNVIDIA GPU向けに構築された高性能なディープラーニングオプティマイザーであると説明しました。TensorFlow、PyTorch、ONNX、MXNetのモデルは、TensorRTを使用して高効率なGPU実行ファイルに変換できます。
TensorRTの高い信頼性を支えているのは、ハードウェア固有の最適化です。Jetsonデバイス向けに最適化されたモデルは、他のGPUでは同じように効率的に動作しません。TensorRTは対象ハードウェアに基づいて性能を微調整するためです。微調整されたコンピュータビジョンモデルでは、最適化されていないモデルと比較して、推論速度が最大36倍向上する可能性があります。
Guy Dahan氏は、UltralyticsがTensorRTをサポートしていることにも注目し、AIモデルのデプロイをより高速かつ効率的にできると説明しました。Ultralytics YOLOモデルはTensorRT形式に直接エクスポートできるため、開発者は変更を加えることなくNVIDIA GPU向けに最適化できます。
DeepStream 7.0:ストリーミング分析ツールキット#
講演の最後に、Guy Dahan氏はNVIDIA DeepStream 7.0を紹介しました。これは、NVIDIA GPUを使用して動画、音声、センサーデータをリアルタイムで処理するために設計されたAIフレームワークです。高速なコンピュータビジョンアプリケーションをサポートするよう構築されており、自律システム、セキュリティ、産業オートメーション、スマートシティにおける物体検出、トラッキング、分析を可能にします。AIをエッジデバイス上で直接実行することで、DeepStreamはクラウドへの依存をなくし、レイテンシを削減して効率を向上させます。

図4. YV24でGuy Dahan氏とDeepStream 7.0を紹介。
具体的には、DeepStreamはAIを活用した動画処理を最初から最後まで処理できます。動画のデコードと前処理から、AI推論、後処理まで、エンドツーエンドのワークフローをサポートします。
最近、DeepStreamにはAIデプロイを強化するための複数のアップデートが導入され、より利用しやすく、スケーラブルになりました。新しいツールによって開発が簡素化され、マルチカメラトラッキングが改善され、より優れた性能を実現するようAIパイプラインが最適化されています。
開発者は現在、Windows環境への対応拡大、複数のソースからのデータ統合を可能にするセンサーフュージョン機能の強化、デプロイを ускорする事前構築済みのリファレンスアプリケーションを利用できます。これらの改善により、DeepStreamはリアルタイムAIアプリケーション向けの、より柔軟で効率的なソリューションとなり、開発者はインテリジェントな動画分析を容易にスケールできます。
主なポイント#
YV24でのGuy Dahan氏の基調講演で示されたように、エッジAIはコンピュータビジョンアプリケーションを再定義しています。ハードウェアとソフトウェアの進歩により、リアルタイム処理はより高速、効率的、かつコスト効率の高いものになっています。
より多くの業界がエッジAIを導入する中、断片化やデプロイの複雑さといった課題への対応が、その可能性を最大限に引き出す鍵となります。こうしたイノベーションを取り入れることで、よりスマートで応答性の高いAIアプリケーションが生まれ、コンピュータビジョンの未来が形作られていきます。
成長を続けるコミュニティの一員になりませんか?AIについて詳しく知るにはGitHubリポジトリをご覧いただき、ビジョンAIプロジェクトを始めるにはライセンスオプションをご確認ください。医療におけるAIや製造業におけるコンピュータビジョンなどのイノベーションに関心がありますか?詳しくはソリューションページをご覧ください。









