Inference Latency
AIにおける推論レイテンシの重要性を説明します。Ultralytics YOLO26でリアルタイム性能を最適化し、より高速で応答性の高いアプリケーションを実現する方法を学びます。
推論レイテンシとは、機械学習(ML)モデルが画像やテキストプロンプトなどの入力を受け取ってから、対応する出力または予測を生成するまでの時間遅延を指します。人工知能(AI)の文脈では、この指標は通常ミリ秒(ms)単位で測定され、システムの応答性を示す重要な指標となります。コンピュータビジョンアプリケーションを構築する開発者にとって、特に携帯電話や組み込みデバイスなどのリソースに制約のある環境にモデルをデプロイする場合、スムーズでインタラクティブなユーザー体験を実現するには、レイテンシを理解して最小限に抑えることが不可欠です。
推論レイテンシが重要な理由#
推論レイテンシの重要性は、具体的なユースケースに大きく左右されます。夜間のサーバーレポートの分析のようなバッチ処理タスクでは数秒の遅延が許容される場合がありますが、インタラクティブなアプリケーションでは受け入れられないことが多くあります。低レイテンシはリアルタイム推論の基盤です。リアルタイム推論では、システムがデータを処理して即座に反応する必要があります。
レイテンシを削減することで、AIエージェントは人間と自然に対話でき、自動化システムは安全に動作できます。レイテンシが大きいと、「ラグのある」インターフェースやユーザー維持率の低下につながり、安全性が極めて重要なシナリオでは危険な運用上の障害を引き起こす可能性があります。エンジニアは、精度を向上できるモデルの複雑さと実行速度のトレードオフを調整しなければならないことがよくあります。
レイテンシに影響する要因#
単一の推論処理に必要な合計時間には、複数の技術的要素が影響します。
- モデルアーキテクチャ: ニューラルネットワーク(NN)の設計は主要な要因です。多くの層を持つ深いモデルは、一般に浅いモデルより多くの計算を必要とします。YOLO26のような最新のアーキテクチャは、計算オーバーヘッドを最小限に抑えながら高い精度を実現するよう特別に最適化されています。
- ハードウェア性能: 処理ユニットの選択は速度に大きく影響します。CPUは汎用性に優れていますが、グラフィックス処理装置(GPU)やテンソル処理装置(TPU)のような専用ハードウェアは、ディープラーニングの中核となる行列演算を並列化するように設計されており、レイテンシを大幅に削減します。
- 入力サイズ: 高解像度の4K動画フレームの処理には、標準的な640p画像の処理よりも時間がかかります。開発者は、速度と小さなディテールを検出する能力のバランスが取れた最適な点を見つけるため、データ前処理中に入力サイズを変更することがよくあります。
- 最適化手法: モデル量子化(重みを低精度に変換する処理)やモデルプルーニング(不要な接続を削除する処理)などの手法は、実行速度を向上させる効果的な方法です。NVIDIA TensorRTのようなツールを使用すると、特定のハードウェア向けにモデルをさらに最適化できます。
実世界での利用例#
推論レイテンシの影響は、速度が妥協できない実用例を通して示すのが最も効果的です。
-
自動運転: 自動車分野におけるAIでは、自動運転車が歩行者、他の車両、信号機を検出するために、周囲の環境を継続的にスキャンする必要があります。物体検出システムのレイテンシが大きい場合、障害物が現れたときに車が間に合わずブレーキをかけられない可能性があります。高速走行時には、わずか100ミリ秒の遅延でも数メートル進んでしまうため、低レイテンシは重要な安全要件となります。
-
高頻度取引: 金融機関は予測モデリングを使用して市場動向を分析し、取引を実行します。これらのアルゴリズムは膨大な量のデータを処理し、マイクロ秒単位で意思決定を行う必要があります。この分野では、レイテンシの低下が直接的に競争優位につながり、企業は競合他社が反応する前に一時的な市場機会を活用できます。
Pythonでレイテンシを測定する#
ベンチマークモードを使用すると、Ultralyticsモデルの推論速度を簡単に測定できます。これにより、使用するハードウェアの制約に適したモデルサイズを選択できます。
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Benchmark the model on CPU to measure latency
# This provides a breakdown of preprocess, inference, and postprocess time
model.benchmark(data="coco8.yaml", imgsz=640, device="cpu")推論レイテンシとスループットの比較#
モデルデプロイにおいて、レイテンシとスループットは関連しているものの異なる概念であるため、区別することが重要です。
- 推論レイテンシは、単一の予測にかかる時間を測定します(例: 「この画像の処理に20msかかりました」)。これは、単一ユーザー向けのリアルタイムアプリケーションにおける主要な指標です。
- スループットは、一定時間あたりの予測数を測定します(例: 「システムは1秒あたり500枚の画像を処理しました」)。高いスループットは、バッチサイズを大きくすることで実現されることが多く、これにより多数の入力を同時に処理できます。ただし、バッチ処理によってキューで待機する個々の項目のレイテンシが実際に増加する場合があります。
一方を最適化すると、もう一方が犠牲になることがよくあります。たとえば、エッジAIアプリケーションでは通常、即時のフィードバックを確保するためにレイテンシを優先します。一方、クラウドベースのデータマイニングタスクでは、大規模なデータセットを効率的に処理するためにスループットを優先する場合があります。
最適化戦略#
開発者は、レイテンシを最小限に抑えるためにさまざまな戦略を採用します。モデルのエクスポートによって、ONNXやOpenVINOなどの最適化された形式に変換すると、標準的なCPUで大幅な速度向上が得られる場合があります。モバイル環境へのデプロイでは、モデルをTFLiteやCoreMLに変換することで、iOSおよびAndroidデバイス上で効率的に実行できます。さらに、MobileNetのような軽量アーキテクチャや、最新のUltralytics YOLO26を使用すると、基盤となるモデルを設計段階から効率的にできます。ユーザーはUltralytics Platformを活用して、複雑な手動設定を行わずに、これらの最適化された形式へモデルをシームレスにデプロイすることもできます。









