Real-time Inference
リアルタイム推論の能力を活用して、AIによる即時の予測を実現しましょう。Ultralytics YOLO26がエッジデバイスやロボティクスにおいてどのように低遅延な結果をもたらすかを解説します。
リアルタイム推論とは、トレーニングされた machine learning (ML) モデルがライブの入力データを受け取り、ほぼ瞬時に予測を生成するプロセスのことです。データをまとめて収集し、後から一括して分析するオフライン処理とは異なり、リアルタイム推論はその場で実行されるため、システムが環境の変化に対して迅速かつ機敏に対応できるようになります。この機能は、現代の Artificial Intelligence (AI) アプリケーションの中核であり、デバイスがミリ秒単位でデータを認識、解釈し、それに基づいて処理を行うことを可能にします。
低遅延の重要性#
リアルタイムパフォーマンスを評価するための主要な指標は inference latency です。これは、ビデオカメラのフレームなど、データがモデルに入力された瞬間から、モデルが境界ボックスや分類ラベルなどの出力を生成する瞬間までの時間遅延を測定するものです。アプリケーションが「リアルタイム」とみなされるためには、入力されるデータストリームの速度に合わせられるよう、レイテンシが十分に低くなければなりません。
たとえば、30フレーム毎秒 (FPS) で動作する video understanding タスクでは、各フレームを処理するための厳格なタイムバジェットが約33ミリ秒となります。推論にそれ以上の時間がかかると、システムにラグが生じ、フレームのドロップや応答の遅延につながる可能性があります。これを実現するには多くの場合、GPUs や NVIDIA Jetson のような特殊な Edge AI デバイスを使用したハードウェアアクセラレーションが必要になります。
リアルタイム推論とバッチ推論の比較#
リアルタイムワークフローを batch processing と区別すると理解しやすくなります。どちらも予測の生成を伴いますが、その目的とアーキテクチャには大きな違いがあります。
- リアルタイム推論: 低レイテンシを優先します。データポイントが到着するとすぐに、単一のデータポイント (または非常に小さなバッチ) を処理します。これは、車が歩行者を即座に検知して間に合うようにブレーキを踏む必要がある autonomous vehicles などのインタラクティブなアプリケーションに不可欠です。
- バッチ推論: 高スループットを優先します。大量のデータを収集し、一度にすべて処理します。これは、毎夜の在庫レポートの生成や、過去の big data トレンドの分析など、緊急性の低いタスクに適しています。
実社会での応用#
瞬時の判断を下す能力は、動的な環境における自動化を実現し、さまざまな業界を変革してきました。
- スマート製造: AI in manufacturing では、コンベアベルトの上方に配置されたカメラがリアルタイム推論を使用して自動品質管理を実行します。object detection モデルにより、高速で移動する製品の欠陥や異物を瞬時に特定できます。異常が検知されると、システムがロボットアームを作動させてそのアイテムを直ちに排除し、高品質な製品のみが梱包工程に届くようにします。
- 監視とセキュリティ: 現代のセキュリティシステムは、境界を監視するために computer vision に依存しています。単に映像を記録するだけでなく、これらのカメラはリアルタイムの person detection や face recognition を実行し、不正アクセスが発生した瞬間にセキュリティ担当者に警告を発します。
- ロボティクス: AI in robotics の分野では、ロボットが pose estimation を使用して複雑な物理空間をナビゲートします。倉庫のロボットは、安全かつ効率的に経路を計画するために、障害物や作業員の居場所を継続的に推論する必要があります。
最適化とデプロイメント#
リアルタイムアプリケーション向けにモデルをデプロイするには、ターゲットハードウェア上で効率的に実行できるようにするための最適化がしばしば必要になります。model quantization などの手法では、モデルのウェイトの精度を低下させ (例: float32 から int8 へ)、accuracy への影響を最小限に抑えながら、メモリ使用量を削減し、推論速度を向上させます。
開発者は Ultralytics Platform を利用してこのプロセスを効率化できます。このプラットフォームはトレーニングを簡素化し、NVIDIA GPU用の TensorRT、Intel CPU用の OpenVINO、またはモバイルデプロイ用の TFLite といった最適化された形式にモデルをエクスポートできるようにします。
コード例#
次のPythonスニペットは、ultralytics ライブラリを使用してWebカメラのフィード上でリアルタイム推論を実行する方法を示しています。これは、エッジデバイスでの高速パフォーマンス向けに特別に設計された YOLO26 Nano モデルを使用しています。
from ultralytics import YOLO
# Load the YOLO26 Nano model, optimized for speed and real-time tasks
model = YOLO("yolo26n.pt")
# Run inference on the default webcam (source="0")
# 'stream=True' returns a generator for memory-efficient processing
# 'show=True' displays the video feed with bounding boxes in real-time
results = model.predict(source="0", stream=True, show=True)
# Iterate through the generator to process frames as they arrive
for result in results:
# Example: Print the number of objects detected in the current frame
print(f"Detected {len(result.boxes)} objects")





