Action Recognition
アクション認識によって動画内の行動を識別する仕組みを解説します。Ultralytics YOLO26を姿勢推定に使用し、HARタスク向けのスマートなAIシステムを構築する方法を学びます。
アクション認識は、一般に人間活動認識(HAR)とも呼ばれ、動画データ内の対象者が行う特定の行動や動きを識別・分類する、コンピュータビジョン(CV)の動的なサブフィールドです。従来の物体検出が「画像内に何があるか」という問いに答えるのに対し、アクション認識は「時間の経過とともに何が起きているか」という、より複雑な問いに対応します。静止画像ではなくフレームのシーケンスを分析することで、機械学習(ML)モデルは「歩く」「自転車に乗る」「転倒する」「握手する」などの複雑な活動を区別できるため、人間の意図やコンテキストを理解するインテリジェントシステムの構築に不可欠な要素となっています。
基本概念と手法#
アクションを認識するには、モデルが空間情報(物体や人物の外観)と時間情報(時間の経過に伴う動き)の両方を処理する必要があります。これを実現するため、最新の人工知能(AI)システムでは、標準的な畳み込みニューラルネットワーク(CNN)を超える特殊なアーキテクチャが採用されることがよくあります。
- ポーズ推定: 肘、膝、肩など、人体上の特定のキーポイントをモデルが追跡する強力な手法です。時間の経過に伴うこれらのキーポイントの幾何学的な変化は、背景の雑然さに左右されず、アクションを分類するための強力なシグナルになります。
- 時間モデリング: アルゴリズムは、リカレントニューラルネットワーク(RNN)や長短期記憶(LSTM)ネットワークなどの構造を利用して、過去のフレームを記憶し、将来のアクションを予測します。近年では、ビデオ Transformerが、動画ストリーム内の長距離依存関係を処理できる能力により注目を集めています。
- ツーストリームネットワーク: このアプローチでは、空間的特徴(RGBフレーム)と時間的特徴(多くの場合、オプティカルフローを使用)を並列ストリームで処理し、データを融合して最終的な分類を行います。
実世界での利用例#
人間の動きを自動的に解釈する能力は、さまざまな業界に変革をもたらす可能性があり、安全性、効率性、ユーザー体験を向上させます。
- ヘルスケアにおけるAI: アクション認識は、患者モニタリングシステムに不可欠です。たとえば、介護施設での転倒を自動検出し、患者が倒れた場合にスタッフへ即座に通知できます。また、遠隔での身体リハビリテーションにも使用されており、AIコーチが患者の運動フォームを分析して、動作を正しく安全に行えていることを確認します。
- スマート監視とセキュリティ: 高度なセキュリティシステムは、単純な動体検知にとどまらず、アクション認識を使用して、けんか、万引き、不正侵入などの不審な行動を、無害な活動と区別して識別します。これにより、誤警報を減らし、リアルタイムセキュリティ監視を改善できます。
Ultralyticsでアクション分析を実装する#
一般的なワークフローでは、まず人物とその骨格ポーズを検出し、次に各関節の動きを分析します。Ultralytics YOLO26モデルは、初期ポーズ推定のステップで最先端の速度と精度を提供します。このステップは、多くのアクション認識パイプラインの基盤となります。
次の例では、Pythonを使用して動画フレームから骨格キーポイントを抽出する方法を示します。
from ultralytics import YOLO
# Load the YOLO26 pose estimation model
model = YOLO("yolo26n-pose.pt")
# Run inference on an image to detect person keypoints
results = model("https://ultralytics.com/images/bus.jpg")
# Process results
for result in results:
# Access the keypoints (x, y, visibility)
if result.keypoints is not None:
print(f"Detected keypoints shape: {result.keypoints.data.shape}")関連用語との違い#
適切な手法を確実に適用するには、アクション認識と類似するコンピュータビジョンタスクを区別することが重要です。
- アクション認識と物体追跡の比較: 物体追跡は、特定の物体や人物がフレーム間を移動する際に、その識別情報を維持することに重点を置きます(例: 「人物Aは座標Xにいる」)。アクション認識は、その追跡対象の行動を解釈します(例: 「人物Aは走っている」)。
- アクション認識と動画理解の比較: アクション認識が特定の身体動作を識別するのに対し、動画理解は、動画シーン全体のストーリー、コンテキスト、因果関係を把握する、より広範な概念です。
課題と今後のトレンド#
堅牢なアクション認識モデルの開発には、Kinetics-400やUCF101などの大規模なアノテーション済み動画データセットが必要であることなど、課題があります。動画データのラベリングは、静止画像のラベリングよりも大幅に時間がかかります。これに対応するため、Ultralytics Platformなどのツールがアノテーションとトレーニングのワークフローの効率化に役立ちます。
さらに、計算効率も重要です。高解像度の動画をリアルタイムで処理するには、相当なハードウェアリソースが必要です。業界では、レイテンシと帯域幅の使用量を削減するため、モデルをカメラやモバイルデバイス上で直接実行できるよう最適化するエッジAIへの移行が進んでいます。今後の進歩では、モデルの汎化の向上が目指されており、システムが明示的にトレーニングされていない視点からでもアクションを認識できるようになることが期待されています。









