Keypoints
キーポイントがAIにおいて物体のジオメトリや姿勢をどのように定義するかを学びます。Ultralytics YOLO26でポーズ推定を探究し、使いやすいPython SDKを使い始めましょう。
キーポイントとは、オブジェクトや被写体の重要な特徴を定義する、画像内の明確な空間上の位置やランドマークのことです。コンピュータビジョンや機械学習の文脈において、キーポイントは通常、人の肘、建物の角、自動車のホイールの中心など、オブジェクトの特定の部分を正確に示す座標(X, Y)のセットによって表現されます。オブジェクトの存在のみを識別する単純なタスクとは異なり、キーポイントを特定することで、人工知能(AI)モデルは被写体のジオメトリ、姿勢、および構造的配置を理解できるようになります。この機能は高度な視覚分析の基礎であり、機械がボディランゲージを解釈し、正確な動きを追跡し、デジタルオーバーレイを現実世界のオブジェクトに合わせることを可能にします。
AIモデルにおけるキーポイントの役割#
キーポイントは、人間や動物の骨格構造をマッピングする手法である姿勢推定の基礎データとして機能します。肩、膝、足首などの事前定義されたポイントのセットを検知することにより、アルゴリズムは被写体の完全な姿勢をリアルタイムで再構築できます。このプロセスは、内部の形状を理解することなく、通常はオブジェクトの周囲に境界ボックスを出力する標準的な物体検出を超えたものです。
最先端のUltralytics YOLO26のような近代的なアーキテクチャは、これらのキーポイントを高精度かつ高速に予測するように進化してきました。これらのモデルは、関節や顔の特徴に関連する視覚的パターンを学習するために、COCO Keypointsのような大規模なアノテーション付きデータセットでトレーニングされたディープラーニング(DL)ネットワークを利用します。推論中、モデルは各キーポイントの座標を回帰し、多くの場合、予測の信頼性を示す信頼度スコアを含めます。
キーポイントと関連概念の比較#
キーポイントが持つ独自の有用性を理解するために、他の一般的なコンピュータビジョンの出力と区別することは有益です。
- キーポイントと境界ボックスの比較:境界ボックスは大まかな位置特定を提供し、オブジェクト全体を長方形で囲みます。キーポイントは、そのオブジェクト内の特定の部分のきめ細やかな位置特定を提供します。
- キーポイントと画像セグメンテーションの比較:画像セグメンテーションはすべてのピクセルを分類して、オブジェクトの形状の正確なマスクを作成します。セグメンテーションが詳細な境界情報を提供する一方で、キーポイントは構造的なサマリー(「スケルトン」)を提供し、これはモーションや運動学の分析において効率的であることがよくあります。
- キーポイントと特徴量記述子の比較:SIFT(スケール不変特徴量変換)のような従来の画像処理では、キーポイントは画像マッチングに使用される関心点(角、ブロブ)です。現代のDL姿勢推定では、キーポイントはネットワークによって学習されたセマンティックラベル(例:「左手首」)です。
実社会での応用#
身体の特定部位やオブジェクトの特徴を追跡する能力は、業界全体で多様なアプリケーションを実現します。
- **スポーツアナリティクス:**コーチやアスリートは、生体力学を分析するために姿勢推定を使用します。関節上のキーポイントを追跡することにより、システムは角度と速度を計算して、ゴルフ、テニス、短距離走などのスポーツでテクニックを向上させることができます。Ultralytics YOLOモデルがゴルフのスイングを追跡して実用的なフィードバックを提供する方法をご覧ください。
- ヘルスケアおよびリハビリテーション: 理学療法プラットフォームは、キーポイントを活用して患者の運動を遠隔で監視します。システムは、リハビリテーションのルーチン中に患者が正しいフォームを維持しているかを確認し、怪我のリスクを低減して回復の進捗状況を追跡します。
- 拡張現実(AR): ソーシャルメディアのフィルターや仮想試着アプリケーションは、顔のキーポイント(目、鼻、口の輪郭)に依存しており、デジタルマスクや眼鏡をユーザーの顔にしっかりと固定し、ユーザーが動いても位置合わせを維持します。
- ドライバー監視: 自動車の安全システムは、顔のランドマークを追跡して眠気や脇見運転の兆候を検出し、目が閉じている場合や頭の位置が注意散漫を示している場合にドライバーに警告します。
Ultralytics YOLO26によるキーポイント検出の実装#
Ultralytics PlatformまたはPython SDKを使用することで、開発者はキーポイント検出を簡単に実装できます。次の例は、事前トレーニング済みのYOLO26-poseモデルをロードし、画像に対して推論を実行して人間の骨格を検出する方法を示しています。
from ultralytics import YOLO
# Load a pre-trained YOLO26 pose estimation model
model = YOLO("yolo26n-pose.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Visualize the results showing detected keypoints and skeletons
for result in results:
result.show() # Display the image with keypoints drawn
# Access keypoint coordinates (x, y, confidence)
keypoints = result.keypoints.data
print(f"Detected keypoints shape: {keypoints.shape}")このシンプルなワークフローにより、洗練されたコンピュータビジョン(CV)アプリケーションを迅速に展開できます。産業機械や動物の種などの特定のポイントを検出するなど、独自のカスタムキーポイントモデルをトレーニングしようとするユーザーにとって、Ultralytics Platformはクラウドでのデータアノテーションとモデルトレーニングのプロセスを簡素化します。
高度な考慮事項#
キーポイント検出を正常に展開するには、オクルージョン(体のパーツが隠れている場合)や多様な照明条件などの課題に対処する必要があります。近代的なモデルは、トレーニング中の堅牢なデータ拡張によってこれに対処し、ネットワークをさまざまなシナリオにさらします。さらに、キーポイントを物体追跡アルゴリズムと統合することで、ビデオストリーム内で時間の経過に伴う個人の一貫した識別が可能になり、セキュリティや行動分析などのアプリケーションに不可欠となります。






