Bounding Box
バウンディングボックスがコンピュータビジョンにおいて物体位置をどのように定義するかを学びます。座標フォーマット、現実世界での応用、およびUltralytics YOLO26の使用方法を探求しましょう。
バウンディングボックスは、画像やビデオフレーム内の特定のオブジェクトを囲む、一連の座標によって定義される長方形の領域です。computer vision (CV)の分野では、これらのボックスは、artificial intelligence (AI)システムに明確なアイテムの位置と認識方法を教えるための基本的なアノテーションとして機能します。画像全体を「車を含んでいる」と単に分類するのではなく、バウンディングボックスを使用することで、モデルは車の正確な位置と空間的広がりを特定し、背景や他のエンティティから切り離すことができます。このローカライゼーション機能は、高精度で複数のオブジェクトを同時に識別することを目的とするobject detectionタスクに不可欠です。
コアコンセプトと座標#
視覚データを効果的に処理するために、machine learning (ML)モデルは特定の座標系を利用してバウンディングボックスを数学的に表現します。選択された形式によって、model trainingのためのデータ準備方法や、モデルが予測を出力する方法が決定されることがよくあります。
- XYXY Coordinates: この形式は、左上の角と右下の角の絶対ピクセル値を使用してボックスを定義します。画像上に直接長方形を描画する場合、OpenCVやMatplotlibのような可視化ツールにとって直感的です。
- XYWH Format: COCOなどのデータセットで一般的なこの方法は、オブジェクトの中心点を指定した後に、ボックスの幅と高さを指定します。この表現は、学習プロセス中にloss functionsを計算するために重要です。
- Normalized Coordinates: 解像度の異なる画像間でのscalabilityを確保するため、座標は通常0から1の範囲にスケーリングされます。これにより、モデルはさまざまな次元の入力を分析する際により適切に一般化できるようになります。
実社会での応用#
バウンディングボックスは、多様な業界における数多くのAIソリューションの構成要素です。正確なローカリゼーションを可能にすることで、システムが物理世界とインテリジェントに対話できるようになります。
- Autonomous Vehicles: 自動運転車は、歩行者、他の車両、交通標識、障害物をリアルタイムで検出および追跡するためにバウンディングボックスを使用します。この空間認識は、ナビゲーションおよび安全システムが瞬間的な判断を下すために極めて重要です。
- Retail Analytics: スマートストアでは、バウンディングボックスは棚の在庫を監視し、製品に対する顧客のやり取りを追跡するのに役立ちます。このデータにより、手動でのカウントなしで在庫補充を自動化し、購入者の行動に関する洞察を得ることができます。
バウンディングボックスの実践#
YOLO26のような最新のアーキテクチャを使用する場合、モデルはクラスラベルおよびconfidence scoreとともにバウンディングボックスを予測します。次の例は、画像に対して推論を実行し、ultralyticsパッケージを使用してバウンディングボックスの座標にアクセスする方法を示しています。
from ultralytics import YOLO
# Load the YOLO26 model
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Access bounding box coordinates (xyxy format) for the first detected object
boxes = results[0].boxes
print(boxes.xyxy[0]) # Output: tensor([x1, y1, x2, y2, ...])関連用語と差別化#
バウンディングボックスは一般的な検出において標準的ですが、より詳細なタスクで使用される他のアノテーションタイプとは異なります。
- Instance Segmentation: 長方形のバウンディングボックスとは異なり、セグメンテーションはオブジェクトの正確な輪郭をトレースするピクセル単位のマスクを作成します。これは、おおよその位置よりも正確な形状が重要である場合に役立ちます。
- Oriented Bounding Box (OBB): 標準的なバウンディングボックスは軸に平行(直立した長方形)です。OBBは、衛星画像の船舶やコンベアベルト上のパッケージなど、角度がついたオブジェクトに合わせて回転させることができ、よりタイトなフィット感を提供し、背景ノイズを削減します。
- Keypoints: オブジェクトを囲む代わりに、キーポイントは、pose estimationのための人体上の関節などの特定のランドマークを特定します。
アノテーションと管理のためのツール#
高品質なバウンディングボックスアノテーションを作成することは、MLパイプラインにおける重要なステップです。Ultralytics Platformは、data annotationおよびデータセット管理のためのツールを提供することで、このプロセスを簡素化します。適切なアノテーションにより、モデルがオブジェクトを正確に区別するように学習し、overfittingや背景の混同などのエラーを最小限に抑えることができます。Non-Maximum Suppression (NMS)のような高度なテクニックは、重なり合うボックスを削除してこれらの予測を洗練させるために推論中に使用され、各オブジェクトに対して最も正確な検出のみが残るようにします。






