Depth Estimation
デプス推定がコンピュータビジョンに3D視点を加える仕組みを学びます。Ultralytics YOLO26モデルを使用した単眼デプスやステレオビジョンなどの手法を解説します。
深度推定は、コンピュータビジョンにおける重要なプロセスであり、カメラから物体までの距離を判断して、2D画像に実質的な第3の次元を加えます。画像内のすべてのピクセルがどれほど遠くにあるかを計算することで、この技術は深度マップを作成します。これは、ピクセルの輝度が距離に対応する表現です。この機能は人間の両眼視を模倣し、機械が空間的な関係や幾何学的構造を認識できるようにします。深度推定は、自律システムが安全に移動し、周囲の環境を理解し、物理的な物体と相互作用できるようにする基盤技術です。
主要な仕組みと技術#
深度推定を実現する方法はいくつかあり、ハードウェアベースのソリューションから、人工知能を使用した純粋なソフトウェアベースのアプローチまで多岐にわたります。
- ステレオビジョンシステム: 人間の目と同様に、ステレオビジョンでは左右に並べて配置した2台のカメラを使用します。アルゴリズムは、左右の画像間にあるわずかな違い、つまり視差を分析して、距離を三角測量します。この処理では、両方のフレーム内で同じ点を特定するために、正確な特徴マッチングに大きく依存します。
- 単眼深度推定: この高度な手法では、1枚の画像から深度を推定します。1枚の2D写真には本質的な深度データがないため、深層学習モデルを大規模なデータセットで学習し、遠近法、物体のサイズ、遮蔽などの視覚的手がかりを認識させます。畳み込みニューラルネットワーク (CNNs)などの最新アーキテクチャはこのタスクに優れており、一般的なカメラから3D構造を導出できます。
- LiDARと飛行時間 (ToF): LiDAR (光検出と測距)や飛行時間カメラなどのアクティブセンサーは光パルスを照射し、戻ってくるまでの時間を測定します。これらの手法は非常に正確な点群を生成し、機械学習モデルの学習用グラウンドトゥルースデータの収集によく使用されます。
実世界での利用例#
距離を測定する能力は多くの業界に変革をもたらし、空間認識を必要とするアプリケーションを支えています。
- 自動運転: 自動運転車は深度推定を利用して障害物を検出し、他の車両との距離を測定し、複雑な道路網を安全に走行します。歩行者や自転車利用者を識別する3D物体検出に不可欠な技術です。
- ロボティクスと自動化: ロボットは、経路計画や物体の操作などのタスクに深度認識を使用します。たとえば、倉庫ロボットは、荷物を棚に衝突させずに取り出すために、棚までの正確な距離を把握する必要があります。
- 拡張現実 (AR): 仮想オブジェクトを現実世界のシーンに説得力を持って配置するには、ARデバイスが環境の3D幾何学的構造を理解する必要があります。深度推定により、仮想キャラクターを現実の家具の背後に隠すことが可能になります。これは遮蔽処理と呼ばれる概念です。
コード例: 単眼深度推定#
専用の深度モデルも存在しますが、単純なシナリオでは、物体検出のバウンディングボックスを距離の代替指標として使用することで、空間的な関係を推定できる場合があります(通常、ボックスが大きいほど物体が近いことを意味します)。ここでは、ultralyticsパッケージを使用してモデルを読み込み、物体を検出する方法を示します。これは、多くの深度対応パイプラインにおける最初のステップです。
from ultralytics import YOLO
# Load the YOLO26 model
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("path/to/image.jpg")
# Process results
for result in results:
# Get bounding boxes (xyxy format)
boxes = result.boxes.xyxy
# Iterate through detections
for box in boxes:
print(f"Detected object at: {box}")他のコンピュータビジョン概念との関係#
深度推定と関連用語を区別することが重要です。物体検出は、バウンディングボックスを使用して2D空間内の物体が何であり、どこにあるかを特定するのに対し、深度推定は物体がどれほど遠くにあるか(Z軸)を特定します。同様に、セマンティックセグメンテーションはピクセルをカテゴリ(例: 道路、空、車)に分類しますが、深度推定は同じピクセルに距離値を割り当てます。
空間AIの進展#
生成AIの近年の進歩により、2Dビジョンと3Dビジョンの隔たりが埋まりつつあります。Neural Radiance Fields (NeRF)などの技術は、複数の2D画像を使用して複雑な3Dシーンを再構築し、その基盤となる深度の原理に大きく依存します。さらに、モデル最適化技術が向上するにつれて、エッジAIデバイス上で非常に正確な深度推定を実行することが現実的になっています。これにより、ドローンやスマートグラスほど小型のハードウェアでもリアルタイムの空間コンピューティングが可能になります。効率的なモデルの学習とデプロイには、Ultralytics Platformなどのプラットフォームが活用されています。









