Computer Vision (CV)
コンピュータービジョンによって機械が画像や動画を解釈できる仕組みを探ります。主要なタスク、業界でのアプリケーション、Ultralytics YOLOを使い始める方法を学びます。
コンピュータービジョン(CV)は、デジタル画像、動画、その他の視覚入力から意味のある情報をコンピューターやシステムが抽出できるようにする人工知能(AI)の分野です。AIによって機械が思考できるようになるとすれば、コンピュータービジョンによって機械は見て、観察し、理解できるようになります。ルールベースの画像処理ツールとは異なり、現代のシステムはデータから直接学習します。車や腫瘍がどのように見えるかを明示的に教えられるのではなく、何千ものラベル付きサンプルに共通する根本的なパターンを特定し、これまで遭遇したことのない画像にもその知識を一般化します。機械学習(ML)とディープラーニング(DL)を適用することで、コンピュータービジョンは非構造化された視覚データを、ソフトウェアが実行可能な意思決定に変換します。
コンピュータービジョンの仕組み#
コンピューターは画像を、ピクセルを表す数値の配列として認識します。この配列をアクションに変換する処理は、5段階のパイプラインに従います。

画像取得。 ワークフローは、CMOSセンサー、赤外線カメラ、LiDARスキャナーなどのハードウェアで光を捉え、デジタルピクセルグリッドに変換するところから始まります。分析を開始する前に、カメラキャリブレーションでレンズの幾何学的特性を補正します。
前処理。 モデルが一貫した入力を受け取れるように、取得したデータを正規化します。これには、リサイズ、ノイズの低減、コントラストの調整が含まれます。
特徴抽出。 システムは、エッジ、勾配、コーナーなどの低レベル特徴を特定します。データがネットワークのより深い層に進むにつれて、これらの基本要素がテクスチャ、パターン、複雑な形状などの高レベル特徴に組み合わされます。システムは、垂直線を検出し、それをフェンスの支柱として認識し、さらにシーンを周囲の境界として理解することがあります。この処理は特徴抽出と呼ばれます。
モデル推論。 現代のコンピュータービジョンの中核を担うのは、畳み込みニューラルネットワーク(CNN)です。画像を数値の平坦なリストとして扱う標準的なニューラルネットワークとは異なり、CNNはピクセル間の空間的関係を保持します。そして、画像上をスライドするフィルターを使用して、フレーム内の位置に関係なくパターンを検出します。近年では、自然言語処理のアテンションメカニズムを画像データに適用する強力な代替手段として、Vision Transformers(ViTs)も登場しています。
出力とアクション。 モデルは、ラベル、複数のバウンディングボックス、ピクセルマスクなどの構造化された結果を返します。周辺のシステムはその結果に基づき、不良部品の排除、車両のブレーキ操作、アラートの発報などを実行します。
モデルの学習方法#
モデルの性能は、取り込むデータの品質に左右されます。教師あり学習には大量のトレーニングデータが必要であり、ImageNetやCOCOなどのベンチマークは、数百万件のアノテーション付きサンプルを提供します。トレーニング中、モデルは予測を行い、その予測を正解ラベルと比較して、誤差を減らすよう内部の重みを調整します。トレーニングが完了すると、同じモデルが前述の推論ステップを実行します。
ルールベースシステムからディープラーニングへの移行#

初期のコンピュータービジョンは、手動による特徴エンジニアリングに依存していました。エンジニアが、機械による物体認識を支援するために、固定的な幾何学的パラメーターを定義していたのです。こうしたシステムは脆弱で、照明が変化したり、物体が未知の角度で現れたりすると機能しなくなりました。100万枚を超えるラベル付きImageNet画像でトレーニングされたAlexNetが2012年に発表されたことで、畳み込みネットワークが大規模環境で人手設計の手法を上回れることが実証され、転換点となりました。ディープラーニングは、手作業で調整されたルールを、独自の特徴を学習するアーキテクチャに置き換えました。これにより、完全には制御できない現実世界の環境にも耐えられる柔軟性が実現しました。
コンピュータービジョン、画像処理、マシンビジョンの違い#
コンピュータービジョンと、しばしば混同される隣接分野を区別することが重要です。
- **画像処理**は、画像を拡張したり信号を抽出したりするために、明るさやコントラストを調整したり、フィルターを適用したりします。通常、出力は別の画像です。コンピュータービジョンは画像を入力として受け取り、解釈(「この部屋には3人います」)を出力します。コンピュータービジョンでは、準備段階として画像処理を日常的に使用します。
- **マシンビジョン**は、照明が固定され、部品の位置が既知であるなど、厳密に管理された環境で稼働する産業用検査システムを指します。コンピュータービジョンは、予測不能で管理されていない条件にも対応できる、より広範な分野です。
- 自然言語処理はテキストと音声を扱います。コンピュータービジョンは視覚データに完全に焦点を当てますが、ビジョン言語モデルによって、両者の橋渡しが進んでいます。
コンピュータービジョンの主要タスク#
コンピュータービジョンは単一の機能ではなく、それぞれ異なる問題を解決する複数の独立したタスクの集合です。各タスクについて詳しく説明した内容は、コンピュータービジョンタスクの完全ガイドをご覧ください。
- **画像分類:**画像全体に1つのラベルを割り当て、「この画像には何が写っているか」という問いに答えます。たとえば、製品を不良品と正常品に分類します。関連性の高い画像認識は、何が存在するかを特定します。
- **物体検出:**個々の物体を特定し、それぞれの周囲にバウンディングボックスを描画することで、1つのフレーム内にある複数の物体のカウントと位置特定を可能にします。
- **インスタンスセグメンテーション:**検出した物体ごとにピクセルレベルのマスクを生成し、同じクラスに属する個々のインスタンスを分離します。一方、セマンティックセグメンテーションは、インスタンスを区別せず、すべてのピクセルにクラスを割り当てます。
- **姿勢推定:**人体の関節など、物体上のキーポイントを検出し、動きや姿勢を追跡します。
- **回転バウンディングボックス:**軸に揃っていない物体に合わせて回転ボックスを適合させます。航空画像や衛星画像では不可欠です。
- **物体追跡:**動画ストリーム内で物体を追跡し、フレーム間で一貫したIDを維持します。オプティカルフローは、連続するフレーム間の見かけ上の動きを分析することで、この機能を拡張します。
- **光学文字認識(OCR):**印刷されたテキストや手書きテキストの画像を、機械可読データに変換し、ドキュメント処理を大規模に自動化します。
適切なタスクの選択#
技術的なタスクを最初からビジネス目標に合わせることで、コストのかかる手戻りを避けられます。
| ビジネス目標 | 使用するタスク |
|---|---|
| 製品をカテゴリーに分類する | 画像分類 |
| 項目を数える、または位置を特定する | 物体検出 |
| 物体の正確な形状や境界を分析する | インスタンスセグメンテーション |
| 動画フレーム間の動きを追跡する | 物体追跡 |
| 身体の位置や関節の角度を測定する | 姿勢推定 |
| 航空画像内の回転した物体を検出する | 回転バウンディングボックス |
| ドキュメントやラベルからテキストを読み取る | 光学文字認識 |
実世界での利用例#
現在、コンピュータービジョンは、ほぼすべての主要産業における本番システムの基盤となっています。

- 製造業と品質管理。 現代の生産ラインは、人間の目視能力を上回る速度で稼働しています。ビジョンシステムは瞬時に品質検査を実行し、人間の検査員が蓄積する疲労の影響を受けることなく、ライン速度を維持したまま微細な亀裂や部品の位置ずれを特定します。機械の摩耗パターンを監視することで予知保全も可能になり、計画外のダウンタイムにつながる故障が発生する前に、故障の兆候を検出できます。製造業におけるコンピュータービジョンと欠陥検出もご覧ください。
- ヘルスケアと診断。 医用画像解析アルゴリズムは、X線、MRI、CTスキャンを処理し、時間的なプレッシャーの下では見落としやすい初期段階の腫瘍、微細骨折、網膜異常を検出します。手術室では、低侵襲処置中のリアルタイムな空間マッピングにビジョンシステムが利用されます。ヘルスケアにおけるコンピュータービジョンもご覧ください。
- 小売。 無人決済店舗では、センサーフュージョンとビジョンアルゴリズムを使用して棚から持ち出される商品を追跡し、顧客に自動で請求します。同じシステムで棚の在庫量をリアルタイムに監視して補充アラートを発報し、在庫管理と小売店のロス防止を支援します。小売業におけるコンピュータービジョンもご覧ください。
- 自律型輸送。 知覚レイヤーは、自動運転車において最も安全性が重要なコンポーネントです。ビジョンシステムは車線標示、交通標識、歩行者、その他の車両をリアルタイムに識別し、カメラ入力をレーダーやLiDARと組み合わせて、3D物体検出によって車両周辺の360度モデルを構築します。自動運転車もご覧ください。
- セキュリティと監視。 セキュリティインフラは、受動的な記録から能動的な介入へと移行しています。立入制限区域での滞留を検出し、発生中の異常な行動パターンにフラグを立て、公共空間での行列管理を支援します。その基盤となる機能が異常検知です。
- 農業。 ドローンやトラクターは個々の植物レベルで作物の健康状態を評価し、マルチスペクトル画像を分析して脱水、害虫被害、栄養不足を検出します。その後、水、農薬、肥料を畑全体ではなく必要な場所にのみ散布します。農業におけるコンピュータービジョンもご覧ください。
エッジにおけるコンピュータービジョン#
リアルタイムの視覚分析は、動画を中央のクラウドサーバーに送るのではなく、カメラやローカルゲートウェイ上で直接実行するエッジ処理へと移行しています。これは2つの理由で重要です。
自律型ロボットや産業ラインの検査では、数ミリ秒の遅延がエラーを生むため、許容できない遅延をほぼゼロまで低減できます。また、ネットワークを通過するのが生の動画ではなくメタデータのみになるため、帯域幅の要件が大幅に下がり、プライバシーも向上します。機密性の高い映像がローカルデバイスから外部に出ることがないためです。エッジAIとリアルタイム推論がこれを実用化し、ONNXやTensorRTなどのモデルデプロイオプションによって、1つのトレーニング済みモデルをさまざまなハードウェアで実行できます。
課題と制限事項#
データ品質。 モデルには、トレーニングデータの品質が反映されます。低解像度、ラベル付けの不備、または代表性に欠けるデータセットでは、信頼性の低いモデルが生成されます。また、多様性のあるアノテーション付きデータセットの構築は、アルゴリズムの設計よりも労力を要することが少なくありません。データラベリングもご覧ください。
環境変数。 激しい雨、レンズフレア、部分的な遮蔽、物体スケールの変動はいずれも性能を低下させます。堅牢なシステムでは、トレーニング中にデータ拡張を用いてこうした条件をシミュレートし、デプロイ前に耐性を構築します。また、過学習を避けるため、慎重な検証も行います。
倫理的配慮とバイアス。 人口統計的な多様性に欠けるデータセットでトレーニングされたモデルは、集団によって性能に偏りが生じます。医用画像、職場の安全、公共空間など、人を分析するシステムを導入する組織は、データセットの公平性を監査し、自動意思決定を対象とする新たな規制を遵守する必要があります。
コンピュータービジョンの未来#
Vision Transformersは、画像内の離れた部分同士の関係を理解する必要があるタスクで、実現可能な範囲を広げています。さらに、マルチモーダル学習は視覚データをテキスト、音声、深度と組み合わせ、より豊かな文脈理解を備えたシステムを構築します。画像について質問に答えるビジョン言語モデルは、その初期の例です。
生成AIは、データ不足に直接対処しています。合成データにより、現実世界では十分な量を収集できない、特定の故障モードやまれな疾患症例など、まれなシナリオの非常にリアルな画像を作成できます。一方、深度センシングカメラとLiDARは、システムを平面的な画像分析から空間コンピューティングへと進化させています。空間コンピューティングでは、ARを利用したメンテナンスや構造マッピングなどの用途で、デジタル情報を物理世界に重ね合わせます。
Ultralyticsでコンピュータービジョンを実装する#
コンピュータービジョンプロジェクトを試験導入するチームにとって、Ultralytics YOLO26は、リアルタイムの物体検出を始めるための実用的な選択肢です。オープンソースで、ドキュメントが充実しており、エッジで実行できる十分な速度を備えています。ハードウェア全体の精度とレイテンシーの数値はベンチマークページで公開されており、ドキュメントにはモデルの横並び比較も掲載されています。より広範なエコシステムには、従来型の画像処理向けのOpenCVや、主要なトレーニングフレームワークであるPyTorchが含まれます。
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Run inference on a standard example image
# The model identifies objects and their locations
results = model("https://ultralytics.com/images/bus.jpg")
# Display the resulting image with bounding boxes
results[0].show()このスクリプトは、事前トレーニング済みモデルを使用して、数行で推論を実行します。パイロットから本番環境へ移行するチームは、Ultralytics Platformを使用してデータセットへのアノテーション、クラウドでのモデルのトレーニング、デプロイの管理を行えます。または、転移学習を適用して、スクラッチからトレーニングする場合よりはるかに少ないラベル付きデータで、事前トレーニング済みモデルをカスタムデータセットに適応させることもできます。
よくある質問
機械学習は、データから学習するシステムを構築する、より広範な分野です。コンピュータービジョンは、通常はディープラーニングを通じて、画像や動画などの視覚入力にその分野を適用したものです。現代のコンピュータービジョンのほぼすべては機械学習を基盤としていますが、機械学習はテキスト、音声、表形式データも対象とします。
いいえ。画像認識はコンピュータービジョンに含まれる1つのタスクで、画像に何が写っているかを特定します。コンピュータービジョンには、物体検出、セグメンテーション、姿勢推定、追跡、シーン理解も含まれます。
タスクの複雑さと、モデルが処理する必要のある変動の大きさによって異なります。Ultralytics YOLO26などの事前トレーニング済みモデルから転移学習を行うと、必要量を大幅に削減できます。基盤モデルのトレーニングに使用される数百万枚の画像ではなく、実用的なカスタム検出モデルは、クラスごとに数百枚から数千枚のラベル付き画像でトレーニングできることがよくあります。
はい。モデルをエッジデバイスに直接デプロイして完全にオフラインで実行できます。これは、レイテンシー、帯域幅、またはデータプライバシー上の規則により、動画をクラウドに送信できない環境で標準的に行われています。
Pythonが主流です。これは、
ultralyticsパッケージ、PyTorch、OpenCVなど、そのエコシステムが成熟しているためです。最大限の推論性能が必要な場合はC++が使用され、通常は組み込みシステムや自動車システムで採用されます。









