Capsule Networks (CapsNet)
Capsule Networks(CapsNet)と、それがCNNの限界をどのように解決するかを探求します。ダイナミックルーティング、空間階層、およびCapsNetとYOLO26の比較について学びましょう。
カプセルネットワーク(CapsNetsと略されることが多い)は、従来のニューラルネットワークに見られる特定の制限を克服するように設計された、ディープラーニング分野の高度なアーキテクチャです。Geoffrey Hintonとそのチームによって導入されたCapsNetsは、標準的なモデルよりも人間の脳の生物学的ニューラル組織をより忠実に模倣しようと試みます。特徴の検出には優れているもののダウンサンプリングによって空間的関係が失われがちな一般的なconvolutional neural network (CNN)とは異なり、カプセルネットワークはニューロンを「カプセル」と呼ばれるグループに整理します。これらのカプセルは、オブジェクトが存在する確率だけでなく、向き、サイズ、テクスチャなどの固有のプロパティもエンコードし、視覚データ内の階層的な空間関係を効果的に保持します。
従来のCNNの制限#
CapsNetsの革新性を理解するには、標準的なコンピュータビジョンモデルの動作を確認すると役立ちます。従来のCNNは、feature extractionのレイヤーと、それに続くプーリングレイヤー(具体的にはmax pooling)を使用して計算負荷を削減し、平行移動不変性を実現します。これは、CNNが画像内のどこに「猫」があるかに関わらずそれを識別できることを意味します。
しかし、このプロセスでは正確な位置データが破棄されることが多く、「ピカソ問題」を引き起こします。つまり、CNNは、必要な特徴がすべて揃っているという理由だけで、たとえ口が額にあっても顔を正しく分類してしまう可能性があります。CapsNetsは、プーリングレイヤーを削除し、オブジェクトのspatial hierarchiesを尊重するプロセスに置き換えることで、この問題に対処します。
カプセルネットワークの仕組み#
このアーキテクチャの核心となる構成要素はカプセルであり、これはスカラー値ではなくベクトルを出力するネストされたニューロンのセットです。vector mathematicsにおいて、ベクトルは大きさと方向の両方を持ちます。CapsNetでは以下のようになります。
- 大きさ (長さ): 現在の入力に特定のエンティティが存在する確率を表します。
- 方向(向き): オブジェクトのpose estimation、スケール、回転などのインスタンス化パラメータをエンコードします。
下位レイヤーのカプセル(エッジなどの単純な形状を検出する)は、上位レイヤーのカプセル(目やタイヤなどの複雑なオブジェクトを検出する)の出力を予測します。この通信は、「動的ルーティング」または「合意によるルーティング」と呼ばれるアルゴリズムによって管理されます。下位レベルのカプセルの予測が上位レベルのカプセルの状態と一致する場合、それらの間の接続が強化されます。これにより、ネットワークは、回転やスケールについてCNNに教えるために通常必要となる大規模なdata augmentationを必要とせずに、さまざまな3D視点からオブジェクトを認識できるようになります。
主な違い: CapsNetとCNNの比較#
どちらのアーキテクチャもcomputer vision (CV)の基本ですが、視覚データの処理方法と表現方法において異なります。
- スカラー vs ベクトル: CNNのニューロンはスカラー出力を使用して特徴の存在を示します。CapsNetはベクトルを使用して、存在 (長さ) と姿勢パラメータ (向き) をエンコードします。
- ルーティングとプーリング: CNNはプーリングを使用してデータをダウンサンプリングするため、多くの場合位置の詳細が失われます。CapsNetsは動的ルーティングを使用して空間データを保持するため、正確なobject trackingを必要とするタスクに非常に効果的です。
- データ効率: カプセルは3Dの視点とaffine transformationsを暗黙的に理解しているため、オブジェクトのあらゆる可能な回転を学習するために多くの例を必要とする可能性のあるCNNと比較して、より少ないtraining dataから一般化できることがよくあります。
実社会での応用#
CapsNetsは、YOLO26のような最適化されたモデルよりも計算コストが高くなることがよくありますが、専門分野において明確な利点を提供します。
-
医用画像解析: ヘルスケアにおいて、異常の正確な向きと形状は非常に重要です。研究者はbrain tumor segmentationにCapsNetsを適用しており、そこでは標準的なCNNが平滑化してしまう可能性のある微妙な空間的階層に基づいて、モデルが周囲の組織から腫瘍を区別する必要があります。Capsule Networks in Medical Imagingに関する関連研究を調べることができます。
-
重なり合う数字の認識: CapsNetsは、特に数字が重なり合うシナリオにおいて、MNIST datasetで最先端の結果を達成しました。ネットワークは各数字の「ポーズ」を追跡するため、それらを単一の混乱した特徴マップにマージするのではなく、2つの重なり合う数字(例:5の上に3がある)を個別のオブジェクトとして分離できます。
実用的なコンテキストと実装#
カプセルネットワークは主に分類アーキテクチャです。理論的な堅牢性は提供しますが、現代の業界アプリケーションでは、リアルタイムパフォーマンスのために高速なCNNやTransformerが優先されることがよくあります。ただし、MNISTのようなCapsNetで使用される分類ベンチマークを理解しておくことは有用です。
次の例は、ultralyticsパッケージを使用して、MNIST datasetで近代的なYOLO classification modelをトレーニングする方法を示しています。これは、カプセルネットワークを検証するために使用される主要なベンチマークタスクと並行しています。
from ultralytics import YOLO
# Load a YOLO26 classification model (optimized for speed and accuracy)
model = YOLO("yolo26n-cls.pt")
# Train the model on the MNIST dataset
# This dataset helps evaluate how well a model learns handwritten digit features
results = model.train(data="mnist", epochs=5, imgsz=32)
# Run inference on a sample image
# The model predicts the digit class (0-9)
predict = model("https://docs.ultralytics.com/datasets/classify/mnist/")カプセルとビジョンAIの未来#
カプセルネットワークの背後にある原則は、AI safetyおよび解釈可能性の研究に影響を与え続けています。カプセルは、部分と全体の関係を明示的にモデル化することにより、ディープニューラルネットワークの「ブラックボックス」の性質に対する「ガラスボックス」の代替手段を提供し、意思決定をより説明可能にします。将来の開発では、カプセルの空間的堅牢性と、YOLO11や新しいYOLO26などのアーキテクチャの推論速度を組み合わせて、3D object detectionおよびロボティクスにおけるパフォーマンスを向上させることが目指されています。研究者たちはまた、合意アルゴリズムの計算コストをさらに削減するために、Matrix Capsules with EM Routingを探索しています。
データセットを管理し、モデルを効率的にトレーニングしたい開発者向けに、Ultralytics Platformは、データの注釈付け、クラウドでのトレーニング、およびCNNの速度と複雑なビジョンタスクに必要な精度のバランスを取るモデルのデプロイを行うための統合環境を提供します。






