YOLO Vision 2026:
返回 Ultralytics 词汇表

Capsule Networks (CapsNet)

探索胶囊网络(Capsule Networks / CapsNets)以及它们如何解决 CNN 的局限性。了解动态路由、空间层次结构,并将 CapsNet 与 YOLO26 进行对比。

胶囊网络(Capsule Networks,通常简称为 CapsNets)代表了深度学习领域的一项先进架构,旨在克服传统神经网络中存在的特定局限性。CapsNets 由 Geoffrey Hinton 及其团队提出,试图比标准模型更密切地模仿人脑的生物神经组织。与典型的卷积神经网络 (CNN)(擅长检测特征但由于降采样往往会丢失空间关系)不同,胶囊网络将神经元组织成称为“胶囊”的组。这些胶囊不仅编码物体存在的概率,还编码其特定属性(如方向、大小和纹理),从而有效地保留了视觉数据中的分层空间关系。

传统 CNN 的局限性#

为了理解 CapsNets 的创新之处,了解标准计算机视觉模型的运作方式会很有帮助。传统的 CNN 使用特征提取层,接着是池化层(特别是最大池化),以减少计算负载并实现平移不变性。这意味着,无论“猫”位于图像中的什么位置,CNN 都能将其识别出来。

然而,这个过程通常会丢弃精确的位置数据,从而导致“毕加索问题”:即使嘴巴在额头上,CNN 也可能正确分类一张脸,仅仅因为所有必要的特征都存在。CapsNets 通过移除池化层并将其替换为一个遵循物体空间层次结构的过程来解决这个问题。

胶囊网络如何工作#

这种架构的核心构建块是胶囊,这是一组嵌套的神经元,输出向量而不是标量值。在向量数学中,向量同时具有幅度和方向。在 CapsNet 中:

  • 大小(长度): 表示特定实体存在于当前输入中的概率。
  • 方向(朝向): 编码实例化参数,例如物体的姿态估计、缩放和旋转。

低层中的胶囊(检测边缘等简单形状)预测高层中的胶囊(检测眼睛或轮胎等复杂对象)的输出。这种通信由称为“动态路由”或“协议路由”的算法管理。如果低层胶囊的预测与高层胶囊的状态一致,它们之间的连接就会得到加强。这使网络能够识别来自不同 3D 视角的物体,而无需通常需要用来教导 CNN 了解旋转和缩海的大规模数据增强

主要区别:CapsNet 与 CNN#

虽然这两种架构都是计算机视觉 (CV)的基础,但它们在处理和表示视觉数据的方式上有所不同:

  • 标量与向量: CNN 神经元使用标量输出表示特征存在。CapsNet 使用向量来编码存在(长度)和姿态参数(方向)。
  • 路由与池化: CNN 使用池化对数据进行降采样,通常会丢失位置细节。CapsNets 使用动态路由来保留空间数据,使其对于需要精确对象跟踪的任务非常有效。
  • 数据效率: 由于胶囊隐式理解 3D 视角和仿射变换,与可能需要大量示例来学习物体每个可能旋转的 CNN 相比,它们通常可以从更少的训练数据中进行泛化。

实际应用#

虽然 CapsNets 的计算成本通常比 YOLO26 等优化模型更高,但它们在专业领域具有明显的优势:

  1. 医学图像分析: 在医疗保健中,异常的精确方向和形状至关重要。研究人员已将 CapsNets 应用于脑肿瘤分割,模型必须根据标准 CNN 可能会平滑掉的微妙空间层次结构,将肿瘤与周围组织区分开来。你可以探索有关医学成像中的胶囊网络的相关研究。

  2. 重叠数字识别: CapsNets 在MNIST 数据集上取得了最先进的结果,尤其是在数字重叠的场景中。由于网络会跟踪每个数字的“姿态”,因此它可以将两个重叠的数字(例如,在 '5' 上方的 '3')解耦为不同的对象,而不是将它们合并为单个混乱的特征图。

实际背景与实现#

胶囊网络主要是一种分类架构。虽然它们提供了理论上的稳健性,但现代工业应用通常更倾向于使用高速 CNN 或 Transformer 来实现实时性能。不过,了解用于 CapsNet 的分类基准(如 MNIST)很有用。

以下示例演示了如何使用 ultralytics 包在 MNIST 数据集上训练现代YOLO 分类模型。这类似于用于验证胶囊网络的主要基准任务。

from ultralytics import YOLO

# Load a YOLO26 classification model (optimized for speed and accuracy)
model = YOLO("yolo26n-cls.pt")

# Train the model on the MNIST dataset
# This dataset helps evaluate how well a model learns handwritten digit features
results = model.train(data="mnist", epochs=5, imgsz=32)

# Run inference on a sample image
# The model predicts the digit class (0-9)
predict = model("https://docs.ultralytics.com/datasets/classify/mnist/")

胶囊与视觉 AI 的未来#

胶囊网络背后的原理继续影响着AI 安全和可解释性研究。通过显式建模部分与整体的关系,胶囊为深度神经网络的“黑盒”性质提供了一种“白盒”替代方案,使决策更具可解释性。未来的发展着眼于将胶囊的空间鲁棒性与 YOLO11 或更新的 YOLO26 等架构的推理速度相结合,以提高在3D 对象检测和机器人技术中的性能。研究人员还在探索带有 EM 路由的矩阵胶囊,以进一步降低协议算法的计算成本。

对于希望高效管理数据集和训练模型的开发者而言,Ultralytics 平台提供了一个统一的环境来注释数据、在云端训练以及部署平衡了 CNN 速度与复杂视觉任务所需准确度的模型。

Explore solutions

Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多
Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多
Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多

让我们一起构建 AI 的未来!

开启你的机器学习未来之旅