Ultralytics YOLO27:
返回 Ultralytics 术语表

Capsule Networks (CapsNet)

探索胶囊网络 (CapsNets) 及其如何解决 CNN 的局限性。了解动态路由、空间层次结构,以及 CapsNets 与 YOLO26 的比较。

胶囊网络通常简称为 CapsNets,是深度学习领域中的一种先进架构,旨在克服传统神经网络存在的特定局限。CapsNets 由 Geoffrey Hinton 及其团队提出,试图比标准模型更贴近地模拟人类大脑的生物神经组织方式。不同于典型的卷积神经网络 (CNN),后者擅长检测特征,但常常因下采样而丢失空间关系,胶囊网络将神经元组织成称为“胶囊”的群组。这些胶囊不仅编码对象存在的概率,还编码其具体属性,例如方向、大小和纹理,从而有效保留视觉数据中的层级空间关系。

传统 CNN 的局限性#

要理解 CapsNets 的创新之处,了解标准计算机视觉模型的运行方式会有所帮助。传统 CNN 使用特征提取层,随后使用池化层,尤其是最大池化,以降低计算负载并实现平移不变性。这意味着无论“猫”位于图像中的什么位置,CNN 都能识别出它。

然而,这一过程通常会丢弃精确的位置数据,从而导致“毕加索问题”:即使嘴巴位于额头上,CNN 也可能正确地将其分类为人脸,仅仅因为所有必要的特征都存在。CapsNets 通过移除池化层,并将其替换为尊重对象空间层级关系的处理过程来解决这一问题。

胶囊网络的工作原理#

这一架构的核心构建模块是胶囊,它是一组嵌套的神经元,输出的是向量而非标量值。在向量数学中,向量同时具有大小和方向。在 CapsNet 中:

  • **大小(长度):**表示当前输入中某个特定实体存在的概率。
  • **方向(朝向):**编码实例化参数,例如对象的姿态估计、缩放比例和旋转角度。

低层胶囊(检测边缘等简单形状)会预测高层胶囊(检测眼睛或轮胎等复杂对象)的输出。这种通信由一种称为“动态路由”或“基于一致性的路由”的算法管理。如果低层胶囊的预测与高层胶囊的状态一致,它们之间的连接就会得到加强。这样一来,网络无需通常为了让 CNN 学会处理旋转和缩放而进行的大量数据增强,就能从不同的 3D 视角识别对象。

关键差异:CapsNets 与 CNN 的对比#

尽管这两种架构都是计算机视觉 (CV)的基础,但它们处理和表示视觉数据的方式不同:

  • **标量与向量:**CNN 神经元使用标量输出表示特征是否存在。CapsNets 使用向量编码存在性(长度)和姿态参数(方向)。
  • **路由与池化:**CNN 使用池化对数据进行下采样,通常会丢失位置细节。CapsNets 使用动态路由保留空间数据,因此在需要精确对象跟踪的任务中非常有效。
  • **数据效率:**由于胶囊能够隐式理解 3D 视角和仿射变换,与 CNN 相比,它们通常只需较少的训练数据就能实现泛化;而 CNN 可能需要大量示例才能学会对象的每一种可能旋转。

实际应用#

尽管 CapsNets 的计算成本通常高于YOLO26等优化模型,但它们在专业领域具有独特优势:

  1. **医学图像分析:**在医疗领域,异常区域的精确方向和形状至关重要。研究人员已将 CapsNets 应用于脑肿瘤分割,在此任务中,模型必须根据标准 CNN 可能平滑掉的细微空间层级关系,将肿瘤与周围组织区分开来。你可以在医学影像中的胶囊网络中了解相关研究。

  2. **重叠数字识别:**CapsNets 在MNIST 数据集上取得了最先进的结果,尤其是在数字重叠的场景中。由于网络会跟踪每个数字的“姿态”,因此能够将两个重叠的数字(例如叠加在 '5' 上的 '3')解耦为不同对象,而不是将它们合并成单个混淆的特征图。

实践背景与实现#

胶囊网络主要是一种分类架构。尽管它们具有理论上的鲁棒性,但现代工业应用通常更倾向于使用高速 CNN 或 Transformer 来实现实时性能。不过,了解 CapsNets 所采用的分类基准(例如 MNIST)仍然很有用。

以下示例演示了如何使用 ultralytics 包在 MNIST 数据集上训练现代YOLO 分类模型。这与用于验证胶囊网络的主要基准任务相对应。

from ultralytics import YOLO

# Load a YOLO26 classification model (optimized for speed and accuracy)
model = YOLO("yolo26n-cls.pt")

# Train the model on the MNIST dataset
# This dataset helps evaluate how well a model learns handwritten digit features
results = model.train(data="mnist", epochs=5, imgsz=32)

# Run inference on a sample image
# The model predicts the digit class (0-9)
predict = model("https://docs.ultralytics.com/datasets/classify/mnist")

胶囊与视觉 AI 的未来#

胶囊网络背后的原理持续影响着AI 安全和可解释性研究。通过显式建模部分与整体之间的关系,胶囊为深度神经网络的“黑盒”特性提供了一种“玻璃盒”替代方案,使决策更易于解释。未来的发展方向是将胶囊的空间鲁棒性与YOLO11或更新的 YOLO26 等架构的推理速度相结合,以提升3D 对象检测和机器人技术的性能。研究人员还在探索带有 EM 路由的矩阵胶囊,以进一步降低协议算法的计算成本。

对于希望高效管理数据集和训练模型的开发者,Ultralytics Platform提供了统一环境,可用于标注数据、在云端训练模型,以及部署兼顾 CNN 速度与复杂视觉任务所需精度的模型。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅