Identity Mapping
探索深度学习中的恒等映射。了解跳跃连接如何防止梯度消失,为 Ultralytics YOLO26 等神经网络提供支持。
在数学和线性代数中,恒等映射或单位矩阵是一种函数,其返回值与输入值完全相同。在人工智能(AI)和深度学习领域,恒等映射指一种特定的架构技术,它将输入数据直接传递到卷积神经网络(CNN)的后续层,而不进行任何非线性变换。2015 年,残差网络(ResNet)的问世让这一概念广为流行,并彻底改变了深度计算机视觉(CV)模型的构建和训练方式。
恒等映射的工作原理#
深度神经网络经常受到梯度消失问题的困扰。在反向传播过程中,用于更新网络权重的误差信号在逐层向后传递时会呈指数级缩小,导致靠前的层无法有效学习。恒等映射通过创建“跳跃连接”或“快捷连接”来解决这一问题。
层与层之间无需被迫学习全新的、缺乏参照的映射,而是被设计为学习残差函数。从数学上来说,如果一个模块的输入为 x,那么该层会学习一个变换 F(x)。恒等映射会将原始输入 x 直接加到该变换的输出上,最终输出为 F(x) + x。这样,即使在极深的网络中,梯度也能不受阻碍地直接流经模型主干网络。Google DeepMind和OpenAI等知名 AI 研究机构经常利用这些架构快捷连接,稳定大型基础模型的训练。
恒等映射与身份保持#
区分恒等映射和名称相似的身份保持至关重要。
恒等映射是神经网络的一种结构性编码特性,旨在优化机器学习(ML)训练流程;而身份保持则是一项独立的计算机视觉任务。身份保持关注在目标跟踪中跨不同视频帧,或在生成式 AI 工作流中跨生成图像,维持特定人物或物体的视觉一致性。
实际应用#
恒等映射是当今许多高精度生产级模型的基础构建模块:
- 高级目标检测:包括最新 Ultralytics YOLO26 在内的现代实时架构,会在特征提取层中使用包含恒等映射的高级残差块。这使模型能够在自动驾驶等复杂环境中执行高速、精准的检测,而且不会因网络深度增加而导致性能下降。
- 图像分类模型:最先进的视觉架构广泛发表于 arXiv 和 IEEE Xplore 数字图书馆等学术资源库中,并依靠恒等映射成功训练拥有数百层的模型。TensorFlow等高级框架会使用这些快捷连接,从海量数据集中提取高度复杂的层次特征。
在 PyTorch 中实现恒等映射#
构建自定义神经网络时,PyTorch等深度学习框架提供了原生工具,让你可以轻松实现这些快捷连接。你可以显式使用 PyTorch nn.Identity 模块,也可以直接在 nn.Module 的前向传播中进行数学加法。
以下代码片段展示了一个使用恒等映射的基础残差块。开发者如果使用基于云端的 Ultralytics Platform 管理数据集和训练模型,就能自动受益于底层高度优化的这些架构结构。
import torch.nn as nn
class ResidualBlock(nn.Module):
def __init__(self, channels):
super().__init__()
# 用于特征提取的简单卷积层
self.conv = nn.Conv2d(channels, channels, kernel_size=3, padding=1)
# 显式恒等映射模块
self.identity = nn.Identity()
def forward(self, x):
# 模块输出是学习到的特征与恒等映射之和
return self.conv(x) + self.identity(x)








