Convolution
探索计算机视觉和深度学习中卷积的基础知识。了解内核和特征图如何为 Ultralytics YOLO26 的实时任务提供支持。
卷积是一项基础的数学运算,是现代 computer vision (CV) 和 deep learning (DL) 系统的核心构建模块。在图像处理的背景下,卷积包括在输入图像上滑动一个小型过滤器(通常称为内核),以创建显著特征的映射。这一过程允许 artificial intelligence (AI) 模型自动学习和识别诸如边缘、纹理和形状等模式,而无需人工干预。与传统通常需要手动 feature extraction 的 machine learning (ML) 不同,卷积使网络能够建立对视觉数据的分层理解,从简单的线条开始,逐步发展到人脸或车辆等复杂的对象。
卷积的工作原理#
该操作的运作方式是将过滤器传递到输入数据上,执行逐元素乘法,并将结果相加,为每个位置产生单个值。这个输出被称为 feature map。
- 内核: 这是一个检测特定特征的小型数字矩阵(权重)。例如,Sobel operator 是一种用于检测垂直或水平边缘的特定类型内核。
- 滑动窗口: 内核使用称为“步幅(stride)”的定义步长在图像上移动。这种 spatial filtering 过程保留了像素之间的关系,这对于理解图像至关重要。
- 层级结构: 在诸如 Convolutional Neural Networks (CNNs) 的深度架构中,初始层捕捉低级细节,而更深的层将这些细节组合成高级概念。
卷积与相关概念#
要完全掌握卷积,将其与 neural network (NN) 文献中经常遇到的类似术语区分开来会很有帮助:
- 互相关与卷积: 从数学上讲,真正的卷积涉及在应用内核之前将其翻转。然而,包括 PyTorch library 在内的绝大多数深度学习框架,实现的是互相关(不翻转滑动),但将其标为“卷积”,因为权重是在训练期间学习的,这使得翻转的区别与性能无关。
- 卷积与注意力机制: 尽管卷积在局部处理信息(相邻像素),但 attention mechanism 允许模型同时关联图像的遥远部分。诸如 YOLO26 的现代架构通常利用高度优化的卷积层来维持 real-time inference 速度,因为注意力层的计算量可能更大。
实际应用#
卷积的效率使人工智能能够通过驱动强大的感知系统来彻底改变各个行业:
-
医疗诊断: 在 AI in Healthcare 领域,卷积有助于分析高分辨率 MRI scans。通过使用旨在突出异常的特定内核,模型能够以堪比人类专家的 accuracy 检测出肿瘤或骨折的早期迹象。
-
自主导航: 自动驾驶汽车依靠卷积来进行实时的 object detection。当汽车行驶时,卷积层处理视频流以即时识别行人、车道线和交通标志,这是 AI in Automotive 安全的关键组成部分。
使用 Ultralytics 的 Python 示例#
你可以使用 Python 检查先进模型中的卷积层。以下示例加载 YOLO26 模型并验证其初始层是否利用了标准的卷积操作,该操作通过 torch.nn 实现。
import torch.nn as nn
from ultralytics import YOLO
# Load the latest YOLO26 model
model = YOLO("yolo26n.pt")
# Access the first layer of the model's backbone
first_layer = model.model.model[0]
# Verify it is a Convolutional layer
if isinstance(first_layer.conv, nn.Conv2d):
print("Success: The first layer is a standard convolution.")
print(f"Kernel size: {first_layer.conv.kernel_size}")为什么卷积对边缘 AI 很重要#
卷积操作具有高度可优化性,这使其非常适合计算资源有限的 Edge AI 部署。由于相同的内核在整个图像中共享(参数共享),该模型所需的内存明显少于较旧的全连接架构。这种效率使先进模型能够在智能手机和 IoT devices 上运行。
对于希望将这些操作用于自定义数据集的团队,Ultralytics Platform 提供了一个无缝的环境来标注图像并训练基于卷积的模型,而无需管理复杂的基础设施。通过使用 transfer learning,你可以微调预训练的卷积权重,以最少的 training data 识别新对象。






