用于去噪的自监督学习:分步解析
了解用于去噪的自监督学习如何工作、图像为何会产生噪声,以及恢复清晰视觉细节所采用的关键方法和步骤。

相机并不总能以我们所看到的方式捕捉世界。在低光照下拍摄的人像,或快速行驶汽车的照片,可能会显得有颗粒感、模糊或失真。
传感器速度较慢、环境昏暗以及运动,都可能引入微小的噪点,使边缘变得柔和并隐藏重要细节。当清晰度丢失时,即使是先进的 AI 和机器学习系统也可能难以理解图像中的内容,因为许多智能系统都依赖这些精细细节才能良好运行。
例如,计算机视觉是人工智能的一个分支,使机器能够解读图像和视频。但要做到准确解读,视觉 AI 模型需要从干净、高质量的视觉数据中学习。
具体来说,Ultralytics YOLO11和即将推出的 Ultralytics YOLO26支持目标检测、实例分割和姿态估计等任务,还可以针对不同用例进行自定义训练。这些任务依赖边缘、纹理、颜色和精细结构细节等清晰的视觉线索。
当噪声遮挡这些特征时,模型接收到的训练信号会变弱,从而更难学习准确的模式。因此,即使少量噪声也可能降低模型在实际应用中的性能。
此前,我们介绍过自监督学习如何为图像去噪。本文将深入探讨自监督去噪技术的工作原理,以及它们如何帮助恢复有意义的视觉信息。让我们开始吧!
真实世界图像中的常见噪声类型#
在探讨如何使用自监督学习进行图像去噪之前,我们先回顾一下图像为什么会产生噪声。
真实世界中的物体和场景图像很少是完美的。低光照、有限的传感器质量和快速运动,可能会在整幅图像的单个像素中引入随机干扰。这些像素级的扰动被称为噪声,会降低整体清晰度,使重要细节更难看清。
当噪声隐藏边缘、纹理和细微模式时,计算机视觉系统就难以准确识别物体或解读场景。不同条件会产生不同类型的噪声,每种噪声都会以自己的方式影响图像。

图 1. 噪声如何导致图像中的不确定性增加示例。(来源)
以下是图像中最常见的一些噪声类型:
- 高斯噪声: 这类噪声表现为柔和、随机的颗粒感,通常由电子传感器干扰或热波动引起。它遵循高斯(正态)分布,像素的微小变化会使精细细节变得模糊,并降低整体锐度。
- 泊松噪声: 这类噪声也称为散粒噪声,通常出现在低光照条件或短曝光时间下。它的方差会随亮度增加,但由于捕获到的光子较少,这种噪声在较暗区域通常更加明显,从而导致信噪比较低。
- 椒盐噪声: 这类噪声表现为尖锐的黑色或白色像素尖峰,通常由传输错误、比特损坏或故障相机传感器引起,并经常导致像素值缺失或损坏。
- 斑点噪声: 这类噪声表现为颗粒状、类似斑点的图案,常见于医学、雷达和超声成像。它由信号干扰和散射引起,会降低对比度,使边缘更难检测。
什么时候应该使用自监督去噪?#
那么,自监督去噪有什么特别之处?当干净的真实图像根本不存在,或难以获取时,它就能发挥优势。
这类情况经常出现在低光照摄影、高 ISO 成像、医学和科学成像中,或任何噪声无法避免且不现实地收集完美参考数据的环境中。模型不需要干净样本,而是直接从你已有的噪声图像中学习,因此能够适应你的相机或传感器特有的噪声模式。
当你希望提升下游计算机视觉任务的性能,但数据集充满不一致或含噪图像时,自监督去噪也是很好的选择。通过恢复更清晰的边缘、纹理和结构,这些方法可以帮助 YOLO 更可靠地检测、分割和理解场景。简而言之,如果你处理的是噪声数据,且无法获得干净的训练图像,自监督去噪通常是最实用、最有效的解决方案。
推动自监督去噪的核心技术#
正如我们之前看到的,自监督去噪是一种基于深度学习的 AI 方法,使模型无需依赖干净标签,便能直接从噪声图像中学习。它建立在自监督学习的原则之上,在这种学习方式中,模型从数据本身生成训练信号。
换句话说,模型可以将噪声图像同时作为输入和学习信号的来源,从而自我学习。通过比较同一图像的不同损坏版本,或预测被遮挡的像素,模型能够学习哪些模式代表真实结构,哪些只是噪声。经过迭代优化和模式识别,网络会逐步提升区分有意义图像内容与随机变化的能力。

图 2. 原始图像和去噪图像。(来源)
特定的学习策略使这一过程成为可能,它们引导模型将稳定的图像结构与随机噪声分离开来。接下来,让我们进一步了解简化这一过程的核心技术和算法,以及每种方法如何帮助模型重建更干净、更可靠的图像。
成对图像去噪方法#
许多早期的自监督去噪方法通过比较同一图像的两个含噪版本来工作。由于每次捕获或损坏图像时,噪声都会随机变化,而真实结构保持不变,因此这些差异可以作为模型的学习信号。
这些方法通常被称为成对图像去噪方法,因为它们在训练期间依赖于使用或生成成对的含噪图像。例如,Noise2Noise 方法(由 Jaakko Lehtinen 及其团队提出)使用同一场景的两张独立含噪图像训练模型。由于两个版本的噪声模式不同,模型会学习识别代表实际底层图像的一致细节。

图 3. Noise2Noise 的工作原理(来源)
随着时间推移,这会教会网络抑制随机噪声并保留真实结构,即使它从未见过干净的参考图像。想象一个简单场景:你在夜间拍摄两张低光照街道的照片。
每张图像都包含相同的建筑、灯光和阴影,但颗粒噪声出现在不同位置。通过在训练期间比较这两张含噪照片,自监督模型可以学习哪些视觉模式是稳定的,哪些是由噪声造成的,最终提升重建更干净图像的能力。
基于盲点的自监督去噪方法#
成对方法依赖比较同一图像的两个不同损坏版本,而盲点方法采取了不同的方式。它们通过隐藏选定像素,让网络无法看到这些像素的损坏值,从而使模型能够仅从一张含噪图像中学习。
然后,模型必须仅利用周围上下文来预测隐藏像素。其核心理念是:噪声是随机的,但图像的底层结构并不是。
通过阻止模型复制像素的噪声值,盲点方法促使模型根据附近的边缘、纹理或颜色渐变等稳定图像模式,推断该像素应有的值。Noise2Void(由 Alexander Krull 及其团队提出)和 Noise2Self(由 Joshua Batson 和 Loïc Royer 开发)等技术,通过遮挡单个像素或小范围邻域,并训练模型重建这些区域,实现了这一原则。
更先进的方法(包括 Noise2Same 和 PN2V)通过在多个遮挡版本之间强制保持预测一致,或显式建模噪声分布以估计不确定性,来提升鲁棒性。由于这些方法只需要一张含噪图像,因此特别适用于难以或无法获取干净图像或成对图像的领域,例如显微镜成像、天文学、生物医学成像或低光照摄影。
Transformer 支持的去噪方法#
大多数成对和盲点自监督去噪方法依赖卷积神经网络(CNN)或去噪网络。CNN 非常适合这些方法,因为它们专注于局部模式,即边缘、纹理和小型细节。
U-Net 等架构被广泛使用,因为它们结合了细粒度特征与多尺度信息。不过,CNN 主要在有限邻域内运行,这意味着它们可能会忽略跨越图像较大区域的重要关系。
为了解决这一局限,人们提出了由 Transformer 支持的先进去噪方法。与只观察邻近像素不同,这些方法使用注意力机制来理解图像不同部分之间的关系。
一些模型使用完整的全局注意力,另一些则使用基于窗口或分层的注意力来降低计算量,但总的来说,它们旨在捕捉仅靠 CNN 无法捕捉的长距离结构。这种更广阔的视角有助于模型恢复重复纹理、平滑表面或需要利用整幅图像信息的大型物体。
其他图像去噪方法#
除了自监督技术,还有几种清理噪声图像的方法。双边滤波、小波去噪和非局部均值等传统方法,使用简单的数学规则平滑噪声,同时尽量保留重要细节。
与此同时,也存在深度学习方法,包括从干净图像与含噪图像对中学习的监督模型,以及能够生成更清晰、更逼真结果的生成对抗网络(GAN)。不过,这些方法通常需要更高质量的图像进行训练。
分步了解自监督图像去噪的工作原理#
既然我们刚刚介绍了几种不同的技术,你可能会想知道,鉴于它们使用各自的架构,它们是否以完全不同的方式工作。不过,它们都遵循类似的流程,从数据准备开始,到模型评估结束。
接下来,让我们逐步了解整个自监督图像去噪流程是如何工作的。
第 1 步:预处理和归一化#
在模型开始从噪声图像中学习之前,第一步是确保所有图像看起来一致。真实照片之间可能存在很大差异。
有些图像可能太亮,有些太暗,还有些图像的颜色可能略有偏差。如果我们直接将这些差异输入模型,模型就更难专注于学习噪声的特征。
为此,每张图像都要经过归一化和基本预处理。这可能包括将像素值缩放到标准范围、校正强度变化,或进行裁剪和调整大小。关键在于,模型接收到的是可作为稳定、可比较输入的干净数据。
第 2 步:创建自监督训练信号#
图像完成归一化后,下一步是创建训练信号,使模型无需看到干净图像也能学习。自监督去噪方法通过确保模型无法简单复制接收到的噪声像素值来实现这一点。
相反,它们会创建这样的场景:模型必须依赖图像的周围上下文,而不是不可预测的噪声;周围上下文包含稳定的结构。不同方法实现这一点的方式略有不同,但核心理念相同。
一些方法会暂时隐藏或遮挡特定像素,使模型必须根据邻近像素推断它们;另一些方法则会生成同一张含噪图像的独立损坏版本,使输入和目标包含相互独立的噪声。在这两种情况下,目标图像都包含有意义的结构信息,同时阻止网络访问它需要预测的像素原始噪声值。
由于噪声会随机变化,而底层图像保持一致,这种设置会自然促使模型学习真实结构的样子,并忽略在不同版本之间变化的噪声。
第 3 步:学习去噪以恢复图像结构#
训练信号建立后,模型就可以通过模型训练开始学习如何将有意义的图像结构与噪声分离。每当模型预测一个被遮挡或重新损坏的像素时,都必须依赖周围上下文,而不是原本位于该位置的噪声值。
经过许多次迭代或多个 epoch,网络会学会识别图像中保持稳定的模式,例如边缘、纹理和平滑表面。它也会学会忽略构成噪声特征的随机波动。
例如,考虑一张表面看起来颗粒感极强的低光照照片。虽然噪声会因像素而异,但底层表面仍然是平滑的。通过反复推断此类区域中的隐藏像素,模型会逐渐更擅长识别噪声下方的稳定模式,并更清晰地重建该模式。
在模型训练过程中,网络会学习图像结构的内部表示。这使模型即使在输入受到严重损坏时,也能恢复连贯的细节。
第 4 步:验证和降噪结果#
模型学会预测隐藏或重新损坏的像素后,最后一步是评估它在完整图像上的表现。在测试期间,模型接收整张含噪图像,并根据所学的图像结构生成完整的去噪版本。为了衡量这一过程的有效性,会将输出与干净参考图像或标准基准数据集进行比较。
两个常用指标是 PSNR(峰值信噪比),用于衡量重建结果与干净真实值的接近程度;以及 SSIM(结构相似性指数),用于评估边缘和纹理等重要特征的保留程度。通常,分数越高,表示去噪结果越准确、视觉可靠性越高。
用于训练和基准测试的图像数据集#
自监督去噪研究发表在 IEEE 期刊以及 CVF 会议(包括 CVPR、ICCV 和 ECCV)上,并广泛分发于 arXiv,通常依赖合成数据集和真实世界数据集的组合,以评估深度学习方法在受控条件和实际条件下的模型性能。一方面,合成数据集以干净图像为基础添加人工噪声,因此可以使用 PSNR 和 SSIM 等指标轻松比较不同方法。
以下是添加合成噪声后常用于基准测试的一些热门数据集:
另一方面,真实世界噪声数据集包含在低光照、高 ISO 或其他挑战性条件下直接由相机传感器捕获的图像。这些数据集用于测试模型能否处理复杂的非高斯噪声,而这类噪声难以轻易模拟。
以下是一些热门的真实世界噪声数据集:

图 4. DND 数据集中的示例。(来源)
训练自监督去噪模型时需要考虑的因素#
如果你计划训练基于深度学习的自监督去噪模型,以下是需要考虑的一些因素和局限:
- 匹配噪声分布: 用于训练的含噪图像应反映模型在实际使用中会遇到的相同噪声;噪声不匹配会导致泛化能力较差。
- 确保训练数据的多样性: 变化有限可能会导致复杂纹理出现过拟合或过度平滑。
- 注意噪声类型的局限: 自监督方法在处理结构化噪声、相关噪声或非随机噪声时更加困难。
- 跨设备或传感器进行测试: 不同相机或成像系统的去噪性能可能存在很大差异。
要点总结#
自监督去噪为 AI 爱好者提供了一种实用方式,只使用我们已有的噪声数据来清理图像。通过学习识别噪声下方的真实结构,这些方法能够恢复重要的视觉细节。随着去噪技术不断进步,它很可能会让日常场景中的各种计算机视觉任务更加可靠。
加入不断壮大的社区!访问我们的 GitHub 代码仓库,进一步了解 AI。如果你希望构建计算机视觉解决方案,请查看我们的许可选项。探索零售业中的计算机视觉的优势,了解制造业中的 AI如何发挥作用!









