使用自监督学习为图像去噪
了解自监督学习如何使用 AI 技术为摄影、医疗和视觉系统中的图像去噪、去除噪声并提升清晰度。

图像是我们日常生活的一部分,从我们拍摄的照片到公共场所摄像头录制的视频。图像中包含丰富的信息,而尖端技术让我们能够分析和解读这些数据。
具体来说,计算机视觉是人工智能 (AI) 的一个分支,它让机器能够处理视觉信息并理解所看到的内容,就像人类一样。不过,在现实应用中,图像往往远非完美。
由雨水、灰尘、低光照或传感器限制造成的图像噪声可能会隐藏重要细节,使 Vision AI 模型 更难准确检测对象或解读场景。图像去噪有助于减少这种噪声,让 Vision AI 模型能够更清晰地看到细节并做出更好的预测。

图 1. 图像去噪示例。(来源)
传统上,图像去噪依赖监督学习:使用成对的含噪图像和干净图像训练模型,使其学习如何去除噪声。不过,收集完全干净的参考图像并不总是可行。
为应对这一挑战,研究人员开发了自监督图像去噪器。它们旨在训练 AI 模型直接从数据中学习,通过创建自己的学习信号来去除噪声并保留重要细节,而无需干净的参考图像。
本文将深入了解自监督图像去噪器、它们的工作原理、背后的关键技术以及现实应用。让我们开始吧!
什么是自监督图像去噪?#
含噪图像会让 Vision AI 模型难以解读图片中的内容。例如,在低光照条件下拍摄的照片可能会显得颗粒感明显或模糊不清,隐藏帮助模型准确识别对象的细微特征。
在基于监督学习的去噪中,模型使用成对的图像进行训练,一张含噪、一张干净,从而学习如何去除不需要的噪声。虽然这种方法效果很好,但在现实场景中,收集完全干净的参考数据通常耗时且困难。
因此,研究人员转向了自监督图像去噪。自监督图像去噪建立在自监督学习的概念之上:模型从数据中创建自己的学习信号,从而实现自我学习。
由于这种方法不依赖大型标注数据集,自监督去噪速度更快、更易扩展,也更容易应用于低光照摄影、医学成像和卫星图像分析等领域,因为这些领域通常无法获得干净的参考图像。
这种方法不依赖干净的参考图像,而是直接使用含噪数据进行训练,通过预测被掩码的像素或重建缺失部分来学习。在这一过程中,模型学会区分有意义的图像细节和随机噪声,从而生成更清晰、更准确的结果。
虽然自监督学习看起来可能与无监督学习相似,但它实际上是无监督学习的一种特殊情况。关键区别在于,在自监督学习中,模型从数据中创建自己的标签或训练信号,以学习特定任务。相比之下,无监督学习侧重于在没有明确任务或预定义目标的情况下,发现数据中的隐藏模式或结构。
自监督去噪中的学习策略#
在自监督去噪中,学习可以通过多种方式实现。一些自监督去噪模型会填补被掩码或缺失的像素,而另一些模型则会比较同一图像的多个含噪版本,以找出一致的细节。
例如,一种称为盲点学习的流行方法,重点是训练去噪模型忽略正在重建的像素,转而依赖周围上下文。随着训练进行,模型会重建高质量图像,同时保留必要的纹理、边缘和颜色。
自监督学习如何实现去噪#
接下来,我们将探讨自监督学习去除噪声背后的过程。
自监督去噪通常从将含噪图像输入去噪模型开始。模型会分析附近的像素,估计每个不清晰或被掩码的像素应呈现的样子,并逐步学会区分噪声和真实的视觉细节。
以一张昏暗且颗粒感明显的天空图像为例。模型会观察附近的星星和周围的模式,预测每个含噪区域在没有噪声时应呈现的样子。通过在整张图像上重复这一过程,模型学会将随机噪声与有意义的特征分离,从而生成更清晰、更准确的结果。
换句话说,模型会根据上下文预测图像更干净的版本,而完全不需要一张绝对干净的参考图像。这一过程可以使用不同类型的模型来实现,每种模型在处理噪声方面都有独特优势。
用于自监督图像降噪的模型类型#
下面快速了解一下自监督图像去噪中常用的模型类型:
- 卷积神经网络 (CNNs): CNNs 是用于识别图像小区域中模式的深度学习模型。它们使用滤波器扫描图像,以检测边缘、形状和纹理。在自监督去噪中,它们通常采用盲点技术,将目标像素从输入中排除,使模型仅根据周围像素预测其值。这有助于模型避免复制噪声,而是推断出更干净的细节。
- 自编码器: 自编码器是学习压缩和重建数据的神经网络。它们首先将图像压缩为更小的表示形式(编码),然后将其重新构建(解码)。在此过程中,它们学会捕捉形状和纹理等重要视觉特征,同时过滤随机噪声和无关细节。
- 基于 Transformer 的模型: Transformer 最初是为自然语言处理开发的模型,如今已广泛用于视觉任务。它们会一次性处理整张图像,学习不同区域之间的关系。这种全局视角使它们即使在复杂或高分辨率图像中,也能保留精细细节和结构一致性。

图 2. 用于自监督图像去噪的基于 CNN 的架构示例。(来源)
使用不同光照和 ISO 设置下拍摄的图像训练这些模型,有助于它们在各种现实场景中发挥良好效果。在数码相机中,ISO 设置通过放大接收到的信号来控制相机将图像增亮的程度。
较高的 ISO 会让暗处的照片更明亮,但也会增加噪声并减少细节。通过学习不同 ISO 水平下拍摄的图像,模型能够更好地区分真实细节和噪声,从而产生更清晰、更准确的结果。
去噪器如何学会区分噪声与真实内容?#
去噪器通过不同的训练技术来学习区分噪声和真实图像细节,这些训练技术与用于去噪的模型类型是分开的。CNNs、自编码器和 Transformer 等模型类型描述了网络的结构以及其处理视觉信息的方式。
另一方面,训练技术决定了模型如何学习。一些方法采用基于上下文的预测,模型利用附近区域的信息填补缺失或被掩码的像素。
另一些方法采用基于重建的学习,模型先将图像压缩为更简单的形式,再将其重建,从而帮助模型识别边缘和纹理等有意义的结构,同时过滤随机噪声。
模型类型和训练技术共同决定了去噪器清理图像的效果。通过将合适的架构与合适的学习方法结合起来,自监督去噪器可以适应多种噪声类型,即使没有干净的参考数据,也能生成更清晰、更准确的图像。
自监督 AI 图像去噪的关键技术#
以下是一些能够实现高效自监督图像去噪的常用训练技术:
- Noise2Noise: 这种方法使用同一图像的两个含噪版本训练模型。由于每个版本中的噪声都是随机的,模型会学会关注代表真实图像的一致细节,并忽略噪声。当同一场景有多次含噪拍摄结果可用时,例如连拍摄影或医学与科学成像,这种方法效果最佳。
- Noise2Void 或 Noise2Self: 这些技术通过隐藏(掩码)一个像素,并要求模型根据周围像素预测其值,使用单张含噪图像进行训练。这可以防止模型简单地复制含噪数据,并帮助它学习图像的自然结构。当只有一张含噪图像可用时,例如显微成像、天文学或低光照摄影,这些技术尤其有用。
- 盲点网络: 这些网络经过专门设计,使模型无法看到正在重建的像素。相反,模型依赖周围区域的信息来估计该像素应呈现的样子。这能让噪声去除更加准确且不偏不倚,并且盲点网络通常会与 Noise2Void 或 Noise2Self 方法结合,用于逐像素去噪任务。
- 掩码自编码器 (MAE): 在这种方法中,图像的部分区域会被隐藏,模型学习重建缺失区域。通过这样做,模型既能学习精细细节,也能学习整体结构,从而帮助其区分真实内容和噪声。掩码自编码器尤其适用于高分辨率或复杂图像,因为理解更广泛的上下文有助于图像恢复。
评估图像去噪系统#
图像去噪需要在两个目标之间取得谨慎平衡:减少噪声和保留完整的精细细节。去噪过度会让图像看起来柔和或模糊,而去噪不足则可能留下不需要的颗粒或伪影。
为了了解模型在这两者之间的平衡效果,研究人员会使用同时衡量图像清晰度和细节保留情况的评估指标。这些指标可以显示模型在不丢失重要视觉信息的情况下清理图像的效果。
以下是有助于衡量图像质量和去噪性能的常用评估指标:
- 均方误差 (MSE): 它衡量原始图像与去噪图像之间平方差的平均值,体现输出在像素层面与原始图像的接近程度。MSE 值越低,错误越少,结果越准确。
- 峰值信噪比 (PSNR): 该指标以分贝为单位,将原始图像信号的强度与剩余噪声进行比较。它用于评估去噪后保留了多少原始细节。PSNR 值越高,图像越清晰、质量越高。
- 结构相似性指数 (SSIM): SSIM 评估结构、亮度和对比度,以衡量去噪图像与原始图像之间的相似性。它关注人类如何观察图像,而不仅是原始数值。SSIM 分数越高,图像看起来越自然,也越接近原始图像。
- 感知指标: 这些指标使用深度学习模型来判断图像看起来是否逼真自然。它们不比较单个像素,而是关注整体外观、纹理和视觉相似性。在大多数情况下,分数越低,图像看起来越接近原始图像,也越符合人类的视觉感受。
自监督去噪的应用#
现在我们已经更好地了解了什么是去噪,接下来探索自监督图像去噪如何应用于现实场景。
使用自监督去噪增强天文摄影#
拍摄清晰的恒星和星系照片并不容易。夜空很暗,因此相机通常需要较长的曝光时间,这可能引入不需要的噪声。这些噪声会模糊细微的宇宙细节,使微弱信号更难被检测到。
传统去噪工具可以帮助减少噪声,但往往也会一并去除重要细节。自监督去噪提供了一种更智能的替代方案。通过直接从含噪图像中学习,AI 模型能够识别代表真实特征的模式,并将其与随机噪声分离。
结果是恒星、星系和太阳等天体的图像清晰得多,能够展现原本可能被忽视的微弱细节。它还可以增强细微的天文特征,提高图像清晰度,让数据对科学研究更有价值。

图 3. 图像去噪可以增强天文摄影图像。(来源)
用于医学成像的自监督去噪#
MRI、CT 和显微镜图像等医学扫描图像通常会受到噪声影响,使细小细节更难看清。当医生需要发现疾病的早期迹象或跟踪一段时间内的变化时,这可能会造成问题。
图像噪声可能来自患者移动、信号强度低,或可使用辐射量受到限制。为了让医学扫描图像更清晰,研究人员探索了 Noise2Self 等自监督去噪方法及其他类似方法。
这些模型直接使用含噪的脑部 MRI 图像进行训练,自主学习噪声模式并将其清理干净,无需完全清晰的示例。处理后的图像纹理更清晰、对比度更好,使精细结构更容易识别。这类 AI 驱动的去噪器简化了诊断成像工作流程,并提高了实时分析效率。

图 4. 在脑部 MRI 扫描中使用不同的自监督去噪技术。(来源)
使用自监督去噪增强视觉系统#
在大多数情况下,去噪会对各种计算机视觉应用产生显著影响。通过去除不需要的噪声和失真,它能够为 Vision AI 模型提供更干净、更一致的输入数据。
更清晰的图像可以提升计算机视觉任务的性能,例如对象检测、实例分割和图像识别。以下是 Vision AI 模型(例如 Ultralytics YOLO11 和 Ultralytics YOLO26)能够从去噪中受益的一些应用示例:
- 工业检测:去噪能够更准确地检测制造环境中的表面缺陷或异常,从而改善质量控制。
- 自动驾驶与导航:去噪能够增强低光照、雨天或雾天等复杂条件下的对象和障碍物检测,提高整体安全性和可靠性。
- 监控与安防: 去噪能够提升低光照或高压缩视频流的图像质量,从而更好地识别和跟踪对象或人员。
- 水下成像: 去噪能够减少散射和光线失真,提高浑浊水下环境中的可见性和对象识别能力。
自监督去噪的优缺点#
以下是自监督去噪在成像系统中的一些主要优势:
- 噪声适应性: 自监督去噪方法无需成对的干净参考图像,即可直接从含噪数据中学习。这使其能够高度适应各种现实噪声水平和类型,例如传感器噪声、运动模糊或环境干扰。
- 细节保留: 设计得当时,这些模型能够保留对准确图像解读至关重要的精细纹理和边缘。盲点网络和基于掩码的学习等方法,有助于在降低噪声的同时保留结构信息。
- 更少的预处理: 通过仅使用可用数据学习将含噪输入映射为干净表示,模型减少了对手动滤波、手工设计的去噪算法或精心整理的训练数据集的需求。
尽管自监督去噪具有诸多优势,但也存在一些局限。以下是需要考虑的几个因素:
- 计算需求: 与传统滤波技术相比,用于自监督去噪的深度神经网络架构,尤其是基于 Transformer 的模型,可能需要大量的计算能力和内存资源。
- 模型设计复杂性: 要获得最佳结果,需要仔细选择模型设置,例如掩码策略和损失函数,而这些设置可能因噪声类型而异。
- 评估挑战: 常见的图像质量指标并不总能反映去噪图像看起来是否自然或逼真,因此通常还需要进行视觉检查或特定任务检查。
要点总结#
自监督去噪帮助 AI 模型直接从含噪图像中学习,在保留精细细节的同时生成更清晰的结果。它能够有效应对低光照、高 ISO 和细节丰富的图像等各种挑战性场景。随着 AI 不断发展,这类技术很可能在各种计算机视觉应用中发挥重要作用。
加入我们的社区,探索我们的 GitHub 代码仓库,进一步了解 AI。如果你想构建自己的 Vision AI 项目,可以查看我们的许可选项。访问我们的解决方案页面,进一步了解医疗保健领域的 AI和零售领域的 Vision AI等应用。









