什么是图像处理中的阈值化?
通过本指南探索图像处理中的阈值化。了解什么是阈值化,以及不同的图像阈值化技术,包括 Otsu 阈值化。

如需直观了解本文涵盖的概念,请观看下方视频。
对人类来说,图像是连贯且有意义的画面;而对计算机来说,图像则是由微小像素组成的网格,像素是数字图像的最小组成部分。在称为图像处理的过程中,可以调整或分析这些像素,以改善图像并提取有用信息。
一种常见的图像处理技术称为图像阈值化。这种方法通过将每个像素与一个设定值进行比较,把灰度图像(其中每个像素表示一种灰度)转换为黑白图像。它可以清晰地区分重要区域和背景。
阈值化常用于图像分割,这是一种将图像拆分为有意义区域、从而更便于分析的技术。它通常是帮助机器解读视觉数据的第一步之一。本文将介绍阈值化是什么、如何工作,以及它在现实场景中的应用。让我们开始吧!
图像阈值化中的基本术语#
在深入了解阈值化的工作原理之前,我们先来仔细看看它背后的基本概念,以及它在图像处理中的应用方式。
二值图像阈值化#
假设你正在处理一幅图像,并希望将其中的物体与背景分离。一种方法是使用阈值化。它会简化图像,使每个像素要么完全为黑色,要么完全为白色。所得结果是二值图像,其中每个像素的值为 0(黑色)或 255(白色)。这一步在图像处理中通常很有用,因为它能让图像中的重要部分清晰突出。

图 1. 阈值化前的灰度图像及其二值化结果。(来源:blog.devops.dev)
直方图#
同样地,如果你想了解亮度值在图像中的分布情况,直方图可以提供帮助。它是一种图表,用于显示每种像素强度出现的频率,范围从黑色(0)到白色(255)。
通过查看直方图,你可以判断图像是暗、亮,还是处于两者之间。这样,在将图像转换为黑白图像时,就更容易选择合适的阈值,因为你可以一眼看出其中的模式和对比度水平。
前景和背景#
图像完成阈值化后,会被分为两部分:前景和背景。前景通常显示为白色,用于突出文本、形状或你想要检测的物体等重要元素。背景显示为黑色,代表其他所有内容。这种分离有助于机器专注于图像中真正重要的部分。
分割#
如前文所述,分割会根据亮度或纹理等特征,将图像划分为有意义的区域。阈值化是实现这一目标的一种简单方法,通常也是计算机视觉流程中的第一步之一。
计算机视觉是 AI 的一个分支,使机器能够像人类一样处理和解读视觉数据。通过在早期使用阈值化,计算机视觉系统可以将物体与背景分离,从而帮助后续的检测或识别等步骤更准确地运行。
全局阈值化#
现在我们已经更好地理解了阈值化的概念,接下来了解如何对图像进行阈值化,以及图像处理中不同类型的阈值化方法。
例如,全局阈值化是创建二值图像最简单的方法之一。它会在整幅图像中应用同一个强度值。亮度高于该阈值的像素变为白色,而较暗的像素变为黑色。这有助于将物体与背景分离。
当图像光照均匀且对比度较强时,这种方法效果最佳。但在光照不均匀或对比度较低的区域中,单一阈值可能会遗漏细节或使边缘变得模糊。
为了解决这一问题,可以使用 Otsu 阈值化等方法。Otsu 阈值化无需手动设置数值,而是分析图像的直方图,并选择一个能够最好地将像素强度分为前景和背景的阈值。

图 2. 应用 Otsu 阈值化前后的土星图像。(来源)
局部(自适应)阈值化#
与全局阈值化不同,自适应阈值化或局部阈值化会分别计算图像不同区域的阈值。这使其更适合处理光照不均匀的图像,例如带有阴影的扫描文档或纹理表面。
它会将图像划分为多个小区域,并为每个区块计算局部阈值,从而有助于保持前景与背景之间的对比度。这种方法广泛用于文本识别、医学成像和表面检测等任务,因为这些场景中的光照会在图像不同位置发生变化。
图像处理中常见的自适应阈值化方法包括自适应均值阈值化和自适应高斯阈值化。在自适应均值阈值化中,局部邻域内的平均像素强度会被用作中心像素的阈值。而自适应高斯阈值化则使用带高斯窗口的加权平均值,使距离中心更近的像素获得更高权重。
阈值化在图像处理中的现实应用#
接下来,让我们了解图像阈值化在现实应用中的使用场景。
用于文档二值化和 OCR 的图像阈值化#
旧书和手写信件通常会被扫描,以便保存或使用光学字符识别(OCR)技术将其转换为数字文本。光学字符识别技术可以读取印刷字符或手写字符。在提取文本之前,通常需要对文档进行清理或预处理。扫描图像中经常存在阴影、褪色的墨迹或光照不均等问题,这些都会使字符识别变得困难。
为了提高图像清晰度,可以使用阈值化将灰度图像转换为二值格式,从而帮助将文本与背景分离。字母等较暗区域会变成黑色,而较亮的背景会变成白色——这会让 OCR 系统更容易读取文本。

图 3. 历史文档及其阈值化图像示例。(来源)
在医学图像处理中使用阈值化#
同样地,在医学成像中,阈值化常用于从扫描图像中分离特定结构,例如 X 射线图像中的骨骼或肺部。通过将灰度图像转换为二值格式,可以更容易地将感兴趣区域与周围组织分离,并为后续分析做好准备。在更复杂的情况下,可以应用多级阈值化,将图像划分为多个不同区域,从而同时识别不同类型的组织或结构。

图 4. 在胸部 X 射线图像上使用多级阈值化方法。(来源:sciencedirect.com)
图像处理中阈值化的优缺点#
以下是图像处理中使用阈值化的一些主要优势:
- 资源占用低: 阈值化在低功耗设备上也能良好运行,无需云访问或高端硬件,因此适合嵌入式系统和离线环境。
- 易于解释: 阈值化逻辑简单,其输出易于理解和调试;在医疗保健或文档处理等重视透明度的领域,这一点至关重要。
- 测试快速: 在早期项目中,阈值化可以帮助团队快速探索图像分割思路,然后再转向更复杂的模型。
虽然图像阈值化在许多场景中都很有用,但它也存在一些局限性。以下是使用阈值化时需要考虑的一些挑战:
- 缺乏适应性: 阈值化遵循固定规则,除非手动调整,否则无法适应新的光照条件或数据变化。
- 对噪声敏感: 阴影或反射造成的亮度细微变化可能会影响结果,尤其是在处理细节丰富或具有纹理的图像时。
- 静态且基于规则: 与 AI 模型不同,阈值化不会从数据中学习,也不会随时间推移而改进。它只能在设计时设定的有限条件下工作。
超越图像阈值化:何时应使用计算机视觉#
在受控环境中,阈值化适用于简单的分割任务。然而,在处理包含多个物体或背景噪声的复杂图像时,它通常表现不佳。由于依赖固定规则,阈值化缺乏应对大多数现实应用所需的灵活性。
为了突破这些限制,许多尖端系统现在使用计算机视觉。与阈值化相比,视觉 AI 模型经过训练,可以检测复杂的模式和特征,因此准确性和适应性都高得多。
例如,Ultralytics YOLO11等计算机视觉模型可以实时检测物体并分割图像。因此,它们非常适合在自动驾驶车辆中识别交通信号,或在农业中发现作物问题等任务。
具体来说,Ultralytics YOLO11 支持一系列计算机视觉任务,例如实例分割,即分别分割图像中的每个物体。它还可以执行其他基于视觉的任务,包括姿态估计(确定物体的位置或姿势)和目标跟踪(跟随物体在视频帧中的移动)。

图 5. YOLO11 让物体检测和分割变得简单。(来源)
虽然阈值化适用于简单任务或早期想法测试,但需要速度、准确性和灵活性的应用通常更适合使用计算机视觉来处理。
要点总结#
阈值化是图像处理中的重要工具,因为它能够快速、简单地将物体与背景分离。它适用于扫描文档、医学图像以及工厂中的产品缺陷检测。
然而,随着图像和视频变得越来越复杂,图像阈值化等基础图像处理方法可能会难以应对。这时,先进的计算机视觉模型就可以发挥作用。Ultralytics YOLO11 等模型能够理解并执行更多任务,同时检测多个物体并实时运行,因此适用于许多使用场景。
想进一步了解 AI?欢迎查看我们的社区和 GitHub repository。探索我们的解决方案页面,了解机器人领域的 AI和农业中的计算机视觉。了解我们的许可选项,立即开始使用计算机视觉进行构建!









