Ultralytics YOLO27:
返回 Ultralytics 术语表

Optical Character Recognition (OCR)

探索光学字符识别(OCR)如何将图像转换为可搜索数据。学习如何使用 Ultralytics YOLO26 构建文本检测 OCR 流程。

光学字符识别 (OCR) 是计算机视觉领域的一项关键技术,能够将不同类型的文档——例如扫描的纸质文档、PDF 文件或数码相机拍摄的图像——转换为可编辑、可搜索的数据。OCR 将文本的视觉表示转换为机器编码的字符,弥合了物理世界与数字世界之间的鸿沟,使人工智能 (AI)系统能够解读和处理此前锁定在静态像素中的文本信息。早期的 OCR 版本依赖于将图像与存储的模板进行简单模式匹配,而现代系统则利用先进的深度学习架构,以高准确率处理多样的字体、复杂的布局,甚至手写文字。

OCR 流水线#

现代 OCR 系统通常以多阶段流水线的形式运行,通过多个明确的步骤将原始图像数据转换为结构化信息。此过程通常将标准图像处理与先进的神经网络相结合。

  • 图像预处理:在识别文本之前,原始输入会经过数据预处理以提升质量。诸如阈值处理之类的技术会将图像转换为黑白二值图像,而降噪有助于从杂乱的背景中分离出字符笔画。
  • 文本检测:这一步的关键在于定位图像中包含文本的特定区域。高性能的目标检测模型(例如最先进的 Ultralytics YOLO26)经常用于在单词、文本行或段落周围绘制边界框。这种定位使后续识别引擎能够只关注相关区域。
  • 文本识别:文本区域裁剪完成后,会将其输入识别模型。结合用于特征提取的卷积神经网络 (CNN)和用于序列建模的循环神经网络 (RNN)的架构,是将像素模式解码为字符序列的标准方案。
  • 后处理:最终输出通常会使用自然语言处理 (NLP)技术进行优化。词典和语言模型有助于纠正拼写错误,并确保识别出的文本在语义上保持一致,从而显著提升整体准确率

实际应用#

OCR 与其他 AI 领域的融合推动了各行业的广泛自动化,改变了企业处理数据的方式。

自动车牌识别(ANPR)#

在智慧城市基础设施中,OCR 是自动车牌识别背后的核心引擎。目标检测器首先识别视频帧中的车辆和车牌。随后,OCR 算法提取字母数字字符,并将其与数据库交叉比对,以实现自动收费或安全监控。这需要强大的实时推理能力,才能有效处理高速交通数据。

智能文档处理 (IDP)#

金融和法律行业利用 OCR 进行智能文档分析。AI 系统不再依赖人工数据录入,而是扫描发票、收据和合同。通过将 OCR 与命名实体识别 (NER)相结合,这些系统可以自动提取日期、供应商名称和总金额等特定字段,从而减少行政负担并加快工作流程。

区分 OCR 与相关术语#

区分 OCR 与图像分类非常重要。图像分类会对整张图像进行分类(例如将图像标记为“文档”或“发票”),而 OCR 更加细粒度:它会定位并识别图像内部的特定字符序列。同样,OCR 也不同于标准的目标检测,后者可能会将“停止标志”识别为一个通用的对象类别,而 OCR 则会读取标志上印刷的具体字母“S-T-O-P”。

使用 Ultralytics 进行文本检测#

一种常见的现代工作流程是先使用 YOLO 模型检测文本区域,再将这些区域传递给 Tesseract 或 PaddleOCR 等专用识别引擎。Ultralytics Platform简化了在自定义数据集上训练这些检测模型的过程。下面的示例演示了如何使用预训练的 Ultralytics YOLO26模型,检测通常包含文本的对象,例如车牌。

from ultralytics import YOLO

# Load a pre-trained YOLO26 model (ideal for locating text regions)
model = YOLO("yolo26n.pt")

# Perform inference on an image containing text objects (e.g., a street sign)
results = model.predict(source="https://ultralytics.com/images/bus.jpg")

# Display detected classes, acting as the localization step in an OCR pipeline
for r in results:
    print(f"Detected classes: {r.boxes.cls}")
    # Further processing would pass these crops to an OCR engine

延伸阅读与资源#

若要了解推动早期 OCR 研究发展的基础数据集,MNIST 手写数字数据库仍是用于基准测试的经典资源。对于关注这项技术开源演进的人来说,Tesseract 项目的历史展现了社区驱动贡献的发展过程。如今,基于云的 Google Cloud Vision APIAmazon Textract等解决方案代表了托管 OCR 服务的当前最先进水平。此外,场景文本识别研究仍在不断突破边界,使 AI 能够读取不受约束的“野外”环境中的文本,其中光照和视角各不相同。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅