Optical Character Recognition (OCR)
استكشف كيفية تحويل التعرّف الضوئي على الحروف (OCR) للصور إلى بيانات قابلة للبحث. وتعلّم إنشاء مسارات OCR باستخدام Ultralytics YOLO26 لاكتشاف النصوص.
يُعدّ التعرّف الضوئي على الأحرف (OCR) تقنية محورية في مجال الرؤية الحاسوبية، إذ تُمكّن من تحويل أنواع مختلفة من المستندات—مثل المستندات الورقية الممسوحة ضوئيًا، وملفات PDF، أو الصور الملتقطة بكاميرا رقمية—إلى بيانات قابلة للتحرير والبحث. ومن خلال تحويل التمثيلات المرئية للنص إلى أحرف مُرمّزة آليًا، يسدّ OCR الفجوة بين العالمين المادي والرقمي، مما يتيح لأنظمة الذكاء الاصطناعي (AI) تفسير المعلومات النصية ومعالجتها، بعد أن كانت حبيسة وحدات بكسل ثابتة. وبينما اعتمدت الإصدارات المبكرة من OCR على مطابقة الأنماط البسيطة مع القوالب المخزنة، تستفيد الأنظمة الحديثة من بنيات التعلّم العميق المتطورة للتعامل مع الخطوط المتنوعة والتخطيطات المعقدة وحتى الكتابة اليدوية بدرجة عالية من الدقة.
خط أنابيب OCR#
تعمل أنظمة OCR المعاصرة عادةً بوصفها خط أنابيب متعدد المراحل، يحوّل بيانات الصور الخام إلى معلومات منظّمة عبر عدة خطوات متميزة. وغالبًا ما تجمع هذه العملية بين معالجة الصور القياسية والشبكات العصبية المتقدمة.
- المعالجة المسبقة للصور: قبل التعرّف على النص، يخضع الإدخال الخام إلى المعالجة المسبقة للبيانات لتحسين الجودة. وتحول تقنيات مثل تحديد العتبة الصور إلى صيغة ثنائية بالأبيض والأسود، بينما يساعد تقليل التشويش على عزل ضربات الأحرف عن الخلفيات المزدحمة.
- اكتشاف النص: تتضمن هذه الخطوة الحاسمة تحديد مناطق معينة داخل الصورة تحتوي على نص. وغالبًا ما تُستخدم هنا نماذج اكتشاف الأجسام عالية الأداء، مثل Ultralytics YOLO26 المتطور، لرسم المربعات المحيطة حول الكلمات أو الأسطر أو الفقرات. ويتيح هذا التحديد لمحرك التعرّف اللاحق التركيز على المناطق ذات الصلة فقط.
- التعرّف على النص: بعد اقتصاص مناطق النص، تُمرّر إلى نموذج للتعرّف. وتُعدّ البنيات التي تجمع بين الشبكات العصبية الالتفافية (CNN) لاستخراج السمات والشبكات العصبية التكرارية (RNN) لنمذجة التسلسلات معياريةً لفك ترميز أنماط وحدات البكسل إلى تسلسلات من الأحرف.
- المعالجة اللاحقة: غالبًا ما تُحسّن المخرجات النهائية باستخدام تقنيات معالجة اللغة الطبيعية (NLP). وتساعد المعاجم والنماذج اللغوية على تصحيح الأخطاء الإملائية وضمان الاتساق الدلالي للنص المتعرَّف عليه، مما يحسّن الدقة الإجمالية بدرجة كبيرة.
التطبيقات الواقعية#
أدى دمج OCR مع تخصصات أخرى في الذكاء الاصطناعي إلى أتمتة واسعة النطاق عبر مختلف القطاعات، مما غيّر طريقة تعامل الشركات مع البيانات.
التعرف الآلي على لوحات أرقام المركبات (ANPR)#
في البنية التحتية للمدن الذكية، يعمل OCR محركًا أساسيًا وراء التعرّف الآلي على لوحات المركبات. يحدد كاشف الأجسام أولًا المركبة ولوحة ترخيصها داخل إطار فيديو. بعد ذلك، تستخرج خوارزميات OCR الأحرف الأبجدية الرقمية لمقارنتها بقواعد البيانات بهدف تحصيل الرسوم آليًا أو مراقبة الأمن. ويتطلب ذلك إمكانات قوية لـالاستدلال في الوقت الفعلي لمعالجة بيانات حركة المرور عالية السرعة بفعالية.
المعالجة الذكية للمستندات (IDP)#
تستخدم القطاعات المالية والقانونية تقنية OCR من أجل تحليل المستندات الذكي. فبدلًا من إدخال البيانات يدويًا، تمسح أنظمة الذكاء الاصطناعي الفواتير والإيصالات والعقود. ومن خلال دمج OCR مع التعرّف على الكيانات المُسمّاة (NER)، تستطيع هذه الأنظمة استخراج حقول محددة آليًا، مثل التواريخ وأسماء الموردين والمبالغ الإجمالية، مما يقلل الأعباء الإدارية ويسرّع سير العمل.
التمييز بين OCR والمصطلحات ذات الصلة#
من المهم التمييز بين OCR وتصنيف الصور. فبينما يصنّف تصنيف الصور صورةً كاملة (مثل وسم صورة بأنها "مستند" أو "فاتورة")، يتعامل OCR مع مستوى أكثر دقة؛ إذ يحدد تسلسل الأحرف المحدد الموجود داخل تلك الصورة ويتعرّف عليه. وبالمثل، يختلف OCR عن اكتشاف الأجسام القياسي، الذي قد يحدد "إشارة توقف" بوصفها فئة عامة من الأجسام، في حين يقرأ OCR الأحرف المحددة "S-T-O-P" المطبوعة على الإشارة.
اكتشاف النص باستخدام Ultralytics#
يتضمن سير العمل الحديث الشائع استخدام نموذج YOLO لاكتشاف مناطق النص قبل تمريرها إلى محرك تعرّف مخصص مثل Tesseract أو PaddleOCR. وتبسّط منصة Ultralytics تدريب نماذج الاكتشاف هذه على مجموعات بيانات مخصصة. يوضح المثال التالي كيفية استخدام نموذج Ultralytics YOLO26 مُدرّب مسبقًا لاكتشاف الأجسام التي تحتوي عادةً على نص، مثل لوحات ترخيص المركبات.
from ultralytics import YOLO
# Load a pre-trained YOLO26 model (ideal for locating text regions)
model = YOLO("yolo26n.pt")
# Perform inference on an image containing text objects (e.g., a street sign)
results = model.predict(source="https://ultralytics.com/images/bus.jpg")
# Display detected classes, acting as the localization step in an OCR pipeline
for r in results:
print(f"Detected classes: {r.boxes.cls}")
# Further processing would pass these crops to an OCR engineقراءات وموارد إضافية#
لاستكشاف مجموعات البيانات الأساسية التي قادت أبحاث OCR المبكرة، تظل قاعدة بيانات MNIST للأرقام المكتوبة بخط اليد موردًا كلاسيكيًا لإجراء المقارنات المعيارية. وللمهتمين بتطور التقنية مفتوحة المصدر، يقدّم تاريخ مشروع Tesseract نظرةً على المساهمات التي قادها المجتمع. وتمثل الحلول الحديثة القائمة على السحابة، مثل Google Cloud Vision API وAmazon Textract، أحدث ما توصلت إليه خدمات OCR المُدارة حاليًا. بالإضافة إلى ذلك، يواصل البحث في التعرّف على نصوص المشاهد دفع الحدود، مما يمكّن الذكاء الاصطناعي من قراءة النصوص في بيئات "غير مقيّدة" و"برية" تتباين فيها الإضاءة والمنظور.









