Image Recognition
تعلّم كيف يستخدم التعرّف على الصور الذكاء الاصطناعي والتعلّم العميق لتحديد البيانات المرئية. استكشف التطبيقات الواقعية وانشر Ultralytics YOLO26 لتحقيق نتائج متقدمة.
يُعدّ التعرّف على الصور تقنية أساسية ضمن المجال الأوسع لـالرؤية الحاسوبية (CV)، إذ تمكّن أنظمة البرمجيات من تحديد الأجسام والأشخاص والأماكن والنصوص داخل الصور الرقمية. ومن خلال تحليل محتوى البكسلات في صورة أو إطار فيديو، تحاول هذه التقنية محاكاة قدرات الإدراك البصري للعين والدماغ البشريين. وبفضل الذكاء الاصطناعي (AI)، يحوّل التعرّف على الصور البيانات المرئية غير المهيكلة إلى معلومات مهيكلة قابلة للتنفيذ، ويشكّل أساس الأتمتة في قطاعات تمتد من الرعاية الصحية إلى النقل الذاتي القيادة.
الآليات والتقنيات الأساسية#
تجاوزت أنظمة التعرّف على الصور الحديثة البرمجة التقليدية القائمة على القواعد، وأصبحت تعتمد بدرجة كبيرة على خوارزميات التعلّم العميق (DL). وتُعدّ الشبكة العصبية الالتفافية (CNN) البنية الأكثر شيوعًا المستخدمة لهذه المهام. وتعالج CNN الصور على هيئة شبكة من القيم، تمثّل عادةً قنوات الألوان الأحمر والأخضر والأزرق (RGB)، وتمرّرها عبر طبقات متعددة من العمليات الرياضية.
خلال هذه العملية، تنفّذ الشبكة استخراج السمات. قد تكتشف الطبقات الأولية أنماطًا هندسية بسيطة مثل الحواف أو الزوايا، بينما تجمع الطبقات الأعمق هذه الأنماط للتعرّف على تراكيب معقدة مثل العيون أو العجلات أو الأوراق. ولتحقيق دقة عالية، تحتاج هذه النماذج إلى كميات هائلة من بيانات التدريب المُعنونة. وتساعد مجموعات البيانات العامة واسعة النطاق، مثل ImageNet، النماذجَ على تعلّم الاحتمال الإحصائي الذي يربط ترتيبًا بصريًا محددًا بمفهوم مثل "قطة" أو "دراجة" أو "إشارة توقف".
تمييز التعرّف عن المفاهيم ذات الصلة#
على الرغم من استخدام مصطلح "التعرّف على الصور" غالبًا باعتباره عبارة شاملة، فإنه يختلف عن مهام أخرى محددة في مجال الرؤية الحاسوبية. ويُعدّ فهم هذه الفروق الدقيقة أمرًا بالغ الأهمية لاختيار النموذج المناسب للمشروع:
- التعرّف مقابل تصنيف الصور: التصنيف هو مهمة إسناد تسمية واحدة إلى صورة كاملة، مثل تسمية صورة بأنها "شاطئ". أما التعرّف فهو القدرة الأوسع التي تمكّن النظام من فهم المحتوى.
- التعرّف مقابل اكتشاف الأجسام: بينما يحدد التعرّف ما الموجود في الصورة، يحدد الاكتشاف مكانه. وترسم خوارزميات الاكتشاف مربع إحاطة حول كل مثيل من الأجسام، وتفصله عن الخلفية.
- التعرّف مقابل تجزئة المثيلات: تأخذ هذه المهمة التعرّف خطوة أبعد من خلال تحديد المحيط الدقيق لبكسلات الجسم، بدلًا من الاكتفاء بمربع. ويُعدّ ذلك أمرًا بالغ الأهمية للتطبيقات التي تتطلب قياسات دقيقة، مثل تحليل الصور الطبية الحيوية.
التطبيقات الواقعية#
تمتد فائدة التعرّف على الصور إلى كل قطاع تقريبًا تُنتج فيه بيانات مرئية.
- التشخيص الطبي: في مجال الرعاية الصحية، تساعد خوارزميات التعرّف أطباءَ الأشعة على تحليل التصوير الطبي، مثل صور الأشعة السينية وصور الرنين المغناطيسي. ويمكن لأدوات مثل الذكاء الاصطناعي في علم الأشعة تحديد الحالات الشاذة، مثل الأورام أو الكسور، بسرعة أكبر وأحيانًا بدقة أعلى من الملاحظة البشرية وحدها.
- تجارة التجزئة وإدارة المخزون: تستخدم المتاجر الكبرى الذكية التعرّف لتتبّع المنتجات أثناء أخذها من الرفوف، مما يتيح أنظمة الدفع الآلي. وبالمثل، تستخدم روبوتات المستودعات هذه التقنية لتحديد الطرود وفرزها.
- الأمن والتحكم في الوصول: تتيح أنظمة التعرّف على الوجوه الوصول الآمن إلى الهواتف الذكية والمباني، من خلال التحقق من الهوية بمقارنتها بقاعدة بيانات تتضمن تمثيلات الوجه المخزّنة.
تنفيذ التعرّف على الصور باستخدام Ultralytics YOLO26#
أصبح تنفيذ التعرّف على الصور أكثر سهولة بكثير للمطورين والباحثين بفضل النماذج المتطورة مثل YOLO26، الذي يدعم التصنيف والاكتشاف والتجزئة أصليًا. ويوضح المثال التالي كيفية تنفيذ التعرّف، وتحديدًا اكتشاف الأجسام، على صورة باستخدام حزمة ultralytics Python.
from ultralytics import YOLO
# Load a pre-trained YOLO26 model (n for nano, fastest speed)
model = YOLO("yolo26n.pt")
# Run inference on an image to recognize and locate objects
# The source can be a file path, URL, or webcam (source=0)
results = model("https://ultralytics.com/images/bus.jpg")
# Display the results with bounding boxes and labels
results[0].show()بالنسبة إلى الفرق التي ترغب في إضافة تعليقات توضيحية إلى مجموعات بياناتها الخاصة وتدريب نماذج مخصصة في السحابة، توفر منصة Ultralytics بيئة مبسطة لإدارة دورة الحياة الكاملة لمشروع التعرّف على الصور، بدءًا من جمع البيانات ووصولًا إلى النشر.
الاتجاهات المستقبلية#
مع ازدياد القدرة الحاسوبية، يتطور التعرّف على الصور إلى فهم الفيديو، حيث تحلل الأنظمة السياق الزمني عبر الإطارات. علاوةً على ذلك، يتيح دمج الذكاء الاصطناعي التوليدي للأنظمة ليس التعرّف على الصور فحسب، بل أيضًا إنشاء أوصاف نصية مفصلة لها، مما يقرّب بين معالجة اللغة الطبيعية (NLP) والرؤية.









