تاريخ نماذج الرؤية
استكشف تاريخ نماذج الرؤية وإنجازاتها وتحدياتها واتجاهاتها المستقبلية.

ما هي الرؤية الحاسوبية؟#
تخيّل دخولك إلى متجر تتعرّف فيه كاميرا على وجهك، وتحلّل حالتك المزاجية، وتقترح منتجات مصمّمة وفق تفضيلاتك—وكل ذلك في الوقت الفعلي. هذه ليست خيالًا علميًا، بل واقع أتاحته نماذج الرؤية الحديثة. ووفقًا لـتقرير صادر عن Fortune Business Insight، بلغت قيمة سوق الرؤية الحاسوبية عالميًا 20.31 مليار دولار أمريكي في عام 2023، ومن المتوقع أن تنمو من 25.41 مليار دولار أمريكي في عام 2024 إلى 175.72 مليار دولار أمريكي بحلول عام 2032، مما يعكس التطورات السريعة والاعتماد المتزايد لهذه التقنية في مختلف الصناعات.
يتيح مجال الرؤية الحاسوبية للحواسيب اكتشاف الكائنات داخل الصور وتحديدها وتحليلها. وكما هو الحال في مجالات الذكاء الاصطناعي الأخرى، شهدت الرؤية الحاسوبية تطورًا سريعًا على مدى العقود القليلة الماضية، محققةً تقدمًا ملحوظًا.
يمتد تاريخ الرؤية الحاسوبية على نطاق واسع. في سنواتها الأولى، كانت نماذج الرؤية الحاسوبية قادرة على اكتشاف الأشكال والحواف البسيطة، وغالبًا ما كانت تقتصر على مهام أساسية مثل التعرّف على الأنماط الهندسية أو التمييز بين المناطق الفاتحة والداكنة. أما نماذج اليوم، فيمكنها تنفيذ مهام معقدة مثل اكتشاف الكائنات في الوقت الفعلي، والتعرّف على الوجوه، بل وحتى تفسير المشاعر من تعبيرات الوجه بدقة وكفاءة استثنائيتين. ويسلّط هذا التطور الهائل الضوء على القفزات المذهلة في القدرة الحاسوبية، والتعقيد الخوارزمي، وتوافر كميات هائلة من البيانات اللازمة للتدريب.
سنستكشف في هذا المقال المحطات الرئيسية في تطور الرؤية الحاسوبية. وسنستعرض بداياتها المبكرة، ونتعمق في الأثر التحويلي للشبكات العصبية الالتفافية (CNNs)، ونبحث في التطورات المهمة التي تلت ذلك.
البدايات المبكرة للرؤية الحاسوبية#
كما هو الحال في مجالات الذكاء الاصطناعي الأخرى، بدأ التطور المبكر للرؤية الحاسوبية بأبحاث تأسيسية وأعمال نظرية. وكانت من المحطات المهمة أعمال Lawrence G. Roberts الرائدة في التعرّف على الكائنات ثلاثية الأبعاد، التي وثّقها في أطروحته "إدراك الآلة للأجسام الصلبة ثلاثية الأبعاد" في أوائل ستينيات القرن العشرين. وقد أرست إسهاماته الأساس لتطورات مستقبلية في هذا المجال.
الخوارزميات الأولى - اكتشاف الحواف#
ركّزت أبحاث الرؤية الحاسوبية المبكرة على تقنيات معالجة الصور، مثل اكتشاف الحواف واستخراج السمات. وكانت خوارزميات مثل مؤثر Sobel، الذي طُوّر في أواخر ستينيات القرن العشرين، من أوائل الخوارزميات التي اكتشفت الحواف من خلال حساب تدرّج شدة الصورة.

الشكل 1. صورة توضّح اكتشاف الحواف، حيث يعرض الجانب الأيسر الكائن الأصلي، بينما يعرض الجانب الأيمن النسخة التي اكتُشفت حوافها.
أدت تقنيات مثل كاشفي الحواف Sobel وCanny دورًا حاسمًا في تحديد الحدود داخل الصور، وهي ضرورية للتعرّف على الكائنات وفهم المشاهد.
التعلّم الآلي والرؤية الحاسوبية#
التعرّف على الأنماط#
في سبعينيات القرن العشرين، برز التعرّف على الأنماط مجالًا رئيسيًا في الرؤية الحاسوبية. وطوّر الباحثون أساليب للتعرّف على الأشكال والأنسجة والكائنات في الصور، مما مهّد الطريق لمهام رؤية أكثر تعقيدًا.

الشكل 2. التعرّف على الأنماط.
تمثّلت إحدى الطرق المبكرة للتعرّف على الأنماط في مطابقة القوالب، حيث تُقارن صورة بمجموعة من القوالب للعثور على أفضل تطابق. وكانت هذه الطريقة محدودة بسبب حساسيتها للتغيرات في المقياس والدوران والضوضاء.

الشكل 3. قالب على الجانب الأيسر عُثر عليه داخل الصورة الموجودة على الجانب الأيمن.
كانت أنظمة الرؤية الحاسوبية المبكرة مقيّدة بسبب القدرة الحاسوبية المحدودة في ذلك الوقت. فقد كانت الحواسيب في ستينيات وسبعينيات القرن العشرين ضخمة ومكلفة، وتمتلك قدرات معالجة محدودة.
إحداث نقلة نوعية باستخدام التعلّم العميق#
التعلّم العميق والشبكات العصبية الالتفافية#
مثّل التعلّم العميق والشبكات العصبية الالتفافية (CNNs) لحظة محورية في مجال الرؤية الحاسوبية. فقد غيّرت هذه التطورات بصورة جذرية كيفية تفسير الحواسيب للبيانات المرئية وتحليلها، ومكّنت مجموعة واسعة من التطبيقات التي كان يُعتقد سابقًا أنها مستحيلة.
كيف تعمل CNNs؟#

الشكل 4. بنية الشبكة العصبية الالتفافية (CNN).
- الطبقات الالتفافية: تستخدم CNNs طبقات التفاف، وهي نوع من نماذج التعلّم العميق المصممة لمعالجة البيانات المهيكلة الشبيهة بالشبكات، مثل الصور أو التسلسلات، من خلال تعلّم الأنماط الهرمية تلقائيًا، لمسح الصورة باستخدام المرشحات أو النوى. وتكتشف هذه المرشحات سمات متنوعة مثل الحواف والأنسجة والألوان عبر انزلاقها فوق الصورة وحساب الضربات النقطية. وينشّط كل مرشح أنماطًا محددة في الصورة، مما يمكّن النموذج من تعلّم السمات الهرمية.
- دوال التنشيط: بعد الالتفاف، تُستخدم دوال تنشيط مثل ReLU (وحدة خطية مصححة)، وهي دالة تنشيط شائعة في التعلّم العميق تُخرج المُدخل مباشرةً إذا كان موجبًا، وتُخرج صفرًا خلاف ذلك، مما يساعد الشبكات العصبية على تعلّم العلاقات غير الخطية في البيانات بكفاءة. ويساعد ذلك الشبكة على تعلّم الأنماط والتمثيلات المعقدة.
- طبقات التجميع: توفّر طبقات التجميع عملية تصغير للعينة تقلّل أبعاد خريطة السمات، مما يساعد على استخراج السمات الأكثر صلة مع تقليل التكلفة الحاسوبية وفرط التكيّف.
- الطبقات كاملة الاتصال: الطبقات النهائية في CNN هي طبقات كاملة الاتصال تفسّر السمات التي استخرجتها طبقات الالتفاف والتجميع لإجراء التنبؤات. وتشبه هذه الطبقات تلك الموجودة في الشبكات العصبية التقليدية.
تطور نماذج الرؤية القائمة على CNN#
كانت رحلة نماذج الرؤية طويلة، وشملت بعض النماذج الأكثر بروزًا:
-
LeNet (1989): كان LeNet أحد أقدم بنيات CNN، واستُخدم أساسًا للتعرّف على الأرقام في الشيكات المكتوبة بخط اليد. وقد أرسا نجاحه الأساس لشبكات CNN الأكثر تعقيدًا، مثبتًا إمكانات التعلّم العميق في معالجة الصور.
-
AlexNet (2012): تفوّق AlexNet بدرجة كبيرة على النماذج الموجودة في مسابقة ImageNet، مبرزًا قوة التعلّم العميق. واستخدم هذا النموذج عمليات تنشيط ReLU، والإسقاط، وزيادة البيانات، ووضع معايير جديدة في تصنيف الصور وأثار اهتمامًا واسعًا بـCNNs.
-
VGGNet (2014): حقق VGGNet نتائج impressive في مهام تصنيف الصور باستخدام مرشحات التفاف أصغر (3x3)، مما عزّز أهمية عمق الشبكة في تحقيق دقة أعلى.
-
ResNet (2015): عالج ResNet مشكلة التدهور في الشبكات العميقة من خلال تقديم التعلّم المتبقي. وأتاح هذا الابتكار تدريب شبكات أعمق بكثير، مما أدى إلى أداء متقدم على مستوى المجال في مختلف مهام الرؤية الحاسوبية.
-
YOLO (نظرة واحدة فقط): أحدث YOLO ثورة في اكتشاف الكائنات من خلال صياغته على هيئة مسألة انحدار واحدة، إذ يتنبأ مباشرةً بـالصناديق المحيطة واحتمالات الفئات من الصور الكاملة في تقييم واحد. وأتاح هذا النهج اكتشاف الكائنات في الوقت الفعلي بسرعة ودقة غير مسبوقتين، مما جعله مناسبًا للتطبيقات التي تتطلب معالجة فورية، مثل القيادة الذاتية والمراقبة.
تطبيقات الرؤية الحاسوبية#
الرعاية الصحية#
استخدامات الرؤية الحاسوبية عديدة. فعلى سبيل المثال، تُستخدم نماذج الرؤية مثل Ultralytics YOLOv8 في التصوير الطبي لاكتشاف أمراض مثل السرطان واعتلال الشبكية السكري. وهي تحلّل صور الأشعة السينية، وصور الرنين المغناطيسي، وفحوصات التصوير المقطعي بدقة عالية، وتحدد التشوهات مبكرًا. وتتيح هذه القدرة على الاكتشاف المبكر التدخل في الوقت المناسب وتحسين نتائج المرضى.

الشكل 5. اكتشاف ورم دماغي باستخدام Ultralytics YOLOv8.
الحفاظ على البيئة#
تساعد نماذج الرؤية الحاسوبية على مراقبة الأنواع المهددة بالانقراض وحمايتها من خلال تحليل الصور ومقاطع الفيديو من موائل الحياة البرية. وهي تحدد سلوك الحيوانات وتتتبعه، وتوفّر بيانات عن أعدادها وتحركاتها. وتوجّه هذه التقنية استراتيجيات الحفاظ على البيئة وقرارات السياسات لحماية أنواع مثل النمور والفيلة.
وبمساعدة الذكاء الاصطناعي للرؤية، يمكن مراقبة تهديدات بيئية أخرى مثل حرائق الغابات وإزالة الغابات، مما يضمن سرعة استجابة السلطات المحلية.

الشكل 6. صورة عبر الأقمار الصناعية لحريق غابات.
التحديات والاتجاهات المستقبلية#
على الرغم من تحقيقها إنجازات مهمة بالفعل، تواجه نماذج الرؤية تحديات عديدة تتطلب أبحاثًا مستمرة وتطورات مستقبلية، نظرًا لتعقيدها البالغ والطبيعة المتطلبة لتطويرها.
قابلية التفسير والإيضاح#
غالبًا ما يُنظر إلى نماذج الرؤية، ولا سيما نماذج التعلّم العميق، على أنها «صناديق سوداء» تتسم بقدر محدود من الشفافية. ويرجع ذلك إلى التعقيد الهائل لهذه النماذج. ويعيق نقص قابلية التفسير الثقة والمساءلة، ولا سيما في التطبيقات الحساسة مثل الرعاية الصحية، على سبيل المثال.
المتطلبات الحاسوبية#
يتطلب تدريب نماذج الذكاء الاصطناعي المتقدمة على مستوى المجال ونشرها موارد حاسوبية كبيرة. وينطبق ذلك خصوصًا على نماذج الرؤية، التي تتطلب غالبًا معالجة كميات كبيرة من بيانات الصور والفيديو. وتزيد الصور ومقاطع الفيديو عالية الدقة، باعتبارها من أكثر مدخلات التدريب استهلاكًا للبيانات، من العبء الحاسوبي. فعلى سبيل المثال، قد تشغل صورة HD واحدة عدة ميغابايتات من مساحة التخزين، مما يجعل عملية التدريب كثيفة الموارد وتستغرق وقتًا طويلًا.
ويستلزم ذلك أجهزة قوية وخوارزميات رؤية حاسوبية محسّنة للتعامل مع البيانات الواسعة والحسابات المعقدة المرتبطة بتطوير نماذج رؤية فعالة. وتُعد الأبحاث المتعلقة بالبنى الأكثر كفاءة، وضغط النماذج، ومسرّعات الأجهزة مثل GPUs وTPUs، من المجالات الرئيسية التي ستدفع مستقبل نماذج الرؤية إلى الأمام.
تهدف هذه التحسينات إلى تقليل المتطلبات الحاسوبية وزيادة كفاءة المعالجة. علاوة على ذلك، يمكن أن يؤدي الاستفادة من النماذج المتقدمة المدرّبة مسبقًا مثل Ultralytics YOLOv8 إلى تقليل الحاجة إلى التدريب المكثف بدرجة كبيرة، وتبسيط عملية التطوير وتعزيز الكفاءة.
مشهد دائم التطور#
في الوقت الحاضر، تنتشر تطبيقات نماذج الرؤية على نطاق واسع، بدءًا من الرعاية الصحية، مثل اكتشاف الأورام، ووصولًا إلى الاستخدامات اليومية مثل مراقبة حركة المرور. وقد جلبت هذه النماذج المتقدمة الابتكار إلى عدد لا يُحصى من الصناعات من خلال توفير دقة وكفاءة وقدرات محسّنة لم يكن من الممكن تصورها سابقًا.
مع استمرار تقدم التقنية، تظل إمكانات نماذج الرؤية في ابتكار مختلف جوانب الحياة والصناعة وتحسينها بلا حدود. ويؤكد هذا التطور المستمر أهمية مواصلة البحث والتطوير في مجال الرؤية الحاسوبية.
هل يثيرك الفضول بشأن مستقبل الذكاء الاصطناعي للرؤية؟ لمزيد من المعلومات حول أحدث التطورات، استكشف وثائق Ultralytics، واطّلع على مشاريعها على GitHub الخاص بـUltralytics وGitHub الخاص بـYOLOv8. بالإضافة إلى ذلك، للحصول على رؤى حول تطبيقات الذكاء الاصطناعي في مختلف الصناعات، تقدّم صفحات الحلول الخاصة بـالسيارات ذاتية القيادة والتصنيع معلومات مفيدة بشكل خاص.









