يغيّر الذكاء الاصطناعي التوليدي المسار المقبل للرؤية الحاسوبية
اكتشف رؤى مثيرة للاهتمام من جلسة نقاشية في YOLO Vision 2024. واستكشف كيف يشكّل الذكاء الاصطناعي التوليدي المسار المقبل لنماذج الذكاء الاصطناعي للرؤية في الوقت الفعلي.

الذكاء الاصطناعي التوليدي هو فرع من الذكاء الاصطناعي (AI) ينشئ محتوى جديدًا، مثل الصور أو النصوص أو الصوت، من خلال تعلّم الأنماط من البيانات الموجودة. وبفضل التطورات الحديثة، يمكن استخدامه الآن لإنتاج محتوى واقعي للغاية يحاكي الإبداع البشري غالبًا.
لكن تأثير الذكاء الاصطناعي التوليدي يتجاوز مجرد إنشاء المحتوى. ومع استمرار تطوّر نماذج الرؤية الحاسوبية في الوقت الفعلي، مثل نماذج Ultralytics YOLO، يعيد الذكاء الاصطناعي التوليدي أيضًا تعريف طريقة معالجة البيانات المرئية وتعزيزها، مما يمهّد الطريق أمام تطبيقات مبتكرة في سيناريوهات العالم الحقيقي.
كان هذا التحول التكنولوجي الجديد موضوعًا مثيرًا للنقاش في YOLO Vision 2024 (YV24)، وهو فعالية هجينة سنوية تستضيفها Ultralytics. جمعت YV24 بين المهتمين بالذكاء الاصطناعي وقادة القطاع لمناقشة أحدث الاختراقات في الرؤية الحاسوبية. وركّزت الفعالية على الابتكار والكفاءة ومستقبل حلول الذكاء الاصطناعي في الوقت الفعلي.
كان من أبرز محاور الفعالية نقاشٌ جماعي حول YOLO في عصر الذكاء الاصطناعي التوليدي. وشارك في النقاش Glenn Jocher، المؤسس والرئيس التنفيذي لشركة Ultralytics، وJing Qiu، مهندس تعلّم آلي أول في Ultralytics، وAo Wang من جامعة تسينغهوا. واستكشفوا كيفية تأثير الذكاء الاصطناعي التوليدي في الرؤية الحاسوبية، والتحديات المرتبطة ببناء نماذج ذكاء اصطناعي عملية.
في هذا المقال، سنستعرض مجددًا أبرز الرؤى المستخلصة من نقاشهم، ونلقي نظرةً أقرب على كيفية إحداث الذكاء الاصطناعي التوليدي تحول في الذكاء الاصطناعي للرؤية.
تطوير نماذج Ultralytics YOLO#
إلى جانب Glenn Jocher، أدّى العديد من المهندسين المهرة دورًا حيويًا في تطوير نماذج Ultralytics YOLO. وكان Jing Qiu أحد هؤلاء المهندسين، وقد روى بدايته غير المتوقعة مع YOLO. وأوضح أن شغفه بالذكاء الاصطناعي بدأ خلال سنوات دراسته الجامعية. وقضى وقتًا طويلًا في استكشاف هذا المجال والتعلّم عنه. وتذكّر Jing Qiu كيف تواصل مع Glenn Jocher على GitHub وشارك في مشاريع متنوعة للذكاء الاصطناعي.
استكمالًا لما قاله Jing Qiu، وصف Glenn Jocher موقع GitHub بأنه "وسيلة مذهلة للمشاركة، حيث يجتمع أشخاص لم تلتقِ بهم من قبل لمساعدة بعضهم بعضًا، والمساهمة في أعمال بعضهم البعض. إنه مجتمع رائع ووسيلة رائعة حقًا للبدء في مجال الذكاء الاصطناعي."

الشكل 1. Glenn Jocher وJing Qiu يتحدثان على المسرح في YV24.
ساعد اهتمام Jing Qiu بالذكاء الاصطناعي وعمله على Ultralytics YOLOv5 في تحسين النموذج. ولاحقًا، أدّى دورًا رئيسيًا في تطوير Ultralytics YOLOv8، الذي قدّم تحسينات إضافية. ووصف ذلك بأنه رحلة مذهلة. ويواصل Jing Qiu اليوم تحسين نماذج مثل Ultralytics YOLO11 والعمل عليها.
YOLOv10: مُحسّن للأداء في العالم الحقيقي#
انضم Ao Wang إلى النقاش الجماعي عن بُعد من الصين، وعرّف بنفسه بصفته طالب دكتوراه. درس في البداية هندسة البرمجيات، لكن شغفه بالذكاء الاصطناعي دفعه إلى التوجه نحو الرؤية الحاسوبية والتعلّم العميق.
التقى أول مرة بنموذج YOLO الشهير أثناء تجريبه تقنيات ونماذج متنوعة للذكاء الاصطناعي. وقد أُعجب بسرعته ودقته، مما ألهمه للتعمق أكثر في مهام الرؤية الحاسوبية، مثل اكتشاف الكائنات. ومؤخرًا، ساهم Ao Wang في YOLOv10، وهو إصدار حديث من نموذج YOLO. وركّز بحثه على تحسين النموذج ليصبح أسرع وأكثر دقة.
الفرق الرئيسي بين الذكاء الاصطناعي التوليدي والذكاء الاصطناعي للرؤية#
بعد ذلك، بدأ أعضاء النقاش في مناقشة الذكاء الاصطناعي التوليدي، وأشار Jing Qiu إلى أن الذكاء الاصطناعي التوليدي والذكاء الاصطناعي للرؤية لهما غايات مختلفة جدًا. فالذكاء الاصطناعي التوليدي ينشئ أو يولّد أشياء مثل النصوص والصور ومقاطع الفيديو، بينما يحلل الذكاء الاصطناعي للرؤية ما هو موجود أصلًا، ولا سيما الصور.
أوضح Glenn Jocher أن الحجم يمثل فرقًا كبيرًا أيضًا. فنماذج الذكاء الاصطناعي التوليدي ضخمة، وغالبًا ما تحتوي على مليارات المَعلمات، وهي إعدادات داخلية تساعد النموذج على التعلّم من البيانات. أما نماذج الرؤية الحاسوبية فهي أصغر بكثير. وقال: “إن أصغر نموذج YOLO لدينا أصغر بنحو ألف مرة من أصغر نموذج لغوي كبير [Large Language Model]. أي 3 ملايين مَعلمة مقارنةً بثلاثة مليارات.”

الشكل 2. النقاش الجماعي حول الذكاء الاصطناعي التوليدي والذكاء الاصطناعي للرؤية في YV24.
أضاف Jing Qiu أن عمليات تدريب الذكاء الاصطناعي التوليدي والرؤية الحاسوبية ونشرهما تختلف أيضًا اختلافًا كبيرًا. يحتاج الذكاء الاصطناعي التوليدي إلى خوادم ضخمة وقوية للعمل. أما نماذج مثل YOLO، فعلى الجانب الآخر، فقد صُممت لتحقيق الكفاءة، ويمكن تدريبها ونشرها على أجهزة قياسية. وهذا يجعل نماذج Ultralytics YOLO أكثر عملية للاستخدام في العالم الحقيقي.
على الرغم من اختلافهما، بدأ هذان المجالان في التداخل. وأوضح Glenn Jocher أن الذكاء الاصطناعي التوليدي يقدّم تطورات جديدة للذكاء الاصطناعي للرؤية، مما يجعل النماذج أكثر ذكاءً وكفاءة.
تأثير الذكاء الاصطناعي التوليدي في الرؤية الحاسوبية#
تطوّر الذكاء الاصطناعي التوليدي بسرعة، وتؤثر هذه الاختراقات في العديد من المجالات الأخرى للذكاء الاصطناعي، بما في ذلك الرؤية الحاسوبية. وفيما يلي نستعرض بعض الرؤى الرائعة التي طرحها النقاش الجماعي حول هذا الموضوع.
تطورات الأجهزة تتيح ابتكارات الذكاء الاصطناعي#
في بداية النقاش، أوضح Glenn Jocher أن أفكار التعلّم الآلي موجودة منذ وقت طويل، لكن أجهزة الكمبيوتر لم تكن قوية بما يكفي لتطبيقها. فقد احتاجت أفكار الذكاء الاصطناعي إلى أجهزة أقوى لتحويلها إلى واقع.
غيّر صعود وحدات معالجة الرسومات (GPUs) خلال السنوات العشرين الماضية، بفضل إمكانات المعالجة المتوازية، كل شيء. فقد جعلت تدريب نماذج الذكاء الاصطناعي أسرع وأكثر كفاءة بكثير، مما أتاح للتعلّم العميق التطوّر بوتيرة سريعة.
في الوقت الحاضر، تستهلك شرائح الذكاء الاصطناعي مثل وحدات معالجة الموتر (TPUs) ووحدات معالجة الرسومات المحسّنة طاقةً أقل أثناء التعامل مع نماذج أكبر وأكثر تعقيدًا. وقد جعل ذلك الذكاء الاصطناعي أكثر إتاحةً وفائدةً في تطبيقات العالم الحقيقي.
مع كل تحسين جديد في الأجهزة، تزداد قوة تطبيقات الذكاء الاصطناعي التوليدي والرؤية الحاسوبية. وتجعل هذه التطورات الذكاء الاصطناعي في الوقت الفعلي أسرع وأكثر كفاءةً وجاهزيةً للاستخدام في مزيد من القطاعات.
كيف يشكّل الذكاء الاصطناعي التوليدي نماذج اكتشاف الكائنات#
عندما سُئل Jing Qiu عن تأثير الذكاء الاصطناعي التوليدي في الرؤية الحاسوبية، قال إن المحوّلات، وهي نماذج تساعد الذكاء الاصطناعي على التركيز على أهم أجزاء الصورة، غيّرت طريقة فهم الذكاء الاصطناعي للصور ومعالجتها. وكانت الخطوة الكبيرة الأولى هي DETR (محوّل الاكتشاف)، الذي استخدم هذا النهج الجديد لاكتشاف الكائنات. وقد حسّن الدقة، لكنه واجه مشكلات في الأداء جعلته أبطأ في بعض الحالات.
ولحل هذه المشكلة، أنشأ الباحثون نماذج هجينة مثل RT-DETR. وتجمع هذه النماذج بين الشبكات العصبية الالتفافية (CNNs، وهي نماذج تعلّم عميق تتعلّم السمات من الصور وتستخرجها تلقائيًا) والمحوّلات، محققةً توازنًا بين السرعة والدقة. ويستفيد هذا النهج من مزايا المحوّلات مع جعل اكتشاف الكائنات أسرع.
ومن المثير للاهتمام أن YOLOv10 يستخدم طبقات انتباه قائمة على المحوّلات، وهي أجزاء من النموذج تعمل ككشاف ضوئي لإبراز أهم المناطق في الصورة مع تجاهل التفاصيل الأقل صلة، لتعزيز أدائه.
ذكر Ao Wang أيضًا أن الذكاء الاصطناعي التوليدي يغيّر طريقة تدريب النماذج. فتساعد تقنيات مثل نمذجة الصور المقنّعة الذكاء الاصطناعي على التعلّم من الصور بكفاءة أكبر، مما يقلل الحاجة إلى مجموعات بيانات كبيرة موسومة يدويًا. وهذا يجعل تدريب الرؤية الحاسوبية أسرع وأقل استهلاكًا للموارد.
مستقبل الذكاء الاصطناعي التوليدي والذكاء الاصطناعي للرؤية#
كانت إحدى الأفكار الرئيسية الأخرى التي ناقشها الفريق هي كيفية اجتماع الذكاء الاصطناعي التوليدي والذكاء الاصطناعي للرؤية لبناء نماذج أكثر قدرة. وأوضح Glenn Jocher أنه رغم امتلاك هذين النهجين نقاط قوة مختلفة، فإن الجمع بينهما قد يفتح إمكانات جديدة.
فعلى سبيل المثال، غالبًا ما تقسّم نماذج الذكاء الاصطناعي للرؤية، مثل YOLO، الصورة إلى شبكة لتحديد الكائنات. وقد تساعد هذه الطريقة القائمة على الشبكة نماذج اللغة على تحسين قدرتها على تحديد التفاصيل ووصفها في الوقت نفسه، وهو تحدٍ تواجهه العديد من نماذج اللغة اليوم. وبعبارة أخرى، قد يؤدي دمج هذه التقنيات إلى أنظمة تستطيع اكتشاف ما تراه بدقة وشرحه بوضوح.

الشكل 3. مستقبل الذكاء الاصطناعي التوليدي والذكاء الاصطناعي للرؤية. الصورة من إعداد المؤلف.
أهم النقاط المستخلصة#
يتقدم الذكاء الاصطناعي التوليدي والرؤية الحاسوبية معًا. فبينما ينشئ الذكاء الاصطناعي التوليدي الصور ومقاطع الفيديو، فإنه يحسّن أيضًا تحليل الصور ومقاطع الفيديو من خلال تقديم أفكار مبتكرة جديدة قد تجعل نماذج الذكاء الاصطناعي للرؤية أكثر دقة وكفاءة.
في هذا النقاش الجماعي المفيد ضمن YV24، شارك Glenn Jocher وJing Qiu وAo Wang أفكارهم حول كيفية تشكيل هذه التقنيات للمستقبل. ومع تحسّن أجهزة الذكاء الاصطناعي، سيواصل الذكاء الاصطناعي التوليدي والذكاء الاصطناعي للرؤية تطورهما، مما سيؤدي إلى مزيد من الابتكارات. ويعمل هذان المجالان معًا لإنشاء ذكاء اصطناعي أكثر ذكاءً وسرعةً وفائدةً في الحياة اليومية.
انضم إلى مجتمعنا واستكشف مستودع GitHub الخاص بنا لمعرفة المزيد عن الذكاء الاصطناعي للرؤية. اطّلع على خيارات الترخيص لدينا لبدء مشاريعك في الرؤية الحاسوبية. هل تهتم بابتكارات مثل الذكاء الاصطناعي في التصنيع أو الرؤية الحاسوبية في المركبات ذاتية القيادة؟ زُر صفحات حلولنا لاكتشاف المزيد.









