تشغيل مشاريع CV باستخدام أدوات Hugging Face مفتوحة المصدر
انضموا إلينا لاستعادة عرض الكلمة الرئيسية من YOLO Vision 2024، الذي يركز على استكشاف كيفية دفع أدوات Hugging Face مفتوحة المصدر لتطوير AI قدمًا.

لا يُعد اختيار الخوارزميات المناسبة سوى جزء واحد من بناء حلول مؤثرة للرؤية الحاسوبية. غالبًا ما يعمل مهندسو الذكاء الاصطناعي مع مجموعات بيانات كبيرة، ويُجرون ضبطًا دقيقًا للنماذج لمهام محددة، ويُحسّنون أنظمة الذكاء الاصطناعي لتحقيق أداء عملي في العالم الحقيقي. ومع اعتماد تطبيقات الذكاء الاصطناعي بوتيرة أسرع، تزداد أيضًا الحاجة إلى أدوات تُبسّط هذه العمليات.
في YOLO Vision 2024 (YV24)، اجتمع خبراء الذكاء الاصطناعي وعشاق التقنية في الفعالية الهجينة السنوية التي تدعمها Ultralytics لاستكشاف أحدث الابتكارات في الرؤية الحاسوبية. وأثارت الفعالية نقاشات حول موضوعات متنوعة، مثل سبل تسريع تطوير تطبيقات الذكاء الاصطناعي.
كان من أبرز محاور الفعالية خطاب رئيسي حول Hugging Face، وهي منصة ذكاء اصطناعي مفتوحة المصدر تُبسّط تدريب النماذج وتحسينها ونشرها. شارك Pavel Iakubovskii، مهندس تعلّم آلي في Hugging Face، كيف تُحسّن أدواتها سير العمل في مهام الرؤية الحاسوبية، مثل اكتشاف الكائنات في الصور، وتصنيف الصور ضمن مجموعات مختلفة، وإجراء التنبؤات دون تدريب مسبق على أمثلة محددة (التعلّم من دون أمثلة).
يستضيف Hugging Face Hub نماذج ذكاء اصطناعي متنوعة، ويتيح الوصول إليها، مثل نماذج الرؤية الحاسوبية من Ultralytics YOLO11. في هذه المقالة، سنستعرض أهم ما ورد في خطاب Pavel، ونرى كيف يمكن للمطورين استخدام أدوات Hugging Face مفتوحة المصدر لبناء نماذج الذكاء الاصطناعي ونشرها بسرعة.

الشكل 1. Pavel على خشبة المسرح في YV24.
يدعم Hugging Face Hub تطوير الذكاء الاصطناعي بوتيرة أسرع#
استهل Pavel خطابه بتقديم Hugging Face بوصفها منصة ذكاء اصطناعي مفتوحة المصدر توفر نماذج مدرّبة مسبقًا لمجموعة متنوعة من التطبيقات. صُممت هذه النماذج لفروع مختلفة من الذكاء الاصطناعي، بما في ذلك معالجة اللغة الطبيعية (NLP)، والرؤية الحاسوبية، والذكاء الاصطناعي متعدد الوسائط، ما يتيح للأنظمة معالجة أنواع مختلفة من البيانات، مثل النصوص والصور والصوت.
ذكر Pavel أن Hugging Face Hub يستضيف الآن أكثر من مليون نموذج، وأن المطورين يستطيعون بسهولة العثور على نماذج مناسبة لمشاريعهم المحددة. وتهدف Hugging Face إلى تبسيط تطوير الذكاء الاصطناعي من خلال توفير أدوات لتدريب النماذج وضبطها الدقيق ونشرها. وعندما يتمكن المطورون من تجربة نماذج مختلفة، تصبح عملية دمج الذكاء الاصطناعي في التطبيقات الواقعية أبسط.
رغم أن Hugging Face كانت معروفة في البداية بـ NLP، فإنها توسعت منذ ذلك الحين إلى الرؤية الحاسوبية والذكاء الاصطناعي متعدد الوسائط، ما يتيح للمطورين معالجة نطاق أوسع من مهام الذكاء الاصطناعي. كما تتمتع بمجتمع قوي يمكن فيه للمطورين التعاون ومشاركة الرؤى والحصول على الدعم عبر المنتديات وDiscord وGitHub.
استكشاف نماذج Hugging Face لتطبيقات الرؤية الحاسوبية#
وبالانتقال إلى مزيد من التفاصيل، أوضح Pavel كيف تجعل أدوات Hugging Face بناء تطبيقات الرؤية الحاسوبية أسهل. ويمكن للمطورين استخدامها في مهام مثل تصنيف الصور، واكتشاف الكائنات، وتطبيقات الرؤية واللغة.
وأشار أيضًا إلى إمكانية تنفيذ العديد من مهام الرؤية الحاسوبية هذه باستخدام نماذج مدرّبة مسبقًا ومتاحة على Hugging Face Hub، ما يوفر الوقت من خلال تقليل الحاجة إلى التدريب من الصفر. وفي الواقع، توفر Hugging Face أكثر من 13,000 نموذج مدرّب مسبقًا لمهام تصنيف الصور، بما في ذلك نماذج لتصنيف الأطعمة والحيوانات الأليفة واكتشاف المشاعر.
وأكد سهولة الوصول إلى هذه النماذج قائلًا: "ربما لا تحتاج حتى إلى تدريب نموذج لمشروعك؛ فقد تجد على Hub نموذجًا درّبه أحد أفراد المجتمع بالفعل."
نماذج Hugging Face لاكتشاف الكائنات#
وقدم Pavel مثالًا آخر، موضحًا كيف يمكن لـ Hugging Face المساعدة في اكتشاف الكائنات، وهي وظيفة أساسية في الرؤية الحاسوبية تُستخدم لتحديد الكائنات وتحديد مواقعها داخل الصور. وحتى مع محدودية البيانات الموسومة، يمكن للنماذج المدرّبة مسبقًا والمتاحة على Hugging Face Hub أن تجعل اكتشاف الكائنات أكثر كفاءة.
كما قدم لمحة سريعة عن عدة نماذج مخصصة لهذه المهمة يمكن العثور عليها على Hugging Face:
- نماذج اكتشاف الكائنات في الوقت الفعلي: في البيئات الديناميكية التي تكون فيها السرعة أمرًا بالغ الأهمية، توفر نماذج مثل Detection Transformer (DETR) إمكانات اكتشاف الكائنات في الوقت الفعلي. وقد دُرّب DETR على مجموعة بيانات COCO، وصُمم لمعالجة الميزات متعددة المقاييس بكفاءة، ما يجعله مناسبًا للتطبيقات الحساسة للوقت.
- نماذج الرؤية واللغة: تجمع هذه النماذج بين معالجة الصور والنصوص، ما يتيح لأنظمة الذكاء الاصطناعي مطابقة الصور مع الأوصاف أو التعرّف على كائنات تتجاوز بيانات التدريب الخاصة بها. ومن أمثلتها CLIP وSigLIP، اللذان يحسّنان البحث عن الصور من خلال ربط النصوص بالمرئيات، ويتيحان لحلول الذكاء الاصطناعي تحديد كائنات جديدة عبر فهم سياقها.
- نماذج اكتشاف الكائنات من دون أمثلة: يمكنها تحديد كائنات لم ترها من قبل من خلال فهم العلاقة بين الصور والنصوص. ومن أمثلتها OwlVit وGroundingDINO وOmDet، التي تستخدم التعلّم من دون أمثلة لاكتشاف كائنات جديدة دون الحاجة إلى بيانات تدريب موسومة.
كيفية استخدام نماذج Hugging Face#
حوّل Pavel بعد ذلك التركيز إلى التطبيق العملي باستخدام نماذج Hugging Face، موضحًا ثلاث طرق يمكن للمطورين من خلالها الاستفادة منها: استكشاف النماذج، واختبارها بسرعة، وتخصيصها بصورة أكبر.
أوضح كيف يمكن للمطورين تصفح النماذج مباشرةً على Hugging Face Hub دون كتابة أي تعليمات برمجية، ما يسهّل اختبار النماذج فورًا عبر واجهة تفاعلية. وأضاف Pavel: "يمكنك تجربته دون كتابة سطر واحد من التعليمات البرمجية أو تنزيل النموذج على حاسوبك." وبما أن بعض النماذج كبيرة الحجم، فإن تشغيلها على Hub يساعد على تجنب قيود التخزين والمعالجة.

الشكل 2. كيفية استخدام نماذج Hugging Face.
بالإضافة إلى ذلك، تتيح Hugging Face Inference API للمطورين تشغيل نماذج الذكاء الاصطناعي باستخدام استدعاءات API بسيطة. وهي مناسبة للاختبارات السريعة، ومشاريع إثبات المفهوم، وإنشاء النماذج الأولية بسرعة دون الحاجة إلى إعداد معقد.
ولحالات الاستخدام الأكثر تقدمًا، يمكن للمطورين استخدام إطار عمل Hugging Face Transformers، وهو أداة مفتوحة المصدر توفر نماذج مدرّبة مسبقًا لمهام النصوص والرؤية والصوت، مع دعم كل من PyTorch وTensorFlow. وأوضح Pavel أنه من خلال سطرين فقط من التعليمات البرمجية، يستطيع المطورون استرداد نموذج من Hugging Face Hub وربطه بأداة للمعالجة المسبقة، مثل معالج الصور، لتحليل بيانات الصور في تطبيقات الذكاء الاصطناعي للرؤية.
تحسين سير عمل الذكاء الاصطناعي باستخدام Hugging Face#
بعد ذلك، أوضح Pavel كيف يمكن لـ Hugging Face تبسيط سير عمل الذكاء الاصطناعي. وكان أحد الموضوعات الرئيسية التي تناولها تحسين آلية الانتباه في Transformers، وهي ميزة أساسية في نماذج التعلّم العميق تساعدها على التركيز على الأجزاء الأكثر صلة من بيانات الإدخال. ويؤدي ذلك إلى تحسين دقة المهام التي تتضمن معالجة اللغة والرؤية الحاسوبية. غير أن هذه الآلية قد تستهلك موارد كبيرة.
يمكن أن يؤدي تحسين آلية الانتباه إلى تقليل استخدام الذاكرة بدرجة كبيرة مع تحسين السرعة. وأشار Pavel قائلًا: "على سبيل المثال، من خلال التحول إلى تطبيق أكثر كفاءة للانتباه، قد تلاحظ أداءً أسرع بما يصل إلى 1.8x."
توفر Hugging Face دعمًا مدمجًا لتطبيقات أكثر كفاءة لآلية الانتباه ضمن إطار عمل Transformers. ويمكن للمطورين تفعيل هذه التحسينات بمجرد تحديد تطبيق بديل للانتباه عند تحميل النموذج.
Optimum وTorch Compile#
كما تحدث عن التكميم، وهو أسلوب يجعل نماذج الذكاء الاصطناعي أصغر حجمًا من خلال تقليل دقة الأرقام التي تستخدمها دون التأثير بدرجة كبيرة في الأداء. ويساعد ذلك النماذج على استخدام ذاكرة أقل والعمل بسرعة أكبر، ما يجعلها أنسب للأجهزة ذات قدرة المعالجة المحدودة، مثل الهواتف الذكية والأنظمة المضمنة.
ولتحسين الكفاءة بصورة أكبر، قدّم Pavel مكتبة Hugging Face Optimum، وهي مجموعة من الأدوات المصممة لتحسين النماذج ونشرها. وباستخدام بضعة أسطر فقط من التعليمات البرمجية، يمكن للمطورين تطبيق تقنيات التكميم وتحويل النماذج إلى تنسيقات فعالة مثل ONNX (تبادل الشبكات العصبية المفتوح)، ما يتيح تشغيلها بسلاسة على أنواع مختلفة من الأجهزة، بما في ذلك الخوادم السحابية والأجهزة الطرفية.

الشكل 3. تحدث Pavel عن مكتبة Optimum وميزاتها.
أخيرًا، ذكر Pavel فوائد Torch Compile، وهي ميزة في PyTorch تحسّن طريقة معالجة نماذج الذكاء الاصطناعي للبيانات، ما يجعل تشغيلها أسرع وأكثر كفاءة. وتدمج Hugging Face ميزة Torch Compile ضمن مكتبتي Transformers وOptimum، ما يتيح للمطورين الاستفادة من تحسينات الأداء هذه مع إجراء تغييرات طفيفة على التعليمات البرمجية.
من خلال تحسين بنية الحسابات في النموذج، يمكن لـ Torch Compile تسريع أوقات الاستدلال وزيادة معدلات الإطارات من 29 إلى 150 إطارًا في الثانية دون المساس بالدقة أو الجودة.
نشر النماذج باستخدام أدوات Hugging Face#
انتقل Pavel بعد ذلك إلى التطرق بإيجاز إلى كيفية توسيع نماذج الذكاء الاصطناعي للرؤية ونشرها باستخدام أدوات Hugging Face، بعد اختيار النموذج المناسب والمنهج الأفضل للتطوير.
فعلى سبيل المثال، يمكن للمطورين نشر تطبيقات ذكاء اصطناعي تفاعلية باستخدام Gradio وStreamlit. يتيح Gradio للمطورين إنشاء واجهات قائمة على الويب لنماذج تعلّم الآلة، بينما يساعد Streamlit على بناء تطبيقات بيانات تفاعلية باستخدام نصوص Python بسيطة.
وأشار Pavel أيضًا إلى أنه «لا تحتاج إلى البدء بكتابة كل شيء من الصفر»، في إشارة إلى الأدلة ودفاتر التدريب والنصوص البرمجية النموذجية التي توفرها Hugging Face. وتساعد هذه الموارد المطورين على البدء بسرعة دون الحاجة إلى بناء كل شيء من الأساس.

الشكل 4. Pavel يناقش إمكانات Hugging Face في YV24.
فوائد Hugging Face Hub#
في ختام خطابه الرئيسي، لخّص Pavel مزايا استخدام Hugging Face Hub. وأكد أنه يبسّط إدارة النماذج والتعاون. كما لفت الانتباه إلى توفر الأدلة ودفاتر الملاحظات والبرامج التعليمية، التي يمكن أن تساعد المبتدئين والخبراء على فهم نماذج الذكاء الاصطناعي وتطبيقها.
وأوضح قائلًا: "هناك الكثير من المساحات الرائعة الموجودة بالفعل على Hub. يمكنك العثور على مساحات مشابهة، واستنساخ التعليمات البرمجية المشتركة، وتعديل بضعة أسطر، واستبدال النموذج بنموذجك الخاص، ثم دفعه مرة أخرى." وشجّع المطورين على الاستفادة من مرونة المنصة.
أهم النقاط المستخلصة#
خلال خطابه في YV24، شارك Pavel كيف توفر Hugging Face أدوات تدعم تدريب نماذج الذكاء الاصطناعي وتحسينها ونشرها. فعلى سبيل المثال، يمكن لابتكارات مثل Transformers وOptimum وTorch Compile مساعدة المطورين على تعزيز أداء النماذج.
مع ازدياد كفاءة نماذج الذكاء الاصطناعي، تسهّل التطورات في التكميم والنشر الطرفي تشغيلها على الأجهزة محدودة الموارد. وتُعد هذه التحسينات، إلى جانب أدوات مثل Hugging Face ونماذج الرؤية الحاسوبية المتقدمة مثل Ultralytics YOLO11، أساسية لبناء تطبيقات ذكاء اصطناعي للرؤية قابلة للتوسع وعالية الأداء.
انضم إلى مجتمعنا المتنامي! استكشف مستودع GitHub لدينا للتعرّف على الذكاء الاصطناعي، واطّلع على تراخيص YOLO لبدء مشاريع الذكاء الاصطناعي للرؤية الخاصة بك. هل تهتم بابتكارات مثل الرؤية الحاسوبية في الرعاية الصحية أو الرؤية الحاسوبية في الزراعة؟ تفضل بزيارة صفحات حلولنا لاكتشاف المزيد!









