أبرز نقاط Ultralytics من YOLO Vision 2025 Shenzhen!
استعد اللحظات الرئيسية من YOLO Vision 2025 Shenzhen، حيث جمعت Ultralytics المبتكرين والشركاء ومجتمع الذكاء الاصطناعي لقضاء يوم من الإلهام.

في 26 أكتوبر، ظهرت فعالية YOLO Vision 2025 (YV25) لأول مرة في الصين في المبنى B10 في منتزه OCT الثقافي الإبداعي في شنزن. جمع حدث الذكاء الاصطناعي للرؤية الهجينة من Ultralytics أكثر من 200 حاضر شخصياً، مع انضمام عدد أكبر بكثير عبر الإنترنت عبر YouTube و Bilibili.
تجاوز بث YV25 Shenzhen livestream بالفعل 3,500 مشاهدة على YouTube، ويستمر في اكتساب الاهتمام حيث تتم مشاركة أبرز الأحداث عبر المجتمع. لقد كان يوماً مليئاً بالأفكار والمحادثات والاستكشاف العملي للمكان الذي تتجه إليه رؤية الذكاء الاصطناعي بعد ذلك.
بدأ اليوم بترحيب حار من مضيفتنا، هوانغ شيوينغ، التي دعت الجميع للتواصل والتعلم والمشاركة في المناقشات طوال الحدث. وأوضحت أن هذا هو ثاني حدث لـ YOLO Vision هذا العام، بعد نسخة لندن في سبتمبر، وشاركت مدى حماسها لجمع مجتمع الذكاء الاصطناعي البصري معًا مرة أخرى هنا في شينزين.
في هذه المقالة، سنستعرض أبرز لحظات اليوم، بما في ذلك تحديثات النماذج، وجلسات المتحدثين، والعروض التوضيحية المباشرة، ولحظات المجتمع التي جمعت الجميع معًا. لنبدأ!
رحلة نماذج Ultralytics YOLO حتى الآن#
قاد الكلمة الرئيسية الأولى لهذا اليوم مؤسس ورئيس التنفيذي لشركة Ultralytics Glenn Jocher، الذي شارك كيف نمت Ultralytics YOLO models من إنجاز بحثي إلى بعض نماذج رؤية الذكاء الاصطناعي الأكثر استخداماً على نطاق واسع في العالم. أوضح Glenn أن عمله المبكر كان يركز على جعل استخدام YOLO أكثر سهولة.
قام بنقل النماذج إلى PyTorch، وتحسين التوثيق، ومشاركة كل شيء بشكل مفتوح حتى يتمكن المطورون في كل مكان من البناء فوقها. وكما استذكر، "لقد انغمست في العمل برأسي في عام 2018. وقررت أن هذا هو مستقبلي". ما بدأ كمجهود شخصي سرعان ما أصبح حركة عالمية مفتوحة المصدر.

الشكل 1. غلين جوشر يتحدث على المسرح في حدث YOLO Vision 2025 في شينزين.
اليوم، تدعم نماذج Ultralytics YOLO مليارات الاستدلالات كل يوم، وأكد غلين أن هذا النطاق لم يكن ممكنًا إلا بفضل الأشخاص الذين ساعدوا في بنائه. لقد شكل الباحثون والمهندسون والطلاب والهواة والمساهمون في المصادر المفتوحة من جميع أنحاء العالم YOLO لتصبح ما هي عليه اليوم.
وكما عبر غلين، "هناك ما يقرب من ألف منهم [المساهمين] في الخارج ونحن ممتنون جدًا لذلك. لم نكن لنصل إلى ما نحن عليه اليوم بدون هؤلاء الأشخاص."
تحديثات حول Ultralytics YOLO26#
تمت مشاركة النظرة الأولى على Ultralytics YOLO26 في وقت سابق من هذا العام في فعالية YOLO Vision 2025 London، حيث تم تقديمها كخطوة رئيسية قادمة للأمام في عائلة نماذج Ultralytics YOLO. في YV25 Shenzhen، قدم Glenn تحديثاً حول التقدم المحرز منذ هذا الإعلان ومنح مجتمع الذكاء الاصطناعي نظرة فاحصة على كيفية تطور النموذج.
تم تصميم Ultralytics YOLO26 ليكون أصغر حجماً وأسرع وأكثر دقة، مع الحفاظ على عمليته للاستخدام في العالم الحقيقي. أوضح غلين أن الفريق قضى العام الماضي في تحسين البنية، وإجراء مقارنات مرجعية للأداء عبر الأجهزة، ودمج الرؤى المستمدة من الأبحاث وتجارب المجتمع. الهدف هو تقديم أداء رائد دون جعل النشر أكثر صعوبة.
ما يمكن توقعه من Ultralytics YOLO26#
أحد التحديثات الأساسية التي أبرزها غلين هو أن Ultralytics YOLO26 يقترن بحملة مخصصة لضبط المعلمات الفائقة، متخلفاً عن التدريب بالكامل من الصفر إلى الضبط الدقيق على مجموعات بيانات أكبر. وأوضح أن هذا النهج يتماشى بشكل أكبر بكثير مع حالات الاستخدام الفعلية في العالم الحقيقي.
إليك بعض التحسينات الرئيسية الأخرى التي تمت مشاركتها في الحدث:
- بنية مبسطة: تمت إزالة طبقة Distribution Focal Loss (DFL). وهذا يجعل النماذج أبسط وأسرع في التشغيل، مع الحفاظ على نفس مستوى الدقة.
- دعم الاستدلال من البداية إلى النهاية: يدعم Ultralytics YOLO26 الاستدلال الأصلي من البداية إلى النهاية، مما يعني أنه يمكن تشغيله بدون طبقة NMS منفصلة. هذا يجعل التصدير إلى تنسيقات مثل ONNX و TensorRT والنشر على أجهزة الحافة أسهل بكثير.
- أداء أفضل للأجسام الصغيرة: تساعد استراتيجيات الفقد المحدثة النموذج على اكتشاف الأجسام الصغيرة بشكل أكثر موثوقية، وهو ما كان يمثل تحديًا طويل الأمد في الرؤية الحاسوبية.
- محسن هجين جديد: يتضمن YOLO26 محسنًا جديدًا مستوحى من أبحاث تدريب نماذج اللغات الكبيرة الحديثة، والذي يحسن دقة النموذج وهو الآن مدمج مباشرة في حزمة Ultralytics Python.
Ultralytics YOLO26 هو الخطوة التالية في الذكاء الاصطناعي البصري العملي#
مجتمعة، تؤدي هذه التحديثات إلى نماذج أسرع بنسبة تصل إلى 43% على CPU مع كونها أكثر دقة من Ultralytics YOLO11، مما يجعل YOLO26 مؤثرًا بشكل خاص للأجهزة المدمجة، والروبوتات، والأنظمة الطرفية.
سيدعم Ultralytics YOLO26 جميع المهام وأجامذج النماذج المتوفرة حالياً في YOLO11، مما ينتج عنه 25 متغيراً للنموذج عبر العائلة. ويشمل ذلك نماذج للاكتشاف، والتجزئة، وتقدير الوضعية، والصناديق المحيطية الموجهة، والتصنيف، والتي تتراوح من الحجم الصغير جداً (nano) إلى الحجم الكبير جداً (extra large).
يعمل الفريق أيضًا على خمسة متغيرات قابلة للمطالبة (promptable). هذه نماذج يمكنها تلقي مطالبة نصية وإرجاع صناديق التحديد مباشرة، دون الحاجة إلى تدريب.
هذه خطوة مبكرة نحو سير عمل رؤية أكثر مرونة وقائمة على التعليمات والتي تعد أسهل في التكيف مع حالات الاستخدام المختلفة. لا تزال نماذج Ultralytics YOLO26 قيد التطوير النشط، لكن نتائج الأداء المبكرة قوية، ويعمل الفريق على إصدارها قريباً.
نظرة على منصة Ultralytics#
بعد تحديث YOLO26، رحب Glenn بـ Prateek Bhatnagar، رئيس هندسة المنتجات لدينا، لتقديم عرض مباشر لمنصة Ultralytics. يتم بناء هذه المنصة لجمع الأجزاء الرئيسية من تدفق عمل رؤية الكمبيوتر معاً، بما في ذلك استكشاف مجموعات البيانات، وتسمية الصور، وتدريب النماذج، ومقارنة النتائج.

الشكل 2. Prateek Bhatnagar يعرض منصة Ultralytics.
أشار Prateek إلى أن المنصة تظل وفية لجذور المصدر المفتوح لشركة Ultralytics، حيث تقدم مساحتين للمجتمع، مجتمع لمجموعات البيانات ومجتمع للمشاريع، حيث يمكن للمطورين المساهمة وإعادة الاستخدام وتحسين عمل بعضهم البعض. خلال العرض التوضيحي، عرض عملية annotation المدعومة بالذكاء الاصطناعي، والتدريب السحابي السهل، والقدرة على ضبط النماذج بدقة مباشرة من المجتمع، دون الحاجة إلى موارد GPU محلية.
المنصة حاليًا قيد التطوير. شجع براتيك الجمهور على ترقب الإعلانات وأشار إلى أن الفريق يتوسع في الصين لدعم الإطلاق.
الأصوات خلف YOLO: حلقة نقاش المؤلفين#
مع تزايد الزخم، انتقل الحدث إلى مناقشة لوحية تضم العديد من الباحثين وراء نماذج YOLO المختلفة. ضمت اللجنة Glenn Jocher، إلى جانب Jing Qiu، مهندس تعلم ماشین أول لدينا؛ و Chen Hui، مهندس تعلم ماشین في Meta وأحد مؤلفي YOLOv10؛ و Bo Zhang، استراتيجي خوارزميات في Meituan وأحد مؤلفي YOLOv6.

الشكل 3. حلقة نقاش حول تطوير نماذج YOLO تضم هوانغ شيوينغ، تشن هوي، بو تشانغ، جينغ تشيو، وغلين جوشر.
ركزت المناقشة على كيفية استمرار YOLO في التطور من خلال الاستخدام في العالم الحقيقي. وتطرق المتحدثون إلى كيفية دفع التقدم غالبًا من خلال تحديات النشر العملي، مثل التشغيل بكفاءة على أجهزة الحافة، وتحسين اكتشاف الأجسام الصغيرة، وتبسيط تصدير النماذج.
بدلاً من السعي وراء الدقة فقط، أشارت اللجنة إلى أهمية موازنة السرعة وسهولة الاستخدام والموثوقية في بيئات الإنتاج. ومن الوجبات السريعة المشتركة الأخرى قيمة التكرار وتعليقات المجتمع.
إليك بعض الأفكار المثيرة الأخرى من المحادثة:
- الاكتشاف ذو المفردات المفتوحة يكتسب زخمًا في نظام YOLO البيئي: تظهر النماذج الأحدث كيف يمكن للمحاذاة بين الرؤية واللغة وسير العمل القائم على المطالبات اكتشاف أجسام خارج الفئات الثابتة.
- الاهتمام خفيف الوزن في تصاعد: ناقشت اللجنة كيف يمكن أن يؤدي استخدام attention mechanisms الفعالة، بدلاً من الانتباه الكامل في كل مكان، إلى تعزيز الدقة مع الحفاظ على خفة الاستدلال لتناسب الأجهزة الطرفية.
- كرر مبكرًا وبشكل متكرر مع المجتمع: عزز أعضاء اللجنة عقلية البناء-الاختبار-التحسين، حيث أن إصدار النماذج في وقت أقرب والتعلم من المستخدمين يؤدي إلى نتائج أقوى من دورات التطوير الخاصة الطويلة.
قادة الفكر الذين يحددون مستقبل الذكاء الاصطناعي والرؤية#
بعد ذلك، دعونا نلقي نظرة فاحصة على بعض الكلمات الرئيسية في YV25 شينزين، حيث شارك قادة عبر مجتمع الذكاء الاصطناعي كيف يتطور الذكاء الاصطناعي البصري، من البشر الرقميين والروبوتات إلى التفكير متعدد الوسائط ونشر الحافة الفعال.
تعليم الذكاء الاصطناعي فهم التجربة البشرية#
في جلسة ثاقبة، شارك الدكتور بينغ تشانغ من مختبر Alibaba Qwen كيف يقوم فريقه بتطوير نماذج فيديو كبيرة يمكنها توليد بشر رقميين معبرين بحركة وتحكم أكثر طبيعية. استعرض Wan S2V وWan Animate، اللذان يستخدمان مراجع صوتية أو حركية لإنتاج خطاب وإيماءات ورسوم متحركة واقعية، مما يعالج قيود التوليد القائم على النص فقط.

الشكل 4. بينغ تشانغ يشرح كيف يمكن لنماذج الفيديو الكبيرة تشغيل البشر الرقميين.
تحدث الدكتور Zhang أيضاً عن التقدم المحرز نحو الصور الرمزية التفاعلية في الوقت الفعلي، بما في ذلك استنساخ zero-shot للمظهر والحركة والنماذج خفيفة الوزن التي يمكنها تحريك الوجه مباشرة من تغذية الكاميرا الحية، مما تقرب البشر الرقميين الشبيهين بالحياة من التشغيل بسلاسة على الأجهزة اليومية.
من الإدراك إلى العمل: عصر الذكاء المتجسد#
كان أحد الموضوعات الرئيسية في YV25 شينزين هو التحول من نماذج الرؤية التي ترى العالم ببساطة إلى الأنظمة التي يمكنها العمل داخله. بمعنى آخر، لم يعد الإدراك نهاية خط الأنابيب؛ بل أصبح بداية العمل.
على سبيل المثال، في كلمته الرئيسية، وصف Hu Chunxu من D-Robotics كيف تدمج مجموعات التطوير وحلول SoC (النظام على شريحة) الخاصة بهم الاستشعار، والتحكم في الحركة في الوقت الفعلي، واتخاذ القرار على مكدس برامج وأجهزة موحد. من خلال التعامل مع الإدراك والفعل كحلقة تغذية مرتدة مستمرة، بدلاً من مراحل منفصلة، يدعم نهجهم robots التي يمكنها التحرك والتكيف والتفاعل بشكل أكثر موثوقية في البيئات الحقيقية.

الشكل 5. عرض D-Robotics في YOLO Vision 2025 في شينزين، الصين.
ردد Alex Zhang من Baidu Paddle هذه الفكرة في محادثته، موضحاً كيف يعمل YOLO و PaddleOCR معاً لاكتشاف الكائنات ومن ثم تفسير النص والبنية المحيطة بها. يتيح ذلك للأنظمة تحويل الصور والمستندات إلى معلومات منظمة قابلة للاستخدام لمهام مثل الخدمات اللوجستية، عمليات التفتيش، والمعالجة الآلية.
الذكاء عند الحافة: ذكاء اصطناعي فعال لكل جهاز#
موضوع مثير للاهتمام آخر في YV25 Shenzhen كان كيف أصبح الذكاء الاصطناعي للرؤية أكثر كفاءة وقدرة على edge devices.
تحدث بول جونغ من DEEPX عن نشر نماذج YOLO مباشرة على الأجهزة المضمنة، مما يقلل الاعتماد على السحابة. من خلال التركيز على استهلاك الطاقة المنخفض، والاستدلال الأمثل، وضبط النموذج الواعي بالأجهزة، تُمكّن DEEPX الإدراك في الوقت الفعلي للطائرات بدون طيار والروبوتات المتنقلة والأنظمة الصناعية العاملة في بيئات ديناميكية.
وبالمثل، شارك ليو لينغفي من Moore Threads كيف تدمج منصة Moore Threads E300 وحدة المعالجة المركزية (CPU)، ووحدة معالجة الرسومات (GPU)، ووحدة المعالجة العصبية (NPU) لتقديم استدلال بصري عالي السرعة على الأجهزة المدمجة.
يمكن للمنصة تشغيل تدفقات YOLO متعددة بمعدلات إطارات عالية، وتبسط سلسلة أدواتها خطوات مثل التكميم، والتجميع الساكن، وضبط الأداء. كما قامت Moore Threads بفتح مصدر مجموعة واسعة من نماذج الرؤية الحاسوبية وأمثلة النشر لخفض العوائق أمام المطورين.
دمج الرؤية واللغة لأنظمة ذكاء اصطناعي أكثر ذكاءً#
حتى وقت قريب، كان بناء نموذج واحد يمكنه فهم الصور وتفسير اللغة يتطلب بنيات transformer كبيرة كانت باكدة التكلفة في التشغيل. في YV25 Shenzhen، أعطى Yue Ziyin من Yuanshi Intelligence نظرة عامة على RWKV، وهي بنية تمزج بين قدرات الاستدلال بالسياق الطويل لنماذج التحويل وكفاءة النماذج المتكررة.
شرح كيف يطبق Vision-RWKV هذا التصميم على الرؤية الحاسوبية من خلال معالجة الصور بطريقة تتوسع خطيًا مع الدقة. وهذا يجعله مناسبًا للمدخلات عالية الدقة ولأجهزة الحافة حيث تكون الحوسبة محدودة.
أوضح يوي أيضًا كيف يتم استخدام RWKV في أنظمة الرؤية واللغة، حيث يتم إقران ميزات الصورة بفهم النص للانتقال إلى ما وراء اكتشاف الأجسام إلى تفسير المشاهد والمستندات وسياق العالم الحقيقي.

الشكل 6. يوي زيين يتحدث عن تطبيقات RWKV.
أجنحة وعروض توضيحية حية أعادت الذكاء الاصطناعي البصري إلى الحياة#
بينما كانت المحادثات على المسرح تتطلع إلى أين يتجه الذكاء الاصطناعي البصري، أظهرت الأجنحة على الأرض كيف يتم استخدامه بالفعل اليوم. تمكن الحاضرون من رؤية النماذج تعمل مباشرة، ومقارنة خيارات الأجهزة، والتحدث مباشرة مع الفرق التي تبني هذه الأنظمة.
إليك لمحة عن التقنيات التي تم عرضها:
- منصات المطورين والنماذج الأولية: عرضت Seeed وM5Stack وInfermove لوحات تطوير مدمجة ومجموعات بداية تجعل من السهل تجربة التطبيقات القائمة على YOLO والانتقال بسرعة من الأفكار إلى عروض توضيحية عاملة.
- أجهزة الحافة عالية الأداء: عرضت Hailo وDEEPX وIntel وMoore Threads رقائق ووحدات مصممة للاستدلال السريع والفعال.
- سير عمل الرؤية واللغة: سلطت Baidu Paddle وRWKV الضوء على مجموعات برمجية يمكنها اكتشاف الأجسام، وأيضًا قراءة وتفسير والاستدلال حول ما يظهر في صورة أو مستند.
- أدوات Open-source والمجتمع: تفاعلت Ultralytics و Datawhale مع المطورين من خلال عروض النماذج الحية، ونصائح التدريب، والتوجيه العملي، مما عزز كيف تسرع المعرفة المشتركة من الابتكار.

الشكل 7. نظرة على جناح M5Stack في YV25 شينزين.
التواصل مع مجتمع الذكاء الاصطناعي البصري#
بالإضافة إلى كل التقنيات المثيرة، كان أحد أفضل أجزاء YV25 شينزين هو جمع مجتمع الرؤية الحاسوبية وفريق Ultralytics معًا شخصيًا مرة أخرى. طوال اليوم، تجمع الناس حول العروض التوضيحية، وتبادلوا الأفكار أثناء استراحات القهوة، واستمرت المحادثات لفترة طويلة بعد انتهاء المحادثات.
قام الباحثون، والمهندسون، والطلاب، والمطورون بمقارنة الملاحظات، وطرح الأسئلة، وتبادل تجارب العالم الحقيقي من النشر إلى تدريب النموذج. وبفضل Cinco Jotas من Grupo Osborne، جلبنا حتى لمسة من الثقافة الإسبانية إلى الحدث مع لحم الخنزير المقدد الطازج، مما خلق لحظة دافئة من التواصل. مكان جميل، وحجم جماهيري حماسي، وروح مشتركة من الزخم جعلت هذا اليوم مميزاً حقاً.
أبرز النقاط#
من الكلمات الرئيسية الملهمة إلى العروض التوضيحية العملية، جسد YOLO Vision 2025 شينزين روح الابتكار التي تحدد مجتمع Ultralytics. طوال اليوم، تبادل المتحدثون والحاضرون الأفكار، واستكشفوا تقنيات جديدة، وتواصلوا حول رؤية مشتركة لمستقبل الذكاء الاصطناعي. معًا، غادروا مفعمين بالطاقة ومستعدين لما هو تالٍ مع Ultralytics YOLO.
أعد تصور ما هو ممكن مع الذكاء الاصطناعي ورؤية الكمبيوتر. انضم إلى community و GitHub repository لاكتشاف المزيد. تعرف على المزيد حول التطبيقات مثل computer vision in agriculture و AI in retail. استكشف our licensing خيارات وابدأ في استخدام رؤية الكمبيوتر اليوم!






