أبرز ما قدمته Ultralytics في YOLO Vision 2025 Shenzhen!
استعد أبرز اللحظات من YOLO Vision 2025 Shenzhen، حيث جمعت Ultralytics المبتكرين والشركاء ومجتمع الذكاء الاصطناعي في يوم حافل بالإلهام.

في 26 أكتوبر، ظهر YOLO Vision 2025 (YV25) لأول مرة في الصين في المبنى B10 بحديقة OCT للثقافة الإبداعية في Shenzhen. جمع حدث Ultralytics الهجين للذكاء الاصطناعي البصري أكثر من 200 حاضرًا شخصيًا، وانضم عدد أكبر بكثير عبر الإنترنت من خلال YouTube وBilibili.
تجاوز البث المباشر لـ YV25 Shenzhen بالفعل 3,500 مشاهدة على YouTube، ولا يزال يحظى باهتمام متزايد مع مشاركة أبرز محطات الحدث عبر المجتمع. كان يومًا حافلًا بالأفكار والنقاش والاستكشاف العملي للاتجاه الذي يتجه إليه الذكاء الاصطناعي البصري.
بدأ اليوم بترحيب حار من مضيفتنا Huang Xueying، التي دعت الجميع إلى التواصل والتعلم والمشاركة في النقاشات طوال الحدث. وأوضحت أن هذا كان ثاني حدث YOLO Vision لهذا العام، بعد نسخة London في سبتمبر، وشاركت مدى حماسها لجمع مجتمع الذكاء الاصطناعي البصري مجددًا هنا في Shenzhen.
في هذا المقال، سنستعرض أبرز محطات اليوم، بما في ذلك تحديثات النماذج، وجلسات المتحدثين، والعروض التوضيحية المباشرة، واللحظات المجتمعية التي جمعت الجميع معًا. لنبدأ!
مسيرة نماذج Ultralytics YOLO حتى الآن#
ألقى الكلمة الرئيسية الأولى في اليوم مؤسس Ultralytics والرئيس التنفيذي Glenn Jocher، الذي شارك كيف نمت نماذج Ultralytics YOLO من إنجاز بحثي إلى بعض نماذج الذكاء الاصطناعي البصري الأكثر استخدامًا على نطاق واسع في العالم. أوضح Glenn أن عمله المبكر ركز على جعل YOLO أسهل استخدامًا.
نقل النماذج إلى PyTorch، وحسّن الوثائق، وشارك كل شيء بشفافية حتى يتمكن المطورون في كل مكان من البناء عليه. وكما تذكر، قال: «انخرطت بكل قوتي في عام 2018. وقررت أن هذا هو مستقبلي». وما بدأ كجهد شخصي أصبح سريعًا حركة عالمية مفتوحة المصدر.

الشكل 1. Glenn Jocher يتحدث على المنصة في YOLO Vision 2025 Shenzhen.
اليوم، تشغّل نماذج Ultralytics YOLO مليارات عمليات الاستدلال يوميًا، وشدد Glenn على أن هذا النطاق لم يكن ممكنًا إلا بفضل الأشخاص الذين ساهموا في بنائها. فقد أسهم باحثون ومهندسون وطلاب وهواة ومساهمون في المصادر المفتوحة من جميع أنحاء العالم في تشكيل YOLO على ما هو عليه اليوم.
وكما قال Glenn: «هناك ما يقارب ألف منهم [مساهم] هناك، ونحن ممتنون جدًا لذلك. لم نكن لنصل إلى ما نحن عليه اليوم من دون هؤلاء الأشخاص».
تحديثات حول Ultralytics YOLO26#
كُشف عن النظرة الأولى إلى Ultralytics YOLO26 في وقت سابق من هذا العام خلال فعالية YOLO Vision 2025 London، حيث قُدّم بوصفه الخطوة الرئيسية التالية إلى الأمام في عائلة نماذج Ultralytics YOLO. وفي YV25 Shenzhen، قدّم Glenn تحديثًا حول التقدم المحرز منذ ذلك الإعلان، وأتاح لمجتمع الذكاء الاصطناعي نظرة أعمق على كيفية تطور النموذج.
صُمم Ultralytics YOLO26 ليكون أصغر وأسرع وأكثر دقة، مع الحفاظ على عمليته للاستخدام في العالم الحقيقي. وأوضح Glenn أن الفريق أمضى العام الماضي في تحسين البنية، وقياس الأداء عبر الأجهزة، ودمج الرؤى المستخلصة من الأبحاث وملاحظات المجتمع. والهدف هو تقديم أداء متطور دون جعل نشر النماذج أكثر صعوبة.
ما المتوقع من Ultralytics YOLO26#
من التحديثات الأساسية التي أبرزها Glenn أن Ultralytics YOLO26 مقترن بحملة مخصصة لضبط المعلمات الفائقة، إذ ينتقل من التدريب من الصفر بالكامل إلى الضبط الدقيق على مجموعات بيانات أكبر. وأوضح أن هذا النهج يتوافق بدرجة أكبر بكثير مع حالات الاستخدام الفعلية في العالم الحقيقي.
فيما يلي بعض التحسينات الرئيسية الأخرى التي كُشف عنها في الحدث:
- بنية مبسطة: أُزيلت طبقة فقدان البؤرة التوزيعي (DFL). وهذا يجعل النماذج أبسط وأسرع في التشغيل، مع الحفاظ على المستوى نفسه من الدقة.
- دعم الاستدلال الشامل من البداية إلى النهاية: يعمل Ultralytics YOLO26 أصلاً من البداية إلى النهاية، ما يعني أنه يمكن تشغيله من دون طبقة NMS منفصلة. وهذا يجعل تصديره إلى تنسيقات مثل ONNX وTensorRT ونشره على الأجهزة الطرفية أسهل بكثير.
- أداء أفضل مع الأجسام الصغيرة: تساعد استراتيجيات الفقد المحدّثة النموذج على اكتشاف الأجسام بالغة الصغر بدرجة أكبر من الموثوقية، وهو ما شكّل تحديًا مستمرًا في الرؤية الحاسوبية.
- مُحسِّن هجين جديد: يتضمن YOLO26 مُحسِّنًا جديدًا مستوحى من الأبحاث الحديثة حول تدريب نماذج اللغة الكبيرة، ما يحسّن دقة النموذج، وقد أُدرج الآن مباشرةً في حزمة Ultralytics Python.
Ultralytics YOLO26 هو الخطوة التالية نحو ذكاء اصطناعي بصري عملي#
تؤدي هذه التحديثات مجتمعةً إلى نماذج أسرع بنسبة تصل إلى 43% على CPU، وأكثر دقة أيضًا من Ultralytics YOLO11، ما يجعل YOLO26 مؤثرًا بصفة خاصة في الأجهزة المضمنة والروبوتات والأنظمة الطرفية.
سيدعم Ultralytics YOLO26 جميع المهام وأحجام النماذج نفسها المتاحة حاليًا في YOLO11، ما ينتج عنه 25 إصدارًا من النماذج ضمن العائلة. ويشمل ذلك نماذج للكشف والتقسيم وتقدير الوضعيات والمربعات المحيطة الموجّهة والتصنيف، بدءًا من الحجم فائق الصغر وصولًا إلى الحجم الكبير جدًا.
يعمل الفريق أيضًا على خمسة إصدارات قابلة للتوجيه بالمطالبات. وهذه نماذج يمكنها تلقي مطالبة نصية وإرجاع المربعات المحيطة مباشرةً، من دون الحاجة إلى تدريب.
تمثل هذه خطوة مبكرة نحو مسارات عمل بصرية أكثر مرونة قائمة على التعليمات، وأسهل في تكييفها مع حالات الاستخدام المختلفة. ولا تزال نماذج Ultralytics YOLO26 قيد التطوير النشط، لكن نتائج الأداء المبكرة قوية، ويعمل الفريق على إطلاقها قريبًا.
نظرة على منصة Ultralytics#
بعد تحديث YOLO26، رحّب Glenn بـ Prateek Bhatnagar، رئيس هندسة المنتجات لدينا، لتقديم عرض توضيحي مباشر لمنصة Ultralytics. ويجري بناء هذه المنصة لجمع الأجزاء الأساسية من سير عمل الرؤية الحاسوبية، بما في ذلك استكشاف مجموعات البيانات، ووضع تعليقات توضيحية على الصور، وتدريب النماذج، ومقارنة النتائج.

الشكل 2. Prateek Bhatnagar يستعرض منصة Ultralytics.
أشار Prateek إلى أن المنصة تحافظ على جذور Ultralytics المفتوحة المصدر، من خلال تقديم مساحتين للمجتمع: مجتمعًا لمجموعات البيانات ومجتمعًا للمشاريع، حيث يمكن للمطورين المساهمة في أعمال بعضهم وإعادة استخدامها وتحسينها. وخلال العرض التوضيحي، استعرض إضافة التعليقات التوضيحية بمساعدة الذكاء الاصطناعي، والتدريب السحابي السهل، وإمكانية ضبط النماذج بدقة مباشرةً من المجتمع، من دون الحاجة إلى موارد GPU محلية.
المنصة قيد التطوير حاليًا. وشجّع Prateek الجمهور على متابعة الإعلانات، وأشار إلى أن الفريق يتوسع في الصين لدعم الإطلاق.
الأصوات التي تقف وراء YOLO: حلقة المؤلفين النقاشية#
مع تزايد الزخم، انتقل الحدث إلى حلقة نقاش ضمت عددًا من الباحثين الذين يقفون وراء نماذج YOLO المختلفة. وشملت الحلقة Glenn Jocher، إلى جانب Jing Qiu، مهندسة تعلم الآلة الأولى لدينا؛ وChen Hui، مهندس تعلم الآلة في Meta وأحد مؤلفي YOLOv10؛ وBo Zhang، استراتيجي الخوارزميات في Meituan وأحد مؤلفي YOLOv6.

الشكل 3. حلقة نقاش حول تطوير نماذج YOLO، بمشاركة Huang Xueying وChen Hui وBo Zhang وJing Qiu وGlenn Jocher.
ركز النقاش على كيفية استمرار YOLO في التطور من خلال الاستخدام الفعلي. وتطرق المتحدثون إلى أن التقدم غالبًا ما تدفعه تحديات النشر العملية، مثل التشغيل بكفاءة على الأجهزة الطرفية، وتحسين اكتشاف الأجسام الصغيرة، وتبسيط تصدير النماذج.
بدلًا من السعي وراء الدقة وحدها، أشارت الحلقة إلى أهمية تحقيق التوازن بين السرعة وسهولة الاستخدام والموثوقية في بيئات الإنتاج. ومن النقاط الأخرى التي جرى التأكيد عليها قيمة التكرار وملاحظات المجتمع.
فيما يلي بعض الرؤى الأخرى المثيرة للاهتمام من الحوار:
- يكتسب الكشف ذي المفردات المفتوحة زخمًا في منظومة YOLO: تُظهر النماذج الأحدث كيف يمكن لمواءمة الرؤية واللغة ومسارات العمل القائمة على المطالبات اكتشاف أجسام تتجاوز الفئات الثابتة.
- يشهد الانتباه خفيف الوزن انتشارًا متزايدًا: ناقشت الحلقة كيف يمكن لاستخدام آليات انتباه فعّالة، بدلًا من استخدام الانتباه الكامل في كل المواضع، أن يعزز الدقة مع إبقاء الاستدلال خفيفًا بما يكفي للأجهزة الطرفية.
- كرّر مبكرًا وباستمرار مع المجتمع: أكد المشاركون عقلية البناء–الاختبار–التحسين، حيث يؤدي إطلاق النماذج في وقت أقرب والتعلم من المستخدمين إلى نتائج أقوى من دورات التطوير الخاصة الطويلة.
رواد الفكر الذين يرسمون مستقبل الذكاء الاصطناعي والرؤية#
والآن، لنلقِ نظرةً أقرب على بعض الكلمات الرئيسية في YV25 Shenzhen، حيث شارك قادة من مختلف أرجاء مجتمع الذكاء الاصطناعي كيفية تطور الذكاء الاصطناعي البصري، بدءًا من البشر الرقميين والروبوتات ووصولًا إلى الاستدلال متعدد الوسائط والنشر الفعّال على الأجهزة الطرفية.
تعليم الذكاء الاصطناعي فهم التجربة الإنسانية#
في جلسة ثرية بالأفكار، شارك الدكتور Peng Zhang من مختبر Alibaba Qwen كيفية تطوير فريقه نماذج فيديو كبيرة يمكنها توليد بشر رقميين معبّرين بحركة وتحكم أكثر طبيعية. واستعرض Wan S2V وWan Animate، اللذين يستخدمان مراجع صوتية أو حركية لإنتاج كلام وإيماءات ورسوم متحركة واقعية، ومعالجة قيود التوليد المعتمد على النصوص فقط.

الشكل 4. Peng Zhang يشرح كيف يمكن لنماذج الفيديو الكبيرة تشغيل البشر الرقميين.
تحدث الدكتور Zhang أيضًا عن التقدم المحرز نحو الصور الرمزية التفاعلية الآنية، بما في ذلك استنساخ المظهر والحركة دون تدريب مسبق، والنماذج خفيفة الوزن التي يمكنها تحريك الوجه مباشرةً من بث كاميرا حي، ما يقرّب البشر الرقميين الشبيهين بالواقع من العمل بسلاسة على الأجهزة اليومية.
من الإدراك إلى الفعل: عصر الذكاء المتجسّد#
كان أحد الموضوعات الرئيسية في YV25 Shenzhen هو الانتقال من نماذج الرؤية التي تكتفي برؤية العالم إلى أنظمة يمكنها التصرف داخله. وبعبارة أخرى، لم يعد الإدراك نهاية المسار؛ بل أصبح بداية الفعل.
فعلى سبيل المثال، وصف Hu Chunxu من D-Robotics في كلمته الرئيسية كيف تدمج مجموعات التطوير وحلول SoC (نظام على شريحة) الخاصة بهم الاستشعار والتحكم في الحركة في الوقت الفعلي واتخاذ القرار ضمن حزمة موحّدة من العتاد والبرمجيات. ومن خلال التعامل مع الإدراك والفعل باعتبارهما حلقة تغذية راجعة مستمرة، بدلًا من مرحلتين منفصلتين، يدعم نهجهم روبوتات يمكنها التحرك والتكيف والتفاعل بموثوقية أكبر في البيئات الحقيقية.

الشكل 5. عرض D-Robotics التوضيحي في YOLO Vision 2025 في Shenzhen بالصين.
ردد Alex Zhang من Baidu Paddle هذه الفكرة في حديثه، موضحًا كيف يعمل YOLO وPaddleOCR معًا لاكتشاف الأجسام ثم تفسير النص والبنية المحيطة بها. ويتيح ذلك للأنظمة تحويل الصور والمستندات إلى معلومات قابلة للاستخدام ومنظمة لمهام مثل الخدمات اللوجستية وعمليات التفتيش والمعالجة الآلية.
الذكاء على الحافة: ذكاء اصطناعي فعّال لكل جهاز#
كان من الموضوعات الأخرى المثيرة للاهتمام في YV25 Shenzhen كيفية ازدياد كفاءة الذكاء الاصطناعي البصري وقدرته على الأجهزة الطرفية.
تحدث Paul Jung من DEEPX عن نشر نماذج YOLO مباشرةً على العتاد المضمن، مما يقلل الاعتماد على السحابة. ومن خلال التركيز على انخفاض استهلاك الطاقة، والاستدلال المحسّن، وضبط النماذج المراعي للعتاد، تتيح DEEPX الإدراك في الوقت الفعلي للطائرات المسيّرة والروبوتات المتنقلة والأنظمة الصناعية العاملة في بيئات ديناميكية.
وبالمثل، شارك Liu Lingfei من Moore Threads كيف تدمج منصة Moore Threads E300 الحوسبة باستخدام وحدة المعالجة المركزية (CPU) ووحدة معالجة الرسومات (GPU) ووحدة المعالجة العصبية (NPU) لتقديم استدلال بصري عالي السرعة على أجهزة مدمجة.
يمكن للمنصة تشغيل تدفقات YOLO متعددة بمعدلات إطارات عالية، كما تعمل سلسلة أدواتها على تبسيط خطوات مثل التكميم والترجمة البرمجية الساكنة وضبط الأداء. وقد أطلقت Moore Threads أيضًا مجموعة واسعة من نماذج الرؤية الحاسوبية وأمثلة النشر كمصادر مفتوحة لخفض العوائق أمام المطورين.
دمج الرؤية واللغة لأنظمة ذكاء اصطناعي أكثر ذكاءً#
حتى وقت قريب، كان بناء نموذج واحد يمكنه فهم الصور وتفسير اللغة معًا يتطلب بنيات Transformer كبيرة ومكلفة التشغيل. وفي YV25 Shenzhen، قدّم Yue Ziyin من Yuanshi Intelligence نظرة عامة على RWKV، وهي بنية تمزج قدرات الاستدلال طويل السياق لدى Transformer بكفاءة النماذج التكرارية.
وأوضح كيف يطبّق Vision-RWKV هذا التصميم على الرؤية الحاسوبية من خلال معالجة الصور بطريقة تتوسع خطيًا مع الدقة. وهذا يجعلها مناسبة للمدخلات عالية الدقة وللأجهزة الطرفية ذات القدرة الحاسوبية المحدودة.
كما أوضح Yue كيفية استخدام RWKV في أنظمة الرؤية واللغة، حيث تُقرن سمات الصورة بفهم النص للانتقال من اكتشاف الأجسام إلى تفسير المشاهد والمستندات والسياق الواقعي.

الشكل 6. Yue Ziyin يتحدث عن تطبيقات RWKV.
أجنحة وعروض توضيحية مباشرة جعلت الذكاء الاصطناعي البصري نابضًا بالحياة#
بينما تطلعت الكلمات على المنصة إلى مستقبل الذكاء الاصطناعي البصري، أظهرت الأجنحة في أرضية المعرض كيف يُستخدم بالفعل اليوم. وتمكن الحاضرون من مشاهدة النماذج وهي تعمل مباشرةً، ومقارنة خيارات العتاد، والتحدث مع الفرق التي تبني هذه الأنظمة مباشرةً.
إليك لمحة عن التقنيات التي عُرضت:
- منصات المطورين والنمذجة الأولية: استعرضت Seeed وM5Stack وInfermove لوحات تطوير مدمجة ومجموعات بداية تجعل تجربة التطبيقات القائمة على YOLO والانتقال سريعًا من الأفكار إلى عروض توضيحية عاملة أمرًا سهلًا.
- عتاد طرفي عالي الأداء: عرضت Hailo وDEEPX وIntel وMoore Threads شرائح ووحدات مصممة للاستدلال السريع والفعّال.
- مسارات عمل الرؤية واللغة: سلطت Baidu Paddle وRWKV الضوء على حزم برمجية يمكنها اكتشاف الأجسام، وكذلك قراءة ما يظهر في صورة أو مستند وتفسيره والاستدلال بشأنه.
- الأدوات مفتوحة المصدر والمجتمعية: تفاعلت Ultralytics وDatawhale مع المطورين من خلال عروض مباشرة للنماذج ونصائح حول التدريب وإرشادات عملية، مما عزز فكرة أن المعرفة المشتركة تسرّع الابتكار.

الشكل 7. نظرة على جناح M5Stack في YV25 Shenzhen.
التواصل مع مجتمع الذكاء الاصطناعي البصري#
إلى جانب كل التقنيات المشوقة، كان جمع مجتمع الرؤية الحاسوبية وفريق Ultralytics مجددًا وجهًا لوجه أحد أفضل جوانب YV25 Shenzhen. وطوال اليوم، تجمع الناس حول العروض التوضيحية، وتبادلوا الأفكار خلال استراحات القهوة، واستمروا في النقاشات بعد انتهاء الكلمات بوقت طويل.
تبادل الباحثون والمهندسون والطلاب والمطوّرون الملاحظات، وطرحوا الأسئلة، وتبادلوا الخبرات الواقعية بدءًا من النشر ووصولًا إلى تدريب النماذج. وبفضل Cinco Jotas من Grupo Osborne، أضفنا أيضًا لمسة من الثقافة الإسبانية إلى الحدث من خلال تقطيع لحم الخنزير المقدد الطازج، مما أوجد لحظة دافئة من التواصل. وقد جعل المكان الجميل والحضور المتحمس والشعور المشترك بالزخم اليوم مميزًا حقًا.
أهم النقاط المستخلصة#
من الكلمات الرئيسية الملهمة إلى العروض التوضيحية العملية، جسّد YOLO Vision 2025 Shenzhen روح الابتكار التي تميّز مجتمع Ultralytics. وطوال اليوم، تبادل المتحدثون والحاضرون الأفكار، واستكشفوا التقنيات الجديدة، وتواصلوا انطلاقًا من رؤية مشتركة لمستقبل الذكاء الاصطناعي. وغادروا معًا وهم مفعمون بالطاقة ومستعدون لما هو قادم مع Ultralytics YOLO.
أعد تصور ما يمكن تحقيقه باستخدام الذكاء الاصطناعي والرؤية الحاسوبية. انضم إلى مجتمعنا ومستودع GitHub لاكتشاف المزيد. تعرّف على المزيد حول تطبيقات مثل الرؤية الحاسوبية في الزراعة والذكاء الاصطناعي في قطاع التجزئة. استكشف خيارات الترخيص لدينا وابدأ استخدام الرؤية الحاسوبية اليوم!









