LiveCodeBench
LiveCodeBench معيار مرجعي مؤرَّخ يقيّم نماذج الذكاء الاصطناعي لكتابة الشيفرات، ويفحص توليد الشيفرات وإصلاحها والاستدلال على تنفيذها والأداء في مسائل جديدة.
LiveCodeBench معيار مرجعي يُحدَّث باستمرار لتقييم مدى كفاءة النماذج اللغوية للذكاء الاصطناعي في حل المسائل البرمجية. ويختبر قدرة النموذج على إنتاج شيفرة قابلة للتشغيل، وإصلاح الأخطاء، والاستدلال على سلوك البرنامج. وتتمثل ميزته الفارقة في مراعاة الزمن: إذ تُرفق بالمسائل تواريخ نشرها، ما يتيح للمقيّمين اختبار النماذج في تحديات نُشرت بعد حدّ بيانات تدريبها، أي أحدث تاريخ تغطيه مواد التدريب. ويساعد ذلك على التمييز بين القدرة الحقيقية على حل المسائل وتذكّر الحلول التي سبق الاطلاع عليها.
النشأة وتصميم المعيار المرجعي#
طوّر باحثون من جامعة كاليفورنيا في بيركلي، ومعهد ماساتشوستس للتكنولوجيا، وجامعة كورنيل هذا المعيار المرجعي، بقيادة نامان جاين، وقدّموه في ورقة بحثية عام 2024 بعنوان LiveCodeBench: تقييم شامل وخالٍ من التلوث للنماذج اللغوية الكبيرة المخصصة للشيفرات. ويجمع مسائل البرمجة التنافسية من LeetCode وAtCoder وCodeforces. وشملت النماذج المرجعية البارزة في المراحل الأولى GPT-4 Turbo وClaude 3 Opus، اللذين حققا أداءً قويًا في مهام التقييم؛ أما DeepSeek-Instruct-33B وPhind-34B فكانا من أبرز النماذج المرجعية المتاحة للوصول المفتوح في المقارنات الأولية. وهذه نقاط مرجعية تاريخية، وليست نماذج تتصدر لوحة المتصدرين بصورة دائمة.
احتوى الإصدار الأولي، release_v1، على 400 مسألة نُشرت بين مايو 2023 ومارس 2024. ووسّعت الإصدارات اللاحقة على Hugging Face مجموعة المسائل، لذا لا يوجد حجم واحد ثابت لـ LiveCodeBench. وينبغي أن تحدد النتيجة القابلة لإعادة الإنتاج الإصدار وفترة التقييم.
مثل مجموعات بيانات المعايير المرجعية الأخرى، توفر هذه المجموعة مهام وإجراءات تقييم مشتركة لمقارنة النماذج. كما يتيح تصميم التقييم المؤرَّخ للمقيّمين اختيار فترة مشتركة للمسائل المنشورة حديثًا.
ما الذي يقيسه LiveCodeBench#
يقيّم LiveCodeBench أربع قدرات مترابطة لدى النماذج اللغوية الكبيرة، وهي أنظمة تولّد النصوص وتفسّرها، بما في ذلك الشيفرة المصدرية:
- توليد الشيفرات: إنتاج برنامج انطلاقًا من وصف للمسألة وأمثلة على المدخلات والمخرجات. ويشغّل المقيّم الحل على اختبارات إضافية.
- الإصلاح الذاتي: مراجعة حل غير صحيح بعد تلقي ملاحظات التنفيذ، مثل استثناء أو اختبار فاشل.
- تنفيذ الشيفرة: توقّع مخرجات برنامج مُعطى عند إدخال محدد. ويصف «التنفيذ» هنا مهمة الاستدلال التي يؤديها النموذج؛ إذ يتحقق المقيّم من صحة توقعه بمقارنته بالتنفيذ الفعلي.
- توقّع مخرجات الاختبار: استنتاج المخرجات المتوقعة من مواصفات المسألة ومدخل مُعطى، من دون تلقي التطبيق البرمجي.
التمييز بين المهمتين الأخيرتين مهم. فتنفيذ الشيفرة يسأل عمّا يفعله برنامج موجود، بينما يسأل توقّع مخرجات الاختبار عمّا ينبغي أن يفعله تطبيق صحيح. ويفحص الإصلاح الذاتي سلوك الاستجابة للملاحظات ومراجعة الشيفرة، وهو ما يُستخدم أيضًا في البرمجة الوكيلة، حيث تخطط أنظمة الذكاء الاصطناعي للشيفرة وتكتبها وتشغّلها وتراجعها.
في توليد الشيفرات، تعني الصحة الوظيفية اجتياز جميع الاختبارات المطلوبة. فقد يعمل البرنامج بنجاح، لكنه ينتج إجابات غير صحيحة، بينما قد يمنعه خطأ في التنفيذ من إنتاج أي إجابة. ويؤثر كلا النوعين من الإخفاق في أداء المعيار المرجعي.
قراءة الدرجات وفهم التلوث#
يقيس Pass@1 احتمال اجتياز حل واحد مولّد لجميع الاختبارات المطلوبة، محسوبًا على متوسط المسائل. وتعني قيمة مُعلنة تبلغ 60% أن نحو ست مسائل من كل عشر تُحل وفق إجراء التقييم المحدد. ولا تعني أن كل برنامج يجتاز 60% من اختباراته.
تتطلب المقارنات العادلة مطابقة إصدار مجموعة البيانات والفترة الزمنية والمهمة وإعدادات التوليد. وقد يؤدي هندسة الموجّهات وإعدادات أخذ العينات وحدود المخرجات وفرص الإصلاح إلى تغيير النتيجة. كما تكشف التصنيفات إلى سهل ومتوسط وصعب عن فروق قد يخفيها المتوسط الإجمالي.
يحدث تلوث المعيار المرجعي عندما تظهر مسائل التقييم أو حلولها في بيانات تدريب النموذج. وقد يؤدي هذا النوع من تسرّب البيانات إلى تضخيم الدرجات لأن النموذج سبق أن اطّلع على المواد. ويحدّ اختيار مسائل نُشرت بعد حدّ بيانات النموذج من هذا الخطر، مع بقاء موثوقية ذلك الحدّ والتحديثات اللاحقة للنموذج عاملين مهمين.
لذلك، يتطلب الادعاء بأن نموذجًا معينًا «يتصدر LiveCodeBench» لقطة مؤرخة من لوحة المتصدرين وإعدادات تقييم مطابقة. ويصعب تفسير ترتيب لا يراعي هذا السياق.
التطبيقات والمعايير المرجعية ذات الصلة#
يدعم LiveCodeBench مقارنة نماذج البرمجة وتشخيص ما إذا كانت مواطن الضعف تكمن في توليد الحلول أو فهم الشيفرة أو إصلاح الإخفاقات. وتوفر مهامه القائمة على المسابقات مؤشرات على القدرة على البرمجة الخوارزمية؛ أما تقييم تطوير البرمجيات على نطاق أوسع فيتطلب أيضًا اختبارات للتنقل بين مستودعات الشيفرة وإدارة التبعيات وسلوك التكامل.
LiveBench معيار مرجعي مستقل وأوسع نطاقًا، يغطي مجالات مثل الاستدلال والرياضيات واللغة والبرمجة. ولا يعني تشابه الأسماء أن الدرجات قابلة للتبادل.
بالنسبة إلى المطورين الذين يبنون باستخدام Ultralytics YOLO، يقدم LiveCodeBench مؤشرًا واحدًا عند تقييم مساعد برمجي. ومن مسارات العمل المكملة الملموسة استخدام مهارات Ultralytics Agent Skills، التي توفر لوكلاء البرمجة المتوافقين تعليمات لإعداد مجموعات البيانات والتدريب والاستدلال والتصدير.
عندما يساعد هذا المساعد في بناء تطبيق YOLO26، قيّم الشيفرة التي يولدها بمعزل عن نموذج الرؤية: إذ يقيس وضع التحقق جودة التنبؤات، بينما يقارن وضع قياس الأداء دقة تنسيقات النشر وسرعة الاستدلال.










