Group Relative Policy Optimization (GRPO)
تحسين السياسات النسبية للمجموعات (GRPO) أسلوب للتعلم المعزز (RL) لا يحتاج إلى ناقد، إذ يقيّم كل إجابة مقارنةً بمجموعتها لتعزيز استدلال نماذج LLM. ويقارن هذا الأسلوب بـ PPO.
يُعد تحسين السياسات النسبي للمجموعات (GRPO) خوارزمية للتعلّم المعزز موفرة للذاكرة، طُورت لتعزيز قدرات الاستدلال لدى النماذج اللغوية الكبيرة (LLMs) وأنظمة الذكاء الاصطناعي (AI) الأوسع نطاقًا. وقد قُدمت الخوارزمية لأول مرة في ورقة DeepSeekMath البحثية لعام 2024، وهي تحسن أساليب التحسين التقليدية بإلغاء الحاجة إلى شبكة قيمة منفصلة (نموذج الناقد). وبدلًا من ذلك، تطبّع مكافآت مجموعة من الإجابات المُولّدة انطلاقًا من المطالبة نفسها. ومن خلال تقييم الإجابات مقارنةً بنظيراتها ضمن المجموعة، يقلل GRPO النفقات الحاسوبية بدرجة كبيرة، مع تعزيز الأداء في مهام الاستدلال المعقدة ضمن بنى التعلّم العميق (DL) الحديثة.
أوجه اختلاف GRPO عن PPO#
مع أن GRPO يتشابه مع تحسين السياسة القريبة (PPO) — وهي خوارزمية تحسين معيارية تُستخدم غالبًا في التعلم المعزز من التغذية الراجعة البشرية (RLHF) — فإنهما يختلفان اختلافًا كبيرًا من حيث البنية. يتطلب PPO نموذجًا ثانويًا «ناقدًا» يعمل بالتوازي مع شبكة السياسة الرئيسية لتقدير قيمة حالة معينة. وهذا يضاعف تقريبًا مقدار الذاكرة المطلوبة خلال مرحلة التدريب.
على النقيض من ذلك، فإن GRPO خوارزمية لا تعتمد على ناقد. فمن خلال أخذ عينات من مخرجات متعددة لمطالبة واحدة وتقييمها باستخدام نظام مكافآت قائم على القواعد أو أداة تحقق، تحسب GRPO الأفضلية بتطبيع الدرجات ضمن المجموعة المحددة. وتعمل هذه المقارنة النسبية كخط أساس، فتوفّر قدراً هائلاً من الذاكرة التي كانت ستُستهلكها شبكة القيم، وتسرّع تدريب النموذج إجمالاً. ويتبع تحديث واحد في GRPO الخطوات التالية:
تطبيقات GRPO في العالم الحقيقي#
أسهم GRPO في تحقيق إنجازات حديثة عديدة في الذكاء الاصطناعي التوليدي ومعالجة اللغة الطبيعية. ومن أبرز تطبيقاته:
- نماذج الاستدلال الرياضي: استُخدمت GRPO في إصدار DeepSeek-R1 واسع الاستشهاد وفي DeepSeekMath لتحفيز النماذج على تطوير استدلال طويل عبر سلاسل الأفكار والتحقق الذاتي، بما يضاهي أداء النماذج المملوكة مثل o1 من OpenAI. ومن خلال مكافأة الإجابات النهائية الصحيحة والتنسيق السليم، مكّنت الخوارزمية النموذج من اكتشاف استراتيجيات متقدمة لحل المشكلات تلقائياً، دون الحاجة إلى ضبط دقيق مكثف على بيانات علّقها البشر.
- توليد الشيفرات والمنطق الوكيلي: يصعب تقييم الصحة المطلقة للنماذج التي تكتب الشيفرات أو تشغّل مسارات العمل الوكيلة المستقلة. يتيح GRPO للنماذج التعلم عبر تنفيذ تنويعات الشيفرة وتقييمها نسبيًا استنادًا إلى نجاح التجميع أو اجتياز حالات الاختبار، ما يسرّع نشر مساعدي برمجة بالذكاء الاصطناعي يتمتعون بموثوقية عالية.
تنفيذ مفاهيم GRPO باستخدام PyTorch#
في جوهره، يحسب GRPO الميزة النسبية للإجابات من خلال تطبيع مكافآتها. فيما يلي تطبيق أساسي باستخدام PyTorch يوضح هذا التطبيع بواسطة عمليات الموترات المعيارية:
def compute_grpo_advantages(rewards):
# 'rewards' هو موتر ذو شكل (batch_size, group_size)
group_mean = rewards.mean(dim=1, keepdim=True)
group_std = rewards.std(dim=1, keepdim=True)
# طبّع المكافآت داخل المجموعة لحساب المزايا النسبية
advantages = (rewards - group_mean) / (group_std + 1e-8)
return advantagesالارتقاء بالذكاء الاصطناعي عبر التحسين الذكي#
مثلما تعيد GRPO تعريف الكفاءة في توليد النص، تواصل تقنيات التعلم الآلي (ML) المتقدمة إعادة تشكيل الإدراك المرئي. ويتيح تحسين البنى ودوال الخسارة للمطورين إنشاء نماذج أصغر وأسرع في جميع المجالات.
في مهام الرؤية الحاسوبية المتطورة، لا تقل أهمية دراسة التحسينات الشاملة. فعلى سبيل المثال، يدعم Ultralytics YOLO26 الاستدلال الأصلي الشامل الخالي من NMS باستخدام الرأس أحادي المطابقة (nms=False)، ويتدرب باستخدام محسّنات هجينة مستوحاة من أبحاث LLM، مما يبسّط النشر على الأجهزة الطرفية. ويمكن للمطورين الراغبين في الاستفادة من مسارات عمل الرؤية الحاسوبية الفعالة إنشاء النماذج وتدريبها ونشرها بسهولة باستخدام منصة Ultralytics. وتبسّط هذه الأداة السحابية إدارة مجموعات البيانات المعقدة وضبط المعلمات الفائقة لتطبيقات الرؤية المتينة والآنية.










