Group Relative Policy Optimization (GRPO)
L’optimisation de politique relative par groupe (GRPO) est une méthode d’apprentissage par renforcement sans critique qui évalue chaque réponse par rapport à son groupe afin d’améliorer le raisonnement des LLM. Cet article la compare à PPO.
L’optimisation de politique relative au groupe (GRPO) est un algorithme d’apprentissage par renforcement économe en mémoire, conçu pour améliorer les capacités de raisonnement des grands modèles de langage (LLMs) et d’autres systèmes d’intelligence artificielle (AI) plus vastes. Présenté pour la première fois dans l’article DeepSeekMath de 2024, GRPO améliore les méthodes d’optimisation traditionnelles en supprimant le besoin d’un réseau de valeur distinct (modèle critique). À la place, il normalise les récompenses d’un groupe de réponses générées à partir de la même invite. En évaluant chaque réponse par rapport aux autres réponses du groupe, GRPO réduit considérablement la charge de calcul tout en améliorant les performances sur des tâches de raisonnement complexes dans les architectures modernes d’apprentissage profond (DL).
Différences entre GRPO et PPO#
Bien que GRPO présente des similitudes avec l’optimisation de politique proximale (PPO), un algorithme d’optimisation standard souvent utilisé dans l’apprentissage par renforcement à partir de retours humains (RLHF), les deux approches diffèrent considérablement sur le plan architectural. PPO nécessite un modèle « critique » secondaire qui s’exécute en parallèle du réseau de politique principal pour estimer la valeur d’un état donné. Cela double presque la mémoire nécessaire pendant la phase d’entraînement.
À l'inverse, GRPO est un algorithme sans critique. En échantillonnant plusieurs sorties pour une même invite et en les notant à l'aide d'un système de récompense fondé sur des règles ou d'un vérificateur, GRPO calcule l'avantage en normalisant les scores au sein du groupe concerné. Cette comparaison relative sert de référence et économise l'énorme quantité de mémoire qu'aurait occupée un réseau de valeur, tout en accélérant l'entraînement du modèle. Une mise à jour GRPO suit ces étapes :
Applications concrètes de GRPO#
GRPO a contribué à plusieurs avancées récentes en IA générative et en traitement automatique du langage naturel. Voici deux applications notables :
- Modèles de raisonnement mathématique : Dans la très citée publication de DeepSeek-R1 et dans DeepSeekMath, GRPO a servi à inciter les modèles à développer un raisonnement en chaîne de pensée long ainsi que l'auto-vérification, pour atteindre des performances comparables à celles de modèles propriétaires comme o1 d'OpenAI. En récompensant les réponses finales correctes et leur mise en forme, l'algorithme a permis au modèle de découvrir naturellement des stratégies avancées de résolution de problèmes sans réglage fin poussé sur des données annotées par des humains.
- Génération de code et logique agentique : Pour les modèles qui écrivent du code ou alimentent des workflows agentiques autonomes, il est difficile d’évaluer la justesse absolue. GRPO permet aux modèles d’apprendre en exécutant différentes variantes de code et en les notant de manière relative, selon la réussite de la compilation ou des tests. Le déploiement d’assistants de programmation IA hautement fiables s’en trouve accéléré.
Mettre en œuvre les concepts de GRPO dans PyTorch#
GRPO calcule essentiellement l’avantage relatif des réponses en normalisant leurs récompenses. Voici une mise en œuvre élémentaire avec PyTorch qui montre cette normalisation au moyen d’opérations standard sur les tenseurs :
def compute_grpo_advantages(rewards):
# « rewards » est un tenseur de forme (batch_size, group_size)
group_mean = rewards.mean(dim=1, keepdim=True)
group_std = rewards.std(dim=1, keepdim=True)
# Normaliser les récompenses au sein du groupe pour calculer les avantages relatifs
advantages = (rewards - group_mean) / (group_std + 1e-8)
return advantagesFaire progresser l’IA grâce à une optimisation intelligente#
Tout comme GRPO redéfinit l'efficacité de la génération de texte, les techniques avancées d'apprentissage automatique (ML) remodèlent continuellement la perception visuelle. L'optimisation des architectures et des fonctions de perte permet aux développeurs de créer des modèles plus légers et plus rapides dans tous les domaines.
Pour les tâches de vision par ordinateur de pointe, il est tout aussi essentiel d'explorer les optimisations de bout en bout. Par exemple, Ultralytics YOLO26 prend en charge nativement l'inférence de bout en bout sans NMS grâce à sa tête un-à-un (nms=False) et s'entraîne avec des optimiseurs hybrides inspirés de la recherche sur les LLM, ce qui simplifie le déploiement en périphérie. Les développeurs qui souhaitent tirer parti de flux de travail efficaces en vision par ordinateur peuvent créer, entraîner et déployer des modèles facilement à l'aide de la plateforme Ultralytics. Cet outil cloud simplifie la gestion complexe des jeux de données et le réglage des hyperparamètres pour des applications de vision robustes et en temps réel.










