Group Relative Policy Optimization (GRPO)
Découvre la Group Relative Policy Optimization (GRPO). Apprends comment cet algorithme RL, économe en mémoire et sans critique, améliore le raisonnement LLM et réduit les coûts d'entraînement.
Group Relative Policy Optimization (GRPO) est un algorithme d'apprentissage par renforcement économe en mémoire, développé pour améliorer les capacités de raisonnement des grands modèles de langage (LLM) et des systèmes d'intelligence artificielle (IA) plus larges. Présenté pour la première fois dans l'article DeepSeekMath de 2024, GRPO améliore les méthodes d'optimisation traditionnelles en éliminant le besoin d'un réseau de valeur séparé (modèle critique). Au lieu de cela, il normalise les récompenses d'un groupe de réponses générées à partir du même prompt. En évaluant les réponses par rapport à leurs pairs au sein du groupe, GRPO réduit considérablement la charge de calcul tout en améliorant les performances sur les tâches de raisonnement complexes dans les architectures modernes de deep learning (DL).
En quoi la GRPO diffère de la PPO#
Bien que GRPO partage des similitudes avec l'optimisation de politique proximale (PPO) — un algorithme d'optimisation standard souvent utilisé dans l'apprentissage par renforcement à partir de rétroaction humaine (RLHF) — les deux diffèrent considérablement dans leur architecture. PPO nécessite un modèle « critique » secondaire qui s'exécute en parallèle du réseau de politique principal pour estimer la valeur d'un état donné. Cela double presque la mémoire requise pendant la phase d'entraînement.
En revanche, GRPO est un algorithme sans critique. En échantillonnant plusieurs sorties pour un seul prompt et en les évaluant à l'aide d'un système de récompense basé sur des règles ou d'un vérificateur, GRPO calcule l'avantage en normalisant les scores au sein de ce groupe spécifique. Cette comparaison relative sert de référence, économisant les quantités massives de mémoire qui auraient été occupées par un réseau de valeur et accélérant l'entraînement des modèles en général.
Applications réelles de la GRPO#
GRPO a stimulé plusieurs avancées récentes en IA générative et en traitement automatique du langage naturel. Deux applications notables incluent :
- Modèles de raisonnement mathématique : Dans la version DeepSeek-R1 largement citée et dans DeepSeekMath, GRPO a été utilisé pour inciter les modèles à développer un long raisonnement en chaîne de pensée et une auto-vérification, égalant les performances de modèles propriétaires tels que l'o1 d'OpenAI. En récompensant les bonnes réponses finales et le formatage, l'algorithme a permis au modèle de découvrir organiquement des stratégies avancées de résolution de problèmes sans réglage fin intensif sur des données annotées par des humains.
- Génération de code et logique agentique : Pour les modèles écrivant du code ou alimentant des flux de travail agentiques autonomes, évaluer l'exactitude absolue est difficile. GRPO permet aux modèles d'apprendre en exécutant des variations de code et en les notant de manière relative en fonction du succès de la compilation ou des cas de test réussis, accélérant ainsi le déploiement d'assistants de codage IA hautement fiables.
Implémentation des concepts de la GRPO avec PyTorch#
À la base, GRPO calcule l'avantage relatif des réponses en normalisant leurs récompenses. Voici une implémentation PyTorch de base démontrant cette normalisation à l'aide d'opérations sur les tenseurs standard :
def compute_grpo_advantages(rewards):
# 'rewards' is a tensor of shape (batch_size, group_size)
group_mean = rewards.mean(dim=1, keepdim=True)
group_std = rewards.std(dim=1, keepdim=True)
# Normalize rewards within the group to calculate relative advantages
advantages = (rewards - group_mean) / (group_std + 1e-8)
return advantagesFaire avancer l'IA grâce à une optimisation intelligente#
Tout comme GRPO redéfinit l'efficacité pour la génération de texte, les techniques avancées d'apprentissage automatique (ML) remodèlent continuellement la perception visuelle. L'optimisation des architectures et des fonctions de perte permet aux développeurs de construire des modèles plus légers et plus rapides dans tous les domaines.
Pour les tâches de vision par ordinateur de pointe, l'exploration d'optimisations de bout en bout est tout aussi critique. Par exemple, Ultralytics YOLO26 introduit une architecture nativement sans NMS et des optimiseurs hybrides inspirés de la recherche sur les LLM, améliorant considérablement le déploiement en périphérie (edge). Les développeurs cherchant à exploiter des flux de travail de vision par ordinateur efficaces peuvent construire, entraîner et déployer des modèles sans effort à l'aide de la plateforme Ultralytics. Cet outil basé sur le cloud simplifie la gestion complexe des jeux de données et le réglage des hyperparamètres pour des applications de vision robustes en temps réel.






