Group Relative Policy Optimization (GRPO)
Entdecke Group Relative Policy Optimization (GRPO). Lerne, wie dieser speichereffiziente, kritikfreie RL-Algorithmus das Reasoning von LLMs verbessert und Trainingskosten senkt.
Group Relative Policy Optimization (GRPO) ist ein speichereffizienter reinforcement learning-Algorithmus, der entwickelt wurde, um die Schlussfolgerungsfähigkeiten von Large Language Models (LLMs) und breiteren Artificial Intelligence (AI)-Systemen zu verbessern. Erstmals vorgestellt im DeepSeekMath paper aus dem Jahr 2024, verbessert GRPO herkömmliche Optimierungsmethoden, indem es den Bedarf an einem separaten Wertnetzwerk (Kritikermodell) überflüssig macht. Stattdessen normalisiert es die Belohnungen einer Gruppe generierter Antworten, die von demselben Prompt abgeleitet wurden. Durch die Bewertung von Antworten relativ zu ihren Peers innerhalb der Gruppe reduziert GRPO den Rechenaufwand drastisch und steigert gleichzeitig die Leistung bei komplexen Argumentationsaufgaben in modernen Deep Learning (DL)-Architekturen.
Wie sich GRPO von PPO unterscheidet#
Während GRPO Ähnlichkeiten mit Proximal Policy Optimization (PPO) aufweist – einem standardmäßigen optimization algorithm, der häufig beim reinforcement learning from human feedback (RLHF) verwendet wird –, unterscheiden sich die beiden in ihrer Architektur erheblich. PPO erfordert ein sekundäres „Kritiker“-Modell, das parallel zum Hauptrichtliniennetzwerk läuft, um den Wert eines bestimmten Zustands zu schätzen. Dadurch verdoppelt sich fast der während der training phase erforderliche Speicher.
Im Gegensatz dazu ist GRPO ein kritikfreier Algorithmus. Durch das Sampling mehrerer Ausgaben für einen einzelnen Prompt und deren Bewertung mithilfe eines rule-based reward system oder Verifiers berechnet GRPO den Vorteil, indem es die Bewertungen innerhalb dieser spezifischen Gruppe normalisiert. Dieser relative Vergleich dient als Baseline, wodurch die enormen Speichermengen eingespart werden, die von einem Wertnetzwerk belegt worden wären, und das gesamte model training beschleunigt wird.
Praxisanwendungen von GRPO#
GRPO hat mehrere neuere Durchbrüche in der generative AI und der natural language processing vorangetrieben. Zwei nennenswerte Anwendungen umfassen:
- Mathematical Reasoning Models: In der weit verbreiteten DeepSeek-R1 release und DeepSeekMath wurde GRPO verwendet, um Modelle dazu zu motivieren, langes chain-of-thought-Schlussfolgern und Selbstüberprüfung zu entwickeln, wodurch die Leistung proprietärer Modelle wie OpenAI's o1 erreicht wird. Durch die Belohnung korrekter Endergebnisse und Formatierungen ermöglichte der Algorithmus dem Modell, ohne umfangreiches fine-tuning mit von Menschen annotierten Daten organisch fortgeschrittene Problemlösungsstrategien zu entdecken.
- Code Generation and Agentic Logic: Für Modelle, die Code schreiben oder autonome agentic workflows antreiben, ist die Bewertung der absoluten Richtigkeit eine Herausforderung. GRPO ermöglicht es Modellen, durch Ausführung von Code-Variationen zu lernen und diese basierend auf Kompilierungserfolgen oder bestandenen Testfällen relativ zu bewerten, was die Bereitstellung hochzuverlässiger KI-Code-Assistenten beschleunigt.
Implementierung von GRPO-Konzepten in PyTorch#
Im Kern berechnet GRPO den relativen Vorteil von Antworten durch Normalisierung ihrer Belohnungen. Hier ist eine einfache PyTorch-Implementierung, die diese Normalisierung mithilfe von Standard-tensor operations demonstriert:
def compute_grpo_advantages(rewards):
# 'rewards' is a tensor of shape (batch_size, group_size)
group_mean = rewards.mean(dim=1, keepdim=True)
group_std = rewards.std(dim=1, keepdim=True)
# Normalize rewards within the group to calculate relative advantages
advantages = (rewards - group_mean) / (group_std + 1e-8)
return advantagesKI mit intelligenter Optimierung voranbringen#
Genau wie GRPO die Effizienz für die Texterstellung neu definiert, formen fortgeschrittene Machine Learning (ML)-Techniken die visual perception kontinuierlich um. Die Optimierung von Architekturen und loss functions ermöglicht Entwicklern den Bau leichterer und schnellerer Modelle in allen Domänen.
Für modernste computer vision tasks ist die Erforschung von End-to-End-Optimierungen ebenso entscheidend. Beispielsweise führt Ultralytics YOLO26 eine von der LLM-Forschung inspirierte, nativ NMS-freie Architektur und hybrid optimizers ein, wodurch die Edge-Bereitstellung drastisch verbessert wird. Entwickler, die effiziente computer vision-Workflows nutzen möchten, können mithilfe der Ultralytics Platform mühelos Modelle erstellen, trainieren und bereitstellen. Dieses cloudbasierte Tool vereinfacht die komplexe Datensatzverwaltung und hyperparameter tuning für robuste Echtzeit-Vision-Anwendungen.






