Group Relative Policy Optimization (GRPO)
Group Relative Policy Optimization (GRPO) ist ein Reinforcement Learning ohne Kritiker, das jede Antwort anhand ihrer Gruppe bewertet, um die Schlussfolgerungsfähigkeit von LLMs zu verbessern. Der Artikel vergleicht das Verfahren mit PPO.
Group Relative Policy Optimization (GRPO) ist ein speichereffizienter Algorithmus für bestärkendes Lernen, der entwickelt wurde, um die Schlussfolgerungsfähigkeiten von großen Sprachmodellen (LLMs) und umfassenderen Systemen der künstlichen Intelligenz (KI) zu verbessern. GRPO wurde erstmals im DeepSeekMath-Artikel von 2024 vorgestellt und verbessert herkömmliche Optimierungsverfahren, indem es den Verzicht auf ein separates Wertnetz (Kritikermodell) ermöglicht. Stattdessen normalisiert GRPO die Belohnungen einer Gruppe von generierten Antworten auf denselben Prompt. Durch den Vergleich der Antworten mit den anderen Antworten der Gruppe verringert GRPO den Rechenaufwand erheblich und steigert zugleich die Leistung bei komplexen Schlussfolgerungsaufgaben in modernen Deep-Learning-(DL)-Architekturen.
Wie sich GRPO von PPO unterscheidet#
GRPO weist zwar Ähnlichkeiten mit Proximal Policy Optimization (PPO) auf, einem gängigen Optimierungsalgorithmus, der häufig beim bestärkenden Lernen mit menschlichem Feedback (RLHF) verwendet wird. Die beiden Verfahren unterscheiden sich jedoch deutlich in ihrer Architektur. PPO benötigt ein zusätzliches „Kritiker“-Modell, das parallel zum Haupt-Policy-Netz läuft, um den Wert eines bestimmten Zustands einzuschätzen. Dadurch verdoppelt sich der Speicherbedarf während der Trainingsphase nahezu.
Im Gegensatz dazu kommt GRPO ohne Kritiker aus. Es erzeugt für einen Prompt mehrere Ausgaben und bewertet sie mithilfe eines regelbasierten Belohnungssystems oder eines Verifikators. Den Vorteil berechnet GRPO, indem es die Bewertungen innerhalb der jeweiligen Gruppe normalisiert. Dieser relative Vergleich dient als Referenzwert und spart den enormen Speicherbedarf eines Wertnetzwerks. Zugleich beschleunigt er das gesamte Modelltraining. Ein GRPO-Update läuft in folgenden Schritten ab:
GRPO-Anwendungen in der Praxis#
GRPO hat zu mehreren jüngsten Durchbrüchen in der generativen KI und der Verarbeitung natürlicher Sprache beigetragen. Zwei bemerkenswerte Anwendungsbereiche sind:
- Mathematische Reasoning-Modelle: In der viel zitierten Veröffentlichung zu DeepSeek-R1 und in DeepSeekMath wurde GRPO eingesetzt, um Modellen längere Gedankengänge und Selbstüberprüfung beizubringen. So erreichten sie eine Leistung, die mit proprietären Modellen wie o1 von OpenAI vergleichbar ist. Indem der Algorithmus korrekte Endantworten und Formatierungen belohnte, ermöglichte er dem Modell, eigenständig fortgeschrittene Problemlösungsstrategien zu entwickeln, ohne umfangreiche Feinabstimmung anhand von durch Menschen annotierten Daten.
- Codegenerierung und agentenbasierte Logik: Bei Modellen, die Code schreiben oder autonome agentenbasierte Arbeitsabläufe steuern, ist die absolute Korrektheit schwer zu bewerten. Mit GRPO können Modelle aus der Ausführung verschiedener Codevarianten lernen und diese anhand des erfolgreichen Kompilierens oder bestandener Testfälle relativ bewerten. Dadurch wird die Bereitstellung äußerst zuverlässiger KI-Programmierassistenten beschleunigt.
GRPO-Konzepte in PyTorch implementieren#
Im Kern berechnet GRPO den relativen Vorteil von Antworten, indem es ihre Belohnungen normalisiert. Hier findest du eine einfache Implementierung in PyTorch, die diese Normalisierung anhand üblicher Tensoroperationen veranschaulicht:
def compute_grpo_advantages(rewards):
# 'rewards' ist ein Tensor mit der Form (batch_size, group_size)
group_mean = rewards.mean(dim=1, keepdim=True)
group_std = rewards.std(dim=1, keepdim=True)
# Belohnungen innerhalb der Gruppe normalisieren, um relative Vorteile zu berechnen
advantages = (rewards - group_mean) / (group_std + 1e-8)
return advantagesKI durch intelligente Optimierung voranbringen#
So wie GRPO die Effizienz der Textgenerierung neu definiert, verändern fortgeschrittene Verfahren des maschinellen Lernens (ML) kontinuierlich die visuelle Wahrnehmung. Durch die Optimierung von Architekturen und Verlustfunktionen können Entwickler in allen Anwendungsbereichen leichtere und schnellere Modelle erstellen.
Bei hochmodernen Computer-Vision-Aufgaben ist es ebenso wichtig, durchgängige Optimierungen zu untersuchen. Ultralytics YOLO26 unterstützt beispielsweise eine native, durchgängige Inferenz ohne NMS mit seinem One-to-One-Kopf (nms=False) und wird mit hybriden Optimierern trainiert, die von der LLM-Forschung inspiriert sind. Das vereinfacht die Bereitstellung auf Edge-Geräten. Entwickler können effiziente Computer-Vision-Arbeitsabläufe nutzen und Modelle mühelos mit der Ultralytics Platform erstellen, trainieren und bereitstellen. Dieses cloudbasierte Werkzeug vereinfacht die komplexe Verwaltung von Datensätzen und die Hyperparameteroptimierung für robuste Bildverarbeitungsanwendungen in Echtzeit.










