YOLO Vision 2026:
Zurück zum Ultralytics Glossar

Group Relative Policy Optimization (GRPO)

Entdecke Group Relative Policy Optimization (GRPO). Lerne, wie dieser speichereffiziente, kritikfreie RL-Algorithmus das Reasoning von LLMs verbessert und Trainingskosten senkt.

Group Relative Policy Optimization (GRPO) ist ein speichereffizienter reinforcement learning-Algorithmus, der entwickelt wurde, um die Schlussfolgerungsfähigkeiten von Large Language Models (LLMs) und breiteren Artificial Intelligence (AI)-Systemen zu verbessern. Erstmals vorgestellt im DeepSeekMath paper aus dem Jahr 2024, verbessert GRPO herkömmliche Optimierungsmethoden, indem es den Bedarf an einem separaten Wertnetzwerk (Kritikermodell) überflüssig macht. Stattdessen normalisiert es die Belohnungen einer Gruppe generierter Antworten, die von demselben Prompt abgeleitet wurden. Durch die Bewertung von Antworten relativ zu ihren Peers innerhalb der Gruppe reduziert GRPO den Rechenaufwand drastisch und steigert gleichzeitig die Leistung bei komplexen Argumentationsaufgaben in modernen Deep Learning (DL)-Architekturen.

Wie sich GRPO von PPO unterscheidet#

Während GRPO Ähnlichkeiten mit Proximal Policy Optimization (PPO) aufweist – einem standardmäßigen optimization algorithm, der häufig beim reinforcement learning from human feedback (RLHF) verwendet wird –, unterscheiden sich die beiden in ihrer Architektur erheblich. PPO erfordert ein sekundäres „Kritiker“-Modell, das parallel zum Hauptrichtliniennetzwerk läuft, um den Wert eines bestimmten Zustands zu schätzen. Dadurch verdoppelt sich fast der während der training phase erforderliche Speicher.

Im Gegensatz dazu ist GRPO ein kritikfreier Algorithmus. Durch das Sampling mehrerer Ausgaben für einen einzelnen Prompt und deren Bewertung mithilfe eines rule-based reward system oder Verifiers berechnet GRPO den Vorteil, indem es die Bewertungen innerhalb dieser spezifischen Gruppe normalisiert. Dieser relative Vergleich dient als Baseline, wodurch die enormen Speichermengen eingespart werden, die von einem Wertnetzwerk belegt worden wären, und das gesamte model training beschleunigt wird.

Praxisanwendungen von GRPO#

GRPO hat mehrere neuere Durchbrüche in der generative AI und der natural language processing vorangetrieben. Zwei nennenswerte Anwendungen umfassen:

  1. Mathematical Reasoning Models: In der weit verbreiteten DeepSeek-R1 release und DeepSeekMath wurde GRPO verwendet, um Modelle dazu zu motivieren, langes chain-of-thought-Schlussfolgern und Selbstüberprüfung zu entwickeln, wodurch die Leistung proprietärer Modelle wie OpenAI's o1 erreicht wird. Durch die Belohnung korrekter Endergebnisse und Formatierungen ermöglichte der Algorithmus dem Modell, ohne umfangreiches fine-tuning mit von Menschen annotierten Daten organisch fortgeschrittene Problemlösungsstrategien zu entdecken.
  2. Code Generation and Agentic Logic: Für Modelle, die Code schreiben oder autonome agentic workflows antreiben, ist die Bewertung der absoluten Richtigkeit eine Herausforderung. GRPO ermöglicht es Modellen, durch Ausführung von Code-Variationen zu lernen und diese basierend auf Kompilierungserfolgen oder bestandenen Testfällen relativ zu bewerten, was die Bereitstellung hochzuverlässiger KI-Code-Assistenten beschleunigt.

Implementierung von GRPO-Konzepten in PyTorch#

Im Kern berechnet GRPO den relativen Vorteil von Antworten durch Normalisierung ihrer Belohnungen. Hier ist eine einfache PyTorch-Implementierung, die diese Normalisierung mithilfe von Standard-tensor operations demonstriert:



def compute_grpo_advantages(rewards):
    # 'rewards' is a tensor of shape (batch_size, group_size)
    group_mean = rewards.mean(dim=1, keepdim=True)
    group_std = rewards.std(dim=1, keepdim=True)

    # Normalize rewards within the group to calculate relative advantages
    advantages = (rewards - group_mean) / (group_std + 1e-8)
    return advantages

KI mit intelligenter Optimierung voranbringen#

Genau wie GRPO die Effizienz für die Texterstellung neu definiert, formen fortgeschrittene Machine Learning (ML)-Techniken die visual perception kontinuierlich um. Die Optimierung von Architekturen und loss functions ermöglicht Entwicklern den Bau leichterer und schnellerer Modelle in allen Domänen.

Für modernste computer vision tasks ist die Erforschung von End-to-End-Optimierungen ebenso entscheidend. Beispielsweise führt Ultralytics YOLO26 eine von der LLM-Forschung inspirierte, nativ NMS-freie Architektur und hybrid optimizers ein, wodurch die Edge-Bereitstellung drastisch verbessert wird. Entwickler, die effiziente computer vision-Workflows nutzen möchten, können mithilfe der Ultralytics Platform mühelos Modelle erstellen, trainieren und bereitstellen. Dieses cloudbasierte Tool vereinfacht die komplexe Datensatzverwaltung und hyperparameter tuning für robuste Echtzeit-Vision-Anwendungen.

Explore solutions

Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr

Lass uns gemeinsam die Zukunft der KI bauen!

Beginne deine Reise mit der Zukunft des maschinellen Lernens