Reinforcement Learning with Verifiable Rewards (RLVR)
Entdecke bestärkendes Lernen mit überprüfbaren Belohnungen (RLVR). Erfahre, wie du fortschrittliche KI mit deterministischem Feedback und Ultralytics YOLO26 trainierst.
Reinforcement Learning mit verifizierbaren Belohnungen (RLVR) ist ein fortgeschrittenes Trainingsparadigma, das die Schlussfolgerungs- und Problemlösungsfähigkeiten von Modellen der künstlichen Intelligenz (AI) verbessern soll. Im Gegensatz zu herkömmlichen Trainingsmethoden, die auf von Menschen annotierten Präferenzdaten beruhen, verwendet RLVR deterministische, regelbasierte Systeme, um die Ausgaben eines Modells zu bewerten. Durch eine objektive, binäre Belohnung – etwa dafür, ob ein generierter Code kompiliert oder eine mathematische Gleichung korrekt gelöst wird – können Modelle mit RLVR durch uneingeschränktes Erkunden lernen. Diese objektive Rückkopplung ist ein wichtiger Treiber der jüngsten Durchbrüche bei leistungsfähigen Schlussfolgerungsmodellen und ermöglicht es ihnen, optimale, komplexe logische Lösungswege ohne kontinuierliches menschliches Eingreifen zu entdecken.
Grundprinzipien von RLVR#
In Umgebungen des überwachten maschinellen Lernens (ML) lernt ein KI-Agent, indem er ein Belohnungssignal maximiert. Bei RLVR wird dieses Belohnungssignal von einem strikten Programmiersystem statt durch subjektive menschliche Beurteilung erzeugt. Der Lernprozess beruht auf einigen grundlegenden Schritten:
- Explorationsstrategie: Das Modell generiert mehrere mögliche Lösungen oder Schlussfolgerungswege für eine Eingabeaufforderung und nutzt häufig schrittweises Schlussfolgern, um komplexe Aufgaben aufzuschlüsseln.
- Deterministische Überprüfung: Ein externes Tool – etwa ein Python-Compiler, ein Taschenrechner oder ein Wahrnehmungssystem für maschinelles Sehen (CV) – prüft die endgültige Ausgabe anhand objektiver Erfolgskriterien.
- Optimierung der Richtlinie: Ist die Ausgabe nachweislich korrekt, erhält das Modell eine positive Belohnung. Anschließend wird die Richtlinie des Modells mithilfe von Optimierungsalgorithmen wie Group Relative Policy Optimization (GRPO) oder Proximal Policy Optimization (PPO) aktualisiert, damit erfolgreiche Schlussfolgerungswege bevorzugt werden.
Dieser Ansatz verbessert die Effizienz der Inferenzlatenz eines Modells während des Trainings erheblich und fördert die Entstehung von Schlussfolgerungsfähigkeiten. Mit dieser Technik wurden kürzlich leistungsfähige Modelle wie DeepSeek-R1 trainiert.
RLVR im Vergleich zu RLHF und PRMs#
Es ist wichtig, RLVR von anderen Ausrichtungs- und Trainingsparadigmen im KI-Ökosystem abzugrenzen:
- Im Vergleich zu Reinforcement Learning aus menschlichem Feedback (RLHF): RLHF stützt sich auf ein erlerntes Belohnungsmodellierungssystem, das mit subjektiven menschlichen Präferenzen trainiert wird. RLVR beseitigt den Engpass durch die Einbindung von Menschen, indem es sich ausschließlich auf objektive, programmatisch feststellbare Wahrheiten stützt. Dadurch lässt sich RLVR für Aufgaben mit eindeutig richtigen oder falschen Antworten stark skalieren.
- Im Vergleich zu Prozessbelohnungsmodellen (PRM): PRMs liefern während des gesamten Schlussfolgerungsverlaufs eines Modells detailliertes Feedback zu jedem einzelnen Schritt. RLVR konzentriert sich dagegen üblicherweise auf das überprüfbare Ergebnis am Ende eines Prozesses. Aktuelle Forschungsergebnisse aus dem Jahr 2025 deuten jedoch darauf hin, dass die Optimierung auf eine abschließende, überprüfbare Belohnung bei RLVR implizit auch korrekte Zwischenschritte im Schlussfolgern fördert.
Anwendungen in der Praxis#
RLVR verändert die Art und Weise, wie komplexe KI-Systeme in verschiedenen deterministischen Bereichen trainiert werden:
- Mathematisches Schlussfolgern: Große Schlussfolgerungsmodelle wie die o-Serie von OpenAI nutzen RLVR, um komplexe mathematische Theoreme zu lösen. Der Verifizierer fungiert als Engine, die eindeutig beweist, ob die abgeleitete Antwort des Modells korrekt ist, und verbessert so die Leistung bei Benchmark-Datensätzen erheblich.
- Softwareentwicklung und Codegenerierung: KI-Programmierassistenten nutzen RLVR, um Code zu schreiben, zu debuggen und zu optimieren. Eine überprüfbare Belohnung wird vergeben, wenn der generierte Code erfolgreich kompiliert und eine Reihe automatisierter Unit-Tests besteht.
- Autonome Bildverarbeitungsagenten: In physischen Umgebungen erhalten autonome Agenten überprüfbare Belohnungen, wenn sie ein Ziel erreichen oder ein Objekt erfolgreich manipulieren. In diesen Umgebungen dienen Bildverarbeitungsmodelle als Prüfer der jeweiligen Bedingungen.
Eine überprüfbare Belohnung in der visuellen KI implementieren#
In physischen und visuellen Umgebungen können Wahrnehmungsmodelle wie Ultralytics YOLO26 in einer RLVR-Schleife als programmatischer Verifizierer dienen. Wenn ein KI-Agent beispielsweise ein Objekt in einen bestimmten Bereich bewegen soll, kann das YOLO-Modell den Erfolg überprüfen, indem es das Objekt in diesem Bereich erkennt.
Das folgende Python-Beispiel zeigt einen konzeptionellen programmatischen Verifizierer, der das Paket ultralytics verwendet.
from ultralytics import YOLO
# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")
def get_verifiable_reward(image_path: str, target_class: int) -> float:
"""Returns a verifiable reward of 1.0 if the target object is detected."""
results = verifier_model(image_path)
# Check if the desired class (e.g., 0 for 'person') exists in the detections
detected_classes = results[0].boxes.cls.tolist()
if target_class in detected_classes:
return 1.0 # Verifiable success
return 0.0 # Verifiable failure
# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")Durch den Einsatz von Cloud-Plattformen wie der Ultralytics Platform zur Bereitstellung dieser Wahrnehmungsverifizierer können Entwickler robuste, skalierbare RLVR-Pipelines erstellen, mit denen die nächste Generation autonomer Agenten und Schlussfolgerungsagenten trainiert wird.









