YOLO Vision 2026:
Zurück zum Ultralytics Glossar

Reward Modeling

Erforsche Reward Modeling im maschinellen Lernen. Lerne, wie es menschliches Feedback nutzt, um KI-Agenten und Ultralytics YOLO26-Modelle für eine sicherere und genauere Leistung auszurichten.

Reward Modeling ist eine Methode des maschinellen Lernens, mit der künstliche Intelligenz-Systeme lernen, ihr eigenes Verhalten auf Basis menschlicher Präferenzen zu bewerten und zu priorisieren. In herkömmlichen reinforcement learning-Umgebungen lernt ein AI agent durch die Maximierung einer vordefinierten, mathematisch starren Belohnungsfunktion, wie zum Beispiel dem Punktestand in einem Videospiel. Bei komplexen realen Aufgaben jedoch, bei denen ein „gutes“ Verhalten subjektiv oder nuanciert ist – wie das Schreiben einer höflichen E-Mail oder das sichere Navigieren an einer Kreuzung –, ist das handschriftliche Verfassen einer fehlerfreien Belohnungsfunktion nahezu unmöglich. Reward Modeling löst dies, indem es ein sekundäres neural network (das Reward Model) trainiert, das als Stellvertreter für das menschliche Urteil dient. Dieses Modell bewertet die Ausgaben der primären KI und weist skalare Werte zu, wodurch das Hauptmodell dynamisch zu sicheren, hilfreichen und präzisen Verhaltensweisen geführt wird.

So funktioniert Reward Modeling#

Die Pipeline zum Aufbau eines Reward Models stützt sich maßgeblich auf die Erfassung von hochwertigem menschlichem Feedback.

  • Data Labeling und Präferenzen: Menschlichen Annotatoren werden Prompts zusammen mit mehreren Antworten vorgelegt, die von einem KI-Modell generiert wurden. Evaluatoren ordnen diese Antworten anhand von Kriterien wie Hilfsbereitschaft, Harmlosigkeit und Genauigkeit von am besten bis am schlechtesten ein. Die Verwaltung dieser groß angelegten Annotations-Workflows lässt sich nahtlos mit der Ultralytics Platform abwickeln.
  • Training des Proxy-Netzwerks: Ein spezialisiertes neuronales Netzwerk wird mit diesem Datensatz menschlicher Vergleiche trainiert. Durch einen Optimierungsprozess lernt es vorherzusagen, welche Ausgabe ein Mensch bevorzugen würde, indem es die embeddings einer Aktion oder Textantwort auf einen einzelnen skalaren Belohnungswert abbildet. Du kannst mehr über den Aufbau neuronaler Netzwerkarchitekturen in der PyTorch API documentation nachlesen.
  • Policy-Optimierung: Das primäre Modell nutzt das kontinuierliche Feedback des Reward Models, um seine Aktionen zu verfeinern, typischerweise unter Verwendung von Algorithmen wie Proximal Policy Optimization (PPO). Dieser Schritt bringt die Policy des Modells iterativ mit der gelernten menschlichen Absicht in Einklang.

Reward Modeling vs. RLHF#

Es ist wichtig, Reward Modeling von Reinforcement Learning from Human Feedback (RLHF) zu unterscheiden. Obwohl die beiden Begriffe häufig zusammen diskutiert werden, sind sie nicht synonym. RLHF ist die umfassende End-to-End-Pipeline zur Ausrichtung von Modellen, die überwachtes Fein-Tuning, Datenerfassung und Policy-Updates umfasst. Reward Modeling ist eine spezifische, entscheidende Komponente innerhalb der RLHF-Pipeline. Es dient als Brücke, die diskrete menschliche Rankings in ein kontinuierliches mathematisches Signal übersetzt, gegen das der Reinforcement-Learning-Algorithmus optimieren kann.

Praxisanwendungen#

Reward Modeling ist maßgeblich an der Entwicklung moderner KI-Systeme beteiligt, die direkt mit Menschen und der physischen Welt interagieren.

  • Large Language Models (LLMs): Konversationelle KI-Assistenten verlassen sich auf Reward Models, um sicherzustellen, dass ihre Antworten nicht nur faktisch korrekt, sondern auch höflich, relevant und frei von toxischer Sprache sind. Organisationen, die AI safety erforschen, treiben das Reward Modeling kontinuierlich voran, um Systeme zu entwickeln, die helpful and harmless AI alignment widerspiegeln.
  • Autonomous Vehicles und Robotik: In der physischen Automatisierung helfen Reward Models Robotern dabei, komplexe Fahrregeln oder Strategien zur Objektmanipulation zu verstehen. Ein von Ultralytics YOLO26 angetriebenes Wahrnehmungssystem erkennt möglicherweise Fußgänger und Verkehrsschilder, während ein Reward Model die geplante Trajektorie des Fahrzeugs bewertet und sicherstellt, dass die KI dem Passagierkomfort und der Sicherheit Vorrang vor rein aggressiver Punkt-zu-Punkt-Navigation einräumt.

Implementierung eines grundlegenden Reward-Model-Konzepts#

Das folgende Python-Beispiel verwendet torch, um die grundlegende Struktur eines Reward Models zu demonstrieren. In der Praxis lernt dieses Netzwerk, einer Ausgabe, die den menschlichen Präferenzen entspricht, einen höheren skalaren Wert zuzuweisen.

import torch
import torch.nn as nn


# Define a simplified reward model architecture
class SimpleRewardModel(nn.Module):
    def __init__(self):
        super().__init__()
        # Maps the AI's output embedding to a single reward score
        self.fc = nn.Linear(768, 1)

    def forward(self, embeddings):
        return self.fc(embeddings)


# Initialize the model
reward_model = SimpleRewardModel()

# Simulated embeddings for a human-preferred action and a rejected action
chosen_action = torch.randn(1, 768)
rejected_action = torch.randn(1, 768)

# The model predicts scalar scores to guide the primary agent
print(f"Chosen Action Reward: {reward_model(chosen_action).item():.4f}")
print(f"Rejected Action Reward: {reward_model(rejected_action).item():.4f}")

Für einen tieferen Einblick in die Auswirkungen von Alignment auf Open-Source-Fundamentmodelle solltest du grundlegende Forschungen zur Ausrichtung von Sprachmodellen an menschlichen Absichten erkunden und erfahren, wie computer vision (CV)-Systeme erweiterte Feedback-Schleifen nutzen, um sicher mit dynamischen Umgebungen zu interagieren.

Explore solutions

Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr

Lass uns gemeinsam die Zukunft der KI bauen!

Beginne deine Reise mit der Zukunft des maschinellen Lernens