YOLO Vision 2026:
Zurück zum Ultralytics Glossar

Reinforcement Learning

Erforsche die Kernkonzepte des Reinforcement Learning (RL). Lerne, wie Agenten Feedback nutzen, um Aufgaben zu meistern, und sehe, wie Ultralytics YOLO26 RL-Vision-Systeme antreibt.

Reinforcement Learning (RL) ist eine zielorientierte Untergruppe des machine learning (ML), bei der ein autonomes System, das als Agent bekannt ist, lernt, Entscheidungen zu treffen, indem es Aktionen ausführt und Feedback von seiner Umwelt erhält. Im Gegensatz zum supervised learning, das auf statischen Datensätzen mit korrekten Antworten beruht, lernen RL-Algorithmen durch einen dynamischen Prozess von Versuch und Irrtum. Der Agent interagiert mit einer Simulation oder der realen Welt und beobachtet die Konsequenzen seiner Handlungen, um festzustellen, welche Strategien die höchsten langfristigen Belohnungen einbringen. Dieser Ansatz ahmt das psychologische Konzept der operant conditioning genau nach, bei dem das Verhalten im Laufe der Zeit durch positive Verstärkung (Belohnungen) und negative Verstärkung (Bestrafungen) geformt wird.

Kernkonzepte des RL-Zyklus#

Um zu verstehen, wie RL funktioniert, ist es hilfreich, es sich als einen kontinuierlichen Interaktionszyklus vorzustellen. Dieser Rahmen wird oft mathematisch als ein Markov Decision Process (MDP) formalisiert, der die Entscheidungsfindung in Situationen strukturiert, in denen die Ergebnisse teilweise zufällig und teilweise durch den Entscheidungsträger kontrolliert werden.

Die Hauptkomponenten dieses Lernzyklus umfassen:

  • AI Agent: Die Entität, die für das Lernen und Treffen von Entscheidungen verantwortlich ist. Sie nimmt die Umwelt wahr und führt Aktionen aus, um ihren kumulativen Erfolg zu maximieren.
  • Umgebung: Die externe Welt, in der der Agent agiert. Dies könnte ein komplexes Videospiel, eine Simulation des Finanzmarktes oder ein physisches Lagerhaus im Bereich AI in logistics sein.
  • Zustand: Eine Momentaufnahme oder Darstellung der aktuellen Situation. In visuellen Anwendungen beinhaltet dies oft die Verarbeitung von Kamerabildern mithilfe von computer vision (CV), um Objekte und Hindernisse zu erkennen.
  • Aktion: Der spezifische Zug oder die Wahl, die der Agent trifft. Die vollständige Menge aller möglichen Züge wird als action space bezeichnet.
  • Belohnung: Ein numerisches Signal, das nach einer Aktion von der Umwelt an den Agenten gesendet wird. Eine gut gestaltete reward function weist positive Werte für vorteilhafte Aktionen und Strafen für schädliche Aktionen zu.
  • Richtlinie: Die Strategie oder der Regelsatz, den der Agent verwendet, um die nächste Aktion basierend auf dem aktuellen Zustand zu bestimmen. Algorithmen wie Q-learning definieren, wie diese Richtlinie aktualisiert und optimiert wird.

Praxisanwendungen#

Reinforcement Learning hat sich von der theoretischen Forschung hin zu praktischen, wirkungsvollen Implementierungen in verschiedenen Branchen entwickelt.

  • Erweiterte Robotik: Im Bereich AI in robotics ermöglicht RL Maschinen, komplexe motorische Fähigkeiten zu meistern, die schwer zu hartkodieren sind. Roboter können lernen, unregelmäßige Objekte zu greifen oder sich auf unwegsamem Gelände zu bewegen, indem sie in Physik-Engines wie NVIDIA Isaac Sim trainieren, bevor sie in der realen Welt eingesetzt werden.
  • Autonome Systeme: Autonomous vehicles nutzen RL, um Echtzeitentscheidungen in unvorhersehbaren Verkehrsszenarien zu treffen. Während object detection-Modelle Fußgänger und Schilder identifizieren, helfen RL-Algorithmen dabei, sichere Fahrrichtlinien für Spurwechsel und Kreuzungsnavigation zu bestimmen.
  • Strategische Optimierung: RL erlangte weltweite Aufmerksamkeit, als Systeme wie Google DeepMind's AlphaGo menschliche Weltmeister in komplexen Brettspielen besiegten. Über das Gaming hinaus optimieren diese Agenten die industrielle Logistik, wie beispielsweise die Steuerung von Kühlsystemen in Rechenzentren, um den Energieverbrauch zu senken.

Integration von Vision mit RL#

In vielen modernen Anwendungen ist der „Zustand“, den ein Agent beobachtet, visuell. Leistungsstarke Modelle wie YOLO26 fungieren als Wahrnehmungsschicht für RL-Agenten und wandeln Rohbilder in strukturierte Daten um. Diese verarbeiteten Informationen – wie der Ort und die Klasse von Objekten – werden zu dem Zustand, den die RL-Richtlinie verwendet, um eine Aktion auszuwählen.

Das folgende Beispiel zeigt, wie man das Paket ultralytics verwendet, um einen Umgebungs-Frame zu verarbeiten und eine Zustandsdarstellung (z. B. Anzahl der Objekte) für eine theoretische RL-Schleife zu erstellen.

from ultralytics import YOLO

# Load the YOLO26 model to serve as the agent's vision system
model = YOLO("yolo26n.pt")

# Simulate the agent observing the environment (an image frame)
observation_frame = "https://ultralytics.com/images/bus.jpg"

# Process the frame to extract the current 'state'
results = model(observation_frame)

# The agent uses detection data to inform its next action
# For example, an autonomous delivery robot might stop if it sees people
num_objects = len(results[0].boxes)
print(f"Agent Observation: {num_objects} objects detected. Calculating next move...")

Unterscheidung verwandter Begriffe#

Es ist wichtig, Reinforcement Learning von anderen Machine-Learning-Paradigmen zu unterscheiden:

  • vs. Supervised Learning: Supervised Learning erfordert einen sachkundigen externen Vorgesetzten, der beschriftete Trainingsdaten bereitstellt (z. B. „dieses Bild enthält eine Katze“). Im Gegensatz dazu lernt RL aus den Konsequenzen seiner eigenen Handlungen ohne explizite Beschriftungen und entdeckt durch Exploration optimale Pfade.
  • vs. Unsupervised Learning: Unsupervised Learning konzentriert sich darauf, verborgene Strukturen oder Muster in unbeschrifteten Daten zu finden (wie das Clustern von Kunden). RL unterscheidet sich dadurch, dass es explizit zielorientiert ist und sich darauf konzentriert, ein Belohnungssignal zu maximieren, anstatt nur die Datenstruktur zu beschreiben.

Mit zunehmender Rechenleistung verfeinern Techniken wie Reinforcement Learning from Human Feedback (RLHF) weiter, wie Agenten lernen, und stimmen ihre Ziele besser auf komplexe menschliche Werte und Sicherheitsstandards ab. Forscher verwenden häufig standardisierte Umgebungen wie Gymnasium, um diese Algorithmen zu bewerten und zu verbessern. Für Teams, die die für die Wahrnehmungsschichten dieser Agenten erforderlichen Datensätze verwalten möchten, bietet die Ultralytics Platform umfassende Tools zur Annotation und Modellverwaltung.

Explore solutions

Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr

Lass uns gemeinsam die Zukunft der KI bauen!

Beginne deine Reise mit der Zukunft des maschinellen Lernens