Deep Reinforcement Learning
Entdecke Deep Reinforcement Learning (DRL) und wie es AI-Entscheidungsfindung mit Deep Learning verbindet. Lerne, Ultralytics YOLO26 heute als Wahrnehmungsschicht einzusetzen.
Tiefes bestärkendes Lernen (DRL) ist ein fortgeschrittener Teilbereich der künstlichen Intelligenz (AI), der die Entscheidungsfähigkeiten des bestärkenden Lernens mit der Wahrnehmungsleistung des tiefen Lernens (DL) verbindet. Während herkömmliches bestärkendes Lernen auf Tabellenmethoden zurückgreift, um Situationen Aktionen zuzuordnen, stoßen diese Methoden an ihre Grenzen, wenn die Umgebung komplex oder visuell ist. DRL überwindet dieses Problem mithilfe von neuronalen Netzen, die hochdimensionale Eingangsdaten wie Videobilder oder Sensormesswerte interpretieren. Dadurch können Maschinen direkt aus unverfälschten Erfahrungen effektive Strategien erlernen, ohne ausdrücklich von Menschen angeleitet zu werden.
Der grundlegende Mechanismus von DRL#
In einem DRL-System interagiert ein AI-Agent in diskreten Zeitschritten mit einer Umgebung. Bei jedem Schritt beobachtet der Agent den aktuellen „Zustand“, wählt anhand einer Policy eine Aktion aus und erhält ein Belohnungssignal, das den Erfolg oder Misserfolg dieser Aktion anzeigt. Das Hauptziel besteht darin, die kumulative Belohnung im Laufe der Zeit zu maximieren.
Die Komponente „deep“ bezeichnet den Einsatz tiefer neuronaler Netze zur Approximation der Policy, also der Handlungsstrategie, oder der Wertfunktion, also der geschätzten zukünftigen Belohnung. Dadurch kann der Agent unstrukturierte Daten verarbeiten und mithilfe des maschinellen Sehens (CV) die Umgebung ähnlich wie ein Mensch „sehen“. Diese Fähigkeit wird durch Frameworks wie PyTorch oder TensorFlow ermöglicht, die das Training dieser komplexen Netze erleichtern.
Anwendungen in der Praxis#
DRL hat sich von der theoretischen Forschung zu praxisnahen Anwendungen mit großer Wirkung in verschiedenen Branchen entwickelt:
- Fortgeschrittene Robotik: Im Bereich AI in der Robotik ermöglicht DRL Maschinen, komplexe motorische Fähigkeiten zu erlernen, die sich nur schwer fest programmieren lassen. Roboter können lernen, unregelmäßig geformte Objekte zu greifen oder unebenes Gelände zu durchqueren, indem sie ihre Bewegungen in Physik-Engines wie NVIDIA Isaac Sim verfeinern. Häufig werden sie zunächst mit synthetischen Daten trainiert, bevor die Policy auf physischer Hardware eingesetzt wird.
- Autonomes Fahren: Autonome Fahrzeuge nutzen DRL, um in unvorhersehbaren Verkehrssituationen Entscheidungen in Echtzeit zu treffen. Während Modelle zur Objekterkennung Fußgänger und Verkehrsschilder identifizieren, verwenden DRL-Algorithmen diese Informationen, um sichere Fahrstrategien für das Einfädeln, das Navigieren durch Kreuzungen und die Geschwindigkeitsregelung zu bestimmen und so die für die Sicherheit erforderliche Inferenzlatenz effektiv zu berücksichtigen.
Visuelle Wahrnehmung als Zustandsbeobachter#
Bei vielen DRL-Anwendungen ist der „Zustand“ visueller Natur. Hochgeschwindigkeitsmodelle fungieren als Augen des Agenten und wandeln unverarbeitete Bilder in strukturierte Daten um, die das Policy-Netz verarbeiten kann. Das folgende Beispiel zeigt, wie das Modell YOLO26 als Wahrnehmungsschicht eines Agenten dient und Beobachtungen, etwa die Anzahl von Hindernissen, aus der Umgebung extrahiert.
from ultralytics import YOLO
# Load YOLO26n to serve as the perception layer for a DRL agent
model = YOLO("yolo26n.pt")
# Simulate an observation from the environment (e.g., a robot's camera feed)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Perform inference to extract the state (detected objects)
results = model(observation_frame)
# The detection count serves as a simplified state feature for the agent's policy
print(f"State Observation: {len(results[0].boxes)} objects detected.")Abgrenzung von DRL gegenüber verwandten Konzepten#
Um die besondere Stellung des tiefen bestärkenden Lernens in der AI-Landschaft zu verstehen, ist es hilfreich, es von ähnlichen Begriffen abzugrenzen:
- Bestärkendes Lernen (RL): Standard-RL ist das grundlegende Konzept, greift jedoch typischerweise auf Nachschlagetabellen wie Q-Tabellen zurück, die bei großen Zustandsräumen unpraktisch werden. DRL löst dieses Problem, indem es Funktionen mithilfe tiefen Lernens approximiert und dadurch komplexe Eingaben wie Bilder verarbeiten kann.
- Bestärkendes Lernen aus menschlichem Feedback (RLHF): Während DRL typischerweise eine mathematisch definierte Belohnungsfunktion optimiert, etwa Punkte in einem Spiel, verfeinert RLHF Modelle – insbesondere große Sprachmodelle (LLMs) – mithilfe subjektiver menschlicher Präferenzen. So wird das Verhalten von AI an menschliche Werte angepasst. Diese Technik wurde durch Forschungsgruppen wie OpenAI bekannt.
- Unüberwachtes Lernen: Unüberwachte Methoden suchen ohne explizites Feedback nach verborgenen Mustern in Daten. Im Gegensatz dazu ist DRL zielorientiert und wird durch ein Belohnungssignal gesteuert, das den Agenten aktiv zu einem bestimmten Ziel führt, wie in grundlegenden Werken von Sutton und Barto beschrieben.
Entwickler, die die für die Wahrnehmungsschichten von DRL-Systemen benötigten Datensätze verwalten möchten, können die Ultralytics Platform nutzen, die Workflows für Annotationen und Cloud-Training vereinfacht. Außerdem verwenden Forschende häufig standardisierte Umgebungen wie Gymnasium, um ihre DRL-Algorithmen anhand etablierter Referenzwerte zu benchmarken.









