YOLO Vision 2026:
Zurück zum Ultralytics Glossar

Diffusion Policies

Erfahre, wie Diffusion Policies die moderne Robotik prägen. Lerne, wie sie Aktionen durch Denoising modellieren und sich für intelligente Wahrnehmung in Ultralytics YOLO26 integrieren lassen.

Diffusion Policies stellen einen Paradigmenwechsel in der Robotics und dem Machine Learning dar, bei dem die visuomotorische Richtlinie eines AI agent als bedingter Rauschentfernungsprozess (Denoising Diffusion Process) modelliert wird. Traditionell setzt Behavior Cloning – eine Form des Imitation Learning – auf direkte Regression, um eine einzelne deterministische Aktion aus sensorischen Eingaben vorherzusagen. Zwar funktioniert dies bei einfachen Aufgaben, jedoch versagt die direkte Regression oft, wenn mehrere gültige Aktionen existieren, was zu instabilen oder unsicheren gemittelten Bewegungen führt. Diffusion Policies lösen dieses Problem, indem sie die Aktionsgenerierung als Sequenzverfeinerungsaufgabe formulieren. Ausgehend von reinem Rauschen verfeinert der Algorithmus das Signal iterativ – bedingt durch sensorische Beobachtungen wie Bilder oder räumliche Zustandsdaten –, um hochpräzise, robuste und multimodale Aktionssequenzen zu erzeugen.

Wie Diffusion Policies funktionieren#

Die Kernmechanik basiert auf der Mathematik des Generative Modeling und adaptiert Techniken, die ursprünglich für die hochpräzise Synthese von Bildern in der Originalvisuomotorik-Diffusion-Policy-Arbeit entwickelt wurden. Während der Trainingsphase, dem sogenannten Vorwärtsprozess, wird optimalen Experten-Aktionstragjekten schrittweise eine kleine Menge Rauschen hinzugefügt. Ein Neural Network wird daraufhin trainiert, dieses Rauschen basierend auf einem bestimmten Beobachtungskontext vorherzusagen und umzukehren.

Während der Inferenz, wenn der Roboter mit seiner Umgebung interagiert, beobachtet er seine Umgebung, initialisiert eine zufällige Aktionssequenz und entrauscht diese mithilfe der stochastischen Langevin-Dynamik. Diese iterative Optimierung liefert feinkörnige, glatte Motorbefehle, die komplexe, hochdimensionale Aktionsräume bewältigen können.

Praxisanwendungen#

Indem sie komplexe Verteilungen ohne Mode Collapse präzise darstellen, gestalten Diffusion Policies die moderne physische Artificial Intelligence aktiv neu.

  • Robotic Manipulation: In industriellen Umgebungen nutzen Roboterarme diese Richtlinien für geschickte, kontaktintensive Aufgaben wie das Greifen unregelmäßig geformter Objekte, das Zusammenbauen komplizierter Elektronik oder die Ausführung flüssiger Gießbewegungen.
  • Autonomous Navigation: Autonome Fahrsysteme und Drohnen kombinieren Depth Estimation mit Diffusion Policies, um sichere, kontinuierliche Trajektorien durch dynamische Umgebungen zu planen und sich elegant an plötzliche Hindernisse anzupassen, die Standardmodelle des Reinforcement Learning sonst verwirren würden.

Unterscheidung der wichtigsten Begriffe#

Um die spezifische Funktion von Diffusion Policies zu verdeutlichen, ist es hilfreich, sie von eng verwandten generativen Architekturen zu unterscheiden:

  • Diffusion Policies vs. Diffusion Models: Diffusion Models beziehen sich im weiten Sinne auf die zugrunde liegende generative Architektur zur Erstellung statischer Daten wie der Text-zu-Bild-Synthese. Diffusion Policies wenden diesen spezifischen Mechanismus an, um kontinuierliche Zeitreihen-Motorbefehle für aktive Roboter vorherzusagen.
  • Diffusion Policies vs. Diffusion Forcing: Diffusion Forcing ist ein allgemeines Sequenzgenerierungs-Framework, das Causal Transformers mit unterschiedlichen Rauschpegeln pro Token trainiert. Obwohl verwandt, konzentriert sich Diffusion Forcing stark auf die autoregressive Vorhersage, während Diffusion Policies streng die Strategie des Imitationslernens für die visuomotorische Steuerung bezeichnen.

Aktuelle Fortschritte beim Policy Learning#

Forschungen führender Institutionen, darunter OpenAI-Forschungsinitiativen und Google DeepMind Robotics, treiben die Grenzen dessen, was diese Algorithmen leisten können, kontinuierlich voran. Insbesondere 3D Diffusion Policy (DP3), veröffentlicht auf arXiv im Jahr 2024, brachte einen Durchbruch, indem Richtlinien auf kompakte 3D-Punktwolken-Repräsentationen statt auf einfache 2D-Bilder gestützt wurden. Dies verbesserte das räumliche Bewusstsein von Robotern erheblich und erforderte gleichzeitig drastisch weniger Expertendemonstrationen. Weitere Innovationen wie D3P: Dynamic Denoising Diffusion Policy haben begonnen, die langsame Inferenzgeschwindigkeit der Standarddiffusion zu beheben, indem sie Entrauschungsschritte für Routineaktionen dynamisch überspringen und so Echtzeit-Reaktionsfähigkeit ermöglichen.

Praktische Implementierung mit Computer Vision#

Bevor eine Diffusionsrichtlinie eine Aktion generieren kann, benötigt sie ein klares, strukturiertes Verständnis ihrer Umgebung. Ingenieure kombinieren häufig robuste object detection-Modelle mit Richtlinienalgorithmen, um eine vollständige computer vision pipeline zu bilden. Beispielsweise kann ein schnelles Wahrnehmungsmodell wie Ultralytics YOLO26 Zielobjekte in Echtzeit isolieren und räumliche Koordinaten in eine auf der PyTorch library basierende Diffusionsrichtlinie einspeisen.

import torch
from ultralytics import YOLO

# Load the Ultralytics YOLO26 Nano model for high-speed robotic perception
model = YOLO("yolo26n.pt")

# Predict bounding boxes on the robot's active camera feed
results = model.predict("robot_camera_feed.jpg")

# Condition the policy by extracting the bounding box center coordinate
if len(results[0].boxes) > 0:
    box = results[0].boxes[0].xyxy.squeeze()
    center_x = (box[0] + box[2]) / 2.0
    center_y = (box[1] + box[3]) / 2.0

    # Create a spatial observation tensor to condition the PyTorch Diffusion Policy.
    # This directly guides the denoising process to generate accurate motor actions.
    observation_state = torch.tensor([center_x, center_y])
    print(f"Conditioning action trajectory on object center: {observation_state}")

Um diesen Workflow zu optimieren, können Entwickler die Ultralytics Platform nutzen, um schnelle auto-annotation tools für benutzerdefinierte Datensätze einzusetzen. Diese End-to-End-Unterstützung beschleunigt die model deployment von rohen Kameradaten zu verwertbarer Robotik-Intelligenz.

Explore solutions

Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr

Lass uns gemeinsam die Zukunft der KI bauen!

Beginne deine Reise mit der Zukunft des maschinellen Lernens