Diffusion Policies
Diffusion Policies'in modern robotik dünyasını nasıl şekillendirdiğini keşfet. Eylemleri gürültü giderme (denoising) yoluyla nasıl modellediklerini ve akıllı algılama için Ultralytics YOLO26 ile nasıl entegre olduklarını öğren.
Diffusion Policies, robotik ve makine öğrenimi alanında, bir AI agent bileşeninin görsel-motor politikasının koşullu bir gürültü giderme difüzyon süreci olarak modellendiği bir paradigma değişimini temsil eder. Geleneksel olarak, bir taklit öğrenimi biçimi olan davranış klonlaması, duyusal girdiden tek bir deterministik eylemi tahmin etmek için doğrudan regresyona dayanır. Basit görevler için işlevsel olsa da, birden fazla geçerli eylem mevcut olduğunda doğrudan regresyon genellikle başarısız olur ve kararsız veya güvenli olmayan ortalama hareketlere yol açar. Diffusion policies, eylem oluşturmayı bir dizi iyileştirme görevi olarak ele alarak bunu çözer. Saf rastgele gürültüden başlayarak algoritma, görüntüler veya uzamsal durum verileri gibi duyusal gözlemlere dayanarak sinyali yinelemeli olarak temizler ve son derece doğru, sağlam ve çok modlu eylem dizileri üretir.
Difüzyon Politikaları Nasıl Çalışır#
Üretken modelleme alanında bulunan matematiğe dayanan temel mekanikler, orijinal görsel-motor difüzyon politikası makalesinde yüksek kaliteli görüntü sentezi için orijinal olarak geliştirilen teknikleri uyarlar. İleri süreç olarak bilinen eğitim aşamasında, optimum uzman eylem yörüngelerine kademeli olarak küçük miktarlarda gürültü eklenir. Daha sonra bir sinir ağı, belirli bir gözlem bağlamına dayanarak bu gürültüyü tahmin etmek ve tersine çevirmek için eğitilir.
Çıkarım sırasında, robot ortamıyla etkileşime girdiğinde çevresini gözlemler, rastgele bir eylem dizisi başlatır ve stokastik Langevin dinamikleri kullanarak bu dizinin gürültüsünü giderir. Bu yinelemeli optimizasyon, karmaşık ve yüksek boyutlu eylem uzaylarını ele alabilen ince taneli, pürüzsüz motor komutları üretir.
Gerçek Dünya Uygulamaları#
Mod çökmesi olmadan karmaşık dağılımları doğru bir şekilde temsil eden diffusion policies, modern fiziksel yapay zekayı aktif olarak yeniden şekillendiriyor.
- Robotik Manipülasyon: Endüstriyel ortamlarda robotik kolları; düzensiz şekilli nesneleri kavrama, karmaşık elektronikleri monte etme veya akışkan dökme hareketleri gerçekleştirme gibi maharetli ve temas yoğun görevler için bu politikaları kullanır.
- Otonom Navigasyon: Otonom sürüş sistemleri ve dronlar, standart pekiştirmeli öğrenme modellerini yanıltabilecek ani engellere zarif bir şekilde uyum sağlayarak dinamik ortamlarda güvenli ve sürekli yörüngeler planlamak için derinlik tahmini ile diffusion policies'i birleştirir.
Temel Terimleri Ayırt Etme#
Difüzyon politikalarının özel işlevini netleştirmek için, onları yakından ilişkili üretken mimarilerden ayırmak yararlıdır:
- Diffusion Policies ve Diffusion Models Karşılaştırması: Diffusion Models, metinden görüntüye sentez gibi statik veriler oluşturmak için kullanılan temel üretken mimariyi genel olarak ifade eder. Diffusion Policies ise aktif robotlar için sürekli zaman serisi motor komutlarını tahmin etmek üzere bu özel mekanizmayı uygular.
- Diffusion Policies ve Diffusion Forcing Karşılaştırması: Diffusion Forcing, token başına değişen gürültü seviyelerini kullanarak nedensel transformer'ları eğiten genel bir dizi oluşturma çerçevesidir. İlişkili olmakla birlikte, diffusion forcing ağırlıklı olarak otoregresif tahmine odaklanırken, diffusion policies kesinlikle görsel-motor kontrol için taklit öğrenme stratejisini belirtir.
Politika Öğreniminde Son Gelişmeler#
OpenAI araştırma girişimleri ve Google DeepMind robotics dahil olmak üzere üst düzey kurumların araştırmaları, bu algoritmaların neleri başarabileceğinin sınırlarını zorlamaya devam ediyor. Özellikle, 2024 yılında arXiv'de yayınlanan 3D Diffusion Policy (DP3), basit 2D görüntüler yerine kompakt 3D nokta bulutu gösterimlerine politikalar uygulayarak bir çığır açtı. Bu durum, dramatik ölçüde daha az uzman gösterimi gerektirirken robotların uzamsal farkındalığını önemli ölçüde artırdı. D3P: Dynamic Denoising Diffusion Policy gibi diğer yenilikler, rutin eylemler için gürültü giderme adımlarını dinamik olarak atlayarak standart difüzyonun yavaş çıkarım hızını ele almaya başlamış ve gerçek zamanlı yanıt verme yeteneğinin kilidini açmıştır.
Bilgisayarlı Görü ile Pratik Uygulama#
Bir diffusion policy bir eylem üretebilmeden önce, çevresinin açık ve yapılandırılmış bir anlayışına ihtiyaç duyar. Mühendisler, eksiksiz bir bilgisayarlı görü boru hattı oluşturmak için genellikle güçlü nesne tespiti modellerini politika algoritmalarıyla birleştirir. Örneğin, Ultralytics YOLO26 gibi hızlı bir algısal model, hedef nesneleri gerçek zamanlı olarak izole edebilir ve uzamsal koordinatları PyTorch kütüphanesini temel alan bir diffusion policy'ye besleyebilir.
import torch
from ultralytics import YOLO
# Load the Ultralytics YOLO26 Nano model for high-speed robotic perception
model = YOLO("yolo26n.pt")
# Predict bounding boxes on the robot's active camera feed
results = model.predict("robot_camera_feed.jpg")
# Condition the policy by extracting the bounding box center coordinate
if len(results[0].boxes) > 0:
box = results[0].boxes[0].xyxy.squeeze()
center_x = (box[0] + box[2]) / 2.0
center_y = (box[1] + box[3]) / 2.0
# Create a spatial observation tensor to condition the PyTorch Diffusion Policy.
# This directly guides the denoising process to generate accurate motor actions.
observation_state = torch.tensor([center_x, center_y])
print(f"Conditioning action trajectory on object center: {observation_state}")Bu iş akışını kolaylaştırmak için geliştiriciler, özelleştirilmiş veri kümeleri için hızlı otomatik etiketleme araçlarından yararlanmak üzere Ultralytics Platform kullanabilir. Bu uçtan uca destek, model dağıtımını ham kamera akışlarından eyleme dönüştürülebilir robotik zekaya doğru hızlandırır.






