Action Chunking
Eylem parçalamanın robotik hassasiyetini ve taklit öğrenimini nasıl geliştirdiğini öğren. Yapay zekâ aracıları için birikimli hataları azaltmak üzere Ultralytics YOLO26'yı nasıl kullanacağını keşfet.
Eylem parçalama, robotik ve taklit öğreniminde yoğun olarak kullanılan, bir modelin her zaman adımında tek bir eylem yerine gelecekteki eylemlerden oluşan bir diziyi (veya "parçayı") tahmin ettiği gelişmiş bir derin öğrenme tekniğidir. Çok adımlı bir yörüngeyi öngören eylem parçalama, AI aracılarına karmaşık ve uzun ufuklu görevleri daha akıcı ve güvenilir bir şekilde gerçekleştirme olanağı sağlar. Bu yaklaşım, zamansal öngörüyü yüksek boyutlu bilgisayarlı görü girdileriyle birleştiren bir model mimarisi olan Transformers ile Eylem Parçalama (ACT) yaklaşımının kullanıma sunulmasının ardından büyük ilgi görmüştür.
Birikimli Hataları Azaltma#
Geleneksel davranış klonlamada model, mevcut duruma göre bir sonraki anlık adımı tahmin eder. Ancak gerçek zamanlı çıkarım sırasında, tahminlerdeki küçük hatalar sistemi gözlemlenmemiş durumlara kaydırır. Bu hatalar hızla çoğalarak görevin başarısız olmasına yol açar; bu olgu birikimli hatalar olarak bilinir.
Eylem parçalama bu sınırlamayı doğrudan ele alır. Birden fazla eylemi eşzamanlı olarak tahmin ederek (örneğin, 1 saniyelik hareketi kapsayan 50 eklem hareketi), etkin kontrol ufku azaltılır. Sistem, tek ve güvenilir bir görsel gözleme dayalı tutarlı bir kısa vadeli plana bağlanır ve tepkisel hataların sıklığını büyük ölçüde azaltır. Uzamsal farkındalık ve sınırlayıcı kutu konumlandırması için Ultralytics YOLO26 gibi görsel omurgalar entegre edildiğinde, ortaya çıkan tahminler işlem gürültüsüne karşı son derece kararlı hâle gelir.
Gerçek Dünya Uygulamaları#
Eylem parçalama, özellikle Intel Edge gibi çerçevelerle optimize edilmiş uç AI donanımlarında kullanıldığında, fiziksel otomasyonda yeni yeteneklerin önünü açmıştır:
- İnce Ayrıntılı Robotik Manipülasyon: Endüstriyel otomasyonda robotlar; kablo geçirme, pilleri yuvalarına yerleştirme veya paket segmentasyonu veri kümeleri tarafından izlenen nesneleri taşıma gibi yüksek hassasiyet gerektiren ve temasın yoğun olduğu görevleri gerçekleştirmek için parçalı tahminleri kullanır. Tutarlı eylem dizileri oluşturmak, tek adımlı taklit öğreniminin tipik kesik ve tutarsız hareketlerini önler.
- Otonom Navigasyon: Otonom sürüşte ve drone uçuşunda, bir kontrol komutları bloğunu (direksiyon ve ivmelenme gibi) öngörmek daha akıcı yörünge planlamasına olanak tanır; bu kavram son dönemdeki IEEE robotik makalelerinde kapsamlı biçimde incelenmiştir. Sürekli nesne takibi ve derinlik tahmini ile birleştirildiğinde araçlar, karmaşık ve dinamik ortamlarda güvenli şekilde ilerleyebilir.
İlişkili Kavramları Ayırt Etme#
Bu tekniğin daha geniş yapay zekâ ekosistemine nasıl uyduğunu daha iyi anlamak için onu benzer terimlerden ayırmak faydalıdır:
- Eylem Parçalama ve Eylem Tanıma Karşılaştırması: Eylem parçalama bir makinenin gerçekleştirmesi için gelecekteki komutlardan oluşan bir diziyi üretirken, eylem tanıma bir video akışında gerçekleşen etkinlikleri belirleme sürecidir.
- Eylem Parçalama ve Diziden Diziye Modeller Karşılaştırması: Diziden diziye mimariler bir girdi dizisini bir çıktı dizisine eşler ve makine çevirisinde yaygın olarak kullanılır. Eylem parçalama bu mimarilerden, özellikle Transformer'lar olmak üzere, yoğun şekilde yararlanır; ancak çıktıyı metin yerine yalnızca düşük seviyeli motor kontrolleri ve kinematikle sınırlar.
- Eylem Parçalama ve Pekiştirmeli Öğrenme Karşılaştırması: Pekiştirmeli öğrenme, bir aracıyı deneme yanılma yoluyla eğitmek için ödül sinyallerine dayanır. Buna karşılık eylem parçalama, öncelikli olarak modelin açık bir ödül maksimizasyonu olmadan doğrudan insan gösterimlerinden öğrendiği denetimli davranış klonlamada kullanılır.
Eylem Parçalamayı Uygulama#
Uygulamada bir görsel sistem ortamı değerlendirir ve bir dizi kod çözücü parçalı yörüngeyi üretir. Aşağıdaki Python kod parçacığı, bir ortam durumunu (örneğin bir nesne algılama işleminden elde edileni) kabul edip gelecekteki eylemlerden oluşan bir dizi çıkaran kavramsal bir PyTorch modülünü (TensorFlow alternatifini) gösterir.
import torch
import torch.nn as nn
class ActionChunker(nn.Module):
def __init__(self, state_dim, action_dim, chunk_size):
super().__init__()
# Maps the current state to a sequence of future actions
self.decoder = nn.Linear(state_dim, chunk_size * action_dim)
self.chunk_size = chunk_size
self.action_dim = action_dim
def forward(self, state):
# Predict the entire action chunk at once
chunk = self.decoder(state)
return chunk.view(-1, self.chunk_size, self.action_dim)
# Example: 128-dim state, 6 degrees of freedom, 50-step chunk
model = ActionChunker(state_dim=128, action_dim=6, chunk_size=50)
# Generate a 50-step action trajectory from a single observation
current_state = torch.randn(1, 128)
action_trajectory = model(current_state)
print(f"Action Chunk Shape: {action_trajectory.shape}")Bu robotik politikaları eğitmek için gereken devasa veri kümelerini yönetmek kaynak yoğun bir süreçtir. OpenAI ve Anthropic gibi sektör liderleri büyük ölçekli modellere öncülük ederken günlük geliştiriciler erişilebilir araçlara güvenir. Ultralytics Platformu, görsel girdiler için veri yaşam döngüsünü kolaylaştırarak otomatik veri etiketleme ve sorunsuz model eğitimi olanakları sunar. Modeller birleşik Görsel-Dil-Eylem (VLA) mimarilerine doğru evrilirken, verimli görsel sistemlerin güçlü eylem parçalamayla birleştirilmesi akıllı otomasyonun yeni neslini tanımlamayı sürdürecektir.









