Action Chunking
Eylem gruplamanın (action chunking) robotik hassasiyeti ve taklit öğrenimini nasıl iyileştirdiğini öğren. Yapay zeka ajanlarında biriken hataları azaltmak için Ultralytics YOLO26'yı nasıl kullanacağını keşfet.
Action chunking (eylem gruplama), robotikte ve taklit öğrenmesinde yoğun olarak kullanılan gelişmiş bir deep learning tekniğidir; bu teknikle bir model, her zaman adımında tek bir eylem yerine gelecekteki eylemlerin bir dizisini (veya "yığınını") tahmin eder. Çok adımlı bir yörünge öngören action chunking, AI agents bileşenlerinin karmaşık, uzun vadeli görevleri daha yüksek akıcılık ve güvenilirlikle gerçekleştirmesini sağlar. Bu yaklaşım, zamansal öngörüyü yüksek boyutlu computer vision girdileriyle birleştiren bir model mimarisi olan Action Chunking with Transformers (ACT) tanıtıldıktan sonra büyük bir ivme kazanmıştır.
Bileşik Hataların Azaltılması#
Geleneksel davranışsal klonlamada bir model, mevcut duruma dayanarak bir sonraki anlık adımı tahmin eder. Ancak real-time inference sırasında ufak tahmin hataları, sistemi gözlemlenmemiş durumlara sürükler. Bileşik hatalar olarak bilinen bu olgu nedeniyle bu hatalar hızla katlanarak görevin başarısız olmasına yol açar.
Action chunking bu sınırlamayı doğrudan ele alır. Aynı anda birden fazla eylemi tahmin ederek (örneğin, 1 saniyelik hareketi kapsayan 50 eklem hareketi), etkili kontrol ufku daraltılır. Sistem, tek bir güvenilir görsel gözleme dayalı tutarlı bir kısa vadeli plana bağlı kalarak reaktif hata sıklığını büyük ölçüde azaltır. Uzamsal farkındalık ve bounding box yerelleştirmesi için Ultralytics YOLO26 gibi görüş omurgaları entegre edildiğinde, elde edilen tahminler süreç gürültüsüne karşı inanılmaz derecede kararlı hale gelir.
Gerçek Dünya Uygulamaları#
Action chunking, özellikle Intel Edge gibi çerçeveler tarafından optimize edilmiş edge AI donanımında dağıtıldığında fiziksel otomasyonda yeni yeteneklerin kilidini açmıştır:
- Ince Taneli Robotik Manipülasyon: Endüstriyel otomasyonda robotlar; kablo geçirme, pil yuvasına takma veya package segmentation datasets tarafından izlenen öğeleri taşıma gibi yüksek hassasiyet gerektiren temasa dayalı görevleri yürütmek için gruplandırılmış tahminler kullanır. Tutarlı eylem dizileri üretmek, tek adımlı imitation learning süreçlerinde tipik olarak görülen sarsıntılı ve tutarsız hareketleri önler.
- Otonom Navigasyon: Otonom sürüş ve drone uçuşlarında, bir kontrol komutu bloğunu (direksiyon ve ivmelenme gibi) öngörmek, son IEEE robotics papers yayınlarında yoğun bir şekilde incelenen bir kavram olan daha akıcı yörünge planlamasına olanak tanır. Sürekli object tracking ve depth estimation ile birleştirilen araçlar, karmaşık dinamik ortamlarda güvenli bir şekilde gezinebilir.
İlgili Kavramları Ayırt Etme#
Bu tekniğin daha geniş artificial intelligence ekosistemine nasıl uyduğunu daha iyi anlamak için onu benzer terimlerden ayırmak faydalıdır:
- Action Chunking ve Eylem Tanıma: Action chunking, bir makinenin yürütmesi için gelecekteki komutların bir dizisini oluştururken, action recognition bir video akışı içinde gerçekleşen etkinlikleri tanımlama analitik sürecidir.
- Action Chunking ve Sıradan Sıraya Modeller: Sıradan sıraya (sequence-to-sequence) mimariler, bir girdi dizisini bir çıktı dizisiyle eşleştirir ve machine translation alanında yaygın olarak kullanılır. Action chunking bu mimarileri —özellikle de Transformers bileşenlerini— yoğun bir şekilde kullanır, ancak çıktıyı metin yerine tamamen düşük seviyeli motor kontrolleri ve kinematiği ile sınırlandırır.
- Action Chunking ve Pekiştirmeli Öğrenme: Reinforcement learning, bir ajana deneme yanılma yoluyla öğretmek için ödül sinyallerine dayanır. Buna karşılık action chunking, modelin açık bir ödül maksimizasyonu olmaksızın doğrudan insan gösterimlerinden öğrendiği denetimli davranışsal klonlamada birincil olarak dağıtılır.
Eylem Gruplamayı Uygulama#
Uygulamada bir vizyon sistemi ortamı değerlendirir ve bir dizi kod çözücü gruplandırılmış yörüngeyi üretir. Aşağıdaki Python kod parçacığı; bir object detection adımından türetilenler gibi bir ortam durumunu kabul eden ve gelecekteki eylemlerin bir dizisini çıktı veren kavramsal bir PyTorch modülünü (TensorFlow alternatifi olarak) gösterir.
import torch
import torch.nn as nn
class ActionChunker(nn.Module):
def __init__(self, state_dim, action_dim, chunk_size):
super().__init__()
# Maps the current state to a sequence of future actions
self.decoder = nn.Linear(state_dim, chunk_size * action_dim)
self.chunk_size = chunk_size
self.action_dim = action_dim
def forward(self, state):
# Predict the entire action chunk at once
chunk = self.decoder(state)
return chunk.view(-1, self.chunk_size, self.action_dim)
# Example: 128-dim state, 6 degrees of freedom, 50-step chunk
model = ActionChunker(state_dim=128, action_dim=6, chunk_size=50)
# Generate a 50-step action trajectory from a single observation
current_state = torch.randn(1, 128)
action_trajectory = model(current_state)
print(f"Action Chunk Shape: {action_trajectory.shape}")Bu robotik politikaları eğitmek için gereken devasa veri setlerini yönetmek kaynak yoğun bir iştir. OpenAI ve Anthropic gibi sektör liderleri büyük ölçekli modellere öncülük eder, ancak sıradan geliştiriciler erişilebilir araçlara güvenir. Ultralytics Platform, görsel girdiler için veri yaşam döngüsünü kolaylaştırarak otomatik data annotation ve kesintisiz model training yetenekleri sunar. Modeller birleşik Vizyon-Dil-Eylem (VLA) mimarilerine doğru evrildikçe, verimli vizyon sistemlerini sağlam action chunking ile birleştirmek akıllı otomasyonun yeni neslini tanımlamaya devam edecektir.






