Action Chunking
Tìm hiểu cách action chunking cải thiện độ chính xác của robot và học bắt chước. Khám phá cách sử dụng Ultralytics YOLO26 để giảm thiểu sai số tích lũy trong các tác nhân AI.
Action chunking là một kỹ thuật deep learning nâng cao, được sử dụng rất nhiều trong lĩnh vực robot và học bắt chước (imitation learning), trong đó một model dự đoán một chuỗi (hoặc "chunk") các hành động trong tương lai thay vì chỉ một hành động duy nhất ở mỗi bước thời gian. Bằng cách dự báo quỹ đạo nhiều bước, action chunking cho phép các AI agents thực hiện các tác vụ phức tạp, dài hạn với độ mượt mà và độ tin cậy cao hơn. Phương pháp này đã thu hút được sự quan tâm lớn sau khi giới thiệu Action Chunking with Transformers (ACT), một kiến trúc model kết hợp dự báo thời gian với các đầu vào computer vision có chiều cao.
Giảm thiểu sai số tích lũy#
Trong behavioral cloning truyền thống, một model dự đoán bước tiếp theo ngay lập tức dựa trên trạng thái hiện tại. Tuy nhiên, trong quá trình real-time inference, các sai sót dự đoán nhỏ sẽ đẩy hệ thống sang các trạng thái chưa từng quan sát. Những sai lầm này nhân lên nhanh chóng, dẫn đến thất bại tác vụ—một hiện tượng được gọi là lỗi tích lũy (compounding errors).
Action chunking giải quyết trực tiếp hạn chế này. Bằng cách dự đoán nhiều hành động đồng thời (ví dụ: 50 chuyển động khớp bao gồm 1 giây chuyển động), tầm nhìn điều khiển hiệu quả sẽ được thu hẹp. Hệ thống cam kết thực hiện một kế hoạch ngắn hạn mạch lạc dựa trên một quan sát trực quan duy nhất và đáng tin cậy, làm giảm đáng kể tần suất lỗi phản ứng. Khi tích hợp các backbone thị giác như Ultralytics YOLO26 để nhận biết không gian và định vị bounding box, các dự đoán kết quả sẽ trở nên cực kỳ ổn định trước nhiễu quá trình.
Các ứng dụng trong thực tế#
Action chunking đã mở ra những khả năng mới trong tự động hóa vật lý, đặc biệt khi được triển khai trên phần cứng edge AI được tối ưu hóa bởi các framework như Intel Edge:
- Thao tác robot tinh vi (Fine-Grained Robotic Manipulation): Trong tự động hóa công nghiệp, robot sử dụng các dự đoán theo cụm để thực thi các tác vụ giàu tương tác đòi hỏi độ chính xác cao, chẳng hạn như luồn cáp, lắp pin hoặc xử lý các mặt hàng được theo dõi bởi package segmentation datasets. Việc tạo ra các chuỗi hành động mạch lạc giúp ngăn chặn các chuyển động giật cục, thiếu nhất quán vốn là đặc trưng của imitation learning đơn bước.
- Điều hướng tự động (Autonomous Navigation): Trong lái xe tự động và chuyến bay của drone, việc dự báo một khối lệnh điều khiển (như lái và tăng tốc) cho phép lập kế hoạch quỹ đạo mượt mà hơn, một khái niệm được nghiên cứu kỹ lưỡng trong các IEEE robotics papers gần đây. Kết hợp với object tracking và depth estimation liên tục, các phương tiện có thể điều hướng an toàn qua các môi trường động phức tạp.
Phân biệt các khái niệm liên quan#
Để hiểu rõ hơn về cách kỹ thuật này phù hợp với hệ sinh thái artificial intelligence rộng lớn hơn, việc phân biệt nó với các thuật ngữ tương tự sẽ rất hữu ích:
- Action Chunking so với Action Recognition: Trong khi action chunking tạo ra một chuỗi các lệnh trong tương lai để máy móc thực thi, action recognition là quá trình phân tích nhằm xác định các hoạt động diễn ra trong nguồn cấp dữ liệu video.
- Action Chunking so với Sequence-to-Sequence Models: Các kiến trúc sequence-to-sequence ánh xạ chuỗi đầu vào thành chuỗi đầu ra và được sử dụng rộng rãi trong machine translation. Action chunking tận dụng triệt để các kiến trúc này—đặc biệt là Transformers—nhưng giới hạn đầu ra hoàn toàn ở các điều khiển vận tốc và động học mức độ thấp thay vì văn bản.
- Action Chunking so với Reinforcement Learning: Reinforcement learning dựa trên các tín hiệu phần thưởng để huấn luyện tác nhân thông qua thử và sai. Ngược lại, action chunking chủ yếu được triển khai trong supervised behavioral cloning, nơi model học trực tiếp từ các bản demo của con người mà không cần tối đa hóa phần thưởng rõ ràng.
Triển khai Action Chunking#
Trong thực tế, hệ thống thị giác đánh giá môi trường và bộ giải mã chuỗi tạo ra quỹ đạo theo cụm. Đoạn mã Python sau đây minh họa một module PyTorch mang tính khái niệm (một giải pháp thay thế cho TensorFlow) chấp nhận trạng thái môi trường—chẳng hạn như trạng thái bắt nguồn từ lần chạy object detection—và xuất ra một chuỗi các hành động trong tương lai.
import torch
import torch.nn as nn
class ActionChunker(nn.Module):
def __init__(self, state_dim, action_dim, chunk_size):
super().__init__()
# Maps the current state to a sequence of future actions
self.decoder = nn.Linear(state_dim, chunk_size * action_dim)
self.chunk_size = chunk_size
self.action_dim = action_dim
def forward(self, state):
# Predict the entire action chunk at once
chunk = self.decoder(state)
return chunk.view(-1, self.chunk_size, self.action_dim)
# Example: 128-dim state, 6 degrees of freedom, 50-step chunk
model = ActionChunker(state_dim=128, action_dim=6, chunk_size=50)
# Generate a 50-step action trajectory from a single observation
current_state = torch.randn(1, 128)
action_trajectory = model(current_state)
print(f"Action Chunk Shape: {action_trajectory.shape}")Quản lý các tập dữ liệu khổng lồ cần thiết để huấn luyện các chính sách robot này đòi hỏi nhiều nguồn lực. Các công ty dẫn đầu ngành như OpenAI và Anthropic đi đầu trong các model quy mô lớn, nhưng các nhà phát triển thông thường lại dựa vào các công cụ dễ tiếp cận. Ultralytics Platform đơn giản hóa vòng đời dữ liệu cho các đầu vào thị giác, cung cấp khả năng data annotation tự động và model training liền mạch. Khi các model tiến hóa hướng tới các kiến trúc Vision-Language-Action (VLA) thống nhất, việc kết hợp các hệ thống thị giác hiệu quả với action chunking mạnh mẽ sẽ tiếp tục định hình thế hệ tự động hóa thông minh tiếp theo.






