Action Chunking
Tìm hiểu cách chia nhỏ hành động cải thiện độ chính xác của robot và imitation learning. Khám phá cách sử dụng Ultralytics YOLO26 để giảm lỗi tích lũy trong các AI agent.
Phân đoạn hành động là một kỹ thuật deep learning nâng cao, được sử dụng rộng rãi trong robotics và imitation learning, trong đó model dự đoán một chuỗi (hay "phân đoạn") hành động trong tương lai thay vì chỉ một hành động tại mỗi timestep. Bằng cách dự báo quỹ đạo gồm nhiều bước, phân đoạn hành động cho phép AI agents thực hiện các tác vụ phức tạp có thời gian kéo dài với độ mượt mà và độ tin cậy cao hơn. Phương pháp này nhận được sự quan tâm đáng kể sau khi Phân đoạn hành động với Transformers (ACT) được giới thiệu; đây là một kiến trúc model kết hợp dự báo theo thời gian với đầu vào computer vision có số chiều cao.
Giảm thiểu lỗi tích lũy#
Trong behavioral cloning truyền thống, một model dự đoán bước tức thời tiếp theo dựa trên trạng thái hiện tại. Tuy nhiên, trong quá trình real-time inference, những sai số nhỏ trong dự đoán khiến hệ thống chuyển sang các trạng thái chưa được quan sát. Những sai sót này nhanh chóng nhân lên, dẫn đến thất bại trong tác vụ—một hiện tượng được gọi là lỗi tích lũy.
Phân đoạn hành động giải quyết trực tiếp hạn chế này. Bằng cách dự đoán đồng thời nhiều hành động (ví dụ: 50 chuyển động khớp bao phủ 1 giây vận động), thời hạn kiểm soát hiệu dụng được rút ngắn. Hệ thống cam kết thực hiện một kế hoạch ngắn hạn nhất quán dựa trên một quan sát hình ảnh đáng tin cậy duy nhất, nhờ đó giảm đáng kể tần suất của các lỗi phản ứng. Khi tích hợp các vision backbone như Ultralytics YOLO26 để nhận thức không gian và định vị bounding box, các dự đoán tạo ra trở nên cực kỳ ổn định trước nhiễu của quá trình.
Các ứng dụng trong thực tế#
Phân đoạn hành động đã mở ra những năng lực mới trong tự động hóa vật lý, đặc biệt khi được triển khai trên phần cứng edge AI được tối ưu hóa bởi các framework như Intel Edge:
- Thao tác robotics tinh vi: Trong tự động hóa công nghiệp, robot sử dụng các dự đoán được phân đoạn để thực hiện những tác vụ có nhiều tương tác tiếp xúc và đòi hỏi độ chính xác cao, chẳng hạn như luồn cáp, lắp pin vào khe hoặc xử lý các vật thể được theo dõi bởi package segmentation datasets. Việc tạo ra các chuỗi hành động nhất quán giúp ngăn chặn những chuyển động giật cục, thiếu ổn định thường thấy trong imitation learning từng bước.
- Điều hướng tự động: Trong lái xe tự động và chuyến bay của drone, việc dự báo một nhóm lệnh điều khiển (như đánh lái và tăng tốc) cho phép lập kế hoạch quỹ đạo mượt mà hơn, một khái niệm được nghiên cứu chuyên sâu trong các IEEE robotics papers gần đây. Khi kết hợp với object tracking và depth estimation liên tục, phương tiện có thể điều hướng an toàn trong các môi trường động phức tạp.
Phân biệt các khái niệm liên quan#
Để hiểu rõ hơn cách kỹ thuật này phù hợp với hệ sinh thái artificial intelligence rộng lớn hơn, việc phân biệt kỹ thuật này với các thuật ngữ tương tự là hữu ích:
- Phân đoạn hành động và nhận dạng hành động: Trong khi phân đoạn hành động tạo ra một chuỗi lệnh tương lai để máy thực thi, action recognition là quá trình phân tích nhằm xác định các hoạt động đang diễn ra trong luồng video.
- Phân đoạn hành động và các model sequence-to-sequence: Các kiến trúc sequence-to-sequence ánh xạ một chuỗi đầu vào thành một chuỗi đầu ra và được sử dụng rộng rãi trong machine translation. Phân đoạn hành động sử dụng nhiều các kiến trúc này—cụ thể là Transformers—nhưng giới hạn đầu ra hoàn toàn ở các điều khiển motor cấp thấp và động học, thay vì văn bản.
- Phân đoạn hành động và học tăng cường: Reinforcement learning dựa vào các tín hiệu phần thưởng để huấn luyện một agent thông qua thử và sai. Ngược lại, phân đoạn hành động chủ yếu được triển khai trong behavioral cloning có giám sát, trong đó model học trực tiếp từ các màn trình diễn của con người mà không tối đa hóa phần thưởng một cách rõ ràng.
Triển khai phân đoạn hành động#
Trong thực tế, một hệ thống vision đánh giá môi trường, còn sequence decoder tạo ra quỹ đạo được phân đoạn. Đoạn mã Python sau đây minh họa một module PyTorch mang tính khái niệm (một giải pháp thay thế cho TensorFlow), tiếp nhận trạng thái môi trường—chẳng hạn trạng thái thu được từ một lượt object detection—và xuất ra một chuỗi hành động trong tương lai.
import torch
import torch.nn as nn
class ActionChunker(nn.Module):
def __init__(self, state_dim, action_dim, chunk_size):
super().__init__()
# Maps the current state to a sequence of future actions
self.decoder = nn.Linear(state_dim, chunk_size * action_dim)
self.chunk_size = chunk_size
self.action_dim = action_dim
def forward(self, state):
# Predict the entire action chunk at once
chunk = self.decoder(state)
return chunk.view(-1, self.chunk_size, self.action_dim)
# Example: 128-dim state, 6 degrees of freedom, 50-step chunk
model = ActionChunker(state_dim=128, action_dim=6, chunk_size=50)
# Generate a 50-step action trajectory from a single observation
current_state = torch.randn(1, 128)
action_trajectory = model(current_state)
print(f"Action Chunk Shape: {action_trajectory.shape}")Việc quản lý các dataset khổng lồ cần thiết để huấn luyện những policy robotics này đòi hỏi nhiều tài nguyên. Các đơn vị dẫn đầu ngành như OpenAI và Anthropic tiên phong trong việc xây dựng các model quy mô lớn, nhưng các developer hằng ngày lại dựa vào những công cụ dễ tiếp cận. Ultralytics Platform đơn giản hóa vòng đời dữ liệu cho các đầu vào hình ảnh, cung cấp khả năng data annotation tự động và model training liền mạch. Khi các model phát triển theo hướng kiến trúc Vision-Language-Action (VLA) hợp nhất, việc kết hợp các hệ thống vision hiệu quả với khả năng phân đoạn hành động mạnh mẽ sẽ tiếp tục định hình thế hệ tiếp theo của tự động hóa thông minh.









