Action Chunking
Узнай, как разбиение действий на фрагменты повышает точность роботов и эффективность обучения имитации. Открой для себя способы использования Ultralytics YOLO26 для уменьшения накапливающихся ошибок в ИИ-агентах.
Чанкинг действий — это продвинутая техника глубокого обучения, широко применяемая в робототехнике и обучении имитации, при которой модель предсказывает последовательность (или «фрагмент») будущих действий, а не одно действие на каждом временном шаге. Прогнозируя многошаговую траекторию, чанкинг действий позволяет ИИ-агентам выполнять сложные задачи с долгим горизонтом планирования более плавно и надежно. Этот подход получил широкое распространение после появления чанкинга действий с Transformer (ACT) — архитектуры модели, объединяющей прогнозирование во времени с высокоразмерными входными данными компьютерного зрения.
Снижение накопления ошибок#
В традиционном клонировании поведения модель предсказывает следующий непосредственный шаг на основе текущего состояния. Однако во время вывода в реальном времени даже небольшие неточности прогнозирования переводят систему в ненаблюдаемые состояния. Эти ошибки быстро накапливаются и приводят к сбою задачи — это явление известно как накопление ошибок.
Чанкинг действий напрямую устраняет это ограничение. Одновременное предсказание нескольких действий (например, 50 движений сочленений, охватывающих 1 секунду движения) сокращает эффективный горизонт управления. Система формирует согласованный краткосрочный план на основе одного надежного визуального наблюдения, значительно снижая частоту реактивных ошибок. При интеграции визуальных базовых моделей, таких как Ultralytics YOLO26, для пространственного восприятия и локализации с помощью ограничивающих рамок получаемые прогнозы становятся чрезвычайно устойчивыми к шуму процесса.
Практические применения#
Чанкинг действий открыл новые возможности в физической автоматизации, особенно при развертывании на оборудовании периферийного ИИ, оптимизированном с помощью таких фреймворков, как Intel Edge:
- Высокоточная роботизированная манипуляция: В промышленной автоматизации роботы используют фрагментированные прогнозы для выполнения задач с интенсивным контактом, требующих высокой точности, таких как продевание кабелей, установка батарей в слоты или обработка объектов, отслеживаемых с помощью датасетов сегментации упаковок. Генерация согласованных последовательностей действий предотвращает резкие и непоследовательные движения, типичные для одношагового обучения имитации.
- Автономная навигация: В автономном вождении и полетах дронов прогнозирование блока команд управления (например, руления и ускорения) обеспечивает более плавное планирование траектории — концепцию, широко исследуемую в современных робототехнических работах IEEE. В сочетании с непрерывным отслеживанием объектов и оценкой глубины транспортные средства могут безопасно перемещаться в сложных динамических средах.
Различие между связанными понятиями#
Чтобы лучше понять, как эта техника вписывается в более широкую экосистему искусственного интеллекта, полезно отличить ее от схожих терминов:
- Чанкинг действий и распознавание действий: Если чанкинг действий генерирует последовательность будущих команд для выполнения машиной, то распознавание действий — это аналитический процесс идентификации действий, происходящих в видеопотоке.
- Чанкинг действий и модели «последовательность — последовательность»: Архитектуры «последовательность — последовательность» преобразуют входную последовательность в выходную и широко используются в машинном переводе. Чанкинг действий активно использует эти архитектуры, в частности Transformers, но ограничивает выход исключительно низкоуровневыми моторными сигналами и кинематикой, а не текстом.
- Чанкинг действий и обучение с подкреплением: Обучение с подкреплением использует сигналы вознаграждения, чтобы обучать агента методом проб и ошибок. Напротив, чанкинг действий преимущественно применяется в рамках обучения имитации с учителем, где модель обучается непосредственно на демонстрациях людей без явной максимизации вознаграждения.
Реализация чанкинга действий#
На практике система компьютерного зрения оценивает окружающую среду, а декодер последовательности генерирует фрагментированную траекторию. Следующий фрагмент кода на Python демонстрирует концептуальный модуль PyTorch (альтернативу TensorFlow), который принимает состояние среды — например, полученное в результате этапа обнаружения объектов, — и выдает последовательность будущих действий.
import torch
import torch.nn as nn
class ActionChunker(nn.Module):
def __init__(self, state_dim, action_dim, chunk_size):
super().__init__()
# Maps the current state to a sequence of future actions
self.decoder = nn.Linear(state_dim, chunk_size * action_dim)
self.chunk_size = chunk_size
self.action_dim = action_dim
def forward(self, state):
# Predict the entire action chunk at once
chunk = self.decoder(state)
return chunk.view(-1, self.chunk_size, self.action_dim)
# Example: 128-dim state, 6 degrees of freedom, 50-step chunk
model = ActionChunker(state_dim=128, action_dim=6, chunk_size=50)
# Generate a 50-step action trajectory from a single observation
current_state = torch.randn(1, 128)
action_trajectory = model(current_state)
print(f"Action Chunk Shape: {action_trajectory.shape}")Управление огромными датасетами, необходимыми для обучения таких роботизированных политик, требует значительных ресурсов. Такие лидеры отрасли, как OpenAI и Anthropic, создают крупномасштабные модели, однако разработчики в повседневной работе полагаются на доступные инструменты. Платформа Ultralytics упрощает жизненный цикл данных для визуальных входных данных, предлагая автоматизированную разметку данных и удобные возможности обучения моделей. По мере развития моделей в направлении унифицированных архитектур «зрение — язык — действие» (VLA) сочетание эффективных систем компьютерного зрения с надежным чанкингом действий продолжит определять следующее поколение интеллектуальной автоматизации.









