Action Chunking
Découvre comment le découpage des actions améliore la précision robotique et l’apprentissage par imitation. Apprends à utiliser Ultralytics YOLO26 pour réduire les erreurs cumulées des agents IA.
Le découpage des actions est une technique avancée d'apprentissage profond, largement utilisée en robotique et en apprentissage par imitation, dans laquelle un modèle prédit une séquence (ou « bloc ») d'actions futures plutôt qu'une seule action à chaque instant. En prévoyant une trajectoire en plusieurs étapes, le découpage des actions permet aux agents d'IA d'effectuer des tâches complexes s'étendant sur de longues périodes avec davantage de fluidité et de fiabilité. Cette approche a gagné en popularité après l'introduction de Action Chunking with Transformers (ACT), une architecture de modèle qui associe la prévision temporelle à des entrées de vision par ordinateur de grande dimension.
Réduire les erreurs cumulatives#
Dans le clonage comportemental traditionnel, un modèle prédit l'étape immédiate suivante à partir de l'état actuel. Cependant, lors de l'inférence en temps réel, de petites imprécisions de prédiction font basculer le système vers des états non observés. Ces erreurs se multiplient rapidement et entraînent l'échec de la tâche — un phénomène appelé erreurs cumulatives.
Le découpage des actions s'attaque directement à cette limite. En prédisant plusieurs actions simultanément (par exemple, 50 mouvements articulaires couvrant 1 seconde de mouvement), l'horizon de contrôle effectif est réduit. Le système s'engage dans un plan cohérent à court terme fondé sur une seule observation visuelle fiable, ce qui réduit considérablement la fréquence des erreurs réactives. Lorsqu'on intègre des backbones de vision tels que Ultralytics YOLO26 pour la perception spatiale et la localisation des boîtes englobantes, les prédictions obtenues deviennent extrêmement stables face au bruit du processus.
Applications concrètes#
Le découpage des actions a ouvert de nouvelles possibilités dans l'automatisation physique, notamment lorsqu'il est déployé sur du matériel d'IA en périphérie optimisé par des frameworks tels qu'Intel Edge :
- Manipulation robotique fine : Dans l'automatisation industrielle, les robots utilisent des prédictions découpées pour exécuter des tâches impliquant de nombreux contacts et nécessitant une grande précision, comme enfiler des câbles, insérer des batteries dans des logements ou manipuler des objets suivis par des jeux de données de segmentation de colis. La génération de séquences d'actions cohérentes évite les mouvements saccadés et irréguliers typiques de l'apprentissage par imitation en une seule étape.
- Navigation autonome : Dans la conduite autonome et le pilotage de drones, la prévision d'un bloc de commandes de contrôle (comme la direction et l'accélération) permet de planifier des trajectoires plus fluides, un concept largement étudié dans de récents articles de robotique de l'IEEE. Associés au suivi continu des objets et à l'estimation de profondeur, ces systèmes permettent aux véhicules de se déplacer en toute sécurité dans des environnements dynamiques complexes.
Distinction entre concepts connexes#
Pour mieux comprendre comment cette technique s'inscrit dans l'écosystème plus large de l'intelligence artificielle, il est utile de la distinguer de termes similaires :
- Découpage des actions par rapport à la reconnaissance d'actions : Alors que le découpage des actions génère une séquence de commandes futures à exécuter par une machine, la reconnaissance d'actions est le processus analytique qui consiste à identifier les activités se déroulant dans un flux vidéo.
- Découpage des actions par rapport aux modèles séquence-à-séquence : Les architectures séquence-à-séquence associent une séquence d'entrée à une séquence de sortie et sont largement utilisées en traduction automatique. Le découpage des actions utilise largement ces architectures — en particulier les Transformers — mais limite la sortie exclusivement aux commandes motrices et à la cinématique de bas niveau, plutôt qu'au texte.
- Découpage des actions par rapport à l'apprentissage par renforcement : L'apprentissage par renforcement s'appuie sur des signaux de récompense pour enseigner un comportement à un agent par essais et erreurs. À l'inverse, le découpage des actions est principalement déployé dans le clonage comportemental supervisé, où le modèle apprend directement à partir de démonstrations humaines, sans maximisation explicite de la récompense.
Mise en œuvre du découpage des actions#
En pratique, un système de vision évalue l'environnement, puis un décodeur de séquence génère la trajectoire découpée. L'extrait Python suivant présente un module conceptuel PyTorch (une alternative à TensorFlow) qui accepte un état de l'environnement — par exemple, un état issu d'une étape de détection d'objets — et génère une séquence d'actions futures.
import torch
import torch.nn as nn
class ActionChunker(nn.Module):
def __init__(self, state_dim, action_dim, chunk_size):
super().__init__()
# Maps the current state to a sequence of future actions
self.decoder = nn.Linear(state_dim, chunk_size * action_dim)
self.chunk_size = chunk_size
self.action_dim = action_dim
def forward(self, state):
# Predict the entire action chunk at once
chunk = self.decoder(state)
return chunk.view(-1, self.chunk_size, self.action_dim)
# Example: 128-dim state, 6 degrees of freedom, 50-step chunk
model = ActionChunker(state_dim=128, action_dim=6, chunk_size=50)
# Generate a 50-step action trajectory from a single observation
current_state = torch.randn(1, 128)
action_trajectory = model(current_state)
print(f"Action Chunk Shape: {action_trajectory.shape}")La gestion des énormes jeux de données nécessaires à l'entraînement de ces politiques robotiques mobilise d'importantes ressources. Des leaders du secteur comme OpenAI et Anthropic ouvrent la voie avec des modèles à grande échelle, mais les développeurs du quotidien s'appuient sur des outils accessibles. La plateforme Ultralytics simplifie le cycle de vie des données pour les entrées visuelles, en proposant l'annotation automatisée des données et des fonctionnalités fluides d'entraînement des modèles. À mesure que les modèles évoluent vers des architectures Vision-Langage-Action (VLA) unifiées, l'association de systèmes de vision efficaces et d'un découpage robuste des actions continuera de définir la prochaine génération d'automatisation intelligente.









