企业级安全保障: 符合 ISO 27001 和 SOC 2 Type I 标准。
返回 Ultralytics 词汇表

Action Chunking

了解动作分块(action chunking)如何提高机器人精度和模仿学习。探索如何使用 Ultralytics YOLO26 来减少 AI 代理中的累积误差。

动作分块(Action chunking)是一种先进的深度学习技术,在机器人技术和模仿学习中得到了广泛应用。模型在每个时间步长预测未来的一系列动作(即“分块”)而不是单一动作。通过预测多步轨迹,动作分块使AI 智能体能够以更高的平稳性和可靠性执行复杂的长期任务。随着结合 Transformer 的动作分块技术 (ACT) 的引入,这种方法获得了广泛关注,该模型架构将时间预测与高维计算机视觉输入结合在了一起。

缓解累积误差#

在传统的行为克隆中,模型根据当前状态预测接下来的直接步骤。然而,在实时推理过程中,微小的预测不准确会将系统推入未观察到的状态。这些错误会迅速累积,导致任务失败——这种现象被称为复合误差(compounding errors)。

动作分块直接解决了这一局限性。通过同时预测多个动作(例如,覆盖 1 秒运动的 50 个关节运动),有效的控制时域(horizon)得以缩短。系统基于单一可靠的视觉观察致力于一个简短连贯的计划,从而极大地减少了反应性错误的频率。当整合诸如用于空间感知和边界框定位的Ultralytics YOLO26等视觉骨干网络时,所得出的预测结果对过程噪声表现得极其稳定。

实际应用#

动作分块在物理自动化领域解锁了新的能力,特别是当部署在由Intel Edge等框架优化的边缘 AI硬件上时:

  • **精细化机器人操作:**在工业自动化中,机器人使用分块预测来执行需要高精度的富接触任务,例如穿线缆、插电池或处理由包裹分割数据集追踪的物品。生成内聚的动作序列可以防止单步模仿学习中常见的生硬、不一致的移动。
  • **自主导航:**在自动驾驶和无人机飞行中,预测控制命令块(如转向和加速度)能够实现更平滑的轨迹规划,这一概念在近期的IEEE 机器人学论文中得到了大量探讨。结合连续的对象追踪深度估计,车辆能够在复杂的动态环境中安全导航。

区分相关概念#

为了更好地理解这一技术如何融入更广泛的人工智能生态系统,将其与相似术语进行区分会很有帮助:

  • **动作分块与动作识别:**动作分块生成供机器执行的未来命令序列,而动作识别则是识别视频流中发生活动的分析过程。
  • **动作分块与序列到序列模型:**序列到序列架构将输入序列映射到输出序列,广泛用于机器翻译。动作分块大量利用了这些架构——具体来说是Transformers——但将输出严格限制在低级运动控制和运动学,而不是文本。
  • 动作分块与强化学习:强化学习依靠奖励信号通过试错来教导智能体。相反,动作分块主要部署在监督行为克隆中,其中模型直接从人类演示中学习,而无需显式的奖励最大化。

实现动作分块#

在实践中,视觉系统评估环境,序列解码器生成分块轨迹。以下Python代码片段展示了一个概念性的PyTorch模块(作为TensorFlow的替代方案),它接收环境状态(例如源自目标检测通道的状态)并输出一系列未来的动作。

import torch
import torch.nn as nn


class ActionChunker(nn.Module):
    def __init__(self, state_dim, action_dim, chunk_size):
        super().__init__()
        # Maps the current state to a sequence of future actions
        self.decoder = nn.Linear(state_dim, chunk_size * action_dim)
        self.chunk_size = chunk_size
        self.action_dim = action_dim

    def forward(self, state):
        # Predict the entire action chunk at once
        chunk = self.decoder(state)
        return chunk.view(-1, self.chunk_size, self.action_dim)


# Example: 128-dim state, 6 degrees of freedom, 50-step chunk
model = ActionChunker(state_dim=128, action_dim=6, chunk_size=50)

# Generate a 50-step action trajectory from a single observation
current_state = torch.randn(1, 128)
action_trajectory = model(current_state)

print(f"Action Chunk Shape: {action_trajectory.shape}")

管理训练这些机器人策略所需的庞大数据集是资源密集型的。OpenAIAnthropic等行业领袖开创了大规模模型,但普通开发者依赖于易于获取的工具。Ultralytics 平台简化了视觉输入的数据生命周期,提供自动化的数据标注和无缝的模型训练功能。随着模型向统一的视觉-语言-动作 (VLA) 架构演进,将高效的视觉系统与强健的动作分块相结合,将继续定义下一代智能自动化。

Explore solutions

Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多
Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多
Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多

让我们一起构建 AI 的未来!

开启你的机器学习未来之旅