Ultralytics YOLO27:
返回 Ultralytics 术语表

Action Chunking

了解动作分块如何提升机器人精度和模仿学习效果。了解如何使用 Ultralytics YOLO26 减少 AI 智能体中的误差累积。

动作分块是一种先进的深度学习技术,广泛应用于机器人和模仿学习领域。在这种技术中,模型会预测未来动作的序列(或称“动作块”),而不是在每个时间步只预测一个动作。通过预测多步轨迹,动作分块能够让AI 代理更加平滑、可靠地执行复杂的长时程任务。在Action Chunking with Transformers (ACT)推出后,这种方法获得了广泛关注。该模型架构将时间预测与高维计算机视觉输入相结合。

缓解误差累积#

在传统的行为克隆中,模型会根据当前状态预测下一个即时步骤。然而,在实时推理期间,即使很小的预测误差也会使系统进入未观测状态。这些错误会迅速累积,最终导致任务失败,这种现象称为误差累积。

动作分块直接解决了这一局限。通过同时预测多个动作(例如,预测覆盖 1 秒运动的 50 个关节动作),有效控制时域得以缩短。系统基于一次可靠的视觉观测确定一个连贯的短期计划,从而大幅降低响应式错误的发生频率。在集成Ultralytics YOLO26等用于空间感知的视觉骨干网络,以及用于边界框定位的组件后,得到的预测对过程噪声具有极高的稳定性。

实际应用#

动作分块为物理自动化解锁了新的能力,尤其是在采用Intel Edge等框架优化的边缘 AI硬件上部署时:

  • 精细化机器人操作: 在工业自动化中,机器人利用分块预测执行需要高精度的高接触任务,例如穿接电缆、将电池插入槽位,或处理由包裹分割数据集跟踪的物品。生成连贯的动作序列可以避免单步模仿学习中常见的动作突兀且不一致问题。
  • 自主导航: 在自动驾驶和无人机飞行中,预测一组控制指令(例如转向和加速)能够实现更平滑的轨迹规划,这一概念在近期的IEEE 机器人学论文中得到了广泛研究。结合持续的目标跟踪深度估计,车辆能够在复杂的动态环境中安全导航。

区分相关概念#

为了更好地理解这种技术如何融入更广泛的人工智能生态系统,有必要将其与相似术语区分开来:

  • 动作分块与动作识别: 动作分块会为机器生成要执行的未来指令序列,而动作识别则是分析视频流中正在发生的活动并对其进行识别的过程。
  • 动作分块与序列到序列模型: 序列到序列架构将输入序列映射为输出序列,广泛应用于机器翻译。动作分块大量采用这类架构,尤其是Transformers,但会将输出严格限制为低级电机控制和运动学信息,而不是文本。
  • 动作分块与强化学习: 强化学习依靠奖励信号,通过试错来训练代理。相比之下,动作分块主要应用于有监督的行为克隆,模型直接从人类示范中学习,而无需明确地最大化奖励。

实现动作分块#

在实践中,视觉系统会评估环境,序列解码器则生成分块轨迹。下面的Python代码片段展示了一个概念性的PyTorch模块(TensorFlow的一种替代方案)。该模块接收环境状态(例如从一次目标检测处理中得到的状态),并输出未来动作序列。

import torch
import torch.nn as nn


class ActionChunker(nn.Module):
    def __init__(self, state_dim, action_dim, chunk_size):
        super().__init__()
        # Maps the current state to a sequence of future actions
        self.decoder = nn.Linear(state_dim, chunk_size * action_dim)
        self.chunk_size = chunk_size
        self.action_dim = action_dim

    def forward(self, state):
        # Predict the entire action chunk at once
        chunk = self.decoder(state)
        return chunk.view(-1, self.chunk_size, self.action_dim)


# Example: 128-dim state, 6 degrees of freedom, 50-step chunk
model = ActionChunker(state_dim=128, action_dim=6, chunk_size=50)

# Generate a 50-step action trajectory from a single observation
current_state = torch.randn(1, 128)
action_trajectory = model(current_state)

print(f"Action Chunk Shape: {action_trajectory.shape}")

管理训练这些机器人策略所需的海量数据集需要投入大量资源。尽管OpenAIAnthropic等行业领先者正在推动大规模模型的发展,但日常开发者依赖的是易于获取的工具。Ultralytics Platform简化了视觉输入的数据生命周期,提供自动化的数据标注和无缝的模型训练能力。随着模型逐步发展为统一的视觉-语言-动作(VLA)架构,将高效的视觉系统与稳健的动作分块相结合,将继续定义下一代智能自动化。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅