Ultralytics YOLO27:
返回 Ultralytics 术语表

Rotary Position Embedding (RoPE)

探索旋转位置嵌入(RoPE)如何通过编码相对位置来增强 Transformer。了解它在 LLMs 和 Ultralytics YOLO26 视觉任务中的作用。

旋转位置嵌入 (RoPE) 是一种非常有效的技术,用于将位置信息注入现代神经网络架构中的词元嵌入。在 Transformer 等深度学习模型中,输入词元会同时处理,而不是按顺序处理。由于这些模型本身没有固有的顺序感,因此需要借助外部机制来理解数据序列。RoPE 通过使用旋转矩阵对词元的绝对位置进行编码,并将相对位置依赖无缝整合到 注意力机制 中,从而让模型能够根据词元之间的距离更好地理解它们之间的关系。

旋转位置嵌入的工作原理#

不同于将固定位置向量添加到词元表示中的传统方法,RoPE 会在多维空间中对词元特征应用几何旋转。旋转角度与词元在序列中的位置直接成正比。当模型计算两个词元之间的注意力分数时,这些旋转的数学性质确保最终分数会自然地取决于两者之间的相对距离。这种方法使 高级 AI 系统 无需占用过多内存,就能在规模大得多的 上下文窗口 中保持稳健的结构感知能力。

为了了解其在实践中的运行方式,开发者通常会使用 PyTorch 等框架 通过张量操作实现 RoPE。下面是一段经过简化且可运行的代码片段,演示了在模型训练或推理期间如何将核心旋转逻辑应用于输入特征:

import torch


def apply_rotary_emb(x, cos, sin):
    # A simplified PyTorch demonstration of applying rotary embeddings
    # Splits the feature dimension and rotates the halves
    half_dim = x.shape[-1] // 2
    x1, x2 = x[..., :half_dim], x[..., half_dim:]

    # Rotate the components to encode relative positional information
    rotated_x = torch.cat((-x2, x1), dim=-1)

    # Combine original features with cosine and sine transformations
    return (x * cos) + (rotated_x * sin)


# Example usage with dummy token features and sinusoidal matrices
dummy_features = torch.randn(2, 10, 64)  # (batch_size, sequence_length, features)
cos, sin = torch.randn(2, 10, 64), torch.randn(2, 10, 64)
embedded_features = apply_rotary_emb(dummy_features, cos, sin)

RoPE 的实际应用#

旋转嵌入已成为序列建模的行业标准,尤其广泛应用于先进的 自然语言处理 (NLP) 任务和最先进的视觉系统。

  1. 大型语言模型 (LLMs): RoPE 是全球一些能力最强的文本生成系统背后的基础位置编码机制,其中包括 Meta 的 LLaMA 架构。借助 RoPE,这些 大型语言模型 (LLMs) 可以在单个提示中处理整本书或整个代码库,并提供无与伦比的 序列外推能力,能够很好地泛化到远超训练期间所见长度的序列。

  2. 视觉 Transformer 与目标检测:计算机视觉 领域,从图像分块中提取的视觉词元需要精确的空间结构。卷积模型(如 Ultralytics YOLO26)能够通过局部感受野自然地捕捉空间层次结构,而自注意力架构(如 视觉 Transformer)通常会整合类似 RoPE 的二维扩展。这有助于基于 Transformer 的 目标检测实例分割 流程更好地理解视觉元素的相对位置,从而提升复杂场景中的准确率。

RoPE 与绝对位置嵌入的区别#

区分 RoPE 与标准的 绝对位置嵌入 非常重要。绝对位置嵌入会为序列中的每个位置分配一个固定且独立的向量,这意味着模型必须独立学习位置 5 与位置 10 之间的关系。而 RoPE 则将距离概念直接融入词元变换中。这一根本差异使 RoPE 在长文档理解和 生成式 AI 工作流方面具有显著优势,因为这些场景中的序列长度变化很大。

在开发和扩展这些超大规模架构时,高效管理数据和基础设施至关重要。为了简化数据集标注、云端训练以及在所有边缘环境中的部署,开发者通常会依赖 Ultralytics Platform 提供的综合工具。这些工具负责将前沿计算机视觉研究投入生产所需的大量工作。将 RoPE 与 微调 最佳实践结合使用,可以确保现代 AI 流程既保持高准确率,又具备稳健的计算性能。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅