Ultralytics YOLO27:
返回 Ultralytics 术语表

Large Concept Models (LCMs)

了解大型概念模型(LCMs)如何处理语义概念、与 LLMs 进行比较,并支持多语言 AI、长篇规划和计算机视觉。

大型概念模型(LCMs)是以更高层次的语义单元,即“概念”,而不是一次预测一个文本 token 的方式来处理和生成信息的 AI 模型。在典型的 LCM 中,一个概念可以表示句子、话语、事件或动作含义的数值向量。这种概念层面的视角可以帮助模型组织长序列、跨语言传递含义,并围绕思想进行推理,而无需将每个内部步骤都绑定到具体措辞。

大型概念模型的工作原理#

传统的大型语言模型会将文本拆分为token,例如单词、子词或标点符号。随后,模型会反复预测下一个 token。TensorFlow 分词指南展示了文本如何被划分为这些小单元。

LCM 将主要的建模步骤提升到更高层次:

  1. 编码器将句子或其他有意义的单元转换为嵌入,即对其含义的密集数值表示。
  2. 模型会检查概念嵌入序列,并预测下一个概念的表示。
  3. 解码器将预测出的表示转换为自然语言、语音或其他输出形式。

在这种设计中,含义相近的句子应位于模型潜在空间中相邻的区域。Google 嵌入概览介绍了这些向量空间如何捕捉关系,其衡量嵌入之间相似度的指南则涵盖余弦相似度等方法。

句子是概念的一种实用代理,并非通用定义。一个句子可能包含多个思想,而一个重要概念也可能跨越多个句子。

LCM 与相关模型的比较#

LCM 的主要差异在于其内部预测的粒度和结构。

  • LCM 与大型语言模型: LLM 通常直接预测 token。LCM 预测更高层次的语义表示,并依靠独立的编码器和解码器将这些表示与语言连接起来。
  • LCM 与视觉语言模型: VLM 将视觉信息与语言信息连接起来。LCM 可以接收视觉概念嵌入,但概念层面的预测并不会使模型天然具备多模态能力。
  • LCM 与概念瓶颈模型: 概念瓶颈模型使用明确且通常由人工标注的属性,例如“有翅膀”。LCM 的概念通常是学习得到的向量,可能无法与命名属性清晰对应。
  • LCM 与潜在一致性模型: 两者都使用缩写 LCM,但潜在一致性模型用于加速生成式扩散工作流。它们与大型概念模型无关。

LCM 仍然可以使用Transformer 架构和注意力机制;关键变化在于序列元素所代表的内容。PyTorch Transformer 文档介绍了通用的序列处理结构,该结构可以处理不同类型的表示。

实际应用#

多语言摘要: 全球支持系统可以将用西班牙语、日语和英语撰写的报告编码到共享语义空间中,组织其中的主要思想,并生成英文摘要。正如 Meta 对多语言句子嵌入空间的说明所展示的那样,共享的多语言表示可以让含义相同的内容彼此接近,即使它们的表面措辞不同。这可以减少对翻译每个中间推理步骤的依赖。

长篇规划与生成: LCM 不必逐字起草报告,而是可以先对问题、证据、分析和建议这样的序列进行建模。随后,每个预测出的概念都会被解码为一个或多个句子。这类似于先规划提纲再写作,可能有助于提升文档摘要或对话摘要中的连贯性;这些任务在 Microsoft 的文本与对话摘要指南中有所介绍。

将概念模型连接到计算机视觉#

以概念为驱动的系统可以将 LCM 风格的推理与目标检测相结合。视觉模型识别场景中的有意义元素,下游模型则将这些元素作为更大序列的一部分进行推理。

from ultralytics import YOLO

# Load a pretrained visual detector
model = YOLO("yolo26n.pt")

# Extract visual information from an image
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]

# Convert detected classes into simple visual concepts
class_ids = result.boxes.cls.int().tolist()
visual_concepts = sorted({result.names[index] for index in class_ids})

print(visual_concepts)

该 YOLO26工作流会生成“公交车”和“人”等标签。它不会将 YOLO 变成 LCM;相反,它展示了计算机视觉如何为概念级推理系统提供结构化的视觉证据。团队可以使用 Ultralytics Platform来标注视觉数据集、训练模型、部署模型并监控这些感知组件。

优势、局限性与评估#

概念级序列可能比 token 序列更短,支持跨语言知识迁移,并将语义规划与表面措辞分离。然而,将句子压缩为一个向量可能会丢失名称、数字、否定、空间细节或细微限定语。解码器错误还可能生成流畅的语言,但其含义与预测出的概念并不完全一致。

因此,实际评估应同时检验语义质量和最终输出的准确性。团队应衡量多语言一致性、事实保留程度、长上下文连贯性、延迟,以及模型在含糊输入上的行为。高影响力部署还应遵循结构化的治理流程,例如 NIST AI 风险管理框架,并根据具体应用采取适当的人工审核和监控。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅