YOLO Vision 2026:
返回 Ultralytics 术语表

Latent Reasoning

了解人工智能中的潜在推理是如何工作的、它与思维链有何不同,以及它在计算机视觉、机器人和工业检测中的应用。

潜在推理是指主要在模型的隐藏数字表示内部执行的AI问题求解,而不是通过显式的单词或符号序列来完成。模型不是写出每个中间步骤,而是转换编码了概念、关系和候选解决方案的内部状态,然后将生成的状态解码为答案或操作。这可以使推理更加紧凑和灵活,但也使该过程更难以检查。

潜在推理的工作原理#

神经网络将输入数据转换为潜在空间中的点或轨迹。这些表示保留了与任务相关的信息,同时省略了来自原始输入的许多细节。例如,图像可以变成编码对象、形状、位置和场景上下文的向量,而不是单独的像素值。同样的原理允许稠密嵌入表示语言和其他数据中的语义关系。

在潜在推理期间,模型更新这些隐藏表示以组合证据、解析关系或规划响应。例如,PyTorch中的Transformer实现将表示传递通过注意力层和前馈层,每个层都会产生一个更具上下文关联的隐藏状态。

一些系统执行单个前向转换序列。其他系统在生成输出之前反复精炼隐藏状态。无论哪种情况,重要的区别在于,有用的中间计算发生在连续的数值空间中,而不是完全转化为可读的标记。

然而,并非每个隐藏激活都是推理。当表示支持诸如连接多个事实、比较替代方案、维护计划或推断未观察到的关系等操作时,它就成为了潜在推理的一部分。通用AI推理还可以使用符号规则、搜索或外部工具。

相关概念与关键区别#

潜在推理与几个AI概念重叠,但不可与它们互换:

  • 思维链提示 生成作为语言标记的中间推理。潜在推理使大多数中间计算保持隐藏状态,这可能会缩短输出长度,但提供的直接可见性较少。
  • 推理模型 广泛指代针对复杂推理进行优化的模型。它们可以通过可见的文本、隐藏的表示、工具调用、搜索或方法的组合来进行推理。
  • 视觉推理 描述关于图像、视频、几何和空间关系的推理。其计算可能以潜在方式发生,但该术语确定的是问题领域,而不是所使用的表示形式。
  • 机械可解释性 试图分析内部特征和计算路径如何产生行为。它调查的是潜在推理,而不是自身成为一种推理方法。
  • 潜在空间: 深度学习使用的压缩表示空间是媒介;潜在空间内的过程是潜在推理。

模型生成的解释不应自动被视为其隐藏计算的忠实副本。它可能反而是答案实际被选定后生成的一个貌似合理的解释。

实际应用#

两个实际应用展示了为什么潜在推理至关重要:

  • 机器人感知与规划: 机器人可以在共享的隐藏表示中组合相机图像、对象位置、当前姿态和任务指令。规划器可以更新该状态,以推断出障碍物挡住了最短路线,或者必须先移动一个对象才能收集另一个对象。这支持紧凑的多模态AI,尽管错误的场景表示可能会导致不安全或无效的操作。

  • 工业检测与决策支持: 视觉模型可以检测组件、损坏或缺失的零件,而下游推理系统则将这些观察结果与设备历史记录和操作条件结合起来。隐藏状态可以支持以下决定:继续生产、请求另一张图像,或者将项目升级以供人工审查。潜在计算有助于融合不同的证据,但隐藏的假设可能会使错误的决策难以诊断。

计算机视觉上下文#

计算机视觉通常为更广泛的推理系统提供基础证据。Ultralytics YOLO26将像素转换为结构化类别、置信度分数和空间坐标。然后,下游模型可以在内部对该证据进行推理。

import json

from ultralytics import YOLO

# Load the visual perception model
model = YOLO("yolo26n.pt")

# Gather evidence from the scene
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]

# Prepare structured observations for a reasoning system
visual_evidence = result.summary()
print(json.dumps(visual_evidence, indent=2))

这个YOLO预测工作流不会暴露或实现潜在推理算法。相反,它演示了感知层如何为智能体或多模态模型提供简洁、结构化的证据。团队可以使用Ultralytics平台来标注视觉数据集、训练感知模型、部署它们并监控生成的流水线。

评估、局限性与安全性#

由于潜在推理是隐藏的,开发者应该评估可观察的结果,而不是假设流畅的回答反映了健康的内部逻辑。有用的测试包括多步任务、反事实输入、不熟悉的场景以及故意改变一条证据的情况。评估应反映错误带来的后果;准确率、精确率和召回率指南说明了为什么单个聚合分数可能是不够的。

不透明性也使调试、审计和人工监督变得复杂。关于可解释和可解释AI的NIST指南区分了理解系统机制与在其预期上下文中解释输出。对于重要的应用,团队应保留结构化的证据、支持弃权或人工审查、监控故障,并遵循诸如NIST AI风险管理框架等基于生命周期的框架。

Explore solutions

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅