返回 Ultralytics 术语表
Latent Space
探索机器学习中的潜在空间。了解神经网络如何将数据压缩为嵌入,以及如何使用 Ultralytics YOLO26 提取特征。
在人工智能中,潜在空间是复杂数据经过压缩后的低维数学表示。当神经网络处理高维输入(例如图像的原始像素值或文本的序列令牌)时,会将这些信息浓缩成紧凑的多维向量。在这个隐藏的几何空间中,语义相似的数据点会在坐标系中彼此靠近。例如,“汽车”的数学表示会靠近“卡车”,但远离“苹果”。通过将数据映射到连续的数学流形中,机器学习模型可以轻松比较、插值并提取有意义的模式,无需处理冗余的背景噪声。
区分相关概念#
要理解这些隐藏表示的工作方式,需要将它们与密切相关的计算机视觉概念区分开来:
真实世界中的 AI 应用#
压缩数据并按语义组织数据的能力,使这一概念成为现代视觉系统的基础,并推动了该行业中的多种实际应用:
- 生成式 AI:先进的生成架构,尤其是潜在扩散模型(LDM),不会逐像素生成图像。正如基础学术研究中所述,它们会完全在压缩空间中迭代添加和去除噪声。这大幅降低了计算成本,使研究机构能够训练高效模型。
- 图像分类:像 CLIP这样的架构会将视觉数据和文本描述映射到共享潜在空间中。通过计算图像向量与文本向量之间的距离,模型可以识别从未明确训练过的物体,彻底改变企业团队处理自动化数据标注工作流的方式。
- 异常检测:通过使用正常、无缺陷产品的图像训练自编码器,网络会学习特定的基准表示。处理有缺陷的产品时,其映射结果会落在预期区域之外,从而触发即时检查。
提取潜在特征#
在实践中,你可以从视觉模型的最后几层提取特征图,在分类或目标检测头之前获取这些隐藏表示。下面的简明示例使用 Ultralytics YOLO26生成图像嵌入。
from ultralytics import YOLO
# Load a pretrained YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Pass an image through the model to extract its latent embedding vector
results = model.embed("https://ultralytics.com/images/bus.jpg")
# The result is a high-dimensional tensor representing the image in the latent space
print(f"Embedding shape: {results[0].shape}")利用潜在表示构建应用#
随着行业转向高效的边缘计算和紧凑的基础模型,掌握潜在空间操作至关重要。利用这些稠密向量空间,开发者可以构建稳健的推荐系统和语义搜索引擎。对于希望扩展自定义视觉应用的团队,Ultralytics Platform提供了简化的云端环境,用于数据集管理、自动标注和无缝模型部署,帮助你将原始视觉数据转化为可操作的信息。









