Vector Quantization
探索用于机器学习数据压缩和离散化的向量量化。了解它如何优化 VQ-VAE、向量搜索和 Ultralytics YOLO26 的部署。
向量量化是一种强大的数据压缩与离散化技术,广泛应用于现代 machine learning (ML) 和 digital signal processing 中。其核心原理是将大型连续点集或向量划分为多个群组,并用单一的“原型”向量来代表每个群组,这些向量共同构成了被称为码本的结构。通过将连续的高维向量映射到这些离散的码本条目,系统能够在保留数据核心语义特征的同时大幅减少内存占用,从而实现有效的 dimensionality reduction。
离散化在深度学习中的角色#
在当代 deep learning (DL) 中,这一概念因向量量化变分自编码器 (VQ-VAE) 而广为人知。与学习连续潜在空间来执行 feature extraction 的标准 autoencoders 不同,VQ-VAE 学习的是离散表示。这使得生成模型能够将图像、音频或视频视为一系列离散的 Token,类似于 Large Language Models (LLMs) 处理文本输入的方式。你可以查阅关于 research on discrete representation learning 的基础研究,了解早期实现是如何为现代基于 Token 的视觉系统铺平道路的。
实际应用#
向量量化在许多对性能和内存效率要求极高的现实 AI 应用中发挥着关键作用:
- Generative AI and Media Compression:通过将复杂的视觉数据压缩为离散的潜在代码,向量量化实现了高效的图像和视频生成。将连续像素映射到离散 Token 的模型大大减少了计算开销,从而助力了像 latent diffusion models 这样先进的架构。
- High-Speed Vector Retrieval:为了执行快速的 similarity search,现代系统必须查询数百万个 embeddings。向量量化压缩了这些庞大的数据集,使检索引擎能够执行快速的近似最近邻 (ANN) 搜索,这对于 AI in retail 和产品推荐系统非常有利。查看 OpenAI's guide on embeddings 以获取有关高维数据处理的更多背景信息。
区分相关概念#
理解向量量化与相似术语之间的细微差别,有助于设计高效的 computer vision (CV) 架构:
- Vector Quantization vs. Model Quantization:模型量化通常是指降低神经网络权重的数值精度(例如,从 32 位浮点数降至 8 位整数),以加速 Ultralytics YOLO26 等模型的硬件部署推理。然而,向量量化是将数据向量聚类为固定的离散原型词汇表。
- Vector Quantization vs. Vector Database:向量数据库是存储高维数据的实际基础设施。向量量化是这些数据库经常采用的一种底层算法技术,用于最小化其内存占用,正如 Qdrant's explanation of vector handling 中详细说明的那样。
- Vector Quantization vs. Vector Search:向量搜索是基于向量邻近度查找相似项的主动过程。量化则充当结构优化层,使这种搜索在海量规模下计算上可行。
基础实现示例#
为了了解向量量化如何在实践中将连续输入映射为离散标记,你可以使用 PyTorch 计算欧几里得距离并在预定义的码本中找到最接近的原型:
import torch
# Define a continuous input batch and a discrete codebook vocabulary
inputs = torch.randn(4, 128) # 4 input vectors of dimension 128
codebook = torch.randn(10, 128) # 10 discrete prototype vectors
# Compute distances and find the nearest codebook index for each input
distances = torch.cdist(inputs, codebook)
quantized_indices = torch.argmin(distances, dim=1)
# Retrieve the discrete quantized vectors corresponding to the inputs
quantized_vectors = codebook[quantized_indices]要深入了解如何本地计算张量距离并优化这些操作,请参考官方的 PyTorch cdist documentation。
利用 Ultralytics 平台增强工作流#
将优化的嵌入集成到你的管道中需要强大的工具支持。Ultralytics Platform 为策划 training data 和训练最先进的视觉模型提供了一个端到端环境。通过简化数据管理并简化 model deployment,开发者可以轻松生成适用于向量量化的高质量视觉特征,从而带来更快地 object detection 和大规模媒体检索应用。






