Diffusion Language Models
了解扩散语言模型如何通过迭代去噪生成和编辑文本,并深入了解 Transformer、应用、优势与局限性。
扩散语言模型是生成式模型,通过迭代去噪来生成或编辑文本,而不是严格地从左到右生成每个 token。它们从一个受损的序列开始(通常包含被掩码、替换或不确定的 token),并反复精炼多个位置,直到文本变得通顺。这种方法结合了语言建模和扩散模型的理念,为传统的下个 token 生成提供了一种替代方案。
Link to this section扩散语言模型的工作原理#
文本首先通过分词被划分为单词、子词、字符或其他离散单元。在训练过程中,正向损坏过程会逐渐从 token 序列中移除信息。根据实现方式的不同,token 可能会被替换为掩码符号、采样的替代项或称为嵌入的噪声连续表示。
该模型学习反向过程:预测受损序列的更干净版本。在推理时,它从一个高度掩码或充满噪声的块开始,并执行多个精炼步骤。早期步骤确立广泛的意义和结构,而后期步骤则修正词汇、语法、格式和局部一致性。
许多扩散语言模型使用transformer来处理序列。Transformer 非常适合这项任务,因为它们的注意力机制可以将每个 token 与周围的上下文联系起来。PyTorch Transformer 文档为这种底层架构提供了有用的概述。
与固定的填空系统不同,扩散生成可以反复重新考虑预测。在某一步骤中选择的 token 不一定是永久的;当序列的其余部分提供更好的上下文时,后面的迭代可能会对其进行修改。Google DeepMind 的文本扩散概述展示了这种块级迭代生成模式。
Link to this section扩散模型与相关概念#
几个密切相关的术语描述了不同的目标或架构:
- **自回归大语言模型**按顺序生成 token,每个预测都以先前的输出为条件。这种因果过程在 TensorFlow 的自回归文本生成教程中得到了演示。扩散模型则可以在每个精炼步骤中更新许多位置。
- 掩码语言模型利用两侧的上下文来预测故意隐藏的 token。Keras 掩码语言建模示例演示了这一训练目标。扩散语言模型将这一想法扩展为一个完整的生成过程,具有多个损坏级别和去噪迭代。
- **Stable Diffusion**是一个图像生成系统,而不是大语言模型。Stability AI 的Stable Diffusion 图像服务用于生成和编辑视觉内容,而扩散语言模型则对文本 token 或其表示进行操作。
- **扩散 Transformer**描述了在扩散系统中使用 transformer,通常用于图像或视频生成。扩散语言模型的定义在于其文本生成目标,而不仅仅是其神经网络架构。
Link to this section实际应用#
一个具体的应用是文档和代码编辑。扩散语言模型不是在光标后追加文本,而是可以精炼整个草稿或选定的文本段。例如,它可以在修改整个块中的变量名、导入和注释的同时重建丢失的函数。当一个位置的修改影响到另一个位置时,利用前后上下文的能力就显得尤为珍贵。
第二个应用是多模态分析。视觉系统可以从图像中提取事实信息,之后扩散语言模型可以迭代地撰写基于这些观察结果的报告、说明文字或回复。例如,目标检测可以在语言组件起草事件摘要之前,识别出交通场景中的车辆和行人。
以下工作流使用Ultralytics YOLO26为下游语言生成创建结构化的视觉上下文:
from ultralytics import YOLO
# Run object detection on a sample image
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Convert detections into compact language-model context
detections = result.summary()
object_names = sorted({item["name"] for item in detections})
visual_context = ", ".join(object_names)
print(visual_context)YOLO 预测工作流返回结构化输出,而Results.summary() 方法则将检测结果转换为更容易传入语言管道的字典。这种分离使视觉模型能够提供基于现实的观察结果,而语言模型则负责迭代组合。
Link to this section优势、局限性与实用指导#
扩散语言模型可以并行提出多个 token,修正先前的选择,并自然地支持填空或受限编辑。然而,并行预测并不保证更低的端到端延迟:生成仍然需要多个去噪步骤,且速度取决于序列长度、模型大小、硬件和采样策略。
文本也是离散的,这使得渐进式损坏不如向连续图像像素添加噪声那样自然。配置不当的系统可能会产生重复、遗漏必要细节、不必要地更改正确的文本,或者难以确定输出长度。
团队应在代表性提示词上评估任务准确性、真实性、编辑稳定性、延迟和资源使用情况。关于生成式 AI 评估的 Google Cloud 指南建议将自动化指标与人工评估结合起来,因为语言质量取决于上下文。高影响力的部署还应遵循诸如NIST AI 风险管理框架之类的结构化流程。
对于视觉应用,Ultralytics 平台支持数据集标注、模型训练、部署和监控,帮助团队构建能够为下游基于扩散的语言工作流提供依据的感知组件。






