Large Language Model (LLM)
探索大型语言模型(LLMs)的基础知识。了解 Transformer 架构、分词,以及如何将 LLMs 与 Ultralytics YOLO26 结合。
大型语言模型 (LLM) 是一种复杂的人工智能 (AI),通过海量数据集进行训练,以理解、生成和处理人类语言。这些模型代表了深度学习 (DL)的一次重大演进,利用拥有数十亿参数的神经网络来捕捉复杂的语言模式、语法和语义关系。从本质上讲,大多数现代 LLM 都依赖于 Transformer 架构,使其能够并行而非按顺序处理数据序列。该架构采用自注意力机制,使模型能够根据句子中不同词语之间的相对关系,为其分配不同的重要性,而不受它们在文本中距离远近的影响。
LLM 的核心机制#
LLM 的功能始于分词,这是一个将原始文本拆分为称为 token 的更小单元(单词或子词)的过程。在模型训练阶段,系统会分析来自互联网、书籍和文章的数 PB 文本。系统通过无监督学习来预测序列中的下一个 token,从而有效学习语言的统计结构。
完成初始训练后,开发者通常会应用微调,使模型专门用于不同的任务,例如医学分析或编程辅助。这种适应性正是 斯坦福基础模型研究中心等机构将其归类为“基础模型”的原因——它们是构建特定应用的通用基础。
实际应用#
LLM 已经从理论研究走向各行各业中具有实际影响力的应用:
- 智能虚拟助手: 现代客户服务高度依赖由 LLM 驱动的聊天机器人。与较早的基于规则的系统不同,这些智能体能够处理细微复杂的查询。为了提高准确性并减少幻觉,开发者会集成检索增强生成 (RAG),使模型能够在回答前参考外部的、最新的公司文档。
- 多模态视觉语言系统: AI 的前沿正在将文本与视觉数据连接起来。视觉语言模型 (VLMs)允许用户使用自然语言查询图像。例如,将语言交互界面与 YOLO26 这样的高性能检测器结合,可以让系统根据语音指令,在实时视频流中识别和描述对象。
使用代码连接文本与视觉#
虽然标准 LLM 处理的是文本,但业界正转向多模态 AI。下面的示例演示了如何使用 YOLO-World 通过语言提示控制计算机视觉任务。YOLO-World 是一种能够理解文本描述、执行开放词汇检测的模型。
from ultralytics import YOLOWorld
# Load a model capable of understanding natural language prompts
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes using text descriptions rather than fixed labels
model.set_classes(["person wearing a red helmet", "blue industrial machine"])
# Run inference to detect these specific text-defined objects
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show results
results[0].show()区分相关概念#
区分 LLM 与更广泛或相近的术语非常重要:
- LLM 与自然语言处理 (NLP)的区别: NLP 是一个 overarching 学术领域,关注计算机与人类语言之间的交互。LLM 是该领域中用于实现先进成果的特定工具或技术。
- LLM 与生成式 AI的区别: 生成式 AI 是一个涵盖任何能够创建新内容的 AI 的类别。LLM 是该类别中基于文本的子集,而 Stable Diffusion 等模型则代表图像生成子集。
挑战与未来展望#
尽管具备强大能力,LLM 仍面临AI 中的偏见等挑战,因为它们可能会无意中再现训练数据中存在的偏见。此外,训练 GPT-4 或 Google Gemini 等模型所需的巨大计算能力,也引发了人们对能源消耗的担忧。目前,研究重点是模型量化,以使这些系统高效到足以在边缘硬件上运行。
如需了解更深入的技术信息,原始论文 Attention Is All You Need 提供了 Transformer 的基础理论。你还可以探索 NVIDIA 如何针对这些大规模工作负载优化硬件。









