Prompt Chaining
了解提示链如何将复杂的 AI 任务拆分为可靠的工作流。探索如何将 Ultralytics YOLO26 与 LLMs 集成,构建高级 AI 智能体。
提示词链是一种先进的架构模式,应用于人工智能 (AI)开发:它将复杂任务分解为一系列更小且易于管理的子任务。在此工作流中,一个步骤的输出(通常由大型语言模型 (LLM)或计算机视觉系统生成)会作为后续步骤的输入。与试图一次性解决多方面问题的单体式提示词不同,提示词链让开发者能够构建更可靠、更易测试且功能更强大的应用。这种模块化方法对于创建能够进行推理、浏览网页或与物理环境交互的复杂AI 智能体至关重要。
提示词链的工作机制#
从本质上看,提示词链解决了基础模型在上下文窗口和推理能力方面的局限。当要求模型在单个请求中执行过多不同操作时(例如:“分析这张图像、提取其中的文本、将其翻译成西班牙语,并将其格式化为 JSON 发票”),出错的概率就会增加。将任务拆分成流水线后,开发者可以验证每个阶段的准确率。
高效的提示词链通常会使用以Python编写的“胶水代码”,或通过LangChain等编排库进行管理,以处理步骤之间的数据转换。这样便可以集成不同的技术,例如将目标检测的视觉识别能力与生成式文本模型的语言流畅性结合起来。
实际应用#
当需要连接不同的数据模态时,提示词链尤其强大,可以让多模态模型在动态的工业和商业环境中运行。
-
自动化视觉报告: 在智能制造中,质量控制系统可以将视觉模型与 LLM 串联起来。首先,像Ultralytics YOLO26这样的高速模型会扫描装配线上的组件。结构化输出(例如,“Class: Dented_Can, Confidence: 0.92”)会被转换为文本字符串。随后,系统会将该文本传递给语言模型,并使用类似“根据此缺陷起草一份维护请求”的提示词,从而为车间经理生成一封易于阅读的电子邮件。
-
上下文感知型客户支持: 智能聊天机器人通常使用提示词链来处理复杂的用户查询。链中的第一个环节可能会使用自然语言处理 (NLP)对用户意图进行分类。如果意图涉及技术问题,系统就会触发检索增强生成 (RAG)工作流:为查询生成嵌入,在向量数据库中搜索相关文档,最后提示 LLM 将检索到的文本片段综合成有帮助的答案。
视觉到语言代码示例#
下面的示例展示了提示词链中的第一个“环节”:使用计算机视觉 (CV)生成结构化数据,为后续提示词提供上下文。
from ultralytics import YOLO
# Load the YOLO26 model (natively end-to-end and highly efficient)
model = YOLO("yolo26n.pt")
# Step 1: Run inference to 'see' the environment
results = model("https://ultralytics.com/images/bus.jpg")
# Step 2: Format visual detections into a natural language string
det_names = [model.names[int(c)] for c in results[0].boxes.cls]
prompt_context = f"The scene contains: {', '.join(det_names)}. Please describe the likely activity."
# The 'prompt_context' variable is now ready to be sent to an LLM API
print(prompt_context)区分相关概念#
为了实现有效的机器学习 (ML)架构,有必要将提示词链与 AI 领域中的相近术语区分开来:
- 与思维链提示的区别: 思维链 (CoT) 是一种在单个提示词内部使用的技术,用于鼓励模型“展示其推理过程”(例如:“逐步思考”)。提示词链涉及多次彼此独立的 API 调用,其中步骤 B 的输入取决于步骤 A 的输出。
- 与提示词工程的区别: 提示词工程是一门更广泛的学科,旨在优化文本输入,以获得更好的模型性能。提示词链则是一种具体的工程模式,重点关注操作的顺序流转和逻辑控制。
- 与提示词调优的区别: 提示词调优是一种模型优化方法,会在训练阶段更新可学习参数(软提示词)。提示词链完全发生在实时推理期间,并不会改变模型的模型权重。
借助提示词链,团队可以构建集成逻辑、数据检索和动作识别的稳健应用。对于管理数据集以及训练为这些链提供支持的视觉模型,Ultralytics 平台提供了用于标注、训练和部署的集中式解决方案。









