Chain-of-Thought Prompting
探索思维链 (CoT) 提示,增强 AI 推理能力。了解将任务拆分为逻辑步骤如何改进 Ultralytics YOLO26 的代码生成。
思维链(CoT)提示是一种高级提示工程技术,可让大型语言模型(LLMs)将复杂的推理任务拆分为中间逻辑步骤来解决。与其要求模型立即给出最终答案,不如通过 CoT 鼓励系统生成一种模仿人类解决问题过程的“思维链”。这种逐步推理显著提升了模型在算术、符号逻辑和常识推理等任务上的性能,改变了我们与人工智能(AI)系统交互的方式。
推理机制#
标准语言模型通常难以处理多步骤问题,因为它们会尝试通过一次处理将输入直接映射为输出。这种“黑盒”方法可能导致错误,尤其是在逻辑跨度过大时。思维链提示通过在输入问题与最终输出之间插入推理步骤来解决这一问题。
这一过程通常通过两种方式实现:
- 零样本 CoT: 用户在提示中附加类似“让我们逐步思考”的简单触发短语。无需提供具体示例,这就能激活模型潜在的推理能力。
- 少样本 CoT: 提示中包含一些问题及其逐步解答示例。这利用少样本学习向模型准确展示如何组织逻辑,然后再尝试解决新问题。
通过明确生成中间推理步骤,模型有更多机会进行自我纠正,并能让人了解它得出结论的过程。这对于减少LLMs 中的幻觉至关重要,因为否则模型可能会自信地陈述错误事实。
实际应用#
虽然思维链提示最初是为基于文本的逻辑开发的,但与计算机视觉和代码生成等其他人工智能领域结合后,它也具有强大的应用价值。
1. 增强计算机视觉代码生成#
开发者使用 CoT 引导 LLMs 为目标检测等任务编写复杂的软件脚本。与其提出“编写查找汽车的代码”这类含糊请求,不如将 CoT 提示组织为:“首先,导入必要的库。其次,加载预训练模型。第三,定义图像源。最后,运行预测循环。”这种结构化方法可确保为 YOLO26 等模型生成的代码在语法上正确、逻辑上严谨。
2. 自主决策#
在自动驾驶车辆领域,系统必须处理视觉数据并作出攸关安全的决策。思维链方法可以让系统阐述其逻辑:“我检测到人行横道附近有一名行人。行人面向道路。对我来说,交通灯是绿灯,但行人可能会走出来。因此,我会减速并准备停车。”这使人工智能的决策具有可解释性,并符合可解释人工智能(XAI)原则。
思维链的实际应用#
虽然 CoT 主要是一种自然语言技术,但也可以通过编程实现,以确保与视觉模型进行一致的交互。下面的 Python 示例演示了开发者如何组织提示,引导 LLM(此处为模拟)为 Ultralytics Platform 生成有效的推理代码。
# Example of structuring a Chain-of-Thought prompt for an LLM
# This prompt guides the model to write a valid YOLO26 inference script
cot_prompt = """
Task: Write a Python script to detect objects using YOLO26.
Chain of Thought:
1. Import the YOLO class from the 'ultralytics' library.
2. Load the 'yolo26n.pt' model weights (the latest nano model).
3. Load a sample image using a URL or local path.
4. Run the predict() function and save the results.
Based on these steps, generate the Python code below:
"""
# In a real application, you would send 'cot_prompt' to an LLM API
print(f"Structured Prompt for LLM:\n{cot_prompt}")区分相关概念#
需要将思维链提示与机器学习(ML)领域中的相似术语区分开来:
- 提示链: 这涉及连接多个独立的模型调用,其中一个步骤的输出会成为下一步骤的输入。CoT 在单个提示中运行,以引出内部推理;而提示链则跨多个交互来编排工作流。
- 检索增强生成(RAG): RAG 专注于获取外部数据(例如文档或数据库),以此为模型知识提供依据。CoT 专注于推理过程本身。二者通常会结合使用——利用 RAG 获取事实,再利用 CoT 对这些事实进行推理。
- 提示调优: 这是一种参数高效的微调方法,会在训练期间优化连续的软提示(向量)。CoT 是一种离散的自然语言策略,应用于实时推理,且不会改变模型权重。
未来展望#
随着基础模型不断发展,思维链提示正成为释放其全部潜力的标准最佳实践。Google DeepMind等机构的研究表明,随着模型规模扩大,其执行 CoT 推理的能力会大幅提升。这一演进正在为更加可靠的自主智能体铺平道路,使其能够处理从医疗保健到智能制造等行业中的复杂工作流。









