Prompt Engineering
掌握 AI 与计算机视觉的提示工程。了解如何优化输入,为 LLMs 和 Ultralytics YOLO26 等多模态模型带来更出色的结果。
提示工程是一个战略性过程,通过设计、改进和优化输入文本,引导人工智能 (AI)模型生成准确、相关且高质量的输出。随着 GPT-4 等大型语言模型 (LLMs)的兴起,提示工程最初受到广泛关注,如今已发展成为与各种模态的生成式 AI系统交互所需的一项关键技能,涵盖文本、图像和视频。提示工程并不通过重新训练来改变底层模型权重,而是通过以系统最容易理解的方式描述任务,利用模型已有的知识,在人类意图与机器执行之间架起桥梁。
有效提示的运作机制#
从本质上看,提示工程依赖于理解基础模型如何处理上下文和指令。构造良好的提示可以通过提供明确的约束、期望的输出格式(例如 JSON 或 Markdown)以及相关背景信息来减少歧义。高级实践者会采用少样本学习等技术,即用户在提示中提供几个输入-输出示例,以展示期望的模式。
另一种强大的策略是思维链提示,它鼓励模型将复杂的推理任务拆分为中间步骤。这可以显著提升模型处理逻辑密集型查询的性能。此外,优化上下文窗口的使用对于在长时间交互中保持连贯性至关重要;上下文窗口是模型一次能够处理的文本量上限。包括OpenAI 提示设计指南在内的外部资源强调了通过迭代改进来有效处理边界情况的重要性。
与计算机视觉的相关性#
虽然提示工程通常与文本相关,但它在计算机视觉 (CV)中的重要性也日益提升。现代多模态模型和开放词汇检测器(例如 YOLO-World)允许用户使用自然语言处理 (NLP)来定义检测目标,而不必使用预定义的数值类别 ID。
在此上下文中,“提示”是对对象的文本描述(例如“戴红色头盔的人”)。这项称为零样本学习的能力通过利用视觉特征与语义嵌入之间学到的关联,使系统能够检测未经过明确训练的对象。对于类别固定的高速生产环境,开发者最终可能会从提示式模型转向高效的重新训练模型,例如 YOLO26,但提示工程仍然是快速原型设计和保持灵活性的关键。
实际应用#
提示工程通过实现灵活且智能的自动化,为各行各业创造价值:
- **动态视觉分析:**在零售业中的 AI场景中,门店经理可以使用基于提示的视觉模型搜索特定商品,无需技术人员介入。系统今天可以被提示追踪“空货架”,第二天则追踪“摆放错误的商品”。这种灵活性让企业能够立即根据季节性趋势调整其目标检测系统。
- **自动化内容创作:**营销团队依靠详细的提示来引导文生图生成器,例如 Stable Diffusion或 Midjourney。通过设计能够指定光照、艺术风格和构图的提示,设计师可以快速生成视觉素材。
- **智能知识检索:**在客户支持中,工程师会设计“系统提示”,指导聊天机器人仅使用经过验证的公司数据回答查询。这是检索增强生成 (RAG)的关键组成部分,能够确保 AI 保持有帮助的角色,同时避免出现大型语言模型中的幻觉。
使用 Ultralytics 实现#
以下示例演示了如何使用 ultralytics 软件包以编程方式应用提示工程。在此示例中,我们使用 YOLO-World 模型,通过接受文本提示来动态定义要查找的对象;与之相对的是使用固定类别列表的标准模型,例如 YOLO26。
from ultralytics import YOLO
# Load a YOLO-World model capable of interpreting text prompts
model = YOLO("yolov8s-world.pt")
# Apply prompt engineering to define custom classes dynamically
# The model maps these text descriptions to visual features
model.set_classes(["person in safety vest", "forklift", "blue hardhat"])
# Run inference on an image
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show results - the model only detects objects matching the prompts
results[0].show()区分相关概念#
要通过 Ultralytics Platform 有效部署 AI 解决方案,区分提示工程与类似的优化技术非常重要:









