Prompt Engineering
掌握 AI 与计算机视觉的提示工程。学习如何为 LLM 和 Ultralytics YOLO26 等多模态模型优化输入,以获得卓越结果。
提示词工程是设计、精炼和优化输入文本的策略性过程,旨在引导人工智能(AI)模型产出准确、相关且高质量的输出。该学科最初随着 GPT-4 等大语言模型(LLM)的兴起而备受瞩目,如今已演变为跨文本、图像和视频等各种模态与生成式 AI 系统进行交互的关键技能。提示词工程不是通过重新训练来改变底层模型权重,而是通过以系统最容易理解的方式构筑任务,来充分利用模型的现有知识,从而架起人类意图与机器执行之间的桥梁。
高效提示的机制#
提示词工程的核心在于理解基础模型如何处理上下文和指令。一个结构良好的提示词通过提供明确的约束、期望的输出格式(如JSON 或 Markdown)以及相关的背景信息来减少歧义。高级从业者会使用少样本学习等技术,即用户在提示词中提供几个输入输出对的示例,以演示所需的模式。
另一种强大的策略是思维链提示,它鼓励模型将复杂的推理任务分解为中间步骤。这显着提高了对逻辑繁重查询的处理性能。此外,优化上下文窗口(即模型一次能处理的文本量限制)的使用对于在长交互中保持连贯性至关重要。OpenAI 关于提示词设计的指南等外部资源强调了迭代精炼对于有效处理边缘情况的重要性。
在计算机视觉中的相关性#
虽然提示词工程通常与文本相关,但它在计算机视觉(CV)中的重要性日益凸显。现代多模态模型和开放词汇检测器(例如 YOLO-World)允许用户使用自然语言处理(NLP)而不是预定义的数字类别 ID 来定义检测目标。
在这种情况下,“提示词”是对对象的文本描述(例如,“戴着红色头盔的人”)。这种被称为零样本学习的能力使系统能够利用视觉特征和语义嵌入之间学到的关联来检测它们未经过明确训练的对象。对于类别固定的高速生产环境,开发人员最终可能会从提示词驱动的模型过渡到像 YOLO26 这样高效、经过重新训练的模型,但提示词工程仍然是快速原型设计和保持灵活性的关键。
实际应用#
提示工程通过实现灵活且智能的自动化,在各行各业中创造价值:
- **动态视觉分析:**在零售业中的 AI 应用中,店长无需进行技术干预,即可使用基于提示词的视觉模型来搜索特定商品。系统可以被提示在一天追踪“空货架”,在另一天追踪“放错位置的产品”。这种灵活性使企业能够立即调整其目标检测系统以适应季节性趋势。
- **自动化内容创作:**营销团队依靠详细的提示词来指导文本到图像生成器,例如 Stable Diffusion 或 Midjourney。通过设计指定光照、艺术风格和构图的提示词,设计人员可以快速生成视觉资产。
- **智能知识检索:**在客户支持中,工程师设计“系统提示词”,指示聊天机器人仅使用经过验证的公司数据来回答查询。这是检索增强生成(RAG)的关键组成部分,可确保 AI 保持乐于助人的角色,同时避免LLM 中的幻觉。
使用 Ultralytics 进行实现#
以下示例演示了如何使用 ultralytics 包以编程方式应用提示词工程。在这里,我们使用一个 YOLO-World 模型,它接受文本提示词来动态定义要寻找的对象,这与使用固定类别列表的标准模型(如 YOLO26)形成鲜明对比。
from ultralytics import YOLO
# Load a YOLO-World model capable of interpreting text prompts
model = YOLO("yolov8s-world.pt")
# Apply prompt engineering to define custom classes dynamically
# The model maps these text descriptions to visual features
model.set_classes(["person in safety vest", "forklift", "blue hardhat"])
# Run inference on an image
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show results - the model only detects objects matching the prompts
results[0].show()区分相关概念#
为了通过Ultralytics 平台有效地部署 AI 解决方案,区分提示词工程和类似的优化技术非常重要:






