Agentic RAG
探索智能体式 RAG 如何通过自主推理增强 AI。了解 Ultralytics YOLO26 和 Ultralytics Platform 如何支持智能检索与视觉任务。
智能体检索增强生成(Agentic RAG)是一种先进的人工智能 (AI)架构,通过整合自主AI 智能体增强传统检索系统。标准 RAG 流程按照线性的“检索并生成”顺序运行,而智能体 RAG 则赋予大语言模型 (LLM)充当智能编排器的能力。该智能体可以独立分析用户提示,判断是否需要外部信息,制定多个搜索查询,评估检索到的数据,并迭代优化研究过程,直到整理出全面且准确的答案。借助函数调用和工具使用能力,这些系统可以在各种数据库、API 和分析工具之间动态路由查询,从而显著减少处理复杂多步骤问题时的LLM 幻觉。
智能体 RAG 系统的工作原理#
智能体 RAG 的核心创新在于其循环和推理能力。领先的智能体 AI 框架会将这一过程组织成动态、自主的工作流:
- 查询规划与路由:智能体将复杂问题拆解为更小、更易管理的子任务,并将每个子任务路由至最合适的工具或向量数据库。
- 迭代检索:与静态检索不同,智能体会审查获取的文档。如果上下文信息不足,它会重新制定搜索策略并再次发起查询。
- 工具集成:智能体可以编写和执行代码、进行数学计算,或触发机器学习 (ML)模型,以即时合成新数据。
智能体 RAG 与标准 RAG#
要实现稳健的生成式流程,区分智能体 RAG 与其基础概念至关重要:
- 标准检索增强生成 (RAG):采用单次处理流程。它根据语义相似度获取文档并生成响应。面对需要分多个步骤综合不同数据源的复杂逻辑时,它往往难以应对。
- 智能体 RAG:引入决策机制和循环。智能体会评估检索质量,并可在最终生成内容之前触发后续搜索或调用其他工具。
- 多模态 RAG:专注于检索多种数据类型(图像、文本、视频)。智能体 RAG 可以控制多模态 RAG 流程,决定何时搜索视觉数据库,何时搜索文本文件。
实际应用#
智能体 RAG 正通过自动化深度研究和复杂故障排查任务,改变各个行业,而这些任务能够模拟人类的分析推理过程。
- 企业知识合成:在企业环境中,智能体可能会收到“总结我们第三季度的业绩,并与最大竞争对手的最新财报进行比较”的提示。智能体会自主查询内部财务数据库,实时搜索竞争对手的申报文件,使用计算器工具分析数据,并起草一份全面的简报。
- 自主质量检测:在制造业中,可以要求智能体识别装配故障的根本原因。它可以触发计算机视觉 (CV)模型检查实时摄像头画面,查询历史维护日志,并根据视觉和文本证据综合生成诊断报告。
将视觉 AI 集成到智能体工作流中#
视觉模型为与物理世界交互的智能体 RAG 系统提供了强大的感知工具。例如,智能体可以使用Ultralytics YOLO26从图像或视频流中动态检索视觉上下文,以回答用户查询。开发者可以使用Ultralytics Platform管理这些定制视觉工具的数据标注和训练。
下面的 Python 示例演示了 AI 智能体如何以编程方式调用 Ultralytics YOLO26,从图像中提取结构化观测结果,为下一步推理收集事实性上下文。
from ultralytics import YOLO
# Initialize YOLO26 for the agent's visual retrieval tool
model = YOLO("yolo26n.pt")
# The agent invokes the model on an image to gather visual facts
results = model("https://ultralytics.com/images/bus.jpg")
# The agent parses the detected objects to formulate its next query or action
visual_context = [model.names[int(c)] for c in results[0].boxes.cls]
print(f"Agent Observation: I currently see {', '.join(visual_context)}.")通过将高能力视觉模型连接到推理引擎,智能体 RAG 弥合了静态知识检索与动态现实世界空间智能之间的鸿沟。若要深入了解不断发展的自主系统领域,斯坦福 AI 指数报告提供了对智能体能力的全面追踪。









