Agentic Workflows
智能体式工作流让 AI 智能体动态规划、决策并执行多步任务,而不是遵循固定流水线。附带视觉智能体示例。
智能体工作流是人工智能(AI)领域的一种变革性方法,多个自主实体可以在其中交互、决策并执行多步骤任务,且只需极少的人工干预。与遵循严格线性执行路径的传统机器学习流水线不同,智能体工作流具有很强的动态性。它允许智能体或协同工作的智能体网络感知环境、推理复杂问题,并利用外部工具实现预设目标。随着组织扩大 AI 项目规模,企业级智能体工作流正取代彼此孤立的脚本,在各行各业实现稳健、可扩展的自动化。
了解智能体工作流#
从本质上说,智能体工作流让 AI 从被动生成转向主动解决问题。这需要从单次提示交互转变为规划、执行和观察的迭代循环。通过编排这些循环,开发者可以构建能够处理意外边缘情况并自行纠正错误的系统。
为了清楚区分密切相关的概念:AI 智能体是单个自主实体(通常由大语言模型(LLM)驱动),负责推理并采取行动。相比之下,智能体工作流是统筹智能体协作、共享记忆和安排行动顺序的整体架构流程。此外,生成式 AI主要根据用户提示,通过单次线性处理创建内容;智能体系统则采用自我反思、规划和多智能体辩论等智能体设计模式,持续完善输出,直到完全实现目标。
核心组件#
以下几个基础要素推动了这些工作流的成功:
- LLM 主干模型:工作流的核心推理引擎。框架会编排大型语言模型来理解用户意图,并动态生成执行计划。
- 函数调用与工具使用:智能体配备特定工具,以便与外部世界交互。这包括查询数据库、执行代码,或调用计算机视觉模型分析视觉数据。模型会发出结构化函数调用,供工作流可靠地触发外部 API。
- 编排框架: LangGraph、CrewAI 和 Microsoft AutoGen等库提供关键基础设施,用于连接智能体、管理对话状态并智能地分配任务。
- 记忆与上下文管理:为了防止幻觉并在多步骤流程中保持一致性,工作流会保留短期记忆(当前对话的上下文窗口)和长期记忆(持久化数据库),以便从过往交互中学习。
实际应用#
智能体工作流正在现实世界中主动解决复杂、开放式任务:
-
自主视觉检测:在制造业中,智能体系统可以自动执行缺陷检测。编排智能体会调用摄像头工具拍摄图像,使用目标检测模型处理图像并分析结果。如果发现缺陷,智能体会自主创建维护工单,并将产品转交人工审核,从而管理整个工厂的响应流程。
-
智能文档解析:在金融和法律领域,工作流旨在从非结构化 PDF 中提取结构化数据。智能体会迭代执行版面检测,并使用有针对性的提示工程进行自我纠正,还会依据预期的财务架构验证提取出的表格。
-
动态营销运营:富有前瞻性的营销团队正通过部署智能体来革新营销工作流。智能体可以自主分析当前趋势、生成营销活动素材、测试广告文案的不同版本,并根据实时绩效指标调整预算策略。
示例:构建视觉智能体工作流#
使用 Ultralytics Platform和 ultralytics Python 包,可以轻松将视觉智能集成到智能体工作流中。在此示例中,智能体系统使用 YOLO26作为感知工具检查工厂产线,让工作流的底层逻辑能够根据预测模式的结果自主决定下一步行动。
from ultralytics import YOLO
# 加载推荐的 Ultralytics YOLO26 模型
model = YOLO("yolo26n.pt")
# 智能体工作流第 1 步:视觉工具收集环境数据
results = model.predict("factory_line.jpg")
# 智能体工作流第 2 步:智能体逻辑评估视觉检测结果
def decision_agent(detections, names):
for obj in detections:
# 检查模型是否检测到特定类别,例如“defect”
if names[int(obj.cls)] == "defect":
return "Action: Trigger immediate maintenance alert."
return "Action: Continue production line smoothly."
# 根据边界框数据执行智能体的决策逻辑
action = decision_agent(results[0].boxes, results[0].names)
print(action)这些视觉工具在底层利用 PyTorch等框架,将高精度空间感知信息传递给更广泛的 AI 逻辑。随着智能体组织日渐成熟,先进推理模型与实时视觉能力的结合将推动新一代智能、自我纠正的自动化系统发展。通过主动学习持续改进并进行复杂编排,智能体工作流能帮助 AI 系统端到端地可靠执行复杂策略。










