Agentic Workflows
了解智能体式工作流如何让自主 AI 智能体解决复杂任务。学习如何集成 Ultralytics YOLO26 等先进视觉工具。
智能体工作流代表了人工智能(AI)领域的一种变革性方法,多个自主实体可以在其中交互、做出决策,并以极少的人工干预执行多步骤任务。与遵循严格线性执行路径的传统机器学习流水线不同,智能体工作流具有高度动态性。它允许一个智能体或由多个智能体组成的协同网络感知环境、推理复杂问题,并利用外部工具来实现预定义目标。随着组织扩大其 AI 计划,企业级智能体工作流正在取代孤立脚本,从而在各行各业实现稳健、可扩展的自动化。
理解智能体工作流#
从本质上说,智能体工作流将 AI 从被动生成转变为主动解决问题。这要求交互方式从单次提示转变为规划、执行和观察的迭代循环。通过编排这些循环,开发者可以构建能够处理意外边界情况并自行纠正错误的系统。
为了清晰区分这些密切相关的概念:AI 智能体是负责推理和行动的单个自主实体,通常由大型语言模型(LLM)提供支持。相反,智能体工作流是统筹性的架构流程,用于管理这些智能体如何协作、共享记忆以及安排行动顺序。此外,生成式 AI主要根据用户提示,通过一次线性处理生成内容,而智能体系统则使用智能体设计模式(例如自我反思、规划和多智能体辩论),持续优化输出,直到完全达成目标。
核心组件#
以下几个基础要素推动着这些工作流的成功:
- LLM 骨干:工作流的核心推理引擎。框架会编排 OpenAI 的 GPT-4o 等先进模型,以解读用户意图并动态生成执行计划。
- 函数调用和工具使用:智能体配备了用于与外部世界交互的专用工具。这包括查询数据库、执行代码或调用计算机视觉模型来分析视觉数据。OpenAI 关于函数调用的文档等提供商文档说明了模型如何格式化输出,以可靠地触发外部 API。
- 编排框架:LangGraph、CrewAI 等库以及 Microsoft AutoGen提供了连接智能体、管理对话状态并智能路由任务所需的关键基础设施。
- 记忆和上下文管理:为防止产生幻觉并在多步骤流程中保持一致性,工作流会保留短期记忆(当前对话上下文窗口)和长期记忆(持久化数据库),以从过往交互中学习。
实际应用#
智能体工作流正在现实世界中积极解决复杂且开放式的任务:
-
**自主视觉检测:**在制造业中,智能体系统可以自动执行缺陷检测。编排智能体会触发相机工具捕获图像,使用目标检测模型处理图像并分析输出。如果发现缺陷,智能体会自主记录维护工单,并将产品转交人工复核,从而管理整个工厂的响应流程。
-
**智能文档解析:**在金融和法律领域,工作流旨在从非结构化 PDF 中提取结构化数据。智能体会迭代应用版面检测,并使用有针对性的提示词工程进行自我纠正,将提取出的表格与预期的财务模式进行核验。
-
**动态营销运营:**具有前瞻性的营销团队正通过部署智能体来重新打造营销工作流。这些智能体可以自主分析当前趋势、生成营销活动素材、测试广告文案变体,并根据实时绩效指标调整预算策略。
示例:构建视觉智能体工作流#
借助 Ultralytics Platform和 ultralytics Python 软件包,将视觉智能集成到智能体工作流中非常简单。在这个概念示例中,智能体系统使用 YOLO26作为感知工具来检查工厂生产线,使工作流的底层逻辑能够根据 预测模式结果自主决定下一步行动。
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model
model = YOLO("yolo26n.pt")
# Agentic workflow step 1: Vision tool gathers environmental data
results = model.predict("factory_line.jpg")
# Agentic workflow step 2: Agent logic evaluates the visual detections
def decision_agent(detections):
for obj in detections:
# Check if the model detected a specific class, e.g., 'defect'
if obj.names[int(obj.cls)] == "defect":
return "Action: Trigger immediate maintenance alert."
return "Action: Continue production line smoothly."
# Execute the agent's decision logic based on bounding box data
action = decision_agent(results[0].boxes)
print(action)通过在底层使用 PyTorch等框架,这些视觉工具可以将高度准确的空间感知能力输入更广泛的 AI 逻辑中。随着智能体组织不断成熟,先进推理模型与实时视觉能力的结合将推动下一代智能、自我纠正自动化的发展。通过主动学习实现持续改进和复杂的编排,智能体工作流确保 AI 系统能够端到端可靠地执行复杂策略。






