Large Action Models (LAM)
探索大型动作模型(LAM)及其如何驱动自主 AI 智能体。了解如何集成 Ultralytics YOLO26,实现从视觉到动作的工作流和任务自动化。
大型行动模型 (LAM) 是一类先进的生成式人工智能,旨在超越文本生成,能够自主执行任务并与数字环境交互。传统模型严格处理和生成文本,而 LAM 则充当 AI 智能体的核心认知引擎,将人类意图转化为具体的多步骤行动。通过弥合自然语言理解与现实世界执行之间的差距,这些模型代表了迈向通用人工智能 (AGI)和高度自主系统的重要一步。
大型行动模型的工作原理#
LAM 建立在传统基础模型的基础架构之上,但经过专门训练,可以与软件、API 和 Web 环境进行交互。借助强化学习和函数调用等技术,LAM 可以将复杂的用户请求拆分为逻辑步骤,操作图形用户界面,并执行 API 端点。例如, Anthropic 的 Claude 3.5 computer use和 Salesforce 的 xLAM 系列的近期发展表明,这些系统可以像人类操作员一样自主点击按钮、填写表单和管理工作流。
当与计算机视觉系统结合时,LAM 的能力会进一步增强。视觉输入可以由 Ultralytics YOLO26 等高效模型进行处理,使 LAM 能够“看见”其环境、理解视觉上下文,并根据检测到的内容触发特定的程序化操作。
实际应用#
LAM 正在改变各行业处理任务自动化的方式,从被动辅助转向主动执行。
- 零售领域的 AI和客户支持: LAM 不仅可以回答客户问题,还能自主处理产品退货。如果用户要求取消订单,模型可以操作公司的计费软件、核实政策、发放退款,并在无需人工干预的情况下更新库存数据库。
- 医疗领域的 AI管理: 在临床环境中,LAM 可以协调复杂的工作流。它们能够提取患者请求、交叉核对医生的可预约时间,通过内部医疗软件自动更新电子健康记录 (EHR),并完成预约安排。
使用代码自动化视觉工作流#
LAM 经常与视觉模型集成,以自动执行视觉检查。下面的 Python 示例演示了假设的 LAM 工作流如何利用 ultralytics 扫描图像,并根据目标检测结果触发自动化库存操作。
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for an agentic vision task
model = YOLO("yolo26n.pt")
# The LAM commands the model to scan a warehouse shelf image
results = model.predict("inventory_shelf.jpg")
# The LAM extracts actionable data to autonomously trigger a supply reorder
for result in results:
detected_items = len(result.boxes)
if detected_items < 10:
print(f"Low inventory ({detected_items} items). Action triggered: Reordering supplies via API.")用户可以使用 Ultralytics Platform无缝部署和监控此类视觉操作集成工作流,该平台为现代 AI 解决方案提供可靠的云基础设施。
区分相关概念#
要全面理解现代 AI 格局,区分 LAM 与其他密切相关的术语会很有帮助:
- LAM 与大型语言模型 (LLM)的区别: LLM 专门用于处理、总结和生成语言,就像高度先进的文本预测器一样。LAM 融合了这种语言理解能力,但经过专门设计,可以与外部工具交互并完成数字操作。
- LAM 与智能体式 AI 的区别: “智能体式 AI”描述的是能够自主运行的总体系统或软件实体。大型行动模型是底层神经网络,也就是赋予智能体规划和执行这些行动能力的“大脑”。
- LAM 与智能体式 RAG的区别: 智能体式 RAG 专注于自主检索和综合外部信息,以提高生成答案的准确性。LAM 专注于操纵系统和改变状态(例如预订航班或移动文件),而不仅仅是检索数据。








