隆重推出 Ultralytics Agents:更快地构建视觉 AI 工作流
使用 Ultralytics Agents 构建视觉 AI 工作流。连接 YOLO、视觉语言模型、条件、数据集和操作。

训练强大的计算机视觉模型只是旅程的一部分。下一个挑战是决定当该模型做出预测时应该发生什么:保存图像、请求更多上下文、向团队发出警报,或者收集不确定的示例以供审查。
过去,团队使用单独的脚本和集成来构建这种协调。Ultralytics Agents 将其带到了视觉画布上,帮助团队以更少的自定义开发将预测转化为实际行动。
Ultralytics Platform 提供 Agents,它将图像、Ultralytics YOLO 模型、部署、条件、语言模型、数据集和操作连接在可重用的视觉工作流中。
什么是 Ultralytics Agents?#
Agents 提供了一种设计和运行计算机视觉工作流的视觉化方法。在画布上添加块,连接每个步骤,并定义图像满足特定条件时应发生的事情。
工作流可以使用官方的 YOLO26 模型、工作空间中训练的模型或现有的 Platform 部署。然后,它可以按类别计数或置信度过滤预测,将选定的图像发送到视觉语言模型,将其收集到数据集中,通知 Slack 频道,或显示结果。
借助 Agents,你可以:
- **视觉化构建:**无需从头开始手动创建完整的工作流,即可连接模型、条件和操作。
- **聚焦注意力:**仅处理符合你定义的标准的图像。
- **结合视觉和语言智能:**在请求视觉语言模型提供额外上下文之前,使用 YOLO 识别重要的内容。
- **将预测转化为行动:**保存相关图像,发送有条件的 Slack 警报,或将结果传递到下一个工作流步骤。
- **将生产洞察连接到数据:**收集不确定或重要的图像以供审查和未来的模型开发。
- **检查实现:**查看从你的视觉工作流生成的 Python。
团队不再止步于“模型检测到了什么?”,而是可以回答更有价值的问题:“接下来应该发生什么?”
从检测转向决策#
许多视觉 AI 系统需要多个工具和自定义连接。模型生成预测,应用程序逻辑对其进行评估,另一个系统存储相关输入,单独的集成发送通知。
Agents 将这些步骤整合到一个视觉工作流中。
例如,制造团队可以运行训练好的检测模型,检查缺陷是否达到选定的阈值,保存图像以供审查,并向运维频道发出警报。物流团队可以收集低置信度检测结果,以识别其训练数据中的差距。安全团队可以使用 YOLO 在受限区域中检测人员,然后要求视觉语言模型描述更广泛的场景。
工作流遵循用户设置的条件,从而清楚地了解每个下游步骤运行或不运行的原因。
结合使用 Ultralytics YOLO 和视觉语言模型#
YOLO 模型能够有效地定位、分类和计算图像中的对象。视觉语言模型可以为更广泛的视觉上下文添加自然语言解释。
Agents 使高效组合这些功能成为可能。YOLO 可以充当第一道过滤器,允许工作流仅在图像满足所需条件时调用视觉语言模型。
例如,工作流可以:
- 在图像上运行 YOLO26。
- 检查是否检测到至少一个人。
- 将匹配的图像发送到选定的视觉语言模型。
- 要求其描述场景。
- 显示生成的描述。
如果未满足条件,则描述步骤不会运行。这使团队能够更好地控制哪些图像可以通过工作流以及何时使用外部模型调用。
从可编辑的工作流模板开始#
Agents 包含模板,可帮助团队迅速从想法过渡到工作的视觉 AI 工作流。
- **YOLO → VLM 监视器:**在请求视觉语言模型描述图像之前,使用 YOLO 识别相关图像。
- **收集不确定的检测结果:**按置信度过滤预测,并在数据集中收集不确定的图像以供审查。
- **捕获并发出警报:**满足检测条件时保存图像并发送 Slack 通知。
模板提供了一个实用的起点,而不是一个固定的解决方案。团队可以选择自己的图像、模型、部署、条件、提示词、目标数据集和集成。
用户还可以检查工作流生成的 Python,将视觉开发的快速性与技术团队理解实现所需的透明度结合起来。
闭环连接部署与模型改进#
真实世界的图像可以揭示训练期间缺失或代表性不足的条件。新环境、不断变化的对象外观和不确定的检测都可能表明改进模型的机会。
Agents 帮助团队将这些观察结果转化为可操作的数据循环:
- 通过 Ultralytics YOLO 模型或 Platform 部署运行图像。
- 使用类别或置信度条件过滤结果。
- 在目标数据集中收集选定的原始图像。
- 在 Ultralytics Platform 中审查和标注图像。
- 使用由真实世界输入指导的数据进行重新训练和重新部署。
通过 Agents 收集的图像未加标签地到达目标数据集的训练集拆分中,准备在标注编辑器中进行审查。团队可以为这些目标示例贴上标签,并使用它们来指导下一个模型迭代。
这开辟了一条更直接的路径,从识别困难示例到准备更好的训练数据。
围绕真实世界结果构建工作流#
Agents 可以支持跨行业和用例的工作流:
- 制造业**:**捕获可能的缺陷以供审查,并在满足定义的条件时通知质量团队。
- 物流业**:**收集涉及集装箱、车辆或设备的 không 确定检测结果,以改善数据集覆盖范围。
- 零售业**:**根据检测到的类别或计数过滤图像,并将相关结果发送到下游操作。
- 安全 **与安防:**在请求额外的场景上下文之前,在指定的场景中检测人员或对象。
- **数据集开发:**查找低置信度示例并将它们收集到集中的审查集中。
每个工作流都可以从一个条件分支到多个操作。例如,同一个匹配图像可以保存到数据集中并触发 Slack 消息,帮助团队在通知负责审查的人员的同时保留证据。
从视觉原型到透明的 Python#
视觉工作流构建器可以加速实验,但技术团队也需要了解正在运行的内容。
Agents 允许用户检查工作流生成的 Python。这连接了视觉画布的可访问性与开发人员理解底层实现所需的透明度。
团队可以使用共享试用版测试小工作流,或者为更大的数据集、更长的运行和训练好的工作空间模型选择专用的 Platform 部署资源。
开始使用 Agents 构建#
Ultralytics Agents 帮助团队超越孤立的预测,构建互联的视觉 AI 工作流。通过将 YOLO、视觉语言模型、可配置条件、数据集和操作带到同一个画布上,Agents 创造了一条从预测到实际结果的更快路径。
Agents 目前通过抢先体验提供。切换到你的个人工作空间,并在设置 > 个人资料下启用抢先体验。这是一个个人偏好设置,包括你在团队工作空间中工作时。
然后从侧边栏打开 Agents,从模板开始,或者在 Agents 画布上构建你自己的工作流。在 Ultralytics Agents 文档中探索支持的块、条件、执行选项和设置指导。









