YOLO Vision 2026:
Ultralytics 平台

在 Ultralytics Platform 上监控已部署的计算机视觉模型

了解如何使用 Ultralytics Platform 监控生产环境中的计算机视觉模型。跟踪指标、检测问题并提升可靠性。

ABAbirami Vina5 min read
在 Ultralytics Platform 上监控已部署的计算机视觉模型

测试用于分析图像和视频的计算机视觉模型并不总是等同于在生产环境中运行它们。在开发过程中,这类模型或算法通常在干净、准备完善的数据集上进行测试,条件受到控制且具有可预测性。

部署后,情况会变得更加动态。模型会接触真实世界的流量,请求量可能发生变化,响应时间可能改变,也可能偶尔出现故障。

在这一阶段,重点转向系统是否能够可靠运行,以及端点能否在不断变化的条件下保持可用、响应迅速且稳定。

这就是监控不可或缺的原因。通过请求量、延迟、错误率和整体系统健康状况等指标,监控可以清晰展示已部署端点在生产环境中的运行情况。

为了让这一过程更加轻松,配备合适的工具与模型本身同样重要。最近,Ultralytics 推出了 Ultralytics Platform,这是我们的全新端到端环境,将完整的计算机视觉工作流整合在一起,覆盖从数据和训练到部署与监控的各个环节。

带有监控功能的 Ultralytics Platform 部署仪表板

图 1. 带有监控功能的 Ultralytics Platform 部署仪表板(来源

由于监控功能直接融入这一工作流,用户无需依赖独立工具即可跟踪端点健康状况、检查请求行为并维护可靠的系统。在本文中,我们将探索如何使用 Ultralytics Platform 监控已部署模型的端点,并让生产系统平稳运行。让我们开始吧!

AI 模型监控概览#

在 AI 模型生命周期中,监控是指观察模型上线并处理真实世界请求后,已部署系统的运行表现。训练和验证可以展示机器学习模型(ML)在准备好的数据集上的表现,而监控则关注已部署端点在生产环境中的运行方式。

监控的关键部分是跟踪反映可靠性和响应能力的系统级指标。延迟和运行时间等指标有助于说明系统处理传入请求的能力。延迟衡量处理请求并返回响应所需的时间,而运行时间则体现端点保持可用的一致性。

另一个重要方面是可观测性,它可以让你了解请求是如何被处理的。每当图像或视频帧等输入发送到已部署模型时,都会作为推理请求进行处理。

日志会记录这些请求,以及时间戳、响应时间和状态代码等详细信息。借助日志,可以更轻松地追踪请求、调试问题,并在故障发生时进行调查。日志对于识别重复错误、响应缓慢或系统行为异常等模式尤其有用。

通过结合指标和日志,监控可以帮助用户了解系统在生产环境中的运行状况,并在问题出现时迅速响应。

了解模型性能指标与系统指标的区别#

在深入了解生产监控之前,我们先讨论模型性能指标与系统指标之间的区别。

通常,模型监控与准确率、精确率、召回率和 mAP(平均精度均值)等评估指标(也称为模型指标)相关。这些指标用于描述模型行为并评估模型预测的质量,通常会结合生产数据或输入数据进行分析。它们对于识别新数据中的边缘案例或异常值尤其有用。

不过,这与监控生产环境中的已部署系统有所不同。在这种情况下,监控关注的是系统如何运行,而不是直接评估模型预测结果。

部署监控不依赖模型指标,而是依赖请求量、延迟、错误率和运行时间等系统级信号。这些指标可以帮助你了解端点如何处理输入数据、响应是否一致,以及端点在生产环境中的运行方式。

模型监控在计算机视觉项目中的作用#

接下来,我们来看一个突出说明计算机视觉部署为何需要监控系统的真实案例。

考虑这样一个视觉解决方案:它使用姿态估计来监控建筑工人是否遵守安全规范。姿态估计是一项计算机视觉任务,用于识别和分析人体动作。在初次部署模型时,这类系统可能在视野清晰、场景标准且受控的条件下表现良好。

然而,真实的建筑工地会带来更多复杂性。请求量可能在一天中不断变化,网络条件可能不稳定,而且多个摄像头或端点可能同时发送数据。如果没有得到适当监控,这些因素可能导致响应变慢或偶发故障。

用于监控建筑工地工人的姿态估计

图 2. 用于监控建筑工地工人的姿态估计(来源

在这样的生产环境中,了解系统运行的可靠程度非常重要。监控可以让你了解端点是否可用、响应传入请求的速度,以及端点能否随着时间推移持续处理流量。

例如,延迟上升可能意味着负载增加或资源受限,而错误率上升则可能表明请求处理或系统稳定性存在问题。日志可以展示单个请求的处理过程以及故障发生的位置,从而提供更多背景信息。

通过跟踪这些信号,AI 爱好者和数据科学家可以及早发现问题、更有效地排查故障,并确保系统在真实世界条件变化时继续可靠运行。

使用 Ultralytics Platform 监控已部署的视觉模型#

在许多深度学习工作流中,日志、指标和系统健康状况通常由不同工具分别处理。这种分散的设置会使你难以清晰了解已部署端点在生产环境中的运行情况,也增加了部署管理的复杂性。

Ultralytics Platform 将监控直接融入统一环境,覆盖从数据导入和标注到训练、部署与监控的完整计算机视觉工作流,从而简化了这一过程。

借助这种集成设置,用户无需搭建外部日志系统或额外的仪表板,即可跟踪已部署端点如何处理真实世界流量。所有信息都集中在一处,更便于观察系统行为并长期维护可靠的部署。

你可以直接从 Deploy 选项卡访问监控功能。在单个仪表板中,用户可以跟踪关键指标、分析请求级行为并可视化趋势。这些内置可视化功能让你无需在不同工具之间切换,就能更轻松地了解解决方案的运行表现。

平台将监控、部署和模型管理整合到更广泛的工作流中,降低了整体复杂性。这样一来,你可以更顺畅地专注于管理部署、优化系统性能并维护可靠性。

Ultralytics Platform 的内置监控功能#

在真实世界的部署中,监控依赖于对系统运行状况的清晰了解,因为条件会随着时间推移而变化。监控不只是跟踪少量指标,还包括了解已部署端点在不同环境中的行为,以及有效管理多个部署。

Ultralytics Platform 结合视觉 AI 社区针对常见计算机视觉挑战提供的反馈,加入了多项功能,让监控更加实用且易于扩展。

下面概览其中一些关键功能:

  • 全局部署可见性: Deploy 页面包含一张交互式世界地图,通过可视化指示器显示部署区域以及活跃和正在进行中的端点,帮助用户监控地理分布和区域活动。
  • 灵活的仪表板视图: 部署仪表板提供多种视图模式,包括卡片视图、紧凑网格视图和表格视图。表格支持按名称、区域、状态和请求数等列排序,便于进行结构化监控和比较。
  • 监控多个端点: 仪表板通过概览卡片和部署列表汇总所有部署中的监控数据。
  • 数据保留策略: 监控数据会保留指定期限,其中指标可保留 30 天,日志可保留 7 天,从而支持近期性能分析和调试工作流。
  • 外部监控支持: 你可以使用 Datadog、New Relic 和运行时间监控服务等外部工具监控部署端点,也可以通过 API 端点进行自定义监控和健康检查。

接下来,我们将更详细地介绍其中一些功能,并了解如何使用它们监控生产环境中的已部署端点。

如何使用 Ultralytics Platform 跟踪关键性能指标#

模型部署后,监控首先要跟踪关键系统指标。准确率和召回率等指标在开发期间很有用,但生产监控关注的是响应时间和错误率等系统级信号,它们可以量化反映端点处理真实世界流量的可靠程度。

Ultralytics Platform 提供集中式仪表板,清晰展示端点活动和系统行为。具体来说,Deployment 仪表板包含四项关键指标,用于显示端点的使用情况以及端点对传入请求的响应方式。

下面详细了解这些指标:

  • 总请求数: 24 小时内所有端点收到的请求总数。这有助于识别使用模式和整体需求。
  • 活跃部署: 当前正在运行并处理请求的端点数量。
  • P95 延迟: 95% 的请求完成处理所需的响应时间。通过考虑较慢的响应,这一指标可以更真实地反映性能。
  • 错误率: 失败请求数占请求总数的百分比。这一指标有助于识别问题,也可用于检测异常。

简而言之,这些指标可以清晰展示已部署端点在生产环境中的运行情况。通过分析使用模式,团队和个人可以了解流量分布、识别负载高峰期,并确保系统在使用量增长时仍保持响应迅速和可靠。

通过日志了解模型部署行为#

指标可以提供系统性能的高层视图,而日志则能更详细地展示已部署端点如何处理单个请求。日志会记录发送到端点的每个请求及其对应的响应。

日志有助于跟踪问题、检查故障并了解请求的处理过程。在 Ultralytics Platform 中,你可以选择任意部署来查看其详细信息,包括日志。

Ultralytics Platform 中的日志示例

图 3. Ultralytics Platform 中的日志示例(来源

平台中的日志条目以结构化格式显示,更便于了解每个请求期间发生的情况。每个条目都包含严重性级别,用于表示事件的重要程度,以及显示事件发生时间的时间戳。

日志还包含描述事件的消息,以及状态代码和延迟等 HTTP 相关详细信息。这些信息有助于追踪请求、排查问题并更有效地调试故障。此外,日志会按严重性分组,因此用户可以优先处理需要关注的部署。

在 Ultralytics Platform 上分析端点健康状况和可靠性#

监控还包括了解已部署端点的整体健康状况,包括端点是否正常运行、能否及时响应,以及能否持续无错误地处理请求。Ultralytics Platform 清晰展示每个部署的健康状态,让你可以轻松确认端点是否按预期运行。

平台会在单个部署卡片上为每个部署显示可视化健康指示器。

例如,绿色指示器表示端点健康且响应正常,红色指示器则表示存在问题或发生停机。旋转图标表示系统正在主动检查部署状态。

通过持续跟踪端点健康状况,可以及早发现问题、保持稳定的性能,并确保生产环境中运行的应用获得稳定的使用体验。

监控数据与性能改进之间的联系#

模型监控不仅仅是跟踪指标。它还会形成支持持续改进的反馈回路。随着端点处理真实世界流量,指标和日志中会逐渐显现出一些模式,揭示延迟增加、错误率上升或系统行为不一致等问题。

监控可以突出需要关注的领域。例如,持续较高的延迟可能表明需要更好地分配资源或进行扩展,而不断上升的错误率可能指向请求处理或系统稳定性方面的问题。

发现这些问题后,就可以采取措施提高可靠性。这可能包括调整基础设施、扩展资源,或修复请求处理方式中的问题。完成这些更改后,还可以继续监控系统,以确认性能是否得到改善。

将监控与持续改进结合起来,用户就能在使用量增长和条件变化时维持稳健的系统。

探索真实案例:监控航空行李处理#

为了更好地了解监控在真实场景中的影响,我们来探索它如何应用于航空地面作业自动化。

设想一个用于监控飞机地面作业期间行李装卸的视觉系统。在这一设置中,可以使用类似 Ultralytics YOLO26 的目标检测模型来检测行李是否从传送带或行李处理设备上掉落。

在测试和早期部署期间,该实时系统可能表现良好,能够准确识别行李并快速响应。

然而,在真实的机场环境中,条件要难以预测得多。光照会在一天中不断变化,多个摄像头会同时传输数据,请求量也会在繁忙时段激增。这些因素可能导致延迟上升或出现错误;如果无法了解系统内部情况,这些问题很容易被忽视。

这正是监控发挥价值的地方。通过跟踪请求量、延迟和错误率等指标,并结合详细日志,团队可以快速发现端点何时变慢或发生故障。如果延迟在高峰时段上升,可能意味着需要扩展资源;而错误突然增加,则可能指向特定摄像头或请求处理方面的问题。根据这些信号采取行动,有助于保持系统可靠,从而即使条件发生变化,也能继续准确监控行李处理。

要点总结#

当已部署的计算机视觉模型脱离开发阶段的受控条件并开始处理真实世界流量后,监控正是维持其可靠性的关键。监控关注请求量、延迟、错误率和运行时间等系统级信号,并结合详细日志,提供及早发现问题并让生产系统平稳运行所需的可见性。

监控功能直接融入部署工作流后,Ultralytics Platform 让你无需依赖独立工具即可跟踪端点健康状况、检查请求行为并维护可靠的系统。平台将数据、训练、部署和监控集中在一处,帮助团队从实验阶段走向可靠的真实世界部署。

加入不断壮大的社区,并探索我们的 GitHub 代码库,进一步了解视觉 AI。要立即开始构建视觉 AI 项目,请查看我们的许可选项。访问我们的解决方案页面,了解制造业中的 AI医疗保健中的 AI如何塑造未来。

Explore solutions

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅