YOLO Vision 2026:
返回 Ultralytics 术语表

Model Routing

了解模型路由如何在多模型系统中为每个请求选择正确的 AI 模型,从而在准确性、成本、延迟和资源使用之间取得平衡。

模型路由是选择哪个AI模型来处理每个传入请求的过程。路由层不会将每个输入发送到一个模型,而是评估诸如请求的任务、输入类型、复杂度、延迟目标、成本限制、硬件可用性或置信度要求等信号。然后,它将请求转发给最合适的候选模型。在此上下文中,“路由器”是推理决策组件,而不是物理网络路由器。路由有助于多模型机器学习系统平衡预测质量、资源使用和推理延迟

模型路由的工作原理#

路由系统通常包含一组已部署的模型、决策逻辑和一个公共应用程序接口。应用程序提交一个请求,路由器选择一个合格的模型,然后模型服务层返回该模型的输出。

路由决策可以是:

  • 基于规则的: 使用显式元数据选择模型,例如将请求掩码的图像路由到分割模型。
  • 基于分数的: 估计每个候选模型的预期质量、成本或响应时间,并选择得分最高的选项。
  • 基于学习的: 使用轻量级分类器或路由模型来推断哪个候选模型最匹配输入。
  • 级联的: 先运行快速模型,然后将不确定或高风险的结果升级到能力更强的模型。

例如,Amazon Bedrock intelligent prompt routing在语言模型之间进行选择之前预测响应质量,而Microsoft的模型路由策略指导则描述了成本、质量和平衡路由。类似的原则也适用于计算机视觉:请求可以按任务、摄像头位置、图像分辨率或所需的预测细节进行路由。

相关概念与关键区别#

模型路由与其它多模型技术紧密相关,但这些术语不能互换。

  • AI网关 AI网关为身份验证、配额、日志记录和流量管理提供更广泛的控制层。模型选择可能是AI网关的一个功能。Kubernetes Gateway API Inference Extension也将模型感知路由与端点选择和负载均衡区分开来。
  • 模型集成 集成通常运行多个模型并组合它们的预测。路由器通常只选择一个模型,从而减少计算量。NVIDIA Triton ensemble models则定义了通过多个模型的固定数据流。
  • 混合专家 MoE架构将内部表示路由到单个神经网络内部的组件。模型路由则在可独立部署的模型或端点之间进行选择。
  • 智能体路由: 智能体路由器选择专门的智能体、工作流或工具。模型路由选择执行推理步骤的基础模型。在智能体系统中,这两种形式的路由可能同时存在。

负载均衡是另一个重要的区别。它在同一服务的副本之间分发请求以提高可用性或吞吐量。模型路由则在具有不同功能、成本或输出的模型之间进行选择。

实际应用#

视觉检测: 制造系统可以使用目标检测来进行常规零件计数,但将可疑的表面缺陷路由到实例分割以获得精确边界。Ultralytics YOLO26同时支持目标检测实例分割,使得在一致的API内进行基于任务的路由成为可能。当边界框足够时,这可以避免支付分割成本。

AI助手: 支持助手可以将简单的分类和查找请求发送给小型、快速的语言模型,同时为复杂的推理或工具使用保留更强的模型。Google Cloud的智能体架构指导将这种模式描述为平衡质量、延迟和成本的一种方式。与固定级联不同,动态路由可以在生成初始答案之前选择更强的模型。

实现与评估路由器#

这个极简的Ultralytics示例根据应用程序请求的输出,将图像路由到检测或分割:

from ultralytics import YOLO

models = {
    "detect": YOLO("yolo26n.pt"),
    "segment": YOLO("yolo26n-seg.pt"),
}

requested_task = "segment"
source = "https://ultralytics.com/images/bus.jpg"

model = models.get(requested_task)
if model is None:
    raise ValueError(f"Unsupported task: {requested_task}")

results = model(source)
result = results[0]
result.save(filename=f"{requested_task}_result.jpg")

该规则有意保持简单:需要对象掩码的请求转入分割,而只需要边界框的请求可以使用检测。生产路由器还可以考虑测量的准确性、队列深度、设备类型、隐私约束或服务健康状况。

应根据代表性流量而不是仅凭模型平均值来评估路由。跟踪每个选定模型的路由分布、端到端延迟、成本、失败情况和任务级质量。OpenTelemetry observability guidance解释了追踪、指标和日志如何跨分布式服务跟踪单个请求。Ultralytics Platform deployment monitoring同样支持检查端点延迟、错误、健康状况和请求活动。

路由错误可能会增加成本、错失延迟目标,或者将困难的输入发送给不适合的模型。因此,团队应定义回退行为、限制敏感工作负载的合格模型、记录选定的路由,并定期重新测试策略。这些控制措施使路由决策与NIST AI Risk Management Framework中的更广泛实践保持一致。

Explore solutions

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅