Model Routing
了解模型路由如何在多模型系统中为每个请求选择正确的 AI 模型,从而在准确性、成本、延迟和资源使用之间取得平衡。
模型路由是选择哪个AI模型来处理每个传入请求的过程。路由层不会将每个输入发送到一个模型,而是评估诸如请求的任务、输入类型、复杂度、延迟目标、成本限制、硬件可用性或置信度要求等信号。然后,它将请求转发给最合适的候选模型。在此上下文中,“路由器”是推理决策组件,而不是物理网络路由器。路由有助于多模型机器学习系统平衡预测质量、资源使用和推理延迟。
模型路由的工作原理#
路由系统通常包含一组已部署的模型、决策逻辑和一个公共应用程序接口。应用程序提交一个请求,路由器选择一个合格的模型,然后模型服务层返回该模型的输出。
路由决策可以是:
- 基于规则的: 使用显式元数据选择模型,例如将请求掩码的图像路由到分割模型。
- 基于分数的: 估计每个候选模型的预期质量、成本或响应时间,并选择得分最高的选项。
- 基于学习的: 使用轻量级分类器或路由模型来推断哪个候选模型最匹配输入。
- 级联的: 先运行快速模型,然后将不确定或高风险的结果升级到能力更强的模型。
例如,Amazon Bedrock intelligent prompt routing在语言模型之间进行选择之前预测响应质量,而Microsoft的模型路由策略指导则描述了成本、质量和平衡路由。类似的原则也适用于计算机视觉:请求可以按任务、摄像头位置、图像分辨率或所需的预测细节进行路由。
相关概念与关键区别#
模型路由与其它多模型技术紧密相关,但这些术语不能互换。
- AI网关: AI网关为身份验证、配额、日志记录和流量管理提供更广泛的控制层。模型选择可能是AI网关的一个功能。Kubernetes Gateway API Inference Extension也将模型感知路由与端点选择和负载均衡区分开来。
- 模型集成: 集成通常运行多个模型并组合它们的预测。路由器通常只选择一个模型,从而减少计算量。NVIDIA Triton ensemble models则定义了通过多个模型的固定数据流。
- 混合专家: MoE架构将内部表示路由到单个神经网络内部的组件。模型路由则在可独立部署的模型或端点之间进行选择。
- 智能体路由: 智能体路由器选择专门的智能体、工作流或工具。模型路由选择执行推理步骤的基础模型。在智能体系统中,这两种形式的路由可能同时存在。
负载均衡是另一个重要的区别。它在同一服务的副本之间分发请求以提高可用性或吞吐量。模型路由则在具有不同功能、成本或输出的模型之间进行选择。
实际应用#
视觉检测: 制造系统可以使用目标检测来进行常规零件计数,但将可疑的表面缺陷路由到实例分割以获得精确边界。Ultralytics YOLO26同时支持目标检测和实例分割,使得在一致的API内进行基于任务的路由成为可能。当边界框足够时,这可以避免支付分割成本。
AI助手: 支持助手可以将简单的分类和查找请求发送给小型、快速的语言模型,同时为复杂的推理或工具使用保留更强的模型。Google Cloud的智能体架构指导将这种模式描述为平衡质量、延迟和成本的一种方式。与固定级联不同,动态路由可以在生成初始答案之前选择更强的模型。
实现与评估路由器#
这个极简的Ultralytics示例根据应用程序请求的输出,将图像路由到检测或分割:
from ultralytics import YOLO
models = {
"detect": YOLO("yolo26n.pt"),
"segment": YOLO("yolo26n-seg.pt"),
}
requested_task = "segment"
source = "https://ultralytics.com/images/bus.jpg"
model = models.get(requested_task)
if model is None:
raise ValueError(f"Unsupported task: {requested_task}")
results = model(source)
result = results[0]
result.save(filename=f"{requested_task}_result.jpg")该规则有意保持简单:需要对象掩码的请求转入分割,而只需要边界框的请求可以使用检测。生产路由器还可以考虑测量的准确性、队列深度、设备类型、隐私约束或服务健康状况。
应根据代表性流量而不是仅凭模型平均值来评估路由。跟踪每个选定模型的路由分布、端到端延迟、成本、失败情况和任务级质量。OpenTelemetry observability guidance解释了追踪、指标和日志如何跨分布式服务跟踪单个请求。Ultralytics Platform deployment monitoring同样支持检查端点延迟、错误、健康状况和请求活动。
路由错误可能会增加成本、错失延迟目标,或者将困难的输入发送给不适合的模型。因此,团队应定义回退行为、限制敏感工作负载的合格模型、记录选定的路由,并定期重新测试策略。这些控制措施使路由决策与NIST AI Risk Management Framework中的更广泛实践保持一致。






