AI Gateway
了解 AI 网关是什么、如何路由模型、控制成本、保护请求并监控推理,从而实现可靠的 AI 和 Ultralytics YOLO 部署。
AI 网关是位于应用与一个或多个人工智能服务之间的控制层。与 API 网关类似,它接收请求并将其转发到后端,但还增加了针对 AI 的控制功能,用于管理模型选择、令牌或计算资源使用、安全性、隐私、成本和性能。它可以为云端模型、自托管系统和 Ultralytics YOLO 模型服务提供一个稳定的端点,使生产环境中的人工智能系统更易于治理,即使其模型和提供商不断变化。(learn.microsoft.com)
AI 网关的工作原理#
网关会在将每个传入请求发送到推理引擎之前对其进行评估。根据配置的策略,它可能会:
- 对请求进行身份验证和保护: 应用访问控制、配额、输入验证,以及基于 OWASP Top 10 for LLM Applications 的防御措施,同时遵循更广泛的数据安全实践。
- 智能路由流量: 根据延迟、可用性、成本、区域、任务或硬件负载选择模型或端点。Kubernetes Gateway API Inference Extension 为自托管生成式模型的感知模型路由提供了标准化方案。
- 提升可靠性: 当提供商或模型不可用时,使用重试、负载均衡和 Vercel AI Gateway model fallbacks。
- 控制消耗: 通过 Envoy Gateway rate limiting 等策略执行请求、令牌或计算资源预算。
- 记录遥测数据: 通过使用 OpenTelemetry GenAI attributes 等标准的可观测性系统,捕获延迟、错误、模型选择和使用情况。(gateway.envoyproxy.io)
实际应用#
- 零售视觉检测: 摄像头通过网关将产品图像提交给 YOLO26 object detection model。网关对每家门店进行身份验证、限制请求量、将流量路由到最近的部署,并将失败请求发送到备用端点,从而支持可靠的实时推理。
- 多模型客户助手: 应用使用 Vercel AI Gateway unified API 或 Cloudflare AI Gateway,将简单问题路由到成本较低的模型,将复杂请求路由到功能更强的模型。日志可用于成本分析、调试和模型监控。
- 企业 AI 访问: 组织可以使用 Azure API Management AI gateway capabilities,通过集中式身份验证、配额、日志记录和内容安全策略,对模型、工具以及远程 Model Context Protocol services 进行治理。(learn.microsoft.com)
计算机视觉示例#
推理代码仍专注于预测,而网关负责处理访问、路由、限制和遥测数据:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
results = model.predict("https://ultralytics.com/images/bus.jpg")
detections = len(results[0].boxes)
print({"detections": detections})此处理程序可以运行在 Ultralytics Platform deployment endpoint 后方,其中部署监控会跟踪请求、延迟、错误、日志和运行状况检查。(learn.microsoft.com)
AI 网关与相关术语#
AI 网关管理模型执行之前和之后的流量,而模型部署是将模型投入生产,模型服务则执行预测。推理网关的专业化程度更高,专门优化模型副本或加速器之间的路由。与此同时,AI agent orchestration负责协调多步骤决策和工具,而不是控制网络访问。
当前的最佳实践包括尽量减少记录敏感内容、应用数据隐私控制、测试备用路径、跟踪每个模型的质量和成本,以及遵循 NIST Generative AI Risk Management Profile。近期关于 LLM control planes 和模型路由中的对抗性风险的研究也强调了可审计策略和安全路由决策的重要性。(nist.gov)









