AI Gateway
了解什么是 AI gateway,它是如何路由模型、控制成本、保护请求并监控推理,以实现可靠的 AI 和 Ultralytics YOLO 部署的。
AI 网关是放置在应用程序和一个或多个人工智能服务之间的控制层。就像 API 网关一样,它接收请求并将其转发给后端,但它增加了针对模型选择、Token 或计算使用量、安全性、隐私、成本和性能的 AI 专有控制。它可以为云端模型、自托管系统和 Ultralytics YOLO model serving 提供一个稳定的端点,使得生产环境中的 artificial intelligence systems 在其模型和提供商发生变化时更容易进行治理。(learn.microsoft.com)
AI Gateway 的工作原理#
网关在将每个传入请求发送到 inference engine 之前对其进行评估。根据配置的策略,它可能会:
- 身份验证和保护请求: 应用访问控制、配额、输入验证,以及基于 OWASP Top 10 for LLM Applications 的防御措施,同时结合更广泛的 data security 实践。
- 智能路由流量: 根据延迟、可用性、成本、区域、任务或硬件负载来选择模型或端点。Kubernetes Gateway API Inference Extension 标准化了针对自托管生成式模型的模型感知路由。
- 提高可靠性: 当提供商或模型不可用时,使用重试、负载均衡和 Vercel AI Gateway model fallbacks。
- 控制消耗: 通过诸如 Envoy Gateway rate limiting 的策略来强制执行请求、Token 或计算预算。
- 记录遥测数据: 通过使用诸如 OpenTelemetry GenAI attributes 等标准的 observability 系统来捕获延迟、错误、模型选择和使用情况。(gateway.envoyproxy.io)
实际应用#
- 零售视觉检查: 摄像头通过网关将产品图像提交给 YOLO26 object detection model。网关对每个店铺进行身份验证、限制请求量、将流量路由到最近的部署,并将失败情况发送到备份端点,从而支持可靠的 real-time inference。
- 多模型客户助手: 应用程序使用 Vercel AI Gateway unified API 或 Cloudflare AI Gateway 将简单问题路由到低成本模型,将复杂请求路由到能力更强的模型。日志支持成本分析、调试和 model monitoring。
- 企业 AI 访问: 组织可以使用 Azure API Management AI gateway capabilities 通过集中式身份验证、配额、日志记录和内容安全策略来管理模型、工具和远程 Model Context Protocol services。(learn.microsoft.com)
计算机视觉示例#
推理代码专注于预测,而网关负责处理访问、路由、限制和遥测:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
results = model.predict("https://ultralytics.com/images/bus.jpg")
detections = len(results[0].boxes)
print({"detections": detections})此处理程序可以在 Ultralytics Platform deployment endpoint 后面运行,其中 deployment monitoring 会跟踪请求、延迟、错误、日志和健康检查。(learn.microsoft.com)
AI Gateway 与相关术语#
AI 网关在模型执行前后管理流量,而 model deployment 将模型投入生产,模型服务则执行预测。推理网关更加专业,能够优化模型副本或加速器之间的路由。同时,AI agent orchestration 协调的是多步决策和工具,而不是控制网络访问。
当前的最佳实践包括:最小化记录的敏感内容、应用 data privacy 控制、测试回退路径、跟踪每个模型的质量和成本,以及遵循 NIST Generative AI Risk Management Profile。关于 LLM control planes 和 adversarial risks in model routing 的最新研究也凸显了可审计策略和安全路由决策的重要性。(nist.gov)






