AI Gateway
Узнай, что такое шлюз ИИ, как он маршрутизирует модели, контролирует затраты, защищает запросы и отслеживает инференс для надёжной работы ИИ и развёртываний Ultralytics YOLO.
AI-шлюз — это уровень управления, расположенный между приложениями и одним или несколькими сервисами искусственного интеллекта. Как и API-шлюз, он принимает запросы и перенаправляет их на бэкенды, но дополнительно предоставляет специализированные для AI средства управления выбором моделей, использованием токенов или вычислительных ресурсов, безопасностью, конфиденциальностью, стоимостью и производительностью. Он может предоставлять одну стабильную конечную точку для облачных моделей, систем с самостоятельным размещением и сервинга моделей Ultralytics YOLO, что упрощает управление рабочими системами искусственного интеллекта по мере изменения их моделей и провайдеров. (learn.microsoft.com)
Как работает AI-шлюз#
Перед отправкой запроса в механизм инференса шлюз проверяет каждый входящий запрос. В зависимости от настроенных политик он может:
- Аутентифицировать запросы и защищать их: применять средства контроля доступа, квоты, проверку входных данных и меры защиты на основе OWASP Top 10 для приложений с LLM, а также более общие методы обеспечения безопасности данных.
- Интеллектуально маршрутизировать трафик: выбирать модель или конечную точку на основе задержки, доступности, стоимости, региона, задачи или нагрузки на оборудование. Расширение Inference Extension для Kubernetes Gateway API стандартизирует маршрутизацию с учетом моделей для самостоятельно размещаемых генеративных моделей.
- Повышать надежность: использовать повторные попытки, балансировку нагрузки и резервные модели AI-шлюза Vercel, когда провайдер или модель становятся недоступны.
- Контролировать потребление: устанавливать ограничения на запросы, токены или вычислительные ресурсы с помощью таких политик, как ограничение частоты запросов в Envoy Gateway.
- Записывать телеметрию: собирать данные о задержке, ошибках, выборе моделей и использовании через системы наблюдаемости, применяющие такие стандарты, как атрибуты GenAI в OpenTelemetry. (gateway.envoyproxy.io)
Практические применения#
- Инспекция товаров с помощью компьютерного зрения: камеры отправляют изображения товаров через шлюз в модель обнаружения объектов YOLO26. Шлюз аутентифицирует каждый магазин, ограничивает объем запросов, направляет трафик к ближайшему развертыванию и отправляет сбои на резервную конечную точку, обеспечивая надежный инференс в реальном времени.
- Многомодельный помощник для клиентов: приложение использует унифицированный API AI-шлюза Vercel или AI-шлюз Cloudflare, чтобы направлять простые вопросы к менее дорогой модели, а сложные запросы — к более мощной. Журналы поддерживают анализ затрат, отладку и мониторинг моделей.
- Корпоративный доступ к AI: организации могут использовать возможности AI-шлюза Azure API Management для управления моделями, инструментами и удаленными сервисами Model Context Protocol посредством централизованных политик аутентификации, квот, ведения журналов и безопасности контента. (learn.microsoft.com)
Пример компьютерного зрения#
Код инференса остается сосредоточенным на предсказании, а шлюз обрабатывает доступ, маршрутизацию, ограничения и телеметрию:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
results = model.predict("https://ultralytics.com/images/bus.jpg")
detections = len(results[0].boxes)
print({"detections": detections})Этот обработчик может работать за конечной точкой развертывания Ultralytics Platform, где мониторинг развертывания отслеживает запросы, задержку, ошибки, журналы и проверки работоспособности. (learn.microsoft.com)
AI-шлюз и связанные термины#
AI-шлюз управляет трафиком до и после выполнения модели, тогда как развертывание модели переводит модель в рабочую среду, а сервинг моделей выполняет предсказания. Шлюз инференса более специализирован и оптимизирует маршрутизацию между репликами моделей или ускорителями. В свою очередь, оркестрация AI-агентов координирует многоэтапные решения и инструменты, а не управляет сетевым доступом.
К актуальным передовым практикам относятся минимизация объема конфиденциального контента в журналах, применение средств защиты конфиденциальности данных, тестирование резервных сценариев, отслеживание качества и стоимости для каждой модели, а также соблюдение требований профиля управления рисками генеративного AI NIST. Недавние исследования плоскостей управления LLM и состязательных рисков при маршрутизации моделей также подчеркивают важность проверяемых политик и безопасных решений по маршрутизации. (nist.gov)









