AI Gateway
AIゲートウェイとは何か、モデルのルーティング、コスト管理、リクエストの保護、推論の監視をどのように行い、信頼性の高いAIとUltralytics YOLOのデプロイを実現するかを学びます。
AIゲートウェイは、アプリケーションと1つ以上の人工知能サービスの間に配置される制御層です。APIゲートウェイと同様に、リクエストを受け取り、バックエンドに転送しますが、モデル選択、トークンまたはコンピューティングリソースの使用量、安全性、プライバシー、コスト、パフォーマンスに関するAI固有の制御機能が追加されています。クラウドモデル、セルフホストシステム、Ultralytics YOLOモデルのサービングに対して、1つの安定したエンドポイントを提供できるため、モデルやプロバイダーが変化しても、本番環境の人工知能システムを容易に管理できます。(learn.microsoft.com)
AIゲートウェイの仕組み#
ゲートウェイは、受信した各リクエストを推論エンジンに送信する前に評価します。設定されたポリシーに応じて、次の処理を実行できます。
- リクエストの認証と保護: アクセス制御、クォータ、入力検証、およびLLMアプリケーション向けOWASP Top 10に基づく防御を、より広範なデータセキュリティ対策と併せて適用します。
- トラフィックのインテリジェントなルーティング: レイテンシ、可用性、コスト、リージョン、タスク、ハードウェア負荷に基づいて、モデルまたはエンドポイントを選択します。Kubernetes Gateway API Inference Extensionは、セルフホスト型の生成モデルに対するモデル認識ルーティングを標準化します。
- 信頼性の向上: プロバイダーまたはモデルが利用できなくなった場合に、リトライ、ロードバランシング、Vercel AI Gatewayのモデルフォールバックを使用します。
- 消費量の制御: Envoy Gatewayのレート制限などのポリシーを通じて、リクエスト、トークン、またはコンピューティングリソースの予算を適用します。
- テレメトリの記録: オブザーバビリティシステムを通じて、レイテンシ、エラー、モデルの選択、使用量を取得します。OpenTelemetry GenAI属性などの標準を使用します。(gateway.envoyproxy.io)
実世界での利用例#
- 小売業のビジョン検査: カメラがゲートウェイを介して製品画像をYOLO26物体検出モデルに送信します。ゲートウェイは各店舗を認証し、リクエスト量を制限し、最寄りのデプロイメントにトラフィックをルーティングして、障害発生時にはバックアップエンドポイントに送信します。これにより、信頼性の高いリアルタイム推論を実現します。
- マルチモデル顧客アシスタント: アプリケーションは、Vercel AI Gateway統合APIまたはCloudflare AI Gatewayを使用して、単純な質問を低コストのモデルに、複雑なリクエストをより高性能なモデルにルーティングします。ログは、コスト分析、デバッグ、モデルモニタリングに役立ちます。
- エンタープライズAIアクセス: 組織は、Azure API ManagementのAIゲートウェイ機能を使用して、集中認証、クォータ、ログ記録、コンテンツセーフティポリシーを通じ、モデル、ツール、リモートのModel Context Protocolサービスを管理できます。(learn.microsoft.com)
コンピュータービジョンの例#
ゲートウェイがアクセス、ルーティング、制限、テレメトリを処理する一方で、推論コードは予測処理に集中できます。
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
results = model.predict("https://ultralytics.com/images/bus.jpg")
detections = len(results[0].boxes)
print({"detections": detections})このハンドラーは、Ultralytics Platformのデプロイメントエンドポイントの背後で実行できます。この場合、デプロイメントモニタリングによって、リクエスト、レイテンシ、エラー、ログ、ヘルスチェックが追跡されます。(learn.microsoft.com)
AIゲートウェイと関連用語の比較#
AIゲートウェイは、モデルの実行の前後でトラフィックを管理します。一方、モデルデプロイメントはモデルを本番環境に配置し、モデルサービングは予測を実行します。推論ゲートウェイはより特化されており、モデルレプリカまたはアクセラレーター間のルーティングを最適化します。一方、AIエージェントオーケストレーションは、ネットワークアクセスを制御するのではなく、複数ステップの意思決定とツールを調整します。
現在のベストプラクティスには、ログに記録する機密コンテンツの最小化、データプライバシー制御の適用、フォールバック経路のテスト、モデルごとの品質とコストの追跡、NIST Generative AI Risk Management Profileへの準拠が含まれます。LLM制御プレーンおよびモデルルーティングにおける敵対的リスクに関する最近の研究でも、監査可能なポリシーと安全なルーティング判断の重要性が強調されています。(nist.gov)









