AI Gateway
Bir AI ağ geçidinin ne olduğunu, modelleri nasıl yönlendirdiğini, maliyetleri nasıl kontrol ettiğini, istekleri nasıl koruduğunu ve güvenilir AI ve Ultralytics YOLO dağıtımları için çıkarımı nasıl izlediğini öğren.
Bir AI gateway, uygulamalar ile bir veya daha fazla yapay zeka servisi arasına yerleştirilen bir kontrol katmanıdır. Bir API gateway gibi, istekleri alır ve arka uçlara iletir, ancak model seçimi, token veya işlem (compute) kullanımı, güvenlik, gizlilik, maliyet ve performans için yapay zekaya özel kontroller ekler. Bulut modelleri, kendi barındırdığın (self-hosted) sistemler ve Ultralytics YOLO model serving için tek ve kararlı bir uç nokta sağlayarak, üretimdeki artificial intelligence systems bileşenlerini modelleri ve sağlayıcıları değiştikçe yönetmeyi daha kolay hale getirir. (learn.microsoft.com)
AI Gateway Nasıl Çalışır#
Gateway, gelen her isteği bir inference engine servisine göndermeden önce değerlendirir. Yapılandırılmış politikalara bağlı olarak şunları yapabilir:
- İsteklerin kimliğini doğrula ve koru: Geniş data security uygulamalarının yanı sıra OWASP Top 10 for LLM Applications temelinde erişim kontrolleri, kotalar, girdi doğrulama ve savunma mekanizmaları uygula.
- Trafiği akıllıca yönlendir: Gecikme, erişilebilirlik, maliyet, bölge, görev veya donanım yüküne göre bir model ya da uç nokta seç. Kubernetes Gateway API Inference Extension, kendi barındırdığın üretken modeller için modele duyarlı yönlendirmeyi standartlaştırır.
- Güvenilirliği artır: Bir sağlayıcı veya model erişilemez duruma geldiğinde yeniden denemeler (retries), yük dengeleme (load balancing) ve Vercel AI Gateway model fallbacks kullan.
- Tüketimi kontrol et: Envoy Gateway rate limiting gibi politikalar aracılığıyla istek, token veya işlem (compute) bütçelerini uygula.
- Telemetri kaydet: OpenTelemetry GenAI attributes gibi standartları kullanan observability sistemleri aracılığıyla gecikmeyi, hataları, model tercihlerini ve kullanımı kaydet. (gateway.envoyproxy.io)
Gerçek Dünya Uygulamaları#
- Perakende Görsel İnceleme (Retail Vision Inspection): Kameralar, ürün görüntülerini bir gateway üzerinden YOLO26 object detection model modeline iletir. Gateway her mağazanın kimliğini doğrular, istek hacmini sınırlar, trafiği en yakın dağıtıma yönlendirir ve hataları yedek bir uç noktaya göndererek güvenilir real-time inference süreçlerini destekler.
- Çok Modelli Müşteri Asistanı (Multi-Model Customer Assistant): Bir uygulama, basit soruları daha düşük maliyetli bir modele ve karmaşık istekleri daha yetenekli bir modele yönlendirmek için Vercel AI Gateway unified API veya Cloudflare AI Gateway kullanır. Günlükler (logs) maliyet analizini, hata ayıklamayı (debugging) ve model monitoring süreçlerini destekler.
- Kurumsal AI Erişimi: Kuruluşlar, merkezileştirilmiş kimlik doğrulama, kotalar, günlük kaydı (logging) ve içerik güvenliği politikaları aracılığıyla modelleri, araçları ve uzaktaki Model ContextProtocol services servislerini yönetmek için Azure API Management AI gateway capabilities özelliklerini kullanabilir. (learn.microsoft.com)
Bilgisayarlı Görü Örneği#
Çıkarım kodu tahmine odaklanmaya devam ederken, gateway erişimi, yönlendirmeyi, sınırları ve telemetriyi yönetir:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
results = model.predict("https://ultralytics.com/images/bus.jpg")
detections = len(results[0].boxes)
print({"detections": detections})Bu işleyici, istekleri, gecikmeyi, hataları, günlükleri ve sağlık kontrollerini takip eden deployment monitoring bileşeninin bulunduğu bir Ultralytics Platform deployment endpoint arkasında çalışabilir. (learn.microsoft.com)
AI Gateway ve İlgili Terimler#
Bir AI gateway model çalıştırılmasından önce ve sonra trafiği yönetirken, model deployment bir modeli üretime (production) taşır ve model serving ise tahminleri yürütür. Bir çıkarım (inference) gateway'i, model kopyaları veya hızlandırıcılar arasındaki yönlendirmeyi optimize ederek daha özelleşmiştir. Bu sırada, AI agent orchestration ağ erişimini kontrol etmek yerine çok adımlı kararları ve araçları koordine eder.
Güncel en iyi uygulamalar; günlüğe kaydedilen hassas içeriği en aza indirmeyi, data privacy kontrollerini uygulamayı, yedek yolları (fallback paths) test etmeyi, model başına kalite ve maliyeti takip etmeyi ve NIST Generative AI Risk Management Profile kılavuzunu izlemeyi içerir. LLM control planes ve adversarial risks in model routing üzerine yapılan son araştırmalar da denetlenebilir politikaların ve güvenli yönlendirme kararlarının önemini vurgulamaktadır. (nist.gov)






