Model Routing
Çok modelli sistemlerde doğruluk, maliyet, gecikme süresi ve kaynak kullanımını dengelemek için model yönlendirmenin her istek için doğru yapay zeka modelini nasıl seçtiğini öğren.
Model yönlendirme, her gelen isteği hangi yapay zeka modelinin ele alacağını seçme sürecidir. Her girdiyi tek bir modele göndermek yerine bir yönlendirme katmanı; istenen görev, girdi türü, karmaşıklık, gecikme hedefi, maliyet sınırı, donanım kullanılabilirliği veya güvenilirlik gereksinimleri gibi sinyalleri değerlendirir. Ardından isteği en uygun adaya iletir. Bu bağlamda "yönlendirici", fiziksel bir ağ yönlendiricisi değil, bir çıkarım karar bileşenidir. Yönlendirme, çok modelli makine öğrenimi sistemlerinin tahmin kalitesini, kaynak kullanımını ve çıkarım gecikmesini dengelemesine yardımcı olur.
Model Yönlendirme Nasıl Çalışır?#
Bir yönlendirme sistemi genellikle dağıtılmış modellerden oluşan bir havuz, karar mantığı ve ortak bir uygulama arayüzü içerir. Uygulama bir istek gönderir, yönlendirici uygun bir model seçer ve model sunum katmanı bu modelin çıktısını döndürür.
Yönlendirme kararları şu şekillerde olabilir:
- Kural tabanlı: Maske isteyen görüntüleri bir bölütleme modeline yönlendirmek gibi açık meta verileri kullanarak bir model seç.
- Puan tabanlı: Her adayın beklenen kalitesini, maliyetini veya yanıt süresini tahmin et ve en yüksek puanlı seçeneği belirle.
- Öğrenilmiş: Hangi adayın girdiye en iyi şekilde uyduğunu çıkarmak için hafif bir sınıflandırıcı veya yönlendirme modeli kullan.
- Kademeli: Önce hızlı bir model çalıştır, ardından belirsiz veya yüksek riskli sonuçları daha yetenekli bir modele aktar.
Örneğin, Amazon Bedrock akıllı komut istemi yönlendirmesi, dil modelleri arasında seçim yapmadan önce yanıt kalitesini tahmin ederken, Microsoft'un model yönlendirme stratejisi rehberi maliyet, kalite ve dengeli yönlendirmeyi açıklar. Benzer ilkeler bilgisayarlı görü için de geçerlidir: istekler göreve, kamera konumuna, görüntü çözünürlüğüne veya gerekli tahmin detayına göre yönlendirilebilir.
İlgili Kavramlar ve Temel Farklar#
Model yönlendirme diğer çok modelli tekniklerle yakından ilişkilidir, ancak terimler birbirinin yerine kullanılamaz.
- Yapay zeka ağ geçitleri: Bir yapay zeka ağ geçidi, kimlik doğrulama, kotalar, günlük kaydı ve trafik yönetimi için daha geniş bir kontrol katmanı sağlar. Model seçimi bir ağ geçidi yeteneği olabilir. Kubernetes Ağ Geçidi API Çıkarım Uzantısı da modele duyarlı yönlendirmeyi uç nokta seçiminden ve yük dengelemeden ayırır.
- Model toplulukları: Bir topluluk normalde birden fazla model çalıştırır ve bunların tahminlerini birleştirir. Bir yönlendirici ise genellikle tek bir model seçerek hesaplama maliyetini azaltır. NVIDIA Triton topluluk modelleri bunun yerine birkaç model üzerinden sabit veri akışları tanımlar.
- Uzman karışımı: Bir uzman karışımı mimarisi, dahili temsilleri tek bir sinir ağı içindeki bileşenlere yönlendirir. Model yönlendirme ise ayrı olarak dağıtılabilen modeller veya uç noktalar arasından seçim yapar.
- Ajan yönlendirme: Bir ajan yönlendiricisi, özelleşmiş bir ajan, iş akışı veya araç seçer. Model yönlendirme ise bir çıkarım adımını gerçekleştiren temel modeli seçer. Ajan tabanlı bir sistemde her iki yönlendirme biçimi de mevcut olabilir.
Yük dengeleme bir diğer önemli ayrımdır. Bulunabilirliği veya aktarım hızını artırmak için istekleri aynı hizmetin kopyaları arasında dağıtır. Model yönlendirme ise farklı yeteneklere, maliyetlere veya çıktılara sahip modeller arasından seçim yapar.
Gerçek Dünya Uygulamaları#
Görsel denetim: Bir üretim sistemi rutin parça sayımı için nesne tespiti kullanabilir ancak şüpheli yüzey kusurlarını kesin sınırlar için örnek bölütlemeye yönlendirebilir. Ultralytics YOLO26 hem nesne tespiti hem de örnek bölütleme desteği sunarak tutarlı bir API içinde göreve dayalı yönlendirmeyi mümkün kılar. Bu, kutuların yeterli olduğu durumlarda bölütleme maliyetini ödemekten kaçınmayı sağlar.
Yapay zeka asistanları: Bir destek asistanı, basit sınıflandırma ve arama isteklerini küçük, hızlı bir dil modeline gönderirken, karmaşık akıl yürütme veya araç kullanımı için daha güçlü bir modeli saklı tutabilir. Google Cloud'un ajan tabanlı mimari rehberi bu modeli kaliteyi, gecikmeyi ve maliyeti dengelemenin bir yolu olarak tanımlar. Sabit bir kademenin aksine dinamik yönlendirme, ilk yanıtı oluşturmadan önce daha güçlü modeli seçebilir.
Bir Yönlendiriciyi Uygulama ve Değerlendirme#
Bu minimal Ultralytics örneği, bir görüntüyü bir uygulamanın talep ettiği çıktıya göre tespite veya bölütlemeye yönlendirir:
from ultralytics import YOLO
models = {
"detect": YOLO("yolo26n.pt"),
"segment": YOLO("yolo26n-seg.pt"),
}
requested_task = "segment"
source = "https://ultralytics.com/images/bus.jpg"
model = models.get(requested_task)
if model is None:
raise ValueError(f"Unsupported task: {requested_task}")
results = model(source)
result = results[0]
result.save(filename=f"{requested_task}_result.jpg")Kural bilerek basittir: nesne maskelerine ihtiyaç duyan istekler bölütlemeye gider, yalnızca kutulara ihtiyaç duyan istekler ise tespiti kullanabilir. Üretim yönlendiricileri ayrıca ölçülen doğruluğu, kuyruk derinliğini, cihaz türünü, gizlilik kısıtlamalarını veya hizmet sağlığını dikkate alabilir.
Yönlendirmeyi yalnızca model ortalamalarına göre değil, temsilci trafik üzerinde değerlendirin. Seçilen her model için rota dağılımını, uçtan uca gecikmeyi, maliyeti, hataları ve görev düzeyinde kaleyi takip edin. OpenTelemetry gözlemlenebilirlik rehberi; izlemelerin, ölçümlerin ve günlüklerin bireysel istekleri dağınık hizmetler boyunca nasıl takip edebileceğini açıklar. Ultralytics Platform dağıtım izleme özelliği de benzer şekilde uç nokta gecikmesini, hatalarını, sağlığını ve istek etkinliğini incelemeyi destekler.
Yanlış yönlendirme maliyetleri artırabilir, gecikme hedeflerini kaçırabilir veya zor girdileri yetersiz bir modele gönderebilir. Bu nedenle ekipler bir yedek davranış tanımlamalı, hassas iş yükleri için uygun modelleri kısıtlamalı, seçilen rotayı kaydetmeli ve politikayı düzenli olarak yeniden test etmelidir. Bu kontroller, yönlendirme kararlarını NIST AI Risk Yönetimi Çerçevesi kapsamındaki daha geniş uygulamalarla uyumlu hale getirir.






