AI Gateway
Tìm hiểu AI gateway là gì, cách nó định tuyến các model, kiểm soát chi phí, bảo vệ request và giám sát inference để vận hành AI và triển khai Ultralytics YOLO đáng tin cậy.
Cổng AI là một lớp điều khiển được đặt giữa các ứng dụng và một hoặc nhiều dịch vụ trí tuệ nhân tạo. Tương tự API gateway, cổng này tiếp nhận các request và chuyển tiếp chúng đến các backend, nhưng bổ sung các cơ chế kiểm soát dành riêng cho AI về việc lựa chọn model, mức sử dụng token hoặc tài nguyên tính toán, tính an toàn, quyền riêng tư, chi phí và hiệu năng. Cổng có thể cung cấp một endpoint ổn định duy nhất cho các model trên cloud, các hệ thống tự lưu trữ và dịch vụ model YOLO của Ultralytics, giúp quản trị các hệ thống trí tuệ nhân tạo trong môi trường production dễ dàng hơn khi các model và nhà cung cấp thay đổi. (learn.microsoft.com)
Cách Cổng AI Hoạt động#
Cổng đánh giá từng request đến trước khi gửi request đó đến một inference engine. Tùy thuộc vào các policy đã cấu hình, cổng có thể:
- Xác thực và bảo vệ request: Áp dụng các cơ chế kiểm soát quyền truy cập, hạn ngạch, validation đầu vào và các biện pháp phòng vệ dựa trên OWASP Top 10 cho các ứng dụng LLM, cùng với các phương pháp bảo mật dữ liệu rộng hơn.
- Định tuyến traffic thông minh: Lựa chọn model hoặc endpoint dựa trên độ trễ, tính khả dụng, chi phí, khu vực, task hoặc tải phần cứng. Kubernetes Gateway API Inference Extension chuẩn hóa việc định tuyến nhận biết model cho các model generative tự lưu trữ.
- Cải thiện độ tin cậy: Sử dụng cơ chế retry, cân bằng tải và cơ chế fallback model của Vercel AI Gateway khi một nhà cung cấp hoặc model không khả dụng.
- Kiểm soát mức tiêu thụ: Thực thi ngân sách cho request, token hoặc tài nguyên tính toán thông qua các policy như giới hạn tốc độ của Envoy Gateway.
- Ghi nhận telemetry: Thu thập độ trễ, lỗi, lựa chọn model và mức sử dụng thông qua các hệ thống observability sử dụng các tiêu chuẩn như thuộc tính GenAI của OpenTelemetry. (gateway.envoyproxy.io)
Các ứng dụng trong thực tế#
- Kiểm tra hình ảnh bán lẻ: Camera gửi hình ảnh sản phẩm qua một cổng đến model phát hiện đối tượng YOLO26. Cổng xác thực từng cửa hàng, giới hạn số lượng request, định tuyến traffic đến deployment gần nhất và chuyển các request thất bại đến một endpoint dự phòng, hỗ trợ inference theo thời gian thực đáng tin cậy.
- Trợ lý khách hàng đa model: Một ứng dụng sử dụng unified API của Vercel AI Gateway hoặc Cloudflare AI Gateway để định tuyến các câu hỏi đơn giản đến model có chi phí thấp hơn và các request phức tạp đến model mạnh hơn. Log hỗ trợ phân tích chi phí, debugging và giám sát model.
- Truy cập AI cho doanh nghiệp: Các tổ chức có thể sử dụng các tính năng cổng AI của Azure API Management để quản trị model, tool và các dịch vụ Model Context Protocol từ xa thông qua xác thực, hạn ngạch, logging và các policy an toàn nội dung tập trung. (learn.microsoft.com)
Ví dụ về Computer Vision#
Code inference vẫn tập trung vào việc prediction, trong khi cổng xử lý quyền truy cập, định tuyến, giới hạn và telemetry:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
results = model.predict("https://ultralytics.com/images/bus.jpg")
detections = len(results[0].boxes)
print({"detections": detections})Handler này có thể chạy phía sau một deployment endpoint của Ultralytics Platform, tại đó giám sát deployment theo dõi các request, độ trễ, lỗi, log và health check. (learn.microsoft.com)
Cổng AI So với Các Thuật ngữ Liên quan#
Cổng AI quản lý traffic trước và sau khi model thực thi, trong khi model deployment đưa một model vào production còn model serving thực thi các prediction. Inference gateway có tính chuyên biệt hơn, tối ưu hóa việc định tuyến giữa các replica của model hoặc các accelerator. Trong khi đó, điều phối AI agent điều phối các quyết định và tool nhiều bước thay vì kiểm soát quyền truy cập mạng.
Các best practice hiện tại bao gồm giảm thiểu nội dung nhạy cảm được ghi log, áp dụng các cơ chế kiểm soát quyền riêng tư dữ liệu, kiểm thử các đường dẫn fallback, theo dõi chất lượng và chi phí theo từng model, đồng thời tuân thủ Hồ sơ Quản lý Rủi ro AI Tạo sinh của NIST. Các nghiên cứu gần đây về control plane LLM và rủi ro đối kháng trong định tuyến model cũng nhấn mạnh tầm quan trọng của các policy có thể kiểm toán và các quyết định định tuyến an toàn. (nist.gov)









