AI Gateway
Tìm hiểu AI gateway là gì, cách nó điều hướng các model, kiểm soát chi phí, bảo vệ yêu cầu và giám sát inference để triển khai AI và Ultralytics YOLO một cách tin cậy.
An AI gateway là một lớp điều khiển được đặt giữa các ứng dụng và một hoặc nhiều dịch vụ trí tuệ nhân tạo. Giống như một API gateway, nó nhận các yêu cầu và chuyển tiếp chúng đến các backend, nhưng nó bổ sung các biện pháp kiểm soát dành riêng cho AI đối với việc lựa chọn model, mức sử dụng token hoặc tính toán, tính an toàn, quyền riêng tư, chi phí và hiệu suất. Nó có thể cung cấp một endpoint ổn định cho các model đám mây, hệ thống tự lưu trữ và Ultralytics YOLO model serving, giúp cho các artificial intelligence systems vận hành dễ dàng quản lý hơn khi các model và nhà cung cấp của chúng thay đổi. (learn.microsoft.com)
Cách hoạt động của AI Gateway#
Gateway đánh giá từng yêu cầu đến trước khi gửi yêu cầu đó đến một inference engine. Tùy thuộc vào các chính sách được định cấu hình, nó có thể:
- Xác thực và bảo vệ các yêu cầu: Áp dụng các biện pháp kiểm soát truy cập, hạn mức, xác thực đầu vào và các cơ chế phòng thủ dựa trên OWASP Top 10 for LLM Applications, bên cạnh các phương pháp thực hành data security rộng hơn.
- Định tuyến lưu lượng truy cập thông minh: Chọn một model hoặc endpoint dựa trên độ trễ, tính khả dụng, chi phí, khu vực, tác vụ hoặc tải phần cứng. Kubernetes Gateway API Inference Extension chuẩn hóa việc định tuyến nhận biết model cho các model tạo sinh tự lưu trữ.
- Cải thiện độ tin cậy: Sử dụng các cơ chế thử lại, cân bằng tải và Vercel AI Gateway model fallbacks khi một nhà cung cấp hoặc model không khả dụng.
- Kiểm soát mức tiêu thụ: Thực thi các ngân sách về yêu cầu, token hoặc tính toán thông qua các chính sách như Envoy Gateway rate limiting.
- Ghi nhận dữ liệu từ xa (telemetry): Thu thập độ trễ, lỗi, các lựa chọn model và mức sử dụng thông qua các hệ thống observability sử dụng các tiêu chuẩn như OpenTelemetry GenAI attributes. (gateway.envoyproxy.io)
Các ứng dụng trong thực tế#
- Kiểm tra thị giác bán lẻ: Các camera gửi hình ảnh sản phẩm qua gateway đến một YOLO26 object detection model. Gateway xác thực từng cửa hàng, giới hạn lưu lượng yêu cầu, định tuyến lưu lượng đến bản triển khai gần nhất và gửi các lỗi đến một endpoint dự phòng, hỗ trợ real-time inference đáng tin cậy.
- Trợ lý khách hàng đa model: Một ứng dụng sử dụng Vercel AI Gateway unified API hoặc Cloudflare AI Gateway để định tuyến các câu hỏi đơn giản đến một model chi phí thấp hơn và các yêu cầu phức tạp đến một model có năng lực hơn. Các bản ghi nhật ký hỗ trợ phân tích chi phí, gỡ lỗi và model monitoring.
- Truy cập AI doanh nghiệp: Các tổ chức có thể sử dụng Azure API Management AI gateway capabilities để quản lý các model, công cụ và các Model Context Protocol services từ xa thông qua việc xác thực tập trung, hạn mức, ghi nhật ký và các chính sách an toàn nội dung. (learn.microsoft.com)
Ví dụ về thị giác máy tính#
Mã suy luận vẫn tập trung vào việc dự đoán trong khi gateway xử lý việc truy cập, định tuyến, giới hạn và telemetry:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
results = model.predict("https://ultralytics.com/images/bus.jpg")
detections = len(results[0].boxes)
print({"detections": detections})Trình xử lý này có thể chạy đằng sau một Ultralytics Platform deployment endpoint, nơi deployment monitoring theo dõi các yêu cầu, độ trễ, lỗi, nhật ký và kiểm tra tình trạng. (learn.microsoft.com)
AI Gateway so với các thuật ngữ liên quan#
An AI gateway quản lý lưu lượng truy cập trước và sau khi thực thi model, trong khi model deployment đưa một model vào sản xuất và việc phục vụ model thực thi các dự đoán. Một inference gateway chuyên biệt hơn, tối ưu hóa việc định tuyến giữa các bản sao model hoặc bộ tăng tốc. Trong khi đó, AI agent orchestration điều phối các quyết định và công cụ nhiều bước thay vì kiểm soát quyền truy cập mạng.
Các phương pháp hay nhất hiện nay bao gồm việc giảm thiểu nội dung nhạy cảm được ghi nhật ký, áp dụng các biện pháp kiểm soát data privacy, kiểm tra các đường dẫn dự phòng, theo dõi chất lượng và chi phí của từng model, và tuân theo NIST Generative AI Risk Management Profile. Nghiên cứu gần đây về LLM control planes và adversarial risks in model routing cũng nhấn mạnh tầm quan trọng của các chính sách có thể kiểm toán và các quyết định định tuyến an toàn. (nist.gov)






