Compound AI Systems
Tìm hiểu cách các hệ thống AI tổ hợp kết hợp model, công cụ, dữ liệu và quy tắc. Khám phá kiến trúc, ứng dụng, các đánh đổi và best practice cho workflow AI đáng tin cậy.
Hệ thống AI hợp thành là các ứng dụng AI được xây dựng từ nhiều thành phần tương tác với nhau thay vì chỉ một model. Một hệ thống có thể kết hợp các model, dịch vụ truy xuất, cơ sở dữ liệu, quy tắc xác định, công cụ bên ngoài và hoạt động đánh giá của con người thành một workflow được điều phối thống nhất. Trong thị giác máy tính, chẳng hạn, một model có thể phát hiện đối tượng trong khi phần mềm tracking duy trì danh tính, các quy tắc nghiệp vụ diễn giải sự kiện và các dịch vụ giám sát theo dõi hiệu năng trong môi trường production. Đặc điểm cốt lõi là tính hợp thành: hành vi ở cấp độ hệ thống hình thành từ cách các thành phần trao đổi thông tin và đưa ra quyết định.
Cách hệ thống AI hợp thành hoạt động#
Một hệ thống hợp thành chia một tác vụ lớn thành các giai đoạn chuyên biệt. Các thành phần điển hình gồm tiền xử lý dữ liệu, một hoặc nhiều model AI, lưu trữ, logic validation, các giao diện lập trình ứng dụng và một lớp orchestration. Các contract rõ ràng, chẳng hạn như những contract được mô tả trong Đặc tả OpenAPI, xác định dữ liệu mà mỗi dịch vụ tiếp nhận và trả về.
Hoạt động điều khiển có thể mang tính xác định, trong đó code truyền thống gọi các thành phần theo một trình tự cố định, hoặc mang tính động, trong đó một lớp orchestration agent AI lựa chọn công cụ và tuyến xử lý tại runtime. AI orchestration điều phối các dependency, lần thử lại, tài nguyên và luồng dữ liệu trong toàn bộ ứng dụng.
Các pattern phổ biến gồm tạo sinh tăng cường bằng truy xuất, trong đó hoạt động truy xuất cung cấp context cho một language model, và các pipeline sensor fusion kết hợp camera, radar hoặc các nguồn đầu vào khác. Sự chuyển dịch rộng hơn từ các model biệt lập sang những hệ thống tích hợp được mô tả trong tổng quan của Berkeley AI Research về các hệ thống AI hợp thành. (bair.berkeley.edu)
Vì sao hệ thống hợp thành quan trọng#
Tính hợp thành cho phép developer cải thiện ứng dụng mà không cần retrain một model khổng lồ. Một thành phần chuyên biệt có thể được thay thế, scale hoặc tối ưu trong khi phần còn lại của workflow vẫn ổn định. Các giai đoạn xử lý quy tắc và validation cũng có thể cung cấp nhiều quyền kiểm soát hơn so với việc hoàn toàn dựa vào đầu ra mang tính xác suất của model.
Những lợi ích này kéo theo các đánh đổi ở cấp độ hệ thống:
- Lan truyền lỗi: Một lần phát hiện không chính xác, hoạt động truy xuất thất bại hoặc API không khả dụng có thể ảnh hưởng đến mọi quyết định ở các bước tiếp theo.
- Độ trễ và chi phí: Mỗi lần gọi model, request mạng và giai đoạn verification đều tiêu tốn một phần ngân sách phản hồi tổng thể.
- Trôi dạt interface: Việc cập nhật một dịch vụ có thể thay đổi format đầu ra hoặc các giả định của dịch vụ đó, từ đó âm thầm làm hỏng một thành phần khác.
- Đánh giá khó khăn: Một thành phần mạnh không đảm bảo kết quả end-to-end cũng mạnh.
Do đó, vận hành machine learning phải bao quát toàn bộ workflow. Hướng dẫn về observability của OpenTelemetry giải thích cách trace, metric và log cho thấy những gì đã xảy ra giữa các dịch vụ phân tán, trong khi theo dõi experiment bằng MLflow có thể ghi lại cấu hình model và kết quả đánh giá. (opentelemetry.io)
Các khái niệm liên quan và điểm khác biệt chính#
Hệ thống AI hợp thành không đơn giản chỉ là một tên gọi khác của model phức tạp.
Ensemble model kết hợp các dự đoán từ nhiều model, thường thông qua voting, averaging hoặc stacking. Một ensemble có thể là một thành phần bên trong hệ thống hợp thành, nhưng thường không có cơ sở dữ liệu, công cụ, logic workflow và các dịch vụ vận hành.
Workflow agentic cho phép các model tự động lựa chọn hành động hoặc công cụ. Hệ thống hợp thành có phạm vi rộng hơn: nhiều hệ thống sử dụng pipeline cố định, dịch vụ hướng sự kiện hoặc phê duyệt của con người mà không cần agent tự động.
Tương tự, RAG là một pattern hợp thành cụ thể liên quan đến truy xuất và tạo sinh. AI hợp thành cũng có thể điều phối thị giác máy tính, dự báo, tối ưu hóa, robotics và phần mềm truyền thống mà không sử dụng language model.
Các ứng dụng trong thực tế#
-
Kiểm tra trực quan trong sản xuất: Camera chụp lại sản phẩm, một model Ultralytics YOLO26 phát hiện lỗi, logic dựa trên quy tắc kiểm tra mức độ nghiêm trọng và vị trí, còn hệ thống production loại hoặc phê duyệt từng sản phẩm. Các trường hợp không chắc chắn có thể được chuyển đến inspector là con người, trong khi hình ảnh được lưu trữ hỗ trợ retrain sau này.
-
Phân tích giao thông và bãi đỗ xe: Detection xác định các phương tiện, tracking đa đối tượng duy trì danh tính qua các frame, logic hình học xác định trạng thái chiếm chỗ của làn đường hoặc khu vực đỗ xe, còn dashboard tổng hợp số lượng và cảnh báo. Lỗi có thể gây đếm trùng, bỏ sót sự kiện ùn tắc hoặc ước tính sai về tình trạng còn chỗ, vì vậy mọi giai đoạn phải được kiểm thử cùng nhau.
Ví dụ đơn giản hóa sau đây cho thấy dữ liệu perception được đưa vào logic quyết định xác định:
from ultralytics import YOLO
# Perception component
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Policy component
person_class = next(i for i, name in result.names.items() if name == "person")
person_count = int((result.boxes.cls == person_class).sum())
decision = "review" if person_count >= 4 else "continue"
print({"people_detected": person_count, "next_step": decision})
result.save(filename="compound_system_input.jpg")Ở đây, YOLO tạo ra các quan sát có cấu trúc, còn logic policy riêng biệt xác định hành động tiếp theo. Một hệ thống production có thể bổ sung lưu trữ, thông báo, quyền kiểm soát truy cập hoặc hoạt động đánh giá của con người.
Hướng dẫn thiết kế thực tế#
Hãy bắt đầu bằng một mục tiêu end-to-end có thể đo lường, sau đó giao cho mỗi thành phần một trách nhiệm rõ ràng. Xác định schema và timeout tại mọi ranh giới, kiểm thử độc lập từng thành phần, đồng thời đánh giá các workflow thực tế thay vì chỉ đánh giá độ chính xác của model.
Sử dụng trace để theo dõi từng request, thiết lập ngân sách độ trễ và chi phí, đồng thời cung cấp cơ chế retry hoặc fallback an toàn cho các dịch vụ không khả dụng. Health probe của Kubernetes minh họa cách các dịch vụ đã triển khai có thể cung cấp các tín hiệu readiness và liveness.
Các biện pháp kiểm soát rủi ro nên giải quyết toàn bộ hệ thống, bao gồm quyền truy cập dữ liệu, công cụ bên ngoài, thao tác override của con người và các hệ quả ở downstream. Khung quản lý rủi ro AI của NIST cung cấp hướng dẫn theo vòng đời để quản trị, đo lường và quản lý những rủi ro này. Các team có thể sử dụng Ultralytics Platform để kết nối hoạt động gán nhãn dataset, training, deployment và giám sát production cho các thành phần thị giác trong một ứng dụng hợp thành rộng hơn. (nist.gov)









