Mixture of Agents (MoA)
Khám phá cách Mixture of Agents (MoA) tận dụng nhiều LLM để giải quyết các tác vụ phức tạp. Tìm hiểu cách tích hợp Ultralytics YOLO26 làm visual agent trong workflow MoA.
Tổ hợp tác nhân (MoA) là một kiến trúc trí tuệ nhân tạo tiên tiến, tận dụng nhiều mô hình ngôn ngữ lớn (LLMs) hoặc tác nhân tự chủ để cùng giải quyết các tác vụ phức tạp. Thay vì dựa vào một model duy nhất để tạo câu trả lời, hệ thống MoA truy vấn đồng thời nhiều model riêng biệt. Các tác nhân ban đầu này tạo ra những câu trả lời độc lập, sau đó chuyển chúng đến một tác nhân tổng hợp hoặc chắt lọc. Tác nhân tổng hợp đánh giá, tinh chỉnh và kết hợp các góc nhìn đa dạng thành một đầu ra cuối cùng duy nhất, chất lượng cao. Phương pháp cộng tác này tăng cường đáng kể năng lực suy luận và giảm thiểu những thiên kiến hoặc điểm yếu riêng của các model độc lập, đánh dấu một bước tiến lớn trong xử lý ngôn ngữ tự nhiên (NLP) và giải quyết vấn đề.
Tổ hợp tác nhân so với Tổ hợp chuyên gia#
Mặc dù nghe có vẻ tương tự, việc phân biệt MoA với khái niệm liên quan Tổ hợp chuyên gia (MoE) là điều rất quan trọng.
- Tổ hợp chuyên gia (MoE): Hoạt động bên trong một kiến trúc mạng nơ-ron duy nhất. Kiến trúc này sử dụng một cơ chế định tuyến để chỉ kích hoạt các lớp con chuyên biệt (chuyên gia) cụ thể cho từng token trong quá trình suy luận. Cách này tối ưu hóa hiệu quả tính toán trong khi vẫn duy trì số lượng tham số lớn.
- Tổ hợp tác nhân (MoA): Hoạt động ở cấp model hoặc hệ thống. Phương pháp này bao gồm các tác nhân AI hoàn toàn tách biệt—thường được xây dựng trên các model nền tảng khác nhau—tương tác với nhau trong một pipeline. MoA hoạt động giống một tổ hợp model kết hợp với quy trình đánh giá thông minh hơn, như được trình bày chi tiết trong các nghiên cứu gần đây về hệ thống đa tác nhân.
Các ứng dụng trong thực tế#
Các kiến trúc MoA phát huy hiệu quả trong những môi trường đòi hỏi suy luận sâu, kiểm chứng sự kiện và tổng hợp dữ liệu đa dạng.
- Kỹ thuật phần mềm phức tạp: Trong phát triển phần mềm, một hệ thống MoA có thể sử dụng Anthropic Claude để viết logic cốt lõi, OpenAI GPT-4o để tạo unit test và một model được bản địa hóa để kiểm tra bảo mật. Tác nhân tổng hợp cuối cùng sẽ đánh giá code đã kết hợp, chạy kiểm thử và xuất ra một script tinh chỉnh, không có lỗi.
- Chẩn đoán y tế tự động: Trong AI trong lĩnh vực chăm sóc sức khỏe, một pipeline MoA chẩn đoán có thể triển khai các tác nhân chuyên biệt để xem xét bệnh sử, phân tích kết quả xét nghiệm và xử lý ảnh y tế. Tác nhân chắt lọc tổng hợp các phát hiện này để hỗ trợ bác sĩ đưa ra chẩn đoán toàn diện, giảm đáng kể khả năng xảy ra lỗi do con người.
Tích hợp thị giác vào quy trình MoA#
Các hệ thống MoA hiện đại ngày càng mang tính đa phương thức, nghĩa là chúng dựa vào các model thị giác máy tính (CV) để nhận thức thế giới vật lý trước khi suy luận về thế giới đó. Ví dụ, trong AI trong sản xuất, một tác nhân thị giác có thể kiểm tra luồng camera trực tiếp và gửi các quan sát thực tế đến một tác nhân suy luận.
Ví dụ Python sau đây minh họa cách Ultralytics YOLO26 có thể hoạt động như một "tác nhân thị giác" trong pipeline MoA, trích xuất dữ liệu ngữ cảnh để cung cấp cho các LLM ở downstream. Developer có thể dễ dàng quản lý và fine-tune các công cụ thị giác chuyên biệt này bằng Ultralytics Platform.
from ultralytics import YOLO
# Initialize YOLO26 as a dedicated visual agent
visual_agent = YOLO("yolo26n.pt")
# The agent observes the environment by running inference on an image
results = visual_agent("https://ultralytics.com/images/bus.jpg")
# Extract structured data to pass to the MoA aggregator
detected_classes = [visual_agent.names[int(cls)] for cls in results[0].boxes.cls]
unique_objects = set(detected_classes)
# This text context is then sent to the reasoning agent
print(f"Visual Agent Report: I have identified {', '.join(unique_objects)} in the scene.")Bằng cách kết nối khoảng cách giữa các model thị giác có năng lực cao được xây dựng bằng những framework như PyTorch và các engine nhận thức tiên tiến như Google Gemini, các hệ sinh thái MoA phản ánh sự cộng tác của con người. Chúng đang nhanh chóng trở thành nền tảng của các pipeline Agentic RAG, mở đường cho những hệ thống tự chủ mạnh mẽ và đáng tin cậy hơn.









