Mixture of Agents (MoA)
Khám phá cách Mixture of Agents (MoA) tận dụng nhiều LLMs để giải quyết các tác vụ phức tạp. Tìm hiểu cách tích hợp Ultralytics YOLO26 như một tác nhân hình ảnh trong các quy trình làm việc MoA.
Mixture of Agents (MoA) là một kiến trúc trí tuệ nhân tạo tiên tiến tận dụng nhiều large language models (LLMs) hoặc các tác nhân tự động để cùng nhau giải quyết các tác vụ phức tạp. Thay vì dựa vào một model đơn lẻ để tạo ra phản hồi, hệ thống MoA truy vấn đồng thời một số model riêng biệt. Các tác nhân ban đầu này tạo ra các câu trả lời độc lập, sau đó được chuyển đến một tác nhân tổng hợp hoặc tổng hợp. Tác nhân tổng hợp đánh giá, tinh chỉnh và kết hợp các góc nhìn đa dạng thành một đầu ra cuối cùng duy nhất, chất lượng cao. Cách tiếp cận cộng tác này giúp tăng cường đáng kể khả năng suy luận và giảm thiểu các sai lệch hoặc điểm yếu riêng lẻ của các model độc lập, đại diện cho một bước tiến lớn trong natural language processing (NLP) và giải quyết vấn đề.
Mixture of Agents so với Mixture of Experts#
Mặc dù nghe có vẻ tương tự, việc phân biệt MoA với khái niệm liên quan Mixture of Experts (MoE) là rất quan trọng.
- Mixture of Experts (MoE): Hoạt động trong một neural network architecture duy nhất. Nó sử dụng cơ chế định tuyến để chỉ kích hoạt các tầng con chuyên biệt (experts) cụ thể cho từng token trong quá trình inference. Điều này tối ưu hóa hiệu quả tính toán trong khi vẫn duy trì số lượng tham số cao.
- Mixture of Agents (MoA): Hoạt động ở cấp độ model hoặc hệ thống. Nó bao gồm các AI agents hoàn toàn riêng biệt — thường được xây dựng trên các foundation models khác nhau — tương tác trong một pipeline. MoA hoạt động giống một model ensemble kết hợp với quy trình đánh giá thông minh, như được trình bày chi tiết trong nghiên cứu multi-agent system research gần đây.
Các ứng dụng trong thực tế#
Các kiến trúc MoA vượt trội trong các môi trường yêu cầu khả năng suy luận sâu, kiểm chứng dữ kiện và tổng hợp dữ liệu đa dạng.
- Kỹ thuật phần mềm phức tạp: Trong phát triển phần mềm, hệ thống MoA có thể sử dụng Anthropic Claude để viết logic cốt lõi, OpenAI GPT-4o để tạo unit tests, và một model cục bộ để kiểm tra bảo mật. Một tác nhân tổng hợp cuối cùng sẽ xem xét đoạn code kết hợp, kiểm tra và xuất ra một script đã được tinh chỉnh, không có lỗi.
- Chẩn đoán y tế tự động: Trong AI in healthcare, một pipeline MoA chẩn đoán có thể triển khai các tác nhân chuyên biệt để xem xét lịch sử bệnh án, phân tích kết quả xét nghiệm và xử lý hình ảnh y tế. Tác nhân tổng hợp sẽ tổng hợp các phát hiện này để hỗ trợ bác sĩ đưa ra chẩn đoán toàn diện, giảm đáng kể khả năng xảy ra lỗi của con người.
Tích hợp thị giác vào các luồng công việc MoA#
Các hệ thống MoA hiện đại ngày càng mang tính đa phương thức, nghĩa là chúng dựa vào các model computer vision (CV) để nhận thức thế giới vật lý trước khi suy luận về nó. Ví dụ, trong AI in manufacturing, một tác nhân trực quan có thể kiểm tra nguồn cấp dữ liệu camera trực tiếp và gửi các quan sát thực tế của nó đến một tác nhân suy luận.
Ví dụ về Python sau đây minh họa cách Ultralytics YOLO26 có thể hoạt động như một "visual agent" trong pipeline MoA, trích xuất dữ liệu ngữ cảnh để cung cấp cho các LLM hạ nguồn. Các nhà phát triển có thể quản lý và tinh chỉnh liền mạch các công cụ thị giác chuyên biệt này bằng cách sử dụng Ultralytics Platform.
from ultralytics import YOLO
# Initialize YOLO26 as a dedicated visual agent
visual_agent = YOLO("yolo26n.pt")
# The agent observes the environment by running inference on an image
results = visual_agent("https://ultralytics.com/images/bus.jpg")
# Extract structured data to pass to the MoA aggregator
detected_classes = [visual_agent.names[int(cls)] for cls in results[0].boxes.cls]
unique_objects = set(detected_classes)
# This text context is then sent to the reasoning agent
print(f"Visual Agent Report: I have identified {', '.join(unique_objects)} in the scene.")Bằng cách thu hẹp khoảng cách giữa các model thị giác có năng lực cao được xây dựng với các framework như PyTorch và các công cụ nhận thức nâng cao như Google Gemini, hệ sinh thái MoA phản ánh sự cộng tác của con người. Chúng đang nhanh chóng trở thành xương sống của các pipeline Agentic RAG, mở đường cho các hệ thống tự động mạnh mẽ và đáng tin cậy hơn.






