Agentic RAG
Khám phá Agentic RAG để tăng cường AI bằng khả năng suy luận tự động. Tìm hiểu cách Ultralytics YOLO26 và Ultralytics Platform hỗ trợ retrieval thông minh và thị giác máy tính.
Agentic Retrieval-Augmented Generation (RAG tác nhân) là một kiến trúc trí tuệ nhân tạo (AI) tiên tiến, giúp nâng cao các hệ thống truy xuất truyền thống bằng cách tích hợp các AI agent tự chủ. Trong khi các pipeline RAG tiêu chuẩn hoạt động theo chuỗi tuyến tính "truy xuất và sinh", RAG tác nhân trao cho một mô hình ngôn ngữ lớn (LLM) vai trò điều phối thông minh. Agent này có thể độc lập phân tích prompt của người dùng, xác định xem có cần thông tin bên ngoài hay không, xây dựng nhiều truy vấn tìm kiếm, đánh giá dữ liệu được truy xuất và lặp lại việc tinh chỉnh quá trình nghiên cứu cho đến khi tổng hợp được câu trả lời toàn diện và chính xác. Bằng cách tận dụng các khả năng gọi hàm và sử dụng công cụ, những hệ thống này định tuyến động các truy vấn qua nhiều cơ sở dữ liệu, API và công cụ phân tích khác nhau, qua đó giảm đáng kể hiện tượng hallucination trong LLM khi xử lý các vấn đề phức tạp, gồm nhiều bước.
Cách các hệ thống RAG tác nhân hoạt động#
Đổi mới cốt lõi của RAG tác nhân nằm ở khả năng lặp và suy luận. Các framework AI tác nhân hàng đầu cấu trúc quy trình này thành các workflow động, tự chủ:
- Lập kế hoạch và định tuyến truy vấn: Agent phân rã các câu hỏi phức tạp thành những tác vụ con nhỏ hơn, dễ quản lý, rồi định tuyến từng tác vụ đến công cụ hoặc cơ sở dữ liệu vector phù hợp nhất.
- Truy xuất lặp: Khác với truy xuất tĩnh, agent xem xét các tài liệu đã lấy về. Nếu ngữ cảnh chưa đủ, agent sẽ điều chỉnh lại chiến lược tìm kiếm và tiếp tục gửi truy vấn.
- Tích hợp công cụ: Agent có thể viết và thực thi code, thực hiện các phép tính hoặc kích hoạt các model machine learning (ML) để tổng hợp dữ liệu mới ngay trong quá trình xử lý.
RAG tác nhân so với RAG tiêu chuẩn#
Để triển khai các pipeline sinh mạnh mẽ, việc phân biệt RAG tác nhân với các khái niệm nền tảng của nó là rất quan trọng:
- Retrieval-Augmented Generation tiêu chuẩn (RAG): Hoạt động trong một lượt duy nhất. Hệ thống lấy các tài liệu dựa trên độ tương đồng ngữ nghĩa rồi sinh phản hồi. Phương pháp này gặp khó khăn với logic phức tạp, đòi hỏi tổng hợp các nguồn dữ liệu khác nhau qua nhiều bước.
- RAG tác nhân: Bổ sung khả năng ra quyết định và lặp. Agent đánh giá chất lượng truy xuất, đồng thời có thể kích hoạt các lượt tìm kiếm tiếp theo hoặc những công cụ khác trước khi hoàn tất việc sinh kết quả.
- RAG đa phương thức: Tập trung vào việc truy xuất nhiều loại dữ liệu khác nhau (hình ảnh, văn bản, video). RAG tác nhân có thể điều khiển một pipeline RAG đa phương thức, quyết định khi nào nên tìm kiếm trong cơ sở dữ liệu hình ảnh thay vì tài liệu văn bản.
Các ứng dụng trong thực tế#
RAG tác nhân đang chuyển đổi nhiều ngành bằng cách tự động hóa các tác vụ nghiên cứu chuyên sâu và khắc phục sự cố phức tạp, mô phỏng khả năng suy luận phân tích của con người.
- Tổng hợp tri thức doanh nghiệp: Trong môi trường doanh nghiệp, agent có thể nhận prompt "tóm tắt hiệu suất Q3 của chúng ta và so sánh với kết quả kinh doanh mới nhất của đối thủ hàng đầu." Agent sẽ tự chủ truy vấn các cơ sở dữ liệu tài chính nội bộ, thực hiện tìm kiếm web theo thời gian thực để tìm hồ sơ công bố của đối thủ, phân tích các con số bằng công cụ máy tính và soạn thảo một bản tóm lược toàn diện.
- Kiểm tra chất lượng tự chủ: Trong lĩnh vực sản xuất, agent có thể được giao nhiệm vụ xác định nguyên nhân gốc rễ của một lỗi lắp ráp. Agent có thể kích hoạt một model thị giác máy tính (CV) để kiểm tra luồng camera trực tiếp, truy vấn nhật ký bảo trì trước đây và tổng hợp báo cáo chẩn đoán dựa trên bằng chứng hình ảnh và văn bản.
Tích hợp Vision AI vào workflow tác nhân#
Các model vision đóng vai trò như những công cụ cảm nhận mạnh mẽ cho các hệ thống RAG tác nhân tương tác với thế giới vật lý. Ví dụ, agent có thể sử dụng Ultralytics YOLO26 để truy xuất động ngữ cảnh hình ảnh từ một luồng hình ảnh hoặc video nhằm trả lời truy vấn của người dùng. Developer có thể quản lý việc gán nhãn dữ liệu và training cho các công cụ vision tùy chỉnh này bằng Ultralytics Platform.
Ví dụ Python sau đây minh họa cách một AI agent có thể gọi Ultralytics YOLO26 theo lập trình để trích xuất các quan sát có cấu trúc từ một hình ảnh, thu thập ngữ cảnh thực tế cho bước suy luận tiếp theo.
from ultralytics import YOLO
# Initialize YOLO26 for the agent's visual retrieval tool
model = YOLO("yolo26n.pt")
# The agent invokes the model on an image to gather visual facts
results = model("https://ultralytics.com/images/bus.jpg")
# The agent parses the detected objects to formulate its next query or action
visual_context = [model.names[int(c)] for c in results[0].boxes.cls]
print(f"Agent Observation: I currently see {', '.join(visual_context)}.")Bằng cách kết nối các model vision có năng lực cao với các engine suy luận, RAG tác nhân thu hẹp khoảng cách giữa truy xuất tri thức tĩnh và trí tuệ không gian động trong thế giới thực. Để tìm hiểu sâu hơn về bối cảnh đang phát triển của các hệ thống tự chủ, Báo cáo Chỉ số AI Stanford cung cấp thông tin theo dõi toàn diện về các năng lực tác nhân.









