Multimodal RAG
Khám phá Multimodal RAG để xử lý text, hình ảnh và video. Tìm hiểu cách Ultralytics YOLO26 nâng cao các retrieval pipeline của AI để tạo ra phản hồi chính xác và phù hợp ngữ cảnh hơn.
Thế hệ tăng cường truy xuất đa phương thức (RAG đa phương thức) là một framework trí tuệ nhân tạo (AI) tiên tiến, mở rộng các hệ thống RAG truyền thống để xử lý và suy luận trên nhiều loại dữ liệu khác nhau như văn bản, hình ảnh, video và âm thanh. Trong khi Thế hệ tăng cường truy xuất (RAG) tiêu chuẩn cải thiện độ chính xác của Mô hình ngôn ngữ lớn (LLM) bằng cách truy xuất các tài liệu văn bản liên quan, RAG đa phương thức cho phép các model "nhìn" và "nghe" bằng cách truy xuất ngữ cảnh từ một cơ sở tri thức đa phương tiện. Phương pháp này neo quá trình tạo sinh của model vào bằng chứng hình ảnh hoặc âm thanh cụ thể, giúp giảm đáng kể hiện tượng hallucination trong LLM và hỗ trợ các tác vụ phức tạp như trả lời câu hỏi trực quan trên các dataset riêng tư. Bằng cách tận dụng học đa phương thức, các hệ thống này có thể tổng hợp thông tin từ truy vấn của người dùng (ví dụ: văn bản) và các tài sản được truy xuất (ví dụ: sơ đồ hoặc khung hình giám sát) để tạo ra các phản hồi toàn diện, nhận biết ngữ cảnh.
RAG đa phương thức hoạt động như thế nào#
Kiến trúc của một hệ thống RAG đa phương thức thường mô phỏng pipeline "Truy xuất rồi Tạo sinh" tiêu chuẩn, nhưng được điều chỉnh cho dữ liệu phi văn bản. Quy trình này phụ thuộc nhiều vào cơ sở dữ liệu vector và các không gian ngữ nghĩa dùng chung.
-
Lập chỉ mục: Dữ liệu từ nhiều nguồn khác nhau—PDF, video, bộ slide—được xử lý. Các model trích xuất đặc trưng chuyển đổi những phương thức khác nhau này thành các vector số chiều cao, được gọi là embedding. Chẳng hạn, một model như CLIP của OpenAI căn chỉnh embedding hình ảnh và văn bản để hình ảnh một con chó và từ "dog" có khoảng cách gần nhau về mặt toán học.
-
Truy xuất: Khi người dùng đặt câu hỏi (ví dụ: "Hãy cho tôi xem lỗi trên bo mạch mạch này"), hệ thống thực hiện tìm kiếm ngữ nghĩa trên cơ sở dữ liệu vector để tìm những hình ảnh hoặc đoạn video liên quan nhất, phù hợp với ý định của truy vấn.
-
Tạo sinh: Ngữ cảnh trực quan được truy xuất sẽ được đưa vào Mô hình thị giác-ngôn ngữ (VLM). VLM xử lý cả prompt văn bản của người dùng và các đặc trưng hình ảnh được truy xuất để tạo ra câu trả lời cuối cùng, về cơ bản là "trò chuyện" với dữ liệu.
Các ứng dụng trong thực tế#
RAG đa phương thức đang chuyển đổi nhiều ngành bằng cách cho phép các tác tử AI tương tác với thế giới vật lý thông qua dữ liệu trực quan.
- Bảo trì công nghiệp và sản xuất: Trong lĩnh vực AI trong sản xuất, kỹ thuật viên có thể truy vấn hệ thống bằng ảnh chụp một bộ phận máy bị hỏng. Hệ thống RAG đa phương thức truy xuất các nhật ký bảo trì trước đây tương tự, bản vẽ kỹ thuật và video hướng dẫn để hỗ trợ quy trình sửa chữa. Điều này giúp giảm thời gian ngừng hoạt động và phổ biến hóa kiến thức chuyên môn.
- Khám phá bán lẻ và thương mại điện tử: Các ứng dụng sử dụng AI trong bán lẻ cho phép khách hàng tải lên hình ảnh một bộ trang phục mà họ yêu thích. Hệ thống truy xuất các sản phẩm tương tự về mặt hình ảnh từ hàng tồn kho hiện tại và tạo ra gợi ý phối đồ hoặc so sánh sản phẩm, mang đến trải nghiệm mua sắm được cá nhân hóa cao.
Phân biệt các thuật ngữ liên quan#
Để hiểu rõ lĩnh vực chuyên biệt của RAG đa phương thức, việc phân biệt nó với các khái niệm liên quan là rất hữu ích:
- RAG đa phương thức so với Mô hình đa phương thức: Một model đa phương thức (như GPT-4o hoặc Gemini) tạo ra phản hồi. RAG đa phương thức là kiến trúc cung cấp cho model đó dữ liệu bên ngoài, riêng tư (hình ảnh, tài liệu) mà model chưa được huấn luyện. Model là động cơ; RAG là đường ống nhiên liệu.
- RAG đa phương thức so với Tinh chỉnh: Tinh chỉnh cập nhật vĩnh viễn trọng số model để học một tác vụ hoặc phong cách mới. RAG cung cấp kiến thức tạm thời tại thời điểm suy luận. RAG được ưu tiên cho dữ liệu động (ví dụ: hàng tồn kho hằng ngày), trong đó việc huấn luyện lại thường xuyên là không thực tế.
Triển khai với Ultralytics#
Các developer có thể xây dựng thành phần truy xuất của pipeline RAG đa phương thức bằng Ultralytics YOLO. Bằng cách phát hiện và phân loại các đối tượng trong hình ảnh, YOLO cung cấp metadata có cấu trúc để lập chỉ mục cho hoạt động truy xuất dựa trên văn bản hoặc dùng để cắt các vùng hình ảnh liên quan cho VLM. Ultralytics Platform đơn giản hóa việc huấn luyện các model thị giác chuyên biệt này nhằm nhận diện các đối tượng tùy chỉnh quan trọng đối với lĩnh vực cụ thể của bạn.
Ví dụ sau đây minh họa cách sử dụng YOLO26 để trích xuất ngữ cảnh trực quan (các đối tượng được phát hiện) từ một hình ảnh, sau đó có thể truyền ngữ cảnh này vào LLM như một phần của workflow RAG.
from ultralytics import YOLO
# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]
print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, personTài liệu đọc thêm và tài nguyên#
- Tài liệu LangChain: Hướng dẫn toàn diện về xây dựng pipeline truy xuất, bao gồm hỗ trợ đa phương thức.
- Hướng dẫn đa phương thức của LlamaIndex: Tài liệu chi tiết về lập chỉ mục và truy xuất các loại dữ liệu phức tạp cho LLM.
- Google Cloud Vertex AI Search: Khả năng tìm kiếm vector cấp doanh nghiệp để xây dựng các ứng dụng RAG có khả năng mở rộng.
- Các giải pháp Ultralytics: Khám phá cách computer vision tích hợp với các hệ thống AI rộng hơn trong nhiều ngành khác nhau.









