Multimodal RAG
Khám phá Multimodal RAG để xử lý văn bản, hình ảnh và video. Tìm hiểu cách Ultralytics YOLO26 tăng cường các pipeline truy xuất AI để có các phản hồi chính xác, nhạy bén với ngữ cảnh hơn.
Multimodal Retrieval Augmented Generation (Multimodal RAG) là một khung trí tuệ nhân tạo (AI) tiên tiến, mở rộng các hệ thống RAG truyền thống để xử lý và suy luận trên nhiều loại dữ liệu đa dạng như văn bản, hình ảnh, video và âm thanh. Trong khi Retrieval Augmented Generation (RAG) tiêu chuẩn cải thiện độ chính xác của Large Language Model (LLM) bằng cách truy xuất các tài liệu văn bản có liên quan, Multimodal RAG cho phép các mô hình "nhìn" và "nghe" thông qua việc truy xuất bối cảnh từ cơ sở kiến thức đa phương tiện. Cách tiếp cận này giúp gắn kết quá trình tạo sinh của mô hình với bằng chứng hình ảnh hoặc thính giác cụ thể, làm giảm đáng kể hiện tượng ảo giác trong LLM và hỗ trợ các tác vụ phức tạp như trả lời câu hỏi trực quan trên các tập dữ liệu riêng tư. Bằng cách tận dụng multi-modal learning, các hệ thống này có thể tổng hợp thông tin từ truy vấn của người dùng (ví dụ: văn bản) và các tài sản được truy xuất (ví dụ: biểu đồ hoặc khung hình giám sát) để tạo ra phản hồi toàn diện, nhận thức theo ngữ cảnh.
Cách thức hoạt động của Multimodal RAG#
Kiến trúc của một hệ thống Multimodal RAG thường phản ánh chu trình chuẩn "Truy xuất rồi Tạo sinh" (Retrieve-then-Generate) nhưng được điều chỉnh cho dữ liệu phi văn bản. Quá trình này phụ thuộc lớn vào vector databases và không gian ngữ nghĩa chia sẻ.
-
Lập chỉ mục (Indexing): Dữ liệu từ nhiều nguồn khác nhau—PDF, video, slide—được xử lý. Các mô hình Feature extraction chuyển đổi các phương thức này thành các vectơ số chiều cao được gọi là embeddings. Ví dụ, một mô hình như OpenAI's CLIP căn chỉnh các embedding hình ảnh và văn bản sao cho hình ảnh của một chú chó và từ "chó" nằm gần nhau về mặt toán học.
-
Truy xuất (Retrieval): Khi người dùng đặt câu hỏi (ví dụ: "Hãy chỉ cho tôi lỗi trên bảng mạch này"), hệ thống sẽ thực hiện semantic search trên cơ sở dữ liệu vectơ để tìm các hình ảnh hoặc đoạn video có liên quan nhất phù hợp với ý định của truy vấn.
-
Tạo sinh (Generation): Bối cảnh trực quan được truy xuất sẽ được đưa vào một Vision-Language Model (VLM). VLM xử lý cả lời nhắc văn bản của người dùng và các đặc trưng hình ảnh được truy xuất để tạo ra câu trả lời cuối cùng, qua đó thực hiện "trò chuyện" với dữ liệu một cách hiệu quả.
Các ứng dụng trong thực tế#
Multimodal RAG đang chuyển đổi các ngành công nghiệp bằng cách cho phép các AI agents tương tác với thế giới vật lý thông qua dữ liệu trực quan.
- Bảo trì Công nghiệp và Sản xuất: Trong AI in manufacturing, các kỹ thuật viên có thể truy vấn hệ thống bằng một bức ảnh chụp bộ phận máy móc bị hỏng. Hệ thống Multimodal RAG sẽ truy xuất các nhật ký bảo trì lịch sử tương tự, sơ đồ kỹ thuật và video hướng dẫn để định hướng quy trình sửa chữa. Điều này giúp giảm thời gian chết và dân chủ hóa kiến thức chuyên môn.
- Khám phá trong Bán lẻ và Thương mại Điện tử: Các ứng dụng sử dụng AI in retail cho phép khách hàng tải lên hình ảnh bộ trang phục họ yêu thích. Hệ thống sẽ truy xuất các mặt hàng có hình ảnh tương tự từ kho hàng hiện tại và tạo ra các lời khuyên phối đồ hoặc so sánh sản phẩm, mang lại trải nghiệm mua sắm được cá nhân hóa cao độ.
Phân biệt các thuật ngữ liên quan#
Để hiểu rõ phân khúc cụ thể của Multimodal RAG, việc phân biệt nó với các khái niệm liên quan là rất hữu ích:
- Multimodal RAG so với Multi-Modal Model: Một mô hình đa phương thức (như GPT-4o hoặc Gemini) tạo ra phản hồi. Multimodal RAG là kiến trúc cung cấp cho mô hình đó dữ liệu bên ngoài, riêng tư (hình ảnh, tài liệu) mà nó chưa từng được huấn luyện. Mô hình là động cơ; RAG là đường ống dẫn nhiên liệu.
- Multimodal RAG so với Fine-Tuning: Fine-tuning cập nhật vĩnh viễn model weights để học một tác vụ hoặc phong cách mới. RAG cung cấp kiến thức tạm thời tại thời điểm suy luận. RAG được ưu tiên cho dữ liệu động (ví dụ: hàng tồn kho hàng ngày) khi việc huấn luyện lại thường xuyên là không khả thi.
Triển khai với Ultralytics#
Các nhà phát triển có thể xây dựng thành phần truy xuất của một pipeline Multimodal RAG bằng cách sử dụng Ultralytics YOLO. Bằng cách phát hiện và phân loại các đối tượng trong hình ảnh, YOLO cung cấp siêu dữ liệu có cấu trúc có thể được lập chỉ mục để truy xuất dựa trên văn bản hoặc được sử dụng để cắt các vùng hình ảnh liên quan cho VLM. Ultralytics Platform đơn giản hóa quá trình huấn luyện các mô hình thị giác chuyên biệt này để nhận diện các đối tượng tùy chỉnh quan trọng cho lĩnh vực cụ thể của bạn.
Ví dụ sau đây minh họa việc sử dụng YOLO26 để trích xuất bối cảnh trực quan (các đối tượng được phát hiện) từ một hình ảnh, sau đó có thể được chuyển đến LLM như một phần của quy trình RAG.
from ultralytics import YOLO
# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]
print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, personĐọc thêm và Tài nguyên#
- LangChain Documentation: Hướng dẫn toàn diện về cách xây dựng các pipeline truy xuất, bao gồm cả hỗ trợ đa phương thức.
- LlamaIndex Multimodal Guide: Tài liệu chi tiết về việc lập chỉ mục và truy xuất các loại dữ liệu phức tạp cho LLM.
- Google Cloud Vertex AI Search: Các tính năng tìm kiếm vectơ cấp độ doanh nghiệp để xây dựng ứng dụng RAG có khả năng mở rộng.
- Ultralytics Solutions: Khám phá cách thị giác máy tính tích hợp với các hệ thống AI rộng lớn hơn trên nhiều ngành công nghiệp khác nhau.






