Multimodal RAG
探索多模态 RAG,处理文本、图像和视频。了解 Ultralytics YOLO26 如何增强 AI 检索流程,提供更准确、具备上下文感知能力的响应。
多模态检索增强生成(Multimodal RAG)是一种先进的人工智能(AI)框架,它扩展了传统 RAG 系统,使其能够处理和推理多种数据类型,例如文本、图像、视频和音频。标准的检索增强生成(RAG)通过检索相关文本档来提高大型语言模型(LLM)的准确性,而多模态 RAG 则通过从混合媒体知识库中检索上下文,让模型能够“看见”和“听见”。这种方法将模型的生成建立在具体的视觉或听觉证据之上,显著减少LLM 中的幻觉,并支持在私有数据集上执行视觉问答等复杂任务。通过利用多模态学习,这些系统可以综合用户查询(例如文本)和检索到的资源(例如图表或监控画面)中的信息,从而生成全面且了解上下文的响应。
多模态 RAG 的工作原理#
多模态 RAG 系统的架构通常与标准的“检索后生成”流程相似,但会针对非文本数据进行适配。此过程高度依赖向量数据库和共享语义空间。
-
**索引:**处理来自各种来源的数据,包括 PDF、视频和幻灯片。 特征提取模型将这些不同模态转换为称为嵌入的高维数值向量。例如,类似OpenAI 的 CLIP的模型会对齐图像和文本嵌入,使狗的图片与“dog”一词在数学空间中彼此接近。
-
**检索:**当用户提出问题时(例如“向我展示这块电路板上的缺陷”),系统会在向量数据库中执行语义搜索,查找与查询意图最匹配的图像或视频片段。
-
**生成:**检索到的视觉上下文会被输入视觉语言模型(VLM)。VLM 会同时处理用户的文本提示和检索到的图像特征,以生成最终答案,从而有效地与数据“对话”。
实际应用#
多模态 RAG 正在通过让AI 代理借助视觉数据与物理世界交互,改变各个行业。
- **工业维护与制造:**在制造业中的 AI应用中,技术人员可以向系统上传损坏机器部件的照片并进行查询。多模态 RAG 系统会检索相似的历史维护日志、技术原理图和视频教程,为维修过程提供指导。这可以减少停机时间,并让更多人能够获得专家知识。
- **零售与电子商务发现:**使用零售业中的 AI的应用允许客户上传他们喜欢的服装图片。系统会从当前库存中检索外观相似的商品,并生成搭配建议或产品比较信息,从而创造高度个性化的购物体验。
区分相关术语#
要理解多模态 RAG 的具体定位,可以将其与相关概念区分开来:
- **多模态 RAG 与多模态模型的比较:**多模态模型(如 GPT-4o 或 Gemini)负责生成响应。多模态 RAG 则是向该模型提供其训练数据中未包含的外部私有数据(图像、文档)的架构。模型是引擎,RAG 是输送燃料的管线。
- **多模态 RAG 与微调的比较:**微调会永久更新模型权重,使模型学习新的任务或风格。RAG 则在推理时提供临时知识。对于动态数据(例如每日库存)而言,频繁重新训练并不实际,因此更适合使用 RAG。
使用 Ultralytics 实现#
开发者可以使用Ultralytics YOLO构建多模态 RAG 流程中的检索组件。YOLO 通过检测和分类图像中的对象,提供可编入索引的结构化元数据,或用于裁剪出与 VLM 相关的图像区域。Ultralytics Platform简化了这些专用视觉模型的训练,使其能够识别对特定领域至关重要的自定义对象。
以下示例演示了如何使用YOLO26从图像中提取视觉上下文(检测到的对象),然后可以将其作为 RAG 工作流的一部分传递给 LLM。
from ultralytics import YOLO
# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]
print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, person延伸阅读与资源#
- **LangChain 文档:**构建检索流程的综合指南,包括多模态支持。
- **LlamaIndex 多模态指南:**关于为 LLM 编制索引和检索复杂数据类型的详细文档。
- **Google Cloud Vertex AI Search:**用于构建可扩展 RAG 应用的企业级向量搜索功能。
- **Ultralytics Solutions:**探索计算机视觉如何与更广泛的 AI 系统集成,并服务于各个行业。









