Multimodal RAG
探索多模态 RAG 以处理文本、图像和视频。了解 Ultralytics YOLO26 如何增强 AI 检索流水线以获得更准确、具有上下文感知的响应。
多模态检索增强生成(Multimodal RAG)是一种先进的人工智能(AI)框架,它将传统的 RAG 系统扩展为能够处理和推理各种数据类型(如文本、图像、视频和音频)。虽然标准的检索增强生成(RAG)通过检索相关的文本文档来提高大型语言模型(LLM)的准确性,但 Multimodal RAG 通过从混合媒体知识库中检索上下文,使模型能够“看”和“听”。这种方法将模型的生成建立在具体的视觉或听觉证据基础之上,显著减少了LLM 中的幻觉,并能够执行诸如针对私有数据集进行视觉问答等复杂任务。通过利用多模态学习,这些系统可以综合用户查询(例如文本)和检索到的资产(例如图表或监控画面)中的信息,从而产生全面且具备上下文感知的响应。
Multimodal RAG 的工作原理#
Multimodal RAG 系统的架构通常镜像了标准的“检索然后生成”流程,但针对非文本数据进行了调整。这个过程高度依赖于向量数据库和共享语义空间。
-
索引: 处理来自各种来源(PDF、视频、幻灯片)的数据。特征提取模型将这些不同的模态转换为被称为嵌入的高维数值向量。例如,像OpenAI 的 CLIP这样的模型会对齐图像和文本嵌入,使得狗的图片和单词“dog”在数学上非常接近。
-
检索: 当用户提出问题(例如,“显示这个电路板中的缺陷”)时,系统会在向量数据库中执行语义搜索,以找到与查询意图最匹配的最相关图像或视频剪辑。
-
生成: 检索到的视觉上下文被输入到视觉语言模型(VLM)中。VLM 处理用户的文本提示和检索到的图像特征来生成最终答案,从而有效地与数据进行“对话”。
实际应用#
Multimodal RAG 正在通过使AI 智能体能够通过视觉数据与物理世界交互来转型各行各业。
- 工业维护与制造: 在制造领域的 AI 中,技术人员可以使用损坏机器零件的照片来查询系统。Multimodal RAG 系统检索相似的历史维护日志、技术原理图和视频教程来指导维修过程。这减少了停机时间并使专家知识普及化。
- 零售与电商发现: 使用零售领域的 AI 的应用程序允许客户上传他们喜欢的服装图像。系统从当前库存中检索视觉上相似的物品,并生成造型建议或产品比较,从而创造高度个性化的购物体验。
区分相关术语#
为了理解 Multimodal RAG 的具体定位,将其与相关概念区分开来会有所帮助:
- Multimodal RAG 与多模态模型的对比: 多模态模型(如 GPT-4o 或 Gemini)负责创建响应。Multimodal RAG 是向该模型提供未经过训练的外部私有数据(图像、文档)的架构。模型是引擎;RAG 是油管。
- Multimodal RAG 与微调的对比: 微调永久更新模型权重以学习新任务或风格。RAG 在推理时提供临时知识。对于频繁重新训练不切实际的动态数据(例如每日库存),RAG 是首选。
使用 Ultralytics 进行实现#
开发者可以使用Ultralytics YOLO 构建 Multimodal RAG 管道的检索组件。通过检测和分类图像中的对象,YOLO 提供结构化元数据,可以为基于文本的检索建立索引,或用于裁剪 VLM 的相关图像区域。Ultralytics 平台简化了训练这些专业视觉模型的过程,以识别对特定领域至关重要的自定义对象。
以下示例演示了使用YOLO26 从图像中提取视觉上下文(检测到的对象),然后可以将其作为 RAG 工作流的一部分传递给 LLM。
from ultralytics import YOLO
# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]
print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, person延伸阅读与资源#
- LangChain 文档: 构建检索管道的综合指南,包括多模态支持。
- LlamaIndex 多模态指南: 有关为 LLM 索引和检索复杂数据类型的详细文档。
- Google Cloud Vertex AI 搜索: 用于构建可扩展 RAG 应用程序的企业级向量搜索功能。
- Ultralytics 解决方案: 探索计算机视觉如何在各个行业中与更广泛的 AI 系统集成。






