Ultralytics YOLO27:
返回 Ultralytics 术语表

Multimodal RAG

探索多模态 RAG,处理文本、图像和视频。了解 Ultralytics YOLO26 如何增强 AI 检索流程,提供更准确、具备上下文感知能力的响应。

多模态检索增强生成(Multimodal RAG)是一种先进的人工智能(AI)框架,它扩展了传统 RAG 系统,使其能够处理和推理多种数据类型,例如文本、图像、视频和音频。标准的检索增强生成(RAG)通过检索相关文本​​档来提高大型语言模型(LLM)的准确性,而多模态 RAG 则通过从混合媒体知识库中检索上下文,让模型能够“看见”和“听见”。这种方法将模型的生成建立在具体的视觉或听觉证据之上,显著减少LLM 中的幻觉,并支持在私有数据集上执行视觉问答等复杂任务。通过利用多模态学习,这些系统可以综合用户查询(例如文本)和检索到的资源(例如图表或监控画面)中的信息,从而生成全面且了解上下文的响应。

多模态 RAG 的工作原理#

多模态 RAG 系统的架构通常与标准的“检索后生成”流程相似,但会针对非文本数据进行适配。此过程高度依赖向量数据库和共享语义空间。

  1. **索引:**处理来自各种来源的数据,包括 PDF、视频和幻灯片。 特征提取模型将这些不同模态转换为称为嵌入的高维数值向量。例如,类似OpenAI 的 CLIP的模型会对齐图像和文本嵌入,使狗的图片与“dog”一词在数学空间中彼此接近。

  2. **检索:**当用户提出问题时(例如“向我展示这块电路板上的缺陷”),系统会在向量数据库中执行语义搜索,查找与查询意图最匹配的图像或视频片段。

  3. **生成:**检索到的视觉上下文会被输入视觉语言模型(VLM)。VLM 会同时处理用户的文本提示和检索到的图像特征,以生成最终答案,从而有效地与数据“对话”。

实际应用#

多模态 RAG 正在通过让AI 代理借助视觉数据与物理世界交互,改变各个行业。

  • **工业维护与制造:**在制造业中的 AI应用中,技术人员可以向系统上传损坏机器部件的照片并进行查询。多模态 RAG 系统会检索相似的历史维护日志、技术原理图和视频教程,为维修过程提供指导。这可以减少停机时间,并让更多人能够获得专家知识。
  • **零售与电子商务发现:**使用零售业中的 AI的应用允许客户上传他们喜欢的服装图片。系统会从当前库存中检索外观相似的商品,并生成搭配建议或产品比较信息,从而创造高度个性化的购物体验。

区分相关术语#

要理解多模态 RAG 的具体定位,可以将其与相关概念区分开来:

  • **多模态 RAG 与多模态模型的比较:**多模态模型(如 GPT-4o 或 Gemini)负责生成响应。多模态 RAG 则是向该模型提供其训练数据中未包含的外部私有数据(图像、文档)的架构。模型是引擎,RAG 是输送燃料的管线。
  • **多模态 RAG 与微调的比较:**微调会永久更新模型权重,使模型学习新的任务或风格。RAG 则在推理时提供临时知识。对于动态数据(例如每日库存)而言,频繁重新训练并不实际,因此更适合使用 RAG。

使用 Ultralytics 实现#

开发者可以使用Ultralytics YOLO构建多模态 RAG 流程中的检索组件。YOLO 通过检测和分类图像中的对象,提供可编入索引的结构化元数据,或用于裁剪出与 VLM 相关的图像区域。Ultralytics Platform简化了这些专用视觉模型的训练,使其能够识别对特定领域至关重要的自定义对象。

以下示例演示了如何使用YOLO26从图像中提取视觉上下文(检测到的对象),然后可以将其作为 RAG 工作流的一部分传递给 LLM。

from ultralytics import YOLO

# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")

# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")

# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]

print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, person

延伸阅读与资源#

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅