Ultralytics YOLO27:
返回 Ultralytics 术语表

Multi-Modal Model

探索多模态模型如何整合文本、图像和音频。了解 Ultralytics YOLO26 等架构,并在 Ultralytics Platform 上部署视觉 AI。

多模态模型是一种先进的人工智能 (AI)系统,能够同时处理、解读并整合多种不同数据类型或“模态”的信息。传统的单模态系统专注于单一领域,例如处理文本的自然语言处理 (NLP)或处理图像的计算机视觉 (CV),而多模态模型则旨在通过综合视觉、听觉和语言线索来模拟人类感知。这种融合使模型能够形成对世界的全面理解,从而在视觉场景与口头描述之间建立复杂的关联。这些能力被视为实现通用人工智能 (AGI)的基础性步骤。

核心机制与架构#

多模态模型的效能取决于其将不同数据类型映射到共享语义空间的能力。此过程通常从创建嵌入开始,嵌入是能够捕捉输入数据核心含义的数值表示。通过在包含成对示例的大规模数据集上进行训练,例如带字幕的视频,模型学会将“猫”图像的向量表示与“猫”一词的文本嵌入对齐。

以下几个关键架构概念使这种整合成为可能:

  • Transformer 架构 许多多模态系统都采用 Transformer,并利用注意力机制动态衡量不同输入部分的重要性。这使模型能够关注与文本提示中相关词语对应的特定图像区域,这一概念在开创性研究论文《Attention Is All You Need》中有详细介绍。
  • 数据融合: 这指的是将来自不同来源的信息结合起来的策略。传感器融合可以通过合并原始数据在早期进行,也可以通过结合独立子模型的决策在后期进行。现代框架(如 PyTorch)提供了构建这些复杂流水线所需的灵活性。
  • 对比学习: OpenAI 的 CLIP等模型采用的技术,会训练系统在向量空间中缩小匹配文本-图像对之间的距离,同时扩大不匹配对之间的距离。

实际应用#

多模态模型解锁了单模态系统此前无法实现的能力。

  • 视觉问答 (VQA) 这些系统允许用户使用自然语言询问有关图像的问题。例如,视障用户可以上传一张食品储藏室的照片,并询问:“顶层货架上有一罐汤吗?”模型利用目标检测识别物品,并利用 NLP 理解问题,从而提供有用的回答。
  • 自动驾驶汽车 自动驾驶汽车充当实时多模态智能体。它们会结合摄像头传来的视觉信息、LiDAR 提供的深度信息以及雷达提供的速度数据。这种冗余机制确保当某个传感器受到天气影响而受阻时,其他传感器仍能保障道路安全
  • 开放词汇检测: Ultralytics YOLO-World等模型允许用户使用任意文本提示来检测对象,而不是依赖固定的类别列表。这弥合了语言指令与视觉识别之间的差距。

示例:开放词汇检测#

以下示例演示如何使用 ultralytics 库执行开放词汇检测,让模型解读文本提示并识别图像中的对象:

from ultralytics import YOLOWorld

# Load a pre-trained YOLO-World model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")

# Define custom classes using natural language text prompts
model.set_classes(["person wearing a hat", "blue backpack"])

# Run inference: The model aligns text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Visualize the detection results
results[0].show()

与相关术语的区别#

了解“多模态模型”与 AI 术语表中的相关概念之间的区别很有帮助:

  • 多模态学习 这指的是用于训练这些系统的过程机器学习 (ML)技术。多模态模型则是这一学习过程产生的成果或软件产品。
  • 大型语言模型 (LLMs) 传统 LLMs 只能处理文本。尽管许多模型正逐渐发展为视觉语言模型 (VLMs),但标准 LLM 仍然是单模态的。
  • 基础模型 这是一个更广泛的类别,用于描述能够适应许多下游任务的大规模模型。多模态模型通常是基础模型,但并非所有基础模型都能处理多种模态。

多模态 AI 的未来#

该领域正快速发展,目标是实现能够实时处理连续音频、视频和文本流的系统。Google DeepMind等组织的研究持续推动机器感知的边界。在 Ultralytics,我们通过YOLO26等高性能视觉骨干网络支持这一生态系统。YOLO26 于 2026 年发布,在实例分割等任务中提供更出色的速度和精度,可作为更大型多模态流水线中的高效视觉组件。开发者可以使用统一的 Ultralytics Platform管理这些复杂工作流中的数据、训练和部署。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅