Ultralytics YOLO27:
返回 Ultralytics 术语表

Multimodal AI

探索多模态 AI,了解它如何整合文本和视觉,实现上下文感知理解。立即学习使用 Ultralytics YOLO26 和开放词汇模型。

多模态 AI 是指一类复杂的人工智能 (AI)系统,旨在同时处理、解释和综合多种不同类型的数据,即“模态”。不同于专注于单一输入源的传统单模态系统——例如用于文本的自然语言处理 (NLP)或用于图像的计算机视觉 (CV)——多模态 AI 通过整合多种数据流来模拟人类感知。这种整合可以包括将视觉数据(图像、视频)与语言数据(文本、语音音频)和感知信息(LiDAR、雷达、热成像)相结合。通过利用这些组合输入,这些模型能够更深入、更具上下文感知能力地理解复杂的现实场景,进一步接近通用人工智能 (AGI)的广泛能力。

多模态系统的工作原理#

多模态 AI 的核心优势在于,它能够将不同类型的数据映射到一个共享的数学空间中,从而进行比较和组合。这一过程通常包括三个关键阶段:编码、对齐和融合。

  1. 特征提取 专用神经网络分别处理每种模态,以识别关键模式。例如,卷积神经网络 (CNN)可以从照片中提取视觉特征,而Transformer则处理配套的说明文字。

  2. 对齐与嵌入 提取出的特征会被转换为高维数值向量。模型会学习对齐这些向量,使语义相似的概念(例如,一张猫的图像和文本中的“猫”一词)在向量空间中彼此接近。这通常通过对比学习等技术实现,这种方法因在OpenAI 的 CLIP等模型中的应用而广为人知。

  3. 数据融合: 系统使用先进的融合技术合并已对齐的数据。现代架构使用注意力机制,根据上下文动态衡量一种模态相对于另一种模态的重要性,使模型能够在图像含义不明确时关注文本,反之亦然。

实际应用#

多模态 AI 解锁了单模态系统此前无法实现的能力,推动了各行各业的创新。

  • 视觉问答 (VQA) 在此应用中,用户可以向 AI 提供一张图像,并用自然语言提出相关问题。例如,视障用户可以上传一张储藏室的照片并询问:“我还剩下意大利面吗?”模型会处理视觉内容和文本查询,以提供具体答案。
  • 自动驾驶汽车 自动驾驶汽车高度依赖多模态输入,结合来自摄像头、LiDAR 点云和雷达的数据来安全导航。这种冗余机制确保在一个传感器发生故障时(例如摄像头因阳光眩光而失效),其他传感器仍能维持汽车工程师协会 (SAE)规定的安全标准。
  • 医疗诊断 先进的医疗 AI 系统会分析医学图像分析结果(例如 MRI 或 X 射线),以及非结构化的患者病史文本和遗传数据。这种全面的视角有助于医生作出更准确的诊断,这也是Nature Digital Medicine经常讨论的主题。
  • 生成式 AI 从文本提示生成图像的工具(如Stable Diffusion)完全依赖于模型理解语言描述与视觉纹理之间关系的能力。

使用 Ultralytics 进行开放词汇检测#

标准目标检测器依赖预定义的类别列表,而YOLO-World等多模态方法允许用户使用开放词汇文本提示来检测对象。这在 Ultralytics 生态系统中架起了语言指令与视觉识别之间的桥梁。

以下示例演示如何使用 ultralytics 库执行开放词汇检测,其中模型会根据自定义文本输入检测对象:

from ultralytics import YOLOWorld

# Load a pretrained YOLO-World model (Multimodal: Text + Vision)
model = YOLOWorld("yolov8s-world.pt")

# Define custom text prompts (modalities) for the model to identify
model.set_classes(["person wearing a red hat", "blue backpack"])

# Run inference: The model aligns the text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Show the results
results[0].show()

区分相关术语#

要了解现代机器学习的发展脉络,区分“多模态 AI”与相关概念会很有帮助:

  • 多模态学习 这是指在混合数据类型上训练算法的学术领域和方法论。“多模态 AI”通常指实际的应用或由此产生的系统本身。
  • 大语言模型 (LLMs) 传统 LLMs 是单模态的,仅使用文本数据进行训练。不过,业界正转向“大多模态模型” (LMMs),这类模型能够原生处理图像和文本;PyTorchTensorFlow等框架也支持这一趋势。
  • 专用视觉模型: Ultralytics YOLO26等最先进的模型是视觉任务领域高度专业化的专家。通用多模态模型或许能够广泛描述场景,而专用模型则擅长高速、精准的目标检测,以及在边缘硬件上的实时处理。

未来展望#

多模态 AI 的发展方向指向具备更强推理能力的系统。通过成功将语言建立在视觉和物理现实的基础上,这些模型正在超越统计相关性,迈向真正的理解。Google DeepMind斯坦福大学基础模型研究中心等机构的研究仍在不断拓展机器感知复杂环境的边界。

在 Ultralytics,我们正将这些进展整合到Ultralytics Platform中,使用户能够管理数据、训练模型并部署解决方案,充分利用各种可用模态,将YOLO26的速度与多模态输入的灵活性相结合。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅