Multimodal AI
探索多模态 AI,了解它如何整合文本和视觉,实现上下文感知理解。立即学习使用 Ultralytics YOLO26 和开放词汇模型。
多模态 AI 是指一类复杂的人工智能 (AI)系统,旨在同时处理、解释和综合多种不同类型的数据,即“模态”。不同于专注于单一输入源的传统单模态系统——例如用于文本的自然语言处理 (NLP)或用于图像的计算机视觉 (CV)——多模态 AI 通过整合多种数据流来模拟人类感知。这种整合可以包括将视觉数据(图像、视频)与语言数据(文本、语音音频)和感知信息(LiDAR、雷达、热成像)相结合。通过利用这些组合输入,这些模型能够更深入、更具上下文感知能力地理解复杂的现实场景,进一步接近通用人工智能 (AGI)的广泛能力。
多模态系统的工作原理#
多模态 AI 的核心优势在于,它能够将不同类型的数据映射到一个共享的数学空间中,从而进行比较和组合。这一过程通常包括三个关键阶段:编码、对齐和融合。
-
特征提取: 专用神经网络分别处理每种模态,以识别关键模式。例如,卷积神经网络 (CNN)可以从照片中提取视觉特征,而Transformer则处理配套的说明文字。
-
对齐与嵌入: 提取出的特征会被转换为高维数值向量。模型会学习对齐这些向量,使语义相似的概念(例如,一张猫的图像和文本中的“猫”一词)在向量空间中彼此接近。这通常通过对比学习等技术实现,这种方法因在OpenAI 的 CLIP等模型中的应用而广为人知。
-
数据融合: 系统使用先进的融合技术合并已对齐的数据。现代架构使用注意力机制,根据上下文动态衡量一种模态相对于另一种模态的重要性,使模型能够在图像含义不明确时关注文本,反之亦然。
实际应用#
多模态 AI 解锁了单模态系统此前无法实现的能力,推动了各行各业的创新。
- 视觉问答 (VQA): 在此应用中,用户可以向 AI 提供一张图像,并用自然语言提出相关问题。例如,视障用户可以上传一张储藏室的照片并询问:“我还剩下意大利面吗?”模型会处理视觉内容和文本查询,以提供具体答案。
- 自动驾驶汽车: 自动驾驶汽车高度依赖多模态输入,结合来自摄像头、LiDAR 点云和雷达的数据来安全导航。这种冗余机制确保在一个传感器发生故障时(例如摄像头因阳光眩光而失效),其他传感器仍能维持汽车工程师协会 (SAE)规定的安全标准。
- 医疗诊断: 先进的医疗 AI 系统会分析医学图像分析结果(例如 MRI 或 X 射线),以及非结构化的患者病史文本和遗传数据。这种全面的视角有助于医生作出更准确的诊断,这也是Nature Digital Medicine经常讨论的主题。
- 生成式 AI: 从文本提示生成图像的工具(如Stable Diffusion)完全依赖于模型理解语言描述与视觉纹理之间关系的能力。
使用 Ultralytics 进行开放词汇检测#
标准目标检测器依赖预定义的类别列表,而YOLO-World等多模态方法允许用户使用开放词汇文本提示来检测对象。这在 Ultralytics 生态系统中架起了语言指令与视觉识别之间的桥梁。
以下示例演示如何使用 ultralytics 库执行开放词汇检测,其中模型会根据自定义文本输入检测对象:
from ultralytics import YOLOWorld
# Load a pretrained YOLO-World model (Multimodal: Text + Vision)
model = YOLOWorld("yolov8s-world.pt")
# Define custom text prompts (modalities) for the model to identify
model.set_classes(["person wearing a red hat", "blue backpack"])
# Run inference: The model aligns the text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show the results
results[0].show()区分相关术语#
要了解现代机器学习的发展脉络,区分“多模态 AI”与相关概念会很有帮助:
- 多模态学习: 这是指在混合数据类型上训练算法的学术领域和方法论。“多模态 AI”通常指实际的应用或由此产生的系统本身。
- 大语言模型 (LLMs): 传统 LLMs 是单模态的,仅使用文本数据进行训练。不过,业界正转向“大多模态模型” (LMMs),这类模型能够原生处理图像和文本;PyTorch和TensorFlow等框架也支持这一趋势。
- 专用视觉模型: Ultralytics YOLO26等最先进的模型是视觉任务领域高度专业化的专家。通用多模态模型或许能够广泛描述场景,而专用模型则擅长高速、精准的目标检测,以及在边缘硬件上的实时处理。
未来展望#
多模态 AI 的发展方向指向具备更强推理能力的系统。通过成功将语言建立在视觉和物理现实的基础上,这些模型正在超越统计相关性,迈向真正的理解。Google DeepMind和斯坦福大学基础模型研究中心等机构的研究仍在不断拓展机器感知复杂环境的边界。
在 Ultralytics,我们正将这些进展整合到Ultralytics Platform中,使用户能够管理数据、训练模型并部署解决方案,充分利用各种可用模态,将YOLO26的速度与多模态输入的灵活性相结合。









