Multimodal AI
探索多模态 AI 及其如何整合文本和视觉以实现上下文感知理解。立即学习如何使用 Ultralytics YOLO26 和开放词汇模型。
多模态 AI 是指一类复杂的人工智能 (AI)系统,旨在同时处理、解释和合成来自多种不同类型数据(即“模态”)的信息。与专注于单一输入源的传统单模态系统不同(例如用于文本的自然语言处理 (NLP) 或用于图像的计算机视觉 (CV)),多模态 AI 通过整合多样化的数据流来模拟人类感知。这种整合可以包括将视觉数据(图像、视频)与语言数据(文本、语音音频)以及传感器信息(激光雷达、雷达、热成像)结合起来。通过利用这些组合输入,这些模型能够对复杂的现实世界场景产生更深层、更具上下文意识的理解,从而更接近通用人工智能 (AGI) 的广泛能力。
多模态系统如何工作#
多模态 AI 的核心优势在于它能够将不同类型的数据映射到一个共享的数学空间中,并在该空间内进行比较和组合。此过程通常包含三个关键阶段:编码、对齐和融合。
-
**特征提取:**专业的神经网络独立处理每个模态以识别关键模式。例如,卷积神经网络 (CNN) 可能会从照片中提取视觉特征,而Transformer 则处理随附的标题。
-
**对齐与嵌入:**提取的特征被转换为高维数值向量。模型学习对齐这些向量,使语义相似的概念(例如,猫的图像和文本词“猫”)在向量空间中彼此靠近。这通常通过对比学习等技术来实现,这是一种在OpenAI 的 CLIP 等模型中广为使用的著名方法。
-
**数据融合:**系统使用先进的融合技术合并对齐的数据。现代架构使用注意力机制根据上下文动态权衡一个模态相对于另一个模态的重要性,从而允许模型在图像模糊时专注于文本,反之亦然。
实际应用#
多模态 AI 开启了单模态系统以前无法实现的功能,推动了各行各业的创新。
- **视觉问答 (VQA):**在此应用程序中,用户可以向 AI 提供图像并询问关于它的自然语言问题。例如,视障用户可能会上传一张食品储藏室的照片并问:“我还有意大利面吗?”模型会处理视觉内容和文本查询以提供具体的回答。
- **自动驾驶汽车:**自动驾驶汽车严重依赖多模态输入,结合了来自摄像头、激光雷达点云和雷达的数据来安全导航。这种冗余确保了如果一个传感器发生故障(例如摄像头被阳光眩光致盲),其他传感器可以维持由美国汽车工程师学会 (SAE) 定义的安全标准。
- **医疗诊断:**先进的医疗 AI 系统分析医学图像分析(例如 MRI 或 X 射线)以及非结构化的文本患者病史和基因数据。这一全面的视角有助于医生做出更准确的诊断,这是Nature Digital Medicine 中经常讨论的话题。
- **生成式 AI:**从文本提示创建图像的工具(例如 Stable Diffusion)完全依赖于模型理解语言描述和视觉纹理之间关系的能力。
Ultralytics 的开放词汇检测#
虽然标准的目标检测器依赖于预定义的类别列表,但像YOLO-World 这样的多模态方法允许用户使用开放词汇文本提示来检测对象。这弥合了 Ultralytics 生态系统中语言命令与视觉识别之间的鸿沟。
以下示例演示了如何使用 ultralytics 库来执行开放词汇检测,其中模型根据自定义文本输入检测对象:
from ultralytics import YOLOWorld
# Load a pretrained YOLO-World model (Multimodal: Text + Vision)
model = YOLOWorld("yolov8s-world.pt")
# Define custom text prompts (modalities) for the model to identify
model.set_classes(["person wearing a red hat", "blue backpack"])
# Run inference: The model aligns the text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show the results
results[0].show()区分相关术语#
为了梳理现代机器学习的格局,区分“多模态 AI”与相关概念会很有帮助:
- **多模态学习:**这指的是在混合数据类型上训练算法的学术学科和方法论。“多模态 AI”通常指实际的应用或生成的系统本身。
- **大型语言模型 (LLM):**传统的 LLM 是单模态的,专门在文本数据上进行训练。然而,行业正在转向能够原生处理图像和文本的“大型多模态模型”(LMM),这一趋势得到了PyTorch 和TensorFlow 等框架的支持。
- **专业视觉模型:**诸如最先进的Ultralytics YOLO26 等模型是视觉任务的高度专业化专家。虽然通用的多模态模型可能会对场景进行广泛的描述,但专业模型擅长在边缘硬件上进行高速、精确的目标检测和实时处理。
未来展望#
多模态 AI 的发展轨迹指向了具备更强推理能力的系统。通过成功将语言扎根于视觉和物理现实,这些模型正在从统计相关性走向真正理解。来自Google DeepMind 和斯坦福基础模型研究中心等机构的研究不断突破机器感知复杂环境的界限。
在 Ultralytics,我们将这些进展整合到Ultralytics Platform 中,使用户能够管理数据、训练模型并部署利用所有可用模态光谱的解决方案,将YOLO26 的速度与多模态输入的通用性结合起来。






