Google 的 PaliGemma 2:先进 VLM 模型解析
和我们一起深入了解 Google 的新型视觉语言模型:PaliGemma 2。这些模型可以帮助理解和分析图像与文本。

2024 年 12 月 5 日,Google 推出了 PaliGemma 2,这是其最新版本的尖端视觉语言模型(VLM)。PaliGemma 2 旨在处理结合图像和文本的任务,例如生成图像描述、回答视觉问题以及检测视觉内容中的对象。
PaliGemma 2 在原版 PaliGemma 的基础上进行了改进。原版 PaliGemma 已经是多语言图像描述和对象识别的强大工具,而 PaliGemma 2 又带来了多项重要改进,包括更大的模型规模、对更高分辨率图像的支持,以及在复杂视觉任务上的更佳性能。这些升级让它能够更加灵活、高效地应对各种应用场景。
本文将深入介绍 PaliGemma 2,包括它的工作原理、主要功能,以及适合发挥其优势的应用场景。让我们开始吧!
从 Gemma 2 到 PaliGemma 2#
PaliGemma 2 基于两项关键技术构建:SigLIP 视觉编码器和 Gemma 2 语言模型。SigLIP 编码器会处理视觉数据,例如图像或视频,并将其拆分为模型可以分析的特征。同时,Gemma 2 负责处理文本,使模型能够理解并生成多语言文本。两者结合后便构成了一个 VLM,能够无缝地解读并关联视觉信息和文本信息。
PaliGemma 2 的可扩展性和多功能性使其实现了重大进步。与原版不同,PaliGemma 2 提供三种规模:30 亿(3B)、100 亿(10B)和 280 亿(28B)参数。这些参数类似于模型的内部设置,帮助它有效地学习和处理数据。它还支持不同的图像分辨率(例如,用于快速任务的 224 x 224 像素,以及用于详细分析的 896 x 896),因此能够适应各种应用。

图 1. PaliGemma 2 概览。
将 Gemma 2 的先进语言能力与 SigLIP 的图像处理能力相结合后,PaliGemma 2 变得更加智能。它可以处理以下任务:
- 图像或视频描述:模型可以生成视觉内容的详细文本描述,因此适用于自动创建图像描述。
- **视觉问答:**PaliGemma 2 可以根据图像回答问题,例如识别场景中的对象、人物或动作。
- 对象识别:它可以识别并标注图像中的对象,例如区分照片中的猫、桌子或汽车。
PaliGemma 2 不只是分别处理图像和文本,还能以有意义的方式将两者结合起来。例如,它可以理解场景中的关系,比如识别出“猫坐在桌子上”,也可以在识别对象的同时添加上下文信息,比如识别出某个著名地标。
Google 的 PaliGemma 2 VLM 模型如何工作#
接下来,我们将使用下图中的示例图表,帮助你更好地了解 PaliGemma 2 如何处理视觉和文本数据。假设你上传了这张图表,并询问模型:“这张图表表示什么?”

图 2. PaliGemma 2 的功能示例。
处理过程首先从 PaliGemma 2 的 SigLIP 视觉编码器开始,用于分析图像并提取关键特征。对于图表来说,这包括识别坐标轴、数据点和标签等元素。编码器经过训练,能够捕捉整体模式和细节。它还会使用光学字符识别(OCR)来检测并处理图像中嵌入的文本。这些视觉特征会被转换为令牌,即模型可以处理的数值表示。随后,模型使用线性投影层调整这些令牌,确保它们能够与文本数据无缝结合。
与此同时,Gemma 2 语言模型会处理随附的查询,以确定其含义和意图。查询中的文本会被转换为令牌,并与 SigLIP 生成的视觉令牌结合,创建一种多模态表示,即一种关联视觉数据和文本数据的统一格式。
借助这种集成表示,PaliGemma 2 会通过自回归解码逐步生成响应。这种方法会根据模型已经处理的上下文,一次预测答案的一部分。
PaliGemma 2 的主要能力#
了解其工作原理后,接下来让我们探索使 PaliGemma 2 成为可靠视觉语言模型的主要功能:
- 微调灵活性:能够轻松适应特定数据集和任务,在图像描述、空间推理和医学影像等应用中表现出色。
- 多样化训练数据:使用 WebLI 和 OpenImages 等数据集进行训练,因此具备出色的对象识别能力和多语言输出能力。
- OCR 集成:集成光学字符识别功能,可从图像中提取并解读文本,因此非常适合文档分析和其他基于文本的任务。
- 多语言输出:能够以多种语言生成图像描述和响应,非常适合全球化应用。
- 工具集成:兼容 Hugging Face Transformers、PyTorch 和 Keras 等框架,便于部署和实验。
比较 PaliGemma 2 和 PaliGemma:有哪些改进?#
了解第一版 PaliGemma 的架构,是认识 PaliGemma 2 改进之处的好方法。其中最显著的变化之一,是用 Gemma 2 替换了原版 Gemma 语言模型,从而在性能和效率方面都实现了大幅提升。
Gemma 2 提供 9B 和 27B 两种参数规模,经过专门设计,能够在降低部署成本的同时,提供同类领先的准确率和速度。它通过重新设计的架构实现了这一点,该架构针对各种硬件配置下的推理效率进行了优化,既支持高性能 GPU,也支持更易获取的配置。

图 3.回顾第一版 PaliGemma 2。
因此,PaliGemma 2 是一款高度准确的模型。PaliGemma 2 的 10B 版本将非蕴含句(NES)得分降至 20.3,而原版模型为 34.3,这意味着其输出中的事实错误更少。这些进步让 PaliGemma 2 更具可扩展性、更精准,也更能适应从详细图像描述到视觉问答等更广泛的应用。
PaliGemma 2 的应用:VLM 模型的真实应用场景#
PaliGemma 2 将视觉理解与语言理解无缝结合,有望重新定义多个行业。例如,在无障碍领域,它可以生成对象、场景和空间关系的详细描述,为视障人士提供重要帮助。这项能力能够帮助用户更好地了解周围环境,在处理日常任务时获得更大的独立性。

图 4. PaliGemma 2 可以让世界更加无障碍。
除了无障碍领域外,PaliGemma 2 还正在以下多个行业产生影响:
- 电子商务:模型通过分析和描述图像中的商品,改进商品分类,从而简化库存管理并改善用户的搜索体验。
- 医疗保健:它可以结合临床记录解读 X 射线和 MRI 等医学影像,为医疗专业人员提供更准确、更有依据的诊断支持。
- 教育:PaliGemma 2 通过生成图像描述并为图像提供上下文信息,帮助教育工作者创建具有描述性且易于访问的学习材料。
- 内容创作:模型能够自动为多媒体内容生成图像描述和视觉描述,帮助创作者节省时间。
亲自试用:PaliGemma 2#
要试用 PaliGemma 2,你可以从 Hugging Face 的交互式演示开始。它支持你探索图像描述和视觉问答等任务中的功能。你只需上传一张图像,然后向模型询问相关问题,或请求它描述场景。

图 5。PaliGemma 2 演示(来源:Hugging Face)。
如果你想进一步深入了解,下面介绍一些实践方法:
- 预训练模型:你可以从 Hugging Face 和 Kaggle 等平台获取预训练模型和代码。这些资源提供了开始使用该模型所需的一切。
- Notebook:这里提供了全面的文档和示例 Notebook,帮助你熟悉 PaliGemma 2。你可以从推理示例开始,并在自己的数据集上尝试微调模型,以完成特定任务。
- 集成:PaliGemma 2 兼容 Hugging Face Transformers、Keras、PyTorch、JAX 和 Gemma.cpp 等广泛使用的框架,让你可以轻松地将其集成到现有工作流中。
Google 的 PaliGemma 2 的优缺点#
了解如何开始使用 PaliGemma 2 后,接下来让我们进一步看看使用这些模型时需要注意的主要优势和不足。
以下是 PaliGemma 2 作为视觉语言模型脱颖而出的原因:
- **效率提升:**借助 Gemma 2 的优化架构,PaliGemma 2 在降低部署成本的同时提供了高性能。
- 增强的安全功能:PaliGemma 2 在训练过程中实现了显著的安全改进,例如严格过滤预训练数据以减少偏见,并依据安全基准进行严格评估。
- 较小配置下的低延迟:3B 模型能够提供更快的推理速度,适用于速度至关重要的场景,例如电子商务商品推荐或实时支持系统。
同时,以下是 PaliGemma 2 可能面临限制的一些方面:
- **延迟:**虽然功能强大,但较大的模型可能会面临延迟问题,尤其是在需要即时响应的任务中部署时,例如实时交互式 AI 系统。
- **依赖大型数据集:**PaliGemma 2 的性能与其训练数据集的质量和多样性密切相关,这可能会限制它在代表性不足的领域,或训练数据未涵盖的语言中的有效性。
- **资源需求高:**尽管经过优化,10B 和 28B 参数版本仍需要大量计算能力,因此对于资源有限的小型组织来说,可用性较低。
要点总结#
PaliGemma 2 是视觉语言建模领域一项令人瞩目的进展,提供了更出色的可扩展性、微调灵活性和准确率。它可以成为许多应用的宝贵工具,应用范围涵盖无障碍解决方案、电子商务、医疗诊断和教育等领域。
尽管它也存在计算资源需求高、依赖高质量数据等限制,但其优势使其成为处理视觉数据和文本数据融合的复杂任务的实用选择。PaliGemma 2 可以为研究人员和开发者提供坚实基础,帮助他们探索并拓展 AI 在多模态应用中的潜力。
通过查看我们的 GitHub 代码库和社区,加入 AI 讨论。了解 AI 如何在农业和医疗保健领域取得进展!🚀









