FastVLM:Apple 推出全新的快速视觉语言模型
Apple 在 CVPR 2025 上发布 FastVLM。这款开源视觉语言模型采用 FastViTHD 编码器,将首个令牌生成时间提升至最高 85 ×。

在 CVPR 2025 大会上,Apple 推出了一款名为 FastVLM 的新型开源 AI 模型。它能够理解图像和语言,并可在 iPhone、iPad 和 Mac 等 Apple 设备上运行。这意味着它无需将数据发送到云端,就能快速提供智能结果。
FastVLM 尤其引人关注的一点是它的速度和效率。Apple 开发了一种名为 FastViTHD 的新型视觉编码器,可帮助模型理解高质量图像,同时减少内存和电量消耗。所有处理都在设备本地完成,因此响应速度更快,同时保护用户隐私。
在本文中,我们将了解 FastVLM 的工作原理、它的独特之处,以及 Apple 发布这一模型为何可能成为设备日常 AI 应用向前发展的重要一步。
了解视觉语言模型(VLMs)#
在深入了解 FastVLM 的特别之处前,我们先来看看其名称中的“VLM”代表什么。它指的是一种 视觉语言模型,旨在理解视觉内容并将其与语言联系起来。
VLMs 将视觉理解与语言结合起来,从而能够执行描述照片、回答有关屏幕截图的问题,或从文档中提取文本等任务。视觉语言模型通常由两部分组成:一部分处理图像并将其转换为数据,另一部分解读这些数据,生成你可以阅读或听到的响应。
你可能已经在不知不觉中使用过这类 AI 创新。扫描收据、读取身份证件、生成图像说明,或帮助低视力用户与屏幕交互的应用,通常都依赖于在后台安静运行的视觉语言模型。
什么是 FastVLM?#
Apple 构建 FastVLM 的目标,是让它执行与其他视觉语言模型相同的任务,同时具备更高的速度、更强的隐私保护,并在其自有设备上实现优化性能。它能够理解图像内容并以文本作出响应,但不同于许多依赖云服务器的模型,FastVLM 可以完全在你的 iPhone、iPad 或 Mac 上运行。
VLMs 通常在处理高分辨率图像时表现更好。例如,如下图所示,只有在输入高分辨率图像版本时,FastVLM 才能正确识别出街道标志上的“禁止驶入”。不过,高分辨率输入通常会降低模型速度。这正是 FastViTHD 发挥作用的地方。

图 1. FastVLM 在低分辨率与高分辨率图像上的性能。(来源)
Apple 的新型视觉编码器 FastViTHD 可帮助 FastVLM 更高效地处理高质量图像,同时减少内存和电量消耗。具体来说,FastViTHD 足够轻量,即使在较小的设备上也能流畅运行。
此外,FastVLM 已公开发布在 FastVLM GitHub 仓库中,开发者可以根据 Apple 的许可条款访问源代码、进行修改,并将其用于自己的应用。
FastVLM 与其他 VLM 模型的比较#
与其他视觉语言模型相比,FastVLM 针对智能手机和笔记本电脑等日常设备进行了优化。在性能测试中,FastVLM 生成第一个词或输出的速度最高可比 LLaVA-OneVision-0.5B 等模型快 85 倍。

图 2. FastVLM 与其他模型的性能比较。(来源)
以下是 FastVLM 接受评估的一些标准基准测试:
- DocVQA(文档视觉问答): 该基准测试评估模型读取和理解文档中文本信息的能力,例如扫描表格或页面中的文字。
- TextVQA(基于文本的视觉问答): 该测试评估模型解读包含嵌入文本的图像并准确回答相关问题的能力。
- GQA(图问答): 该任务通过要求模型理解图像中物体与场景之间的关系,测试其推理能力。
- MMMU(大规模多学科多模态理解): 该测试结合视觉和文本理解能力,衡量模型在广泛学术科目和格式上的表现。
- SeedBench(用于基准测试的增强数据标准评估): 该基准测试探索模型在多个领域中的视觉理解和推理综合能力。
在这些基准测试中,FastVLM 以更少的资源取得了具有竞争力的结果。它将实用的视觉 AI 带到了手机、平板电脑和笔记本电脑等 日常设备上。
FastVLM 的高效视觉编码器:FastViTHD#
接下来,让我们更仔细地了解 FastViTHD——这个对 FastVLM 图像处理性能起着关键作用的视觉编码器。
大多数视觉语言模型会将图像拆分成数千个称为 token 的小图块。token 越多,模型理解图像所需的时间和电量就越多。这会导致处理速度变慢,尤其是在手机或笔记本电脑上。

图 3. 视觉编码器如何处理图像。(来源)
FastViTHD 通过使用更少的 token,同时保持对完整图像的理解,避免了处理过多 token 所带来的速度下降。它结合了两种方法:Transformer,擅长建模模式和关系;以及卷积层,能够高效处理视觉数据。最终得到的系统运行速度更快,且占用更少内存。
Apple 表示,FastViTHD 的体积最多比某些传统视觉编码器小 3.4 倍,同时仍能保持较高准确率。它没有依赖 token pruning 等模型优化技术(移除不太重要的图像图块以加快处理速度),而是通过更简单、更精简的架构实现了高效运行。
FastVLM 的模型变体和训练流程#
Apple 发布了三种不同规模的 FastVLM:包含 0.5B、1.5B 和 7B 参数(其中“B”代表 billion,即模型中可训练权重的数量)。每个版本都针对不同类型的设备进行设计。较小的模型可以在手机和平板电脑上运行,而较大的 7B 模型更适合台式机或要求更高的任务。
这让开发者可以灵活选择最适合自己应用的方案。他们可以为移动设备构建快速轻量的应用,也可以为更大型的系统构建更复杂的应用,同时使用相同的底层模型架构。
Apple 使用 LLaVA‑1.5 流程训练 FastVLM 的模型变体。该流程是用于对齐视觉和语言模型的框架。对于语言部分,他们使用 Qwen 和 Vicuna 等现有开源模型对 FastVLM 进行了评估,这些模型以生成自然、连贯的文本而闻名。这种设置使 FastVLM 能够处理简单和复杂的图像,并生成易读且相关的响应。
FastVLM 的意义:Apple 对高效 AI 的诠释#
你可能会想,FastVLM 高效的图像处理为何如此重要?关键在于,应用可以在不依赖云端的情况下顺畅地实时运行。FastVLM 能够处理最高 1152 × 1152 像素的高分辨率图像,同时保持足够快速和轻量,能够直接在你的设备上运行。
这意味着应用可以描述摄像头看到的内容、在收据被拍摄时扫描收据,或响应屏幕上的变化,同时将所有内容保留在本地。这对教育、无障碍、生产力和摄影等领域尤其有帮助。
由于 FastViTHD 即使处理大型图像也很高效,因此有助于保持设备响应迅速并避免过热。它适用于所有模型规模,包括能够在入门级 iPhone 上运行的最小模型。这意味着相同的 AI 功能可以在手机、平板电脑和 Mac 上运行。
FastVLM 的应用#
凭借速度快、效率高以及设备端隐私保护等关键优势,FastVLM 可以支持广泛的应用。以下是几种使用方式:
-
读取文档: 它可以扫描收据、表格或身份证件,并仅提取相关信息。它还能聚焦图像中的特定区域,这对需要快速、准确进行文本提取的应用很有用。
-
图像说明: 通过分析照片,它可以生成清晰的图像内容描述。这可以支持相机应用、照片图库,或任何受益于实时视觉理解的工具中的相关功能。
-
无障碍支持: FastVLM 可以为失明或低视力用户描述屏幕内容,让按钮、菜单和布局元素更易于导航和使用。
-
设备端 AI 助手: FastVLM 可以很好地配合需要快速理解屏幕内容的 AI 助手使用。由于它直接在设备上运行并保护数据隐私,因此可以帮助完成读取文本、识别按钮或图标,以及实时引导用户等任务,而无需将信息发送到云端。

图 4. FastVLM 可用于文本识别和视觉问答。(来源)
要点总结#
FastVLM 将设备端视觉语言 AI 带到了 Apple 设备上,兼具速度、隐私和效率。凭借轻量化设计和开源发布,它能够在移动端和桌面端应用中实现实时图像理解。
这有助于让 AI 更加实用、更易于日常使用,也为开发者构建实用且注重隐私的应用提供了坚实基础。展望未来,视觉语言模型很可能会在我们与技术交互的方式中发挥重要作用,让 AI 在日常场景中响应更快、更具上下文感知能力,也更加有用。
访问我们的 GitHub 仓库,详细了解 AI。加入活跃的社区,探索汽车行业中的 AI和制造业中的视觉 AI等领域的创新。要立即开始计算机视觉之旅,请查看我们的许可选项。









