探索 SAM 3:Meta AI 的新型分割一切模型
了解 SAM 3(Meta AI 推出的新型分割一切模型)如何轻松检测、分割和跟踪真实世界图像与视频中的对象。

2025 年 11 月 19 日,Meta AI 发布了 Segment Anything Model 3,也称为 SAM 3。这个最新版本的 Segment Anything 模型引入了使用文本提示、视觉提示和图像示例,在真实世界图像和视频中检测、分割和跟踪对象的新方法。
SAM 3 模型在 SAM 和 SAM 2 的基础上,带来了概念分割、开放词汇检测和实时视频跟踪等新进展与功能。它可以理解简短的名词短语,跨帧跟踪对象,并识别早期模型难以稳定处理的细粒度或罕见概念。
作为 SAM 3 发布的一部分,Meta 还推出了 SAM 3D。这套新一代模型可以根据单张图像重建对象、场景和完整人体,并将 Segment Anything 生态系统扩展到 3D 理解领域。这些新增功能为计算机视觉、机器人、媒体编辑和创意工作流带来了新的应用。
在本文中,我们将探索 SAM 3 是什么、它与 SAM 2 有何不同、模型如何工作,以及它在现实世界中的应用。让我们开始吧!
什么是 SAM 3?了解 Meta 的 Segment Anything Model 3#
SAM 3 是一种先进的计算机视觉模型,可以根据简单指令识别、分离和跟踪图像与视频中的对象。SAM 3 不依赖固定的标签列表,而是理解自然语言和视觉线索,因此你可以轻松告诉模型想要查找什么。
例如,使用 SAM 3 时,你可以输入“黄色校车”或“条纹猫”这样的短语,点击某个对象,或在图像中标记一个示例。随后,模型会检测所有匹配的对象,并生成清晰的分割掩码(用于准确显示哪些像素属于某个对象的视觉轮廓)。SAM 3 还可以跨视频帧跟踪这些对象,在对象移动时保持其一致性。
SAM 3D 支持单图像 3D 重建#
Meta AI 此次发布的另一个亮点是 SAM 3D,它将 Segment Anything 项目扩展到了3D 理解领域。SAM 3D 可以获取一张 2D 图像,并以三维方式重建对象或人体的形状、姿态或结构。换句话说,即使只有一个视角,模型也能估计物体如何占据空间。
SAM 3D 已作为两个不同的模型发布:SAM 3D Objects 可重建具有几何结构和纹理的日常物品,SAM 3D Body 则可根据单张图像估计人体形状和姿态。两个模型都会使用 SAM 3 的分割输出,然后生成与原始照片中对象的外观和位置相匹配的 3D 表示。

图 1. 使用 SAM 3D 的示例。(来源:使用 Meta AI 的 segment anything playground 创建)
SAM 3:统一检测、分割和跟踪的新功能#
以下是 SAM 3 引入的一些关键更新,可将检测、分割和跟踪整合到一个统一模型中:
- 概念分割任务: 在 SAM 和 SAM 2 中,对象分割依赖点击或框等视觉提示。SAM 3 增加了根据短文本短语或图像中的示例裁剪区域分割对象的能力。这意味着模型可以识别所有匹配的实例,而不需要逐个点击。
- 开放词汇文本提示: 与早期版本不同,SAM 3 可以理解简短的自然语言短语。这样就不再需要固定的标签列表,模型也能够处理更具体或更少见的概念。
- 用于检测、分割和跟踪的单一模型: SAM 3 将检测、分割和跟踪统一到一个模型中,无需再使用独立系统来查找对象、生成分割掩码并跨视频帧跟踪对象。这为图像和视频带来了更加一致、简化的工作流。虽然 SAM 2 也提供了一些跟踪能力,但 SAM 3 的性能明显更强、更可靠。
- 复杂场景中的结果更加稳定: 由于 SAM 3 可以结合文本、示例图像和视觉提示,因此相比仅依赖视觉点击的早期版本,它能够更可靠地处理杂乱或重复的场景。

图 2. SAM 3 通过文本或图像示例引入了概念分割。(来源)
SAM 3、SAM 2 与 SAM 1 对比#
假设你正在观看一段包含许多不同动物的野生动物园视频,并且只想检测和分割大象。那么,在 SAM 的不同版本中,这项任务会是什么样?
使用 SAM 时,你需要在每一帧中手动点击每头大象,以生成分割掩码。由于没有跟踪功能,每一帧都需要重新点击。
使用 SAM 2 时,你可以在一头大象上点击一次并获取其掩码,模型会在整个视频中跟踪同一头大象。不过,如果你想分割多头大象(特定对象),仍然需要分别提供点击,因为 SAM 2 本身无法理解“大象”这样的类别。
使用 SAM 3 时,工作流会简单得多。你可以输入“大象”,或在一头大象周围绘制边界框作为示例,模型会自动在视频中找到每一头大象,分割它们,并在各帧之间持续跟踪。它仍然支持早期版本使用的点击和框提示,但现在还可以响应文本提示和示例图像,这是 SAM 和 SAM 2 无法做到的。
SAM 3 模型的工作原理#
接下来,让我们更仔细地了解 SAM 3 模型的工作原理以及它的训练方式。
SAM 3 模型架构概览#
SAM 3 将多个组件整合到一个系统中,以支持概念提示和视觉提示。模型的核心是 Meta Perception Encoder,这是 Meta 的统一开源图像-文本编码器。
该编码器可以处理图像和简短的名词短语。简单来说,这使 SAM 3 能够比早期版本的 Segment Anything 模型更有效地关联语言特征和视觉特征。
在这个编码器之上,SAM 3 集成了一个基于 DETR 系列 Transformer 模型的检测器。该检测器可以识别图像中的对象,并帮助系统确定哪些对象与用户的提示相对应。
具体来说,在视频分割方面,SAM 3 使用了一个跟踪组件,该组件基于 SAM 2 的记忆库和记忆编码器构建。这样,模型就能跨帧保存对象信息,从而随时间重新识别并跟踪对象。

图 3. 基于概念进行任意分割的工作原理(来源:scontent)
Segment Anything Model 3 背后的可扩展数据引擎#
为了训练 SAM 3,Meta 需要的数据量远超当前互联网中已有的数据。高质量的分割掩码和文本标签很难大规模创建,而在图像和视频中完整勾勒出某个概念的每个实例,过程缓慢且成本高昂。
为了解决这一问题,Meta 构建了一个新的数据引擎,将 SAM 3 本身、额外的 AI 模型和人工标注员结合起来协同工作。该工作流从一条 AI 系统流水线开始,其中包括 SAM 3 和一个基于 Llama 的图像描述模型。
这些系统会扫描大量图像和视频集合,生成描述,将描述转换为文本标签,并生成初步的分割掩码候选结果。随后,人工和 AI 标注员会审核这些候选结果。
AI 标注员经过训练,能够在检查掩码质量和验证概念覆盖范围等任务上达到甚至超过人工准确率,因此会先筛除简单案例。只有在模型仍可能难以处理的更具挑战性的示例中,人工才会介入。

图 4. SAM 3 数据引擎(来源)
这种方法显著提升了 Meta 的标注速度。通过让 AI 标注员处理简单案例,在细粒度领域中,该流水线处理负面提示的速度提高了约 5 倍,处理正面提示的速度提高了 36%。
这种效率使数据集得以扩展到超过 400 万个独特概念。AI 提议、人工修正和模型预测更新组成的持续循环,也会不断提升标签质量,并帮助 SAM 3 学习更广泛的视觉和文本概念。
SAM 3 的性能提升#
在性能方面,SAM 3 相比早期模型实现了明显提升。在 Meta 新推出的 SA-Co 基准测试中,该测试用于评估开放词汇概念检测和分割,SAM 3 在图像和视频上的性能约为此前系统的两倍。
在点到掩码和掩码到掩码序列等交互式视觉任务上,SAM 3 的表现也达到或超过了 SAM 2。Meta 表示,在零样本 LVIS(模型必须在没有训练示例的情况下识别罕见类别)和对象计数(衡量是否检测到对象的所有实例)等更具挑战性的评测中,SAM 3 也取得了进一步提升,体现出更强的跨领域泛化能力。
除了准确率提升外,SAM 3 也十分高效:在 H200 GPU 上处理一张包含超过 100 个检测对象的图像只需约 30 毫秒,并且在视频中跟踪多个对象时仍能保持接近实时的速度。
Segment Anything Model 3 的应用#
现在我们已经更好地了解了 SAM 3,接下来让我们看看它如何应用于实际场景,包括先进的文本引导推理、科学研究以及 Meta 自有产品。
使用 SAM 3 Agent 处理复杂文本查询#
SAM 3 还可以作为更大型多模态语言模型中的工具使用,Meta 将其称为 SAM 3 Agent。用户不必只向 SAM 3 提供“大象”这样的短语,智能体可以将更复杂的问题拆分成 SAM 3 能够理解的较小提示。
例如,如果用户询问“图片中哪个物体用于控制和引导马匹?”,智能体会尝试不同的名词短语,将它们发送给 SAM 3,并检查哪些掩码是合理的。它会持续优化,直到找到正确的对象。
即使没有接受专门推理数据集的训练,SAM 3 Agent 在 ReasonSeg 和 OmniLabel 等用于复杂文本查询的基准测试中也表现良好。这表明 SAM 3 可以支持同时需要语言理解和细粒度视觉分割的系统。
SAM 3 在科学研究和保护领域的应用#
有趣的是,SAM 3 已经用于详细视觉标签十分重要的研究场景。Meta 与 Conservation X Labs 和 Osa Conservation 合作,构建了 SA-FARI,这是一个包含超过 10,000 段相机陷阱视频的公共野生动物监测数据集。
每一帧中的每只动物都带有边界框和分割掩码标注,而手动完成这项工作会耗费大量时间。同样,在海洋研究中,SAM 3 正与 FathomNet 和 MBARI 配合使用,为水下图像创建实例分割掩码,并支持新的评测基准。
此类数据集有助于科学家更高效地分析视频素材,并研究通常难以大规模跟踪的动物和栖息地。研究人员还可以利用这些资源构建自己的物种识别、行为分析和自动生态监测模型。
Meta 如何在其产品中部署 SAM 3#
除了研究用途外,SAM 3 还为 Meta 消费产品中的新功能和应用场景提供支持。以下是它已经集成的一些方式:
- Instagram 编辑: 创作者可以对视频中的特定人物或对象应用效果,而无需逐帧手动处理。
- Meta AI 应用和网页版 meta.ai: SAM 3 支持用于修改、增强和重新混合图像与视频的新工具。
- Facebook Marketplace 的“在房间中查看”: SAM 3 与 SAM 3D 配合使用,让人们只需一张照片就能预览家具或装饰品摆放在家中的效果。
- Aria Gen 2 研究眼镜: Segment Anything Model 3 可从第一人称视角分割和跟踪手部与对象,为 AR(增强现实)、机器人和情境 AI 研究提供支持。
要点总结#
SAM 3 是分割技术向前迈出的重要一步。它引入了概念分割、开放词汇文本提示和改进的跟踪功能。凭借在图像和视频上的显著性能提升,以及 SAM 3D 的加入,这套模型为视觉 AI、创意工具、科学研究和现实世界产品开辟了新的可能性。
加入我们的社区,探索我们的 GitHub 仓库,进一步了解 AI。如果你想构建自己的视觉 AI 项目,可以查看我们的许可选项。访问我们的解决方案页面,进一步了解医疗领域的 AI和零售领域的视觉 AI等应用。









