Meta AI 分割一切模型 2 (SAM 2) 的应用
和我们一起深入了解 Meta AI 的分割一切模型 2 (SAM 2),并探索它可用于各行业的实时应用。

2024 年 7 月 29 日,Meta AI 发布了其 Segment Anything Model 的第二个版本 SAM 2。这个新模型能够在图像和视频中精准确定哪些像素属于目标对象!更令人印象深刻的是,该模型能够实时稳定地跟踪视频所有帧中的对象。SAM 2 为视频编辑、混合现实体验以及更快速地标注用于训练计算机视觉系统的视觉数据,带来了令人振奋的可能性。
原始 SAM 已成功应用于海洋科学、卫星影像和医学等领域,SAM 2 在此基础上应对快速移动对象和外观变化等挑战。更高的准确率和效率使其成为适用于广泛应用的多功能工具。在本文中,我们将重点介绍SAM 2 的应用场景,以及它为何对 AI 社区意义重大。
什么是 SAM 2?#
Segment Anything Model 2 是一种先进的基础模型,支持在图像和视频中进行可提示视觉分割(PVS)。PVS 是一种技术,模型可以根据用户提供的特定提示或输入,对图像或视频的不同部分进行分割或识别。这些提示可以是点击、框或用于突出显示感兴趣区域的掩码。随后,模型会生成一个勾勒指定区域轮廓的分割掩码。
SAM 2 的架构以原始 SAM 为基础,将分割范围从图像扩展到了视频。它配备了轻量级掩码解码器,利用图像数据和提示创建分割掩码。对于视频,SAM 2 引入了记忆系统,帮助模型记住前序帧中的信息,从而确保随时间推移进行准确跟踪。记忆系统包含用于存储和调用被分割对象相关细节的组件。SAM 2 还能够处理遮挡、跨多个帧跟踪对象,并通过生成多个可能的掩码来处理含义不明确的提示。SAM 2 的先进架构使其在静态和动态视觉环境中都具备强大能力。
具体来说,在视频分割方面,与之前的方法相比,SAM 2 只需三分之一的用户交互次数即可实现更高的准确率。在图像分割方面,SAM 2 的性能优于原始的 Segment Anything Model(SAM),速度提高了六倍,准确率也更高。SAM 2 研究论文在 37 个不同数据集上展示了这一改进,其中包括 SAM 之前测试过的 23 个数据集。

图 1。 SAM 与 SAM 2 的比较。
有趣的是,Meta AI 的 SAM 2 是通过创建迄今为止最大的视频分割数据集 SA-V 数据集开发的。这个大型数据集包含超过 50,000 个视频和 3,550 万个分割掩码,通过用户交互式贡献收集而来。标注人员提供提示和修正,帮助模型从各种场景和对象类型中学习。
Segment Anything Model 2 的应用#
得益于其先进的图像和视频分割能力,SAM 2 可以应用于各行各业。下面来看看其中一些应用。
SAM 2 赋能增强现实(AR)和虚拟现实(VR)#
Meta AI 的新分割模型可用于增强现实(AR)和虚拟现实(VR)应用。例如,SAM 2 可以准确识别并分割现实世界中的对象,让用户与虚拟对象的互动更加逼真。它可用于游戏、教育和培训等多个领域,在这些领域中,虚拟元素与现实元素之间的逼真互动至关重要。
随着 AR 眼镜等设备日益先进,SAM 2 的能力很快就可能集成到这些设备中。想象一下,你戴上眼镜环顾客厅。当眼镜分割并识别出你的狗狗饮水碗时,它可能会像下图所示那样提醒你给水碗加水。或者,当你按照新食谱做饭时,眼镜可以识别台面上的食材,并提供分步说明和提示,改善你的烹饪体验,确保你手边备齐所有必需物品。

图 2。 SAM 2 很快可能用于 AR 眼镜。
使用 Segment Anything Model 2 进行声呐成像#
使用 SAM 模型的研究表明,它可以应用于声呐成像等专业领域。由于分辨率低、噪声水平高,以及图像中对象形状复杂,声呐成像面临独特挑战。研究人员通过针对声呐图像对 SAM 进行微调,证明了它能够准确分割海洋垃圾、地质构造和其他感兴趣的水下对象。精准可靠的水下成像可用于海洋研究、水下考古、渔业管理和监控,执行栖息地测绘、文物发现和威胁检测等任务。

图 3。使用微调后的 SAM 分割声呐图像的示例。
由于 SAM 2 在 SAM 面临的诸多挑战基础上进行了改进,它有望进一步提升声呐成像分析能力。其精准的分割能力可以助力各种海洋应用,包括科学研究和渔业。例如,SAM 2 可以有效勾勒水下结构、检测海洋垃圾,并识别前视声呐图像中的对象,从而实现更准确、更高效的水下探索和监测。
以下是使用 SAM 2 分析声呐成像的潜在优势:
- 效率:减少手动分割所需的时间和精力,让专业人员能够更加专注于分析和决策。
- 一致性: 提供一致且可复现的分割结果,这对大规模海洋研究和监测至关重要。
- 多功能性: 能够处理广泛的声呐图像,因此适用于海洋科学和工业中的多种应用。
将 SAM 2 集成到声呐成像流程中,可以提高海洋行业在水下探索和分析方面的效率、准确性和可靠性,最终改善海洋研究的成果。
在自动驾驶车辆中使用 SAM 2#
SAM 2 的另一个应用领域是自动驾驶车辆。SAM 2 可以实时准确识别行人、其他车辆、道路标志和障碍物等对象。SAM 2 能够提供的细节对于做出安全导航和避碰决策至关重要。通过精确处理视觉数据,SAM 2 有助于创建详细可靠的环境地图,并带来更好的决策。

图 4。使用分割理解交通状况。
SAM 2 在不同光照条件、天气变化和动态环境中都能良好运行,因此适用于自动驾驶车辆。无论是在繁忙的城市街道还是雾气弥漫的高速公路上,SAM 2 都能持续准确地识别和分割对象,使车辆能够正确应对各种情况。
不过,也需要注意一些局限性。对于复杂的快速移动对象,SAM 2 有时会遗漏细节,其预测结果也可能在不同帧之间变得不稳定。此外,在拥挤场景中,SAM 2 有时会混淆多个外观相似的对象。这些挑战正是将额外传感器和技术集成到自动驾驶应用中的关键原因。
借助 SAM 2 进行环境监测#
使用计算机视觉进行环境监测可能颇具挑战,尤其是在缺乏标注数据的情况下,但这也正是 SAM 2 一个有趣应用场景的原因。SAM 2 可以通过准确分割和识别卫星或无人机图像中的森林、水体、城市区域和农业用地等环境特征,跟踪并分析自然景观的变化。具体而言,精准分割有助于监测森林砍伐、城市化和土地利用随时间的变化,为环境保护与规划提供有价值的数据。

以下是使用 SAM 2 等模型分析环境随时间变化的一些优势:
- 早期检测: 识别环境退化的早期迹象,从而及时采取干预措施,防止进一步损害。
- 资源管理: 通过提供各种环境特征状态的详细洞察,协助高效管理自然资源。
- 生物多样性保护: 协助跟踪野生动物和监测生物多样性,为保护工作和濒危物种保护作出贡献。
- 灾害响应: 协助评估洪水、野火和飓风等自然灾害的影响,从而实现快速有效的灾害响应和恢复规划。
使用 SAM 2 进行视频编辑:亲自试用#
Segment Anything 2 Demo 是在视频上试用该模型的绝佳方式。利用 SAM 2 的 PVS 能力,我们选取了一段旧的 Ultralytics YouTube 视频,成功分割出其中的三个对象或人物,并对其进行像素化处理。传统上,要从这样的视频中编辑出三个人物既耗时又繁琐,需要逐帧手动创建掩码。不过,SAM 2 简化了这一过程。在演示中点击几下,你就能在几秒钟内保护三个感兴趣对象的身份。

图 6。试用 SAM 2 Demo。
该演示还允许你试用几种不同的视觉效果,例如为选中跟踪的对象添加聚光灯,以及擦除正在跟踪的对象。如果你喜欢这个演示并准备开始使用 SAM 2 进行创新,可以查看 Ultralytics SAM 2 模型文档页面,了解亲自上手该模型的详细说明。探索其中的功能、安装步骤和示例,充分发挥 SAM 2 在项目中的潜力!
总结#
Meta AI 的 Segment Anything Model 2(SAM 2)正在改变视频和图像分割。随着对象跟踪等任务不断改进,我们正在视频编辑、混合现实、科学研究和医学成像领域发现新的机会。通过简化复杂任务并加快标注速度,SAM 2 已经具备成为 AI 社区重要工具的全部条件。随着我们继续探索并创新使用 SAM 2 等模型,可以预见各个领域将出现更多突破性的应用和进展!
通过探索我们的 GitHub 仓库并加入我们的社区,进一步了解 AI。查看我们的解决方案页面,详细了解 AI 在制造业和医疗保健领域的应用。🚀









