Meta FAIR 的 AI 研究更新:SAM 2.1 和 CoTracker3
探索 Meta FAIR 最新的 AI 模型 SAM 2.1 和 CoTracker3,它们为各种真实世界应用提供先进的分割和跟踪能力。

人工智能(AI)是一个近年来充满活力与热情的研究领域,新创新和突破出现的速度比以往任何时候都快。在过去几周,Meta 的基础 AI 研究(FAIR)团队发布了一系列旨在应对 AI 不同领域挑战的工具和模型。这些发布内容包括可能影响医疗保健、机器人技术和增强现实等不同领域的更新。
例如,更新后的 SAM 2.1 模型改进了对象分割,从而更容易在图像和视频中准确识别并分离对象。与此同时,CoTracker3 专注于点跟踪,即使对象发生移动或被部分遮挡,也能帮助持续跟踪视频帧中的点。
Meta 还推出了更轻量、更快速的Llama 语言模型版本,以实现高效的设备端使用,同时还推出了用于机器人技术的新型触觉感知技术。在本文中,我们将详细介绍 Meta FAIR 的这些最新发布内容,了解每种工具所提供的功能。让我们开始吧!
Meta 增强版 Segment Anything Model:SAM 2.1#
对象分割是一项关键的计算机视觉任务,能够识别并分离图像或视频中的不同对象,从而更容易分析特定的关注区域。自 Meta 发布以来,其Segment Anything 模型 2(SAM 2)已被用于医学影像和气象学等不同领域的对象分割。基于社区反馈,Meta 现已推出 SAM 2.1,这一改进版本旨在解决原始模型遇到的一些挑战,并全面提升性能。

图 1。 SAM 2.1 模型性能基准测试。
得益于新的数据增强技术,SAM 2.1 包含了更好地处理外观相似对象和较小对象的更新。它还通过在更长的视频序列上进行训练,改进了模型处理遮挡的方式(即对象的部分区域被遮挡而无法看到),使模型能够随着时间推移“记住”并识别对象,即使对象暂时被遮挡。例如,如果有人正在拍摄视频,记录一个人从树后面走过,SAM 2.1 可以在此人从另一侧重新出现时对其进行跟踪,利用对对象位置和运动的记忆,在视野短暂中断时补全缺失信息。
在这些更新之外,Meta 还发布了 SAM 2 Developer Suite,提供开源训练代码和完整的演示基础设施,使开发者能够使用自己的数据对 SAM 2.1 进行微调,并将其集成到各种应用中。
CoTracker3:Meta 的跟踪模型及其功能和更新#
另一项有趣的计算机视觉任务是点跟踪。它涉及在视频的多个帧中持续跟踪特定的点或特征。设想一段骑自行车的人沿赛道骑行的视频——点跟踪可以让模型持续跟踪点在骑行者身上的位置,例如头盔或车轮,即使这些点短暂地被障碍物遮挡。
点跟踪对于3D 重建、机器人技术和视频编辑等应用至关重要。传统模型通常依赖复杂的配置和大量合成数据集,因此应用于真实场景时效果受到限制。
Meta 的 CoTracker3 跟踪模型通过简化模型架构解决了这些局限。它还引入了一种伪标注技术,使模型能够从真实的未标注视频中学习,从而让 CoTracker3 在实际使用中更加高效且易于扩展。

图 2。 CoTracker3 与其他跟踪模型的比较。
CoTracker3 的突出特点之一是能够很好地处理遮挡。借助跨轨迹注意力这一技术,模型可以在多个跟踪点之间共享信息,CoTracker3 能够参考可见点推断隐藏点的位置。通过这种方式,CoTracker3 旨在动态环境中实现高效表现,例如在人群密集的场景中跟随一个人。
CoTracker3 还提供在线和离线两种模式。在线模式支持实时跟踪,而离线模式可用于对完整视频序列进行更全面的跟踪,非常适合视频编辑或动画制作等任务。
Meta FAIR 的其他更新与研究#
虽然 SAM 2.1 和 CoTracker3 展示了 Meta 在计算机视觉领域的最新进展,但AI的其他领域也有令人振奋的更新,例如自然语言处理(NLP)和机器人技术。让我们来看看 Meta FAIR 最近的其他一些发展。
Meta 的 Spirit LM:语言和多模态模型领域的 AI 创新#
Meta 的 Spirit LM 是一种新的多模态语言模型,结合了文本和语音能力,让与 AI 的交互更加自然。不同于只能处理文本或只能处理语音的传统模型,Spirit LM 可以在两者之间无缝切换。
Spirit LM 能够以更接近人类的方式理解和生成语言。例如,它可以增强虚拟助手,使其能够听取并以口语或书面语回应;也可以支持在语音和文本之间进行转换的无障碍工具。

图 3。使用 Meta Spirit LM 进行文本转语音的示例。
此外,Meta 还开发了让大型语言模型更加高效的技术。其中一种名为 Layer Skip 的技术,只激活特定任务所需的层,从而帮助减少计算需求和能源成本。这对内存和电力有限的设备上的应用尤其有用。
为了进一步满足在这类设备上部署 AI应用的需求,Meta 还推出了其Llama 模型的量化版本。这些模型经过压缩,可以在移动设备上运行得更快,同时不会牺牲准确率。
通过 Meta Lingua 展望优化的未来#
随着AI 模型规模和复杂性不断增长,优化其训练过程变得至关重要。在优化方面,Meta 推出了 Meta Lingua,这是一个灵活高效的代码库,让大型语言模型的训练更加轻松。Meta Lingua 的模块化设计让研究人员能够快速定制和扩展实验。
研究人员可以减少花在技术配置上的时间,将更多精力投入实际研究。该代码库同样轻量且易于集成,适用于小型实验和大型项目。通过消除这些技术障碍,Meta Lingua 帮助研究人员更快取得进展,并更轻松地测试新想法。

图 4。 Meta Lingua 概览。
Meta 在 AI 安全方面的增强#
随着量子计算技术的发展,数据安全面临新的挑战。与今天的计算机不同,量子计算机很可能能够更快地解决复杂计算。这意味着它们可能会破解加密方法,而这些方法目前用于保护敏感信息。因此,该领域的研究正变得越来越重要——随着我们为量子计算的未来做准备,开发保护数据的新方法至关重要。
为应对这一问题,Meta 开发了 Salsa,这是一种旨在加强后量子密码安全性的工具。Salsa 帮助研究人员测试 AI 驱动的攻击并识别潜在弱点,使他们能够更好地理解和解决密码系统中的漏洞。通过模拟先进的攻击场景,Salsa 提供了有价值的洞察,可指导量子时代更强大、更具韧性的安全措施的开发。
Meta 的 AI:机器人技术领域的最新创新#
Meta 在机器人技术领域的最新工作,重点是通过增强触觉感知、灵巧性以及与人类的协作,帮助 AI 更自然地与物理世界交互。具体来说,Meta Digit 360 是一种先进的触觉传感器,能够赋予机器人更精细的触觉。该传感器帮助机器人检测纹理、压力甚至对象形状等细节。基于这些信息,机器人可以更精确地操控对象;这对医疗保健和制造业等领域至关重要。
以下是 Meta Digit 360 所包含的一些主要功能:
- 它配备了 18 种不同的感知功能,能够捕捉广泛的触觉细节。
- 该传感器可以检测小至 1 毫牛顿的压力变化,使机器人能够响应精细纹理和细微动作。
- 其指尖表面分布着超过 800 万个 taxel(微小感知点),可提供高分辨率的触觉信息图。
Meta Digit 360 的扩展产品 Meta Digit Plexus 是一个将各种触觉传感器集成到单个机器手上的平台。这种设置让机器人能够同时处理来自多个点的触觉信息,类似于人手收集感官数据的方式。

图 5。 Meta Digit Plexus。
为 AI 的下一个篇章奠定基础#
Meta 最新的 AI 更新涵盖了 SAM 2.1 和 CoTracker3 在计算机视觉方面的进展,以及语言模型和机器人技术领域的新发展,展现了 AI 正稳步从理论走向切实且有影响力的解决方案。
这些工具旨在让 AI 在不同领域更加灵活且实用,从分割复杂图像、理解人类语言,到甚至在物理空间中与我们协作,都能提供帮助。
通过优先考虑可访问性和现实世界的应用,Meta FAIR 正让我们更接近这样一个未来:AI 能够应对现实世界的挑战,并以有意义的方式改善我们的日常生活。
你对 AI 感兴趣吗?加入我们的社区,获取最新更新和洞察,并查看我们的GitHub 仓库。你还可以探索计算机视觉如何应用于自动驾驶汽车和农业等行业!






