来自 Meta FAIR 的 AI 研究更新:SAM 2.1 和 CoTracker3
探索 Meta FAIR 最新的 AI 模型 SAM 2.1 和 CoTracker3,它们为多样化的现实世界应用提供了先进的分割和跟踪功能。

人工智能(AI)是一个近年来充满激情与活力的研究领域,new innovations和突破比以往任何时候都出现得更快。在过去几周里,Meta 的基础人工智能研究(FAIR)团队公布了一系列旨在应对不同 AI 领域挑战的工具和models。这些发布包含的更新可能会影响healthcare、robotics和augmented reality等多元化领域。
例如,更新后的 SAM 2.1 模型改进了object segmentation,使在images和视频中准确识别和分离物体变得更加容易。同时,CoTracker3 专注于点tracking,即使在物体移动或部分被遮挡时,也能帮助追踪视频帧中的点。
Meta 还推出了更轻、更快的Llama language model版本,以便进行高效的on-device use,并为robotics配备了新的触觉传感技术。在本文中,我们将剖析 Meta FAIR 的这些最新发布,看看每个工具能提供什么。让我们开始吧!
Meta 的增强版 Segment Anything Model:SAM 2.1#
Object segmentation是一项关键的computer vision task,它能够识别和分离图像或视频中的不同物体,从而更轻松地分析特定的感兴趣区域。自发布以来,Meta 的Segment Anything Model 2 (SAM 2)已被用于medical imaging和meteorology等不同领域的物体分割。基于社区的反馈,Meta 现在推出了 SAM 2.1,这是一个改进的版本,旨在解决原模型遇到的一些挑战,并提供更强的整体performance。

Fig 1. SAM 2.1 模型性能基准测试。
得益于新的data augmentation技术,SAM 2.1 包含了一些更新,能更好地处理视觉上相似且较小的物体。它还通过在更长的视频序列上进行训练,改善了模型处理遮挡(物体的一部分被遮挡而无法看见)的方式,使其能够随时间“记住”和识别物体,即使它们被暂时阻挡也是如此。例如,如果有人在filming a video拍摄一个人走过tree后方,当这个人从另一侧重新出现时,SAM 2.1 可以对其进行track,利用对object’s position和movement的记忆在视野短暂中断时填补空白。
除了这些更新之外,Meta 还发布了 SAM 2 Developer Suite,提供了open-source训练代码和完整的演示基础架构,以便开发者能够使用自己的datafine-tune SAM 2.1,并将其集成到各种applications中。
CoTracker3:Meta 的跟踪模型及其功能和更新#
另一个有趣的计算机视觉任务是点tracking。它涉及在视频的多个帧中跟随特定的点或特征。想象一下,一段关于cyclist沿赛道骑行的视频——点追踪可以让模型保持track of points在骑手身上(如头盔或车轮),即使它们暂时被障碍物隐藏。
3D reconstruction、robotics和视频编辑等应用程序离不开点追踪。传统模型通常依赖于复杂的设置和大型合成数据集,这限制了它们在真实场景中应用时的有效性。
Meta 的 CoTracker3 tracking模型通过简化模型架构解决了这些局限性。它还引入了一种伪labeling technique,使模型能够从真实的、未标注的视频中学习,从而使 CoTracker3 在实际应用中更加高效和可扩展。

Fig 2. 将 CoTracker3 与其他追踪模型进行比较。
使 CoTracker3 脱颖而出的功能之一是它能够很好地处理遮挡。通过使用跨轨道注意力(一种允许模型在多个被追踪点之间共享信息的Техника),CoTracker3 可以通过参考可见点来推断隐藏点的位置。通过这样做,CoTracker3 旨在在动态环境中发挥极高的效用,例如在拥挤的场景中following a person。
CoTracker3 还提供在线和离线两种模式。在线模式提供实时追踪,而离线模式可用于跨整个视频序列的更全面的追踪,非常适合视频编辑或animation等任务。
来自 Meta FAIR 的其他更新和研究#
虽然 SAM 2.1 和 CoTracker3 展示了 Meta 在computer vision方面的最新进展,但AI的其他领域(例如natural language processing (NLP) 和robotics)也迎来了令人兴奋的更新。让我们来看看 Meta FAIR 的其他这些最新发展。
Meta 的 Spirit LM:语言和多模态模型中的 AI 创新#
Meta 的 Spirit LM 是一种新型multimodal语言模型,它结合了text and speech功能,使interactions with AI感觉更自然。与仅处理文本或仅处理语音的传统模型不同,Spirit LM 可以在两者之间无缝切换。
Spirit LM 能够以更像人类的方式理解和generate language。例如,它可以增强能够用口头或书面语言进行聆听和回应的virtual assistants,或者支持在语音和文本之间进行转换的accessibility tools。

Fig 3. 使用 Meta Spirit LM 的文本转语音示例。
此外,Meta 还开发了使大语言模型更高效的技术。其中一项名为 Layer Skip 的技术通过仅激活给定任务所需的层,有助于减少computational needs和energy costs。这对于内存和电力有限的on devices上的应用程序特别有用。
为了进一步满足在这些设备上deploy AI应用程序的需求,Meta 还推出了其Llama models的quantized版本。这些模型经过压缩,能够在mobile devices上更快地运行,且不会牺牲accuracy。
展望使用 Meta Lingua 进行优化的未来#
随着AI models在规模和复杂性上的增长,优化其training过程变得至关重要。在optimization方面,Meta 推出了 Meta Lingua,这是一个灵活且高效的代码库,使训练large language models变得更加容易。Meta Lingua 的模块化设计让researchers能够快速定制和扩展他们的实验。
研究人员可以减少在技术设置上花费的时间,从而有更多时间投入到实际研究中。该代码库还轻量且易于integrate,非常适合小型实验和大规模项目。通过消除这些技术障碍,Meta Lingua 帮助研究人员取得更快进展,并更轻松地测试new ideas。

Fig 4. Meta Lingua 概述。
Meta 在 AI 安全方面的增强#
随着量子计算技术的进步,它给data security带来了新的挑战。与当今的计算机不同,量子计算机很可能能够快得多地解决复杂的计算问题。这意味着它们可能会break the encryption目前用于protect敏感信息的各种方法。这就是为什么该领域的研发变得越来越重要——在我们为量子计算的未来做准备时,开发保护数据的新方法是必不可少的。
为了解决这个问题,Meta 开发了 Salsa,这是一个旨在加强后量子密码学安全性的工具。Salsa 帮助研究人员测试人工智能驱动的攻击并识别潜在弱点,使他们能够更好地理解和解决密码系统中的漏洞。通过模拟高级攻击场景,Salsa 提供了宝贵的见解,可以指导为量子时代开发更强大、更具弹性的security measures。
Meta 的 AI:机器人技术的最新创新#
Meta 在robotics领域的最新工作重点是通过增强触觉感知、灵活性以及与人类的协作,帮助 AI 与物理世界进行更自然的交互。特别是,Meta Digit 360 是一种先进的触觉传感器,赋予机器人精细的触觉。这些传感器帮助机器人检测纹理、压力甚至物体形状等细节。借助这些见解,机器人能够以更高的精度处理物体;这在healthcare和manufacturing等领域至关重要。
以下是 Meta Digit 360 包含的一些关键功能:
- 它配备了 18 种不同的传感功能,能够捕捉广泛的触觉细节。
- 该传感器可以检测小至 1 毫牛顿的压力变化,使机器人能够响应精细的纹理和细微的动作。
- 它在指尖表面包含超过 800 万个 taxel(微小传感点),提供了触觉信息的高分辨率地图。
Meta Digit 360 的一个扩展是 Meta Digit Plexus,这是一个将各种触觉传感器集成到单一机械手上的平台。这种设置允许机器人同时处理来自多个点的触觉信息,类似于人类手部收集感官数据的方式。

Fig 5. Meta Digit Plexus。
为 AI 的下一篇章奠定基础#
Meta 最新的 AI 更新,从 SAM 2.1 和 CoTracker3 在计算机视觉方面的进步,到语言模型和机器人技术的新发展,展示了 AI 如何稳步地从理论走向实际、有影响力的解决方案。
这些工具旨在使 AI 在不同领域更具适应性和实用性,帮助处理从分割复杂图像到理解人类语言,甚至在物理空间中与我们并肩工作的所有事务。
通过优先考虑可访问性和现实世界应用,Meta FAIR 正让我们更接近这样一个未来:AI 能够应对现实世界的挑战,并以有意义的方式改善我们的日常生活。
你对 AI 好奇吗?加入our community获取最新更新和见解,并查看我们的GitHub repository。你还可以探索计算机视觉如何应用于self-driving cars和agriculture等行业!






