Ultralytics YOLO27:
视觉 AI

Meta FAIR 的 AI 研究更新:SAM 2.1 和 CoTracker3

探索 Meta FAIR 最新的 AI 模型 SAM 2.1 和 CoTracker3,它们为各种真实世界应用提供先进的分割和跟踪能力。

ABAbirami Vina6 min read
Meta FAIR AI 研究:SAM 2.1 和 CoTracker3

人工智能(AI)是一个近年来充满活力与热情的研究领域,新创新和突破出现的速度比以往任何时候都快。在过去几周,Meta 的基础 AI 研究(FAIR)团队发布了一系列旨在应对 AI 不同领域挑战的工具和模型。这些发布内容包括可能影响医疗保健机器人技术增强现实等不同领域的更新。

例如,更新后的 SAM 2.1 模型改进了对象分割,从而更容易在图像和视频中准确识别并分离对象。与此同时,CoTracker3 专注于点跟踪,即使对象发生移动或被部分遮挡,也能帮助持续跟踪视频帧中的点。

Meta 还推出了更轻量、更快速的Llama 语言模型版本,以实现高效的设备端使用,同时还推出了用于机器人技术的新型触觉感知技术。在本文中,我们将详细介绍 Meta FAIR 的这些最新发布内容,了解每种工具所提供的功能。让我们开始吧!

Meta 增强版 Segment Anything Model:SAM 2.1#

对象分割是一项关键的计算机视觉任务,能够识别并分离图像或视频中的不同对象,从而更容易分析特定的关注区域。自 Meta 发布以来,其Segment Anything 模型 2(SAM 2)已被用于医学影像气象学等不同领域的对象分割。基于社区反馈,Meta 现已推出 SAM 2.1,这一改进版本旨在解决原始模型遇到的一些挑战,并全面提升性能

SAM 2.1 模型性能基准测试

图 1。 SAM 2.1 模型性能基准测试。

得益于新的数据增强技术,SAM 2.1 包含了更好地处理外观相似对象和较小对象的更新。它还通过在更长的视频序列上进行训练,改进了模型处理遮挡的方式(即对象的部分区域被遮挡而无法看到),使模型能够随着时间推移“记住”并识别对象,即使对象暂时被遮挡。例如,如果有人正在拍摄视频,记录一个人从后面走过,SAM 2.1 可以在此人从另一侧重新出现时对其进行跟踪,利用对对象位置运动的记忆,在视野短暂中断时补全缺失信息。

在这些更新之外,Meta 还发布了 SAM 2 Developer Suite,提供开源训练代码和完整的演示基础设施,使开发者能够使用自己的数据对 SAM 2.1 进行微调,并将其集成到各种应用中。

CoTracker3:Meta 的跟踪模型及其功能和更新#

另一项有趣的计算机视觉任务是点跟踪。它涉及在视频的多个帧中持续跟踪特定的点或特征。设想一段骑自行车的人沿赛道骑行的视频——点跟踪可以让模型持续跟踪点在骑行者身上的位置,例如头盔或车轮,即使这些点短暂地被障碍物遮挡。

点跟踪对于3D 重建机器人技术和视频编辑等应用至关重要。传统模型通常依赖复杂的配置和大量合成数据集,因此应用于真实场景时效果受到限制。

Meta 的 CoTracker3 跟踪模型通过简化模型架构解决了这些局限。它还引入了一种伪标注技术,使模型能够从真实的未标注视频中学习,从而让 CoTracker3 在实际使用中更加高效且易于扩展。

CoTracker3 与其他跟踪模型的比较

图 2。 CoTracker3 与其他跟踪模型的比较。

CoTracker3 的突出特点之一是能够很好地处理遮挡。借助跨轨迹注意力这一技术,模型可以在多个跟踪点之间共享信息,CoTracker3 能够参考可见点推断隐藏点的位置。通过这种方式,CoTracker3 旨在动态环境中实现高效表现,例如在人群密集的场景中跟随一个人

CoTracker3 还提供在线和离线两种模式。在线模式支持实时跟踪,而离线模式可用于对完整视频序列进行更全面的跟踪,非常适合视频编辑或动画制作等任务。

Meta FAIR 的其他更新与研究#

虽然 SAM 2.1 和 CoTracker3 展示了 Meta 在计算机视觉领域的最新进展,但AI的其他领域也有令人振奋的更新,例如自然语言处理(NLP)机器人技术。让我们来看看 Meta FAIR 最近的其他一些发展。

Meta 的 Spirit LM:语言和多模态模型领域的 AI 创新#

Meta 的 Spirit LM 是一种新的多模态语言模型,结合了文本和语音能力,让与 AI 的交互更加自然。不同于只能处理文本或只能处理语音的传统模型,Spirit LM 可以在两者之间无缝切换。

Spirit LM 能够以更接近人类的方式理解和生成语言。例如,它可以增强虚拟助手,使其能够听取并以口语或书面语回应;也可以支持在语音和文本之间进行转换的无障碍工具

使用 Meta Spirit LM 进行文本转语音的示例

图 3。使用 Meta Spirit LM 进行文本转语音的示例。

此外,Meta 还开发了让大型语言模型更加高效的技术。其中一种名为 Layer Skip 的技术,只激活特定任务所需的层,从而帮助减少计算需求能源成本。这对内存和电力有限的设备上的应用尤其有用。

为了进一步满足在这类设备上部署 AI应用的需求,Meta 还推出了其Llama 模型量化版本。这些模型经过压缩,可以在移动设备上运行得更快,同时不会牺牲准确率

通过 Meta Lingua 展望优化的未来#

随着AI 模型规模和复杂性不断增长,优化其训练过程变得至关重要。在优化方面,Meta 推出了 Meta Lingua,这是一个灵活高效的代码库,让大型语言模型的训练更加轻松。Meta Lingua 的模块化设计让研究人员能够快速定制和扩展实验。

研究人员可以减少花在技术配置上的时间,将更多精力投入实际研究。该代码库同样轻量且易于集成,适用于小型实验和大型项目。通过消除这些技术障碍,Meta Lingua 帮助研究人员更快取得进展,并更轻松地测试新想法

Meta Lingua 概览

图 4。 Meta Lingua 概览。

Meta 在 AI 安全方面的增强#

随着量子计算技术的发展,数据安全面临新的挑战。与今天的计算机不同,量子计算机很可能能够更快地解决复杂计算。这意味着它们可能会破解加密方法,而这些方法目前用于保护敏感信息。因此,该领域的研究正变得越来越重要——随着我们为量子计算的未来做准备,开发保护数据的新方法至关重要。

为应对这一问题,Meta 开发了 Salsa,这是一种旨在加强后量子密码安全性的工具。Salsa 帮助研究人员测试 AI 驱动的攻击并识别潜在弱点,使他们能够更好地理解和解决密码系统中的漏洞。通过模拟先进的攻击场景,Salsa 提供了有价值的洞察,可指导量子时代更强大、更具韧性的安全措施的开发。

Meta 的 AI:机器人技术领域的最新创新#

Meta 在机器人技术领域的最新工作,重点是通过增强触觉感知、灵巧性以及与人类的协作,帮助 AI 更自然地与物理世界交互。具体来说,Meta Digit 360 是一种先进的触觉传感器,能够赋予机器人更精细的触觉。该传感器帮助机器人检测纹理、压力甚至对象形状等细节。基于这些信息,机器人可以更精确地操控对象;这对医疗保健制造业等领域至关重要。

以下是 Meta Digit 360 所包含的一些主要功能:

  • 它配备了 18 种不同的感知功能,能够捕捉广泛的触觉细节。
  • 该传感器可以检测小至 1 毫牛顿的压力变化,使机器人能够响应精细纹理和细微动作。
  • 其指尖表面分布着超过 800 万个 taxel(微小感知点),可提供高分辨率的触觉信息图。

Meta Digit 360 的扩展产品 Meta Digit Plexus 是一个将各种触觉传感器集成到单个机器手上的平台。这种设置让机器人能够同时处理来自多个点的触觉信息,类似于人手收集感官数据的方式。

Meta Digit Plexus 触觉感知平台

图 5。 Meta Digit Plexus。

为 AI 的下一个篇章奠定基础#

Meta 最新的 AI 更新涵盖了 SAM 2.1 和 CoTracker3 在计算机视觉方面的进展,以及语言模型和机器人技术领域的新发展,展现了 AI 正稳步从理论走向切实且有影响力的解决方案。

这些工具旨在让 AI 在不同领域更加灵活且实用,从分割复杂图像、理解人类语言,到甚至在物理空间中与我们协作,都能提供帮助。

通过优先考虑可访问性和现实世界的应用,Meta FAIR 正让我们更接近这样一个未来:AI 能够应对现实世界的挑战,并以有意义的方式改善我们的日常生活。

你对 AI 感兴趣吗?加入我们的社区,获取最新更新和洞察,并查看我们的GitHub 仓库。你还可以探索计算机视觉如何应用于自动驾驶汽车农业等行业!

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅