YOLO Vision 2026:
视觉 AI

来自 Meta FAIR 的 AI 研究更新:SAM 2.1 和 CoTracker3

探索 Meta FAIR 最新的 AI 模型 SAM 2.1 和 CoTracker3,它们为多样化的现实世界应用提供了先进的分割和跟踪功能。

ABAbirami Vina5 min read
Meta FAIR AI 研究:SAM 2.1 和 CoTracker3

人工智能(AI)是一个近年来充满激情与活力的研究领域,new innovations和突破比以往任何时候都出现得更快。在过去几周里,Meta 的基础人工智能研究(FAIR)团队公布了一系列旨在应对不同 AI 领域挑战的工具和models。这些发布包含的更新可能会影响healthcareroboticsaugmented reality等多元化领域。

例如,更新后的 SAM 2.1 模型改进了object segmentation,使在images和视频中准确识别和分离物体变得更加容易。同时,CoTracker3 专注于点tracking,即使在物体移动或部分被遮挡时,也能帮助追踪视频帧中的点。

Meta 还推出了更轻、更快的Llama language model版本,以便进行高效的on-device use,并为robotics配备了新的触觉传感技术。在本文中,我们将剖析 Meta FAIR 的这些最新发布,看看每个工具能提供什么。让我们开始吧!

Meta 的增强版 Segment Anything Model:SAM 2.1#

Object segmentation是一项关键的computer vision task,它能够识别和分离图像或视频中的不同物体,从而更轻松地分析特定的感兴趣区域。自发布以来,Meta 的Segment Anything Model 2 (SAM 2)已被用于medical imagingmeteorology等不同领域的物体分割。基于社区的反馈,Meta 现在推出了 SAM 2.1,这是一个改进的版本,旨在解决原模型遇到的一些挑战,并提供更强的整体performance

SAM 2.1 model performance benchmarking

Fig 1. SAM 2.1 模型性能基准测试。

得益于新的data augmentation技术,SAM 2.1 包含了一些更新,能更好地处理视觉上相似且较小的物体。它还通过在更长的视频序列上进行训练,改善了模型处理遮挡(物体的一部分被遮挡而无法看见)的方式,使其能够随时间“记住”和识别物体,即使它们被暂时阻挡也是如此。例如,如果有人在filming a video拍摄一个人走过tree后方,当这个人从另一侧重新出现时,SAM 2.1 可以对其进行track,利用对object’s positionmovement的记忆在视野短暂中断时填补空白。

除了这些更新之外,Meta 还发布了 SAM 2 Developer Suite,提供了open-source训练代码和完整的演示基础架构,以便开发者能够使用自己的datafine-tune SAM 2.1,并将其集成到各种applications中。

CoTracker3:Meta 的跟踪模型及其功能和更新#

另一个有趣的计算机视觉任务是点tracking。它涉及在视频的多个帧中跟随特定的点或特征。想象一下,一段关于cyclist沿赛道骑行的视频——点追踪可以让模型保持track of points在骑手身上(如头盔或车轮),即使它们暂时被障碍物隐藏。

3D reconstructionrobotics和视频编辑等应用程序离不开点追踪。传统模型通常依赖于复杂的设置和大型合成数据集,这限制了它们在真实场景中应用时的有效性。

Meta 的 CoTracker3 tracking模型通过简化模型架构解决了这些局限性。它还引入了一种伪labeling technique,使模型能够从真实的、未标注的视频中学习,从而使 CoTracker3 在实际应用中更加高效和可扩展。

Comparing CoTracker3 to other tracking models

Fig 2. 将 CoTracker3 与其他追踪模型进行比较。

使 CoTracker3 脱颖而出的功能之一是它能够很好地处理遮挡。通过使用跨轨道注意力(一种允许模型在多个被追踪点之间共享信息的Техника),CoTracker3 可以通过参考可见点来推断隐藏点的位置。通过这样做,CoTracker3 旨在在动态环境中发挥极高的效用,例如在拥挤的场景中following a person

CoTracker3 还提供在线和离线两种模式。在线模式提供实时追踪,而离线模式可用于跨整个视频序列的更全面的追踪,非常适合视频编辑或animation等任务。

来自 Meta FAIR 的其他更新和研究#

虽然 SAM 2.1 和 CoTracker3 展示了 Meta 在computer vision方面的最新进展,但AI的其他领域(例如natural language processing (NLP) 和robotics)也迎来了令人兴奋的更新。让我们来看看 Meta FAIR 的其他这些最新发展。

Meta 的 Spirit LM:语言和多模态模型中的 AI 创新#

Meta 的 Spirit LM 是一种新型multimodal语言模型,它结合了text and speech功能,使interactions with AI感觉更自然。与仅处理文本或仅处理语音的传统模型不同,Spirit LM 可以在两者之间无缝切换。

Spirit LM 能够以更像人类的方式理解和generate language。例如,它可以增强能够用口头或书面语言进行聆听和回应的virtual assistants,或者支持在语音和文本之间进行转换的accessibility tools

An example of text-to-speech using Meta Spirit LM

Fig 3. 使用 Meta Spirit LM 的文本转语音示例。

此外,Meta 还开发了使大语言模型更高效的技术。其中一项名为 Layer Skip 的技术通过仅激活给定任务所需的层,有助于减少computational needsenergy costs。这对于内存和电力有限的on devices上的应用程序特别有用。

为了进一步满足在这些设备上deploy AI应用程序的需求,Meta 还推出了其Llama modelsquantized版本。这些模型经过压缩,能够在mobile devices上更快地运行,且不会牺牲accuracy

展望使用 Meta Lingua 进行优化的未来#

随着AI models在规模和复杂性上的增长,优化其training过程变得至关重要。在optimization方面,Meta 推出了 Meta Lingua,这是一个灵活且高效的代码库,使训练large language models变得更加容易。Meta Lingua 的模块化设计让researchers能够快速定制和扩展他们的实验。

研究人员可以减少在技术设置上花费的时间,从而有更多时间投入到实际研究中。该代码库还轻量且易于integrate,非常适合小型实验和大规模项目。通过消除这些技术障碍,Meta Lingua 帮助研究人员取得更快进展,并更轻松地测试new ideas

An overview of Meta Lingua

Fig 4. Meta Lingua 概述。

Meta 在 AI 安全方面的增强#

随着量子计算技术的进步,它给data security带来了新的挑战。与当今的计算机不同,量子计算机很可能能够快得多地解决复杂的计算问题。这意味着它们可能会break the encryption目前用于protect敏感信息的各种方法。这就是为什么该领域的研发变得越来越重要——在我们为量子计算的未来做准备时,开发保护数据的新方法是必不可少的。

为了解决这个问题,Meta 开发了 Salsa,这是一个旨在加强后量子密码学安全性的工具。Salsa 帮助研究人员测试人工智能驱动的攻击并识别潜在弱点,使他们能够更好地理解和解决密码系统中的漏洞。通过模拟高级攻击场景,Salsa 提供了宝贵的见解,可以指导为量子时代开发更强大、更具弹性的security measures

Meta 的 AI:机器人技术的最新创新#

Meta 在robotics领域的最新工作重点是通过增强触觉感知、灵活性以及与人类的协作,帮助 AI 与物理世界进行更自然的交互。特别是,Meta Digit 360 是一种先进的触觉传感器,赋予机器人精细的触觉。这些传感器帮助机器人检测纹理、压力甚至物体形状等细节。借助这些见解,机器人能够以更高的精度处理物体;这在healthcaremanufacturing等领域至关重要。

以下是 Meta Digit 360 包含的一些关键功能:

  • 它配备了 18 种不同的传感功能,能够捕捉广泛的触觉细节。
  • 该传感器可以检测小至 1 毫牛顿的压力变化,使机器人能够响应精细的纹理和细微的动作。
  • 它在指尖表面包含超过 800 万个 taxel(微小传感点),提供了触觉信息的高分辨率地图。

Meta Digit 360 的一个扩展是 Meta Digit Plexus,这是一个将各种触觉传感器集成到单一机械手上的平台。这种设置允许机器人同时处理来自多个点的触觉信息,类似于人类手部收集感官数据的方式。

The Meta Digit Plexus tactile sensing platform

Fig 5. Meta Digit Plexus。

为 AI 的下一篇章奠定基础#

Meta 最新的 AI 更新,从 SAM 2.1 和 CoTracker3 在计算机视觉方面的进步,到语言模型和机器人技术的新发展,展示了 AI 如何稳步地从理论走向实际、有影响力的解决方案。

这些工具旨在使 AI 在不同领域更具适应性和实用性,帮助处理从分割复杂图像到理解人类语言,甚至在物理空间中与我们并肩工作的所有事务。

通过优先考虑可访问性和现实世界应用,Meta FAIR 正让我们更接近这样一个未来:AI 能够应对现实世界的挑战,并以有意义的方式改善我们的日常生活。

你对 AI 好奇吗?加入our community获取最新更新和见解,并查看我们的GitHub repository。你还可以探索计算机视觉如何应用于self-driving carsagriculture等行业!

Explore solutions

Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多
Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多
Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多

让我们一起构建 AI 的未来!

开启你的机器学习未来之旅