Ultralytics YOLO27:
비전 AI

Meta FAIR의 AI 연구 업데이트: SAM 2.1 및 CoTracker3

Meta FAIR의 최신 AI 모델인 SAM 2.1과 CoTracker3가 다양한 실제 애플리케이션에 제공하는 고급 세그멘테이션 및 추적 기능을 살펴봅니다.

ABAbirami Vina7 min read
Meta FAIR AI 연구: SAM 2.1 및 CoTracker3

인공지능(AI)은 최근 새로운 혁신과 획기적인 발전이 그 어느 때보다 빠르게 등장하면서 열정과 활기가 넘치는 연구 분야입니다. 지난 몇 주 동안 Meta의 기초 AI 연구(FAIR) 팀은 AI의 다양한 영역에서 과제를 해결하기 위한 일련의 도구와 모델을 공개했습니다. 이러한 릴리스에는 의료, 로보틱스, 증강 현실처럼 서로 다른 분야에 영향을 미칠 수 있는 업데이트가 포함되어 있습니다.

예를 들어 업데이트된 SAM 2.1 모델은 객체 분할 기능을 개선하여 이미지와 동영상에서 객체를 더욱 정확하게 식별하고 분리할 수 있도록 합니다. 한편 CoTracker3는 점 추적에 중점을 두어 객체가 움직이거나 부분적으로 가려지더라도 동영상 프레임에서 점을 계속 추적할 수 있도록 지원합니다.

Meta는 효율적인 온디바이스 사용을 위해 더 가볍고 빠른 Llama 언어 모델 버전도 선보였으며, 로보틱스를 위한 새로운 촉각 감지 기술도 공개했습니다. 이 글에서는 Meta FAIR의 최신 릴리스를 자세히 살펴보고 각 도구가 제공하는 기능을 설명합니다. 시작하겠습니다!

Meta의 향상된 Segment Anything Model: SAM 2.1#

핵심 컴퓨터 비전 작업객체 분할은 이미지나 동영상 내에서 서로 다른 객체를 식별하고 분리할 수 있도록 하여 관심 영역을 더욱 쉽게 분석할 수 있게 합니다. Meta의 Segment Anything Model 2 (SAM 2)는 출시 이후 의료 영상기상학 등 다양한 분야에서 객체 분할에 사용되어 왔습니다. Meta는 커뮤니티의 피드백을 바탕으로 기존 모델에서 발생한 일부 문제를 해결하고 전반적으로 더욱 뛰어난 성능을 제공하도록 설계된 개선 버전 SAM 2.1을 이제 선보였습니다.

SAM 2.1 모델 성능 벤치마킹

그림 1. SAM 2.1 모델 성능 벤치마킹.

SAM 2.1은 새로운 데이터 증강 기법을 통해 시각적으로 유사하거나 크기가 작은 객체를 더욱 잘 처리하도록 업데이트되었습니다. 또한 더 긴 동영상 시퀀스로 모델을 학습하여 가림(객체의 일부가 시야에서 숨겨지는 상황)에 대응하는 방식도 개선했습니다. 이를 통해 객체가 일시적으로 가려지더라도 시간의 흐름에 따라 객체를 "기억"하고 인식할 수 있습니다. 예를 들어 누군가 나무 뒤로 걸어가는 사람을 촬영하고 있다면, SAM 2.1은 객체의 위치움직임에 대한 기억을 활용하여 시야가 잠시 차단된 동안의 공백을 보완하고, 사람이 반대편에 다시 나타날 때까지 추적할 수 있습니다.

이러한 업데이트와 함께 Meta는 SAM 2 Developer Suite도 출시했습니다. 여기에는 오픈 소스 학습 코드와 전체 데모 인프라가 포함되어 있어 개발자가 자체 데이터로 SAM 2.1을 파인튜닝하고 다양한 애플리케이션에 통합할 수 있습니다.

CoTracker3: Meta의 추적 모델과 기능 및 업데이트#

또 다른 흥미로운 컴퓨터 비전 작업은 점 추적입니다. 이는 동영상의 여러 프레임에 걸쳐 특정 점이나 특징을 따라가는 작업입니다. 예를 들어 트랙을 따라 달리는 자전거 이용자의 동영상에서 점 추적을 사용하면 헬멧이나 바퀴처럼 자전거 이용자 위의 점을 추적할 수 있으며, 장애물에 의해 잠시 가려지는 경우에도 이를 계속 추적할 수 있습니다.

점 추적은 3D 재구성, 로보틱스, 동영상 편집과 같은 애플리케이션에 필수적입니다. 기존 모델은 복잡한 설정과 대규모 합성 데이터셋에 의존하는 경우가 많아 실제 환경에 적용할 때 효과가 제한적입니다.

Meta의 CoTracker3 추적 모델은 모델 아키텍처를 단순화하여 이러한 한계를 해결합니다. 또한 실제 비주석 동영상에서 모델이 학습할 수 있도록 하는 의사-라벨링 기법을 도입하여 CoTracker3를 실제 사용 환경에서 더욱 효율적이고 확장 가능하게 만들었습니다.

CoTracker3와 다른 추적 모델 비교

그림 2. CoTracker3와 다른 추적 모델 비교.

CoTracker3를 돋보이게 하는 기능 중 하나는 가림을 잘 처리할 수 있다는 점입니다. 여러 추적 지점 간에 모델이 정보를 공유하도록 하는 기법인 교차 트랙 어텐션을 사용하면 CoTracker3는 보이는 지점을 참조하여 숨겨진 지점의 위치를 추론할 수 있습니다. 이를 통해 CoTracker3는 혼잡한 장면에서 사람을 따라가는 것과 같은 동적 환경에서 매우 효과적으로 작동하도록 설계되었습니다.

CoTracker3는 온라인 모드와 오프라인 모드도 모두 제공합니다. 온라인 모드는 실시간 추적을 제공하며, 오프라인 모드는 전체 동영상 시퀀스에 걸쳐 보다 종합적인 추적을 수행할 수 있어 동영상 편집이나 애니메이션과 같은 작업에 적합합니다.

Meta FAIR의 기타 업데이트 및 연구#

SAM 2.1과 CoTracker3가 Meta의 최신 컴퓨터 비전 발전을 보여주는 한편, 자연어 처리(NLP)로보틱스 같은 다른 AI 영역에서도 흥미로운 업데이트가 이루어지고 있습니다. Meta FAIR의 최근 다른 연구 성과도 살펴보겠습니다.

Meta의 Spirit LM: 언어 및 멀티모달 모델의 AI 혁신#

Meta의 Spirit LM은 텍스트와 음성 기능을 결합한 새로운 멀티모달 언어 모델로, AI와의 상호작용을 더욱 자연스럽게 만듭니다. 텍스트만 처리하거나 음성만 처리하는 기존 모델과 달리 Spirit LM은 두 방식 간에 원활하게 전환할 수 있습니다.

Spirit LM은 더욱 인간과 유사한 방식으로 언어를 이해하고 생성할 수 있습니다. 예를 들어 음성 또는 문자 언어를 모두 듣고 응답할 수 있는 가상 비서를 개선하거나, 음성과 텍스트 간 변환을 지원하는 접근성 도구를 제공할 수 있습니다.

Meta Spirit LM을 사용한 텍스트 음성 변환 예시

그림 3. Meta Spirit LM을 사용한 텍스트 음성 변환 예시.

또한 Meta는 대규모 언어 모델을 더욱 효율적으로 만드는 기법을 개발했습니다. 그중 하나인 Layer Skip은 특정 작업에 필요한 레이어만 활성화하여 계산 요구량에너지 비용을 줄이는 데 도움을 줍니다. 이는 메모리와 전력이 제한된 디바이스에서 실행되는 애플리케이션에 특히 유용합니다.

이러한 디바이스에 AI 애플리케이션을 배포해야 한다는 요구에 한 걸음 더 나아가 Meta는 Llama 모델양자화 버전도 출시했습니다. 이러한 모델은 모바일 디바이스에서 더 빠르게 실행되도록 압축되었으며 정확도는 유지합니다.

Meta Lingua를 통한 최적화의 미래 살펴보기#

AI 모델의 규모와 복잡성이 커짐에 따라 학습 프로세스를 최적화하는 일이 중요해졌습니다. 최적화와 관련하여 Meta는 대규모 언어 모델 학습을 더욱 쉽게 만드는 유연하고 효율적인 코드베이스인 Meta Lingua를 선보였습니다. Meta Lingua의 모듈식 설계를 통해 연구자는 실험을 빠르게 맞춤 설정하고 확장할 수 있습니다.

연구자는 기술 설정에 소요되는 시간을 줄이고 실제 연구에 더 많은 시간을 할애할 수 있습니다. 이 코드베이스는 가볍고 통합하기도 쉬워 소규모 실험과 대규모 프로젝트 모두에 적합합니다. Meta Lingua는 이러한 기술적 장벽을 제거하여 연구자가 더 빠르게 진전을 이루고 새로운 아이디어를 더욱 쉽게 테스트하도록 지원합니다.

Meta Lingua 개요

그림 4. Meta Lingua 개요.

Meta의 AI 보안 강화#

양자 컴퓨팅 기술이 발전하면서 데이터 보안에 새로운 과제가 제기되고 있습니다. 오늘날의 컴퓨터와 달리 양자 컴퓨터는 복잡한 계산을 훨씬 빠르게 해결할 수 있을 것으로 예상됩니다. 이는 현재 민감한 정보를 보호하는 데 사용되는 암호화 방식을 잠재적으로 해독할 수 있음을 의미합니다. 따라서 이 분야의 연구가 점점 더 중요해지고 있습니다. 양자 컴퓨팅의 미래에 대비하려면 데이터를 보호할 새로운 방법을 개발하는 것이 필수적입니다.

이를 해결하기 위해 Meta는 양자 이후 암호화 보안을 강화하는 것을 목표로 하는 도구 Salsa를 개발했습니다. Salsa는 연구자가 AI 기반 공격을 테스트하고 잠재적인 취약점을 식별하도록 지원하여 암호화 시스템의 취약성을 더 잘 이해하고 해결할 수 있게 합니다. Salsa는 고도화된 공격 시나리오를 시뮬레이션하여 양자 시대를 위한 더욱 강력하고 복원력 높은 보안 조치를 개발하는 데 도움이 되는 귀중한 인사이트를 제공합니다.

Meta의 AI: 로보틱스 분야의 최신 혁신#

Meta의 최신 로보틱스 연구는 촉각 인지, 손재주, 인간과의 협업을 향상하여 AI가 물리적 세계와 더욱 자연스럽게 상호작용하도록 지원하는 데 중점을 둡니다. 특히 Meta Digit 360은 로봇에 정교한 촉각을 제공하는 첨단 촉각 센서입니다. 이 센서는 로봇이 질감, 압력, 심지어 객체의 형태와 같은 세부 사항을 감지하도록 지원합니다. 로봇은 이러한 정보를 바탕으로 객체를 더욱 정밀하게 다룰 수 있으며, 이는 의료제조 같은 분야에서 매우 중요합니다.

Meta Digit 360의 주요 기능은 다음과 같습니다.

  • 다양한 촉각 세부 정보를 포착할 수 있도록 18개의 서로 다른 감지 기능을 갖추고 있습니다.
  • 센서는 1밀리뉴턴만큼 작은 압력 변화도 감지할 수 있어 로봇이 미세한 질감과 미묘한 움직임에 대응할 수 있습니다.
  • 손끝 표면 전체에 800만 개가 넘는 택셀(작은 감지 지점)이 포함되어 촉각 정보의 고해상도 맵을 제공합니다.

Meta Digit 360의 확장 제품인 Meta Digit Plexus는 다양한 촉각 센서를 하나의 로봇 손에 통합하는 플랫폼입니다. 이 구성은 인간의 손이 감각 데이터를 수집하는 방식과 유사하게 로봇이 여러 지점의 촉각 정보를 동시에 처리할 수 있도록 합니다.

Meta Digit Plexus 촉각 감지 플랫폼

그림 5. Meta Digit Plexus.

AI의 다음 장을 위한 기반 마련#

SAM 2.1과 CoTracker3를 통한 컴퓨터 비전의 발전부터 언어 모델과 로보틱스의 새로운 개발에 이르기까지 Meta의 최신 AI 업데이트는 AI가 이론에서 실용적이고 영향력 있는 솔루션으로 꾸준히 발전하고 있음을 보여줍니다.

이러한 도구는 AI를 다양한 분야에서 더욱 유연하고 유용하게 만들도록 설계되었으며, 복잡한 이미지를 분할하는 작업부터 인간의 언어를 이해하고 물리적 공간에서 우리와 함께 작업하는 일까지 폭넓은 영역을 지원합니다.

접근성과 실제 적용을 우선시함으로써 Meta FAIR는 AI가 현실의 문제를 해결하고 우리의 일상을 의미 있는 방식으로 향상할 수 있는 미래에 한 걸음 더 다가가고 있습니다.

AI에 관심이 있으신가요? 커뮤니티에 참여하여 최신 업데이트와 인사이트를 확인하고 GitHub 저장소도 살펴보세요. 또한 컴퓨터 비전이 자율주행 자동차농업 같은 산업에서 어떻게 활용될 수 있는지 알아보세요!

Explore solutions

항공 이미지를 위한 컴퓨터 비전

항공 이미지를 위한 컴퓨터 비전

Ultralytics YOLO을 활용하여 드론 및 항공 이미지를 농업, 수산업, 환경 모니터링, 자연 보호, 지리 공간 분석을 위한 실시간 인사이트로 변환합니다.
자세히 알아보기
항공우주 분야의 컴퓨터 비전

항공우주 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 항공 모니터링에 비전 AI를 도입하세요. 컴퓨터 비전 솔루션으로 드론, 항공우주 워크플로, 환경 보전 및 지리 공간 산업을 지원합니다.
자세히 알아보기

Ultralytics YOLO 모델로 모든 사이트를 보호하세요. 비전 AI는 경계 모니터링, 위협 탐지, 번호판 인식 및 작업장 안전을 지원합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기
항공 이미지를 위한 컴퓨터 비전

항공 이미지를 위한 컴퓨터 비전

Ultralytics YOLO을 활용하여 드론 및 항공 이미지를 농업, 수산업, 환경 모니터링, 자연 보호, 지리 공간 분석을 위한 실시간 인사이트로 변환합니다.
자세히 알아보기
항공우주 분야의 컴퓨터 비전

항공우주 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 항공 모니터링에 비전 AI를 도입하세요. 컴퓨터 비전 솔루션으로 드론, 항공우주 워크플로, 환경 보전 및 지리 공간 산업을 지원합니다.
자세히 알아보기

Ultralytics YOLO 모델로 모든 사이트를 보호하세요. 비전 AI는 경계 모니터링, 위협 탐지, 번호판 인식 및 작업장 안전을 지원합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기
항공 이미지를 위한 컴퓨터 비전

항공 이미지를 위한 컴퓨터 비전

Ultralytics YOLO을 활용하여 드론 및 항공 이미지를 농업, 수산업, 환경 모니터링, 자연 보호, 지리 공간 분석을 위한 실시간 인사이트로 변환합니다.
자세히 알아보기
항공우주 분야의 컴퓨터 비전

항공우주 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 항공 모니터링에 비전 AI를 도입하세요. 컴퓨터 비전 솔루션으로 드론, 항공우주 워크플로, 환경 보전 및 지리 공간 산업을 지원합니다.
자세히 알아보기

Ultralytics YOLO 모델로 모든 사이트를 보호하세요. 비전 AI는 경계 모니터링, 위협 탐지, 번호판 인식 및 작업장 안전을 지원합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기

AI의 미래를 함께 만들어가세요!

머신러닝의 미래와 함께 여정을 시작하세요