SAM 3 살펴보기: Meta AI의 새로운 Segment Anything 모델
Meta AI의 새로운 Segment Anything 모델인 SAM 3가 실제 이미지와 동영상에서 객체를 쉽게 탐지하고 세그먼트화하며 추적하는 방법을 알아보세요.

2025년 11월 19일, Meta AI는 Segment Anything Model 3를 출시했습니다. 이 모델은 SAM 3로도 알려져 있습니다. Segment Anything Model의 최신 버전인 SAM 3는 텍스트 프롬프트, 시각적 프롬프트, 이미지 예시를 사용해 실제 이미지와 동영상에서 객체를 탐지하고, 세그먼트화하고, 추적하는 새로운 방법을 제공합니다.
SAM 3 모델은 SAM과 SAM 2를 기반으로 하며, 개념 세그먼테이션, 오픈 보캐뷸러리 탐지, 실시간 동영상 추적과 같은 새로운 발전과 기능을 제공합니다. SAM 3는 짧은 명사구를 이해하고, 프레임 전반에서 객체를 추적하며, 이전 모델이 일관되게 처리하지 못했던 세밀하거나 희귀한 개념을 식별할 수 있습니다.
SAM 3 출시의 일환으로 Meta는 SAM 3D도 소개했습니다. 이 차세대 모델 제품군은 단일 이미지에서 객체, 장면, 사람의 전체 신체를 재구성하고 Segment Anything 생태계를 3D 이해로 확장합니다. 이러한 추가 기능은 컴퓨터 비전, 로보틱스, 미디어 편집, 크리에이티브 워크플로 전반에서 새로운 애플리케이션을 가능하게 합니다.
이 글에서는 SAM 3가 무엇인지, SAM 2와 어떤 차이가 있는지, 모델이 어떻게 작동하는지, 실제 애플리케이션에는 어떻게 활용되는지 살펴보겠습니다. 시작하겠습니다!
SAM 3란 무엇인가요? Meta의 Segment Anything Model 3 살펴보기#
SAM 3는 간단한 지시를 바탕으로 이미지와 동영상에서 객체를 식별하고, 분리하고, 추적할 수 있는 최첨단 컴퓨터 비전 모델입니다. 고정된 레이블 목록에 의존하는 대신 SAM 3는 자연어와 시각적 단서를 이해하므로, 찾고자 하는 대상을 모델에 쉽게 전달할 수 있습니다.
예를 들어 SAM 3에서는 “yellow school bus” 또는 “a striped cat”과 같은 짧은 문구를 입력하거나, 객체를 클릭하거나, 이미지에서 예시를 강조 표시할 수 있습니다. 그러면 모델은 일치하는 모든 객체를 탐지하고 깔끔한 세그멘테이션 마스크(어떤 픽셀이 객체에 속하는지 정확히 보여 주는 시각적 윤곽)를 생성합니다. 또한 SAM 3는 동영상 프레임 전반에서 해당 객체를 추적하여 객체가 움직이는 동안에도 일관성을 유지할 수 있습니다.
SAM 3D로 단일 이미지 3D 재구성 지원#
Meta AI 발표에서 주목할 만한 또 다른 부분은 Segment Anything 프로젝트를 3D 이해로 확장한 SAM 3D입니다. SAM 3D는 단일 2D 이미지를 입력으로 받아 객체나 사람 신체의 형태, 포즈 또는 구조를 3차원으로 재구성할 수 있습니다. 즉, 하나의 시점만 제공되더라도 대상이 공간을 어떻게 차지하는지 추정할 수 있습니다.
SAM 3D는 두 가지 모델로 출시되었습니다. SAM 3D Objects는 일상적인 사물을 기하 구조와 텍스처로 재구성하고, SAM 3D Body는 단일 이미지에서 사람 신체의 형태와 포즈를 추정합니다. 두 모델 모두 SAM 3의 세그멘테이션 출력을 사용한 다음, 원본 사진 속 객체의 외형과 위치에 맞는 3D 표현을 생성합니다.

그림 1. SAM 3D 사용 예시. (출처: Meta AI의 segment anything playground를 사용해 생성)
SAM 3: 탐지, 세그먼테이션, 추적을 통합하는 새로운 기능#
SAM 3는 탐지, 세그먼테이션, 추적을 하나의 통합 모델로 결합하기 위해 다음과 같은 주요 업데이트를 제공합니다.
- 개념 세그먼테이션 작업: SAM과 SAM 2에서는 객체 세그먼테이션이 클릭이나 박스와 같은 시각적 프롬프트에 의존했습니다. SAM 3는 짧은 텍스트 문구나 이미지에서 잘라낸 예시를 바탕으로 객체를 세그먼트화하는 기능을 추가합니다. 따라서 각 객체를 하나씩 클릭하지 않아도 일치하는 모든 인스턴스를 식별할 수 있습니다.
- 오픈 보캐뷸러리 텍스트 프롬프트: 이전 버전과 달리 SAM 3는 짧은 자연어 문구를 해석할 수 있습니다. 이에 따라 고정된 레이블 목록이 필요하지 않으며, 더 구체적이거나 흔하지 않은 개념도 모델이 처리할 수 있습니다.
- 탐지, 세그먼테이션, 추적을 위한 단일 모델: SAM 3는 탐지, 세그먼테이션, 추적을 하나의 모델로 통합하여 객체를 찾고 세그멘테이션 마스크를 생성하며 동영상 프레임 전반에서 객체를 추적하기 위한 별도 시스템의 필요성을 없앱니다. 이를 통해 이미지와 동영상 모두에서 더 일관되고 간소화된 워크플로를 구현할 수 있습니다. SAM 2도 일부 추적 기능을 제공했지만, SAM 3는 훨씬 더 강력하고 안정적인 성능을 제공합니다.
- 복잡한 장면에서 더 안정적인 결과: SAM 3는 텍스트, 이미지 예시, 시각적 프롬프트를 결합할 수 있으므로 시각적 클릭에만 의존했던 이전 버전보다 복잡하거나 반복적인 장면을 더 안정적으로 처리할 수 있습니다.

그림 2. SAM 3는 텍스트 또는 이미지 예시를 사용한 개념 세그먼테이션을 도입합니다. (출처)
SAM 3와 SAM 2, SAM 1 비교#
다양한 동물이 많이 등장하는 사파리 동영상을 보고 있으며, 코끼리만 탐지하고 세그먼트화하고 싶다고 가정해 보겠습니다. 이 작업은 SAM의 버전별로 어떻게 달라질까요?
SAM을 사용하면 세그멘테이션 마스크를 생성하기 위해 각 프레임에서 각각의 코끼리를 수동으로 클릭해야 합니다. 추적 기능이 없으므로 새 프레임마다 다시 클릭해야 합니다.
SAM 2에서는 코끼리를 한 번 클릭해 마스크를 얻으면 모델이 동영상 전체에서 같은 코끼리를 추적할 수 있습니다. 하지만 여러 코끼리(특정 객체)를 세그먼트화하려면 여전히 각각 별도의 클릭을 제공해야 합니다. SAM 2는 자체적으로 “elephant”와 같은 카테고리를 이해하지 못하기 때문입니다.
SAM 3에서는 워크플로가 훨씬 간단해집니다. “elephant”를 입력하거나 코끼리 한 마리 주위에 바운딩 박스를 그려 예시를 제공하면, 모델이 동영상 속 모든 코끼리를 자동으로 찾아 세그먼트화하고 프레임 전반에서 일관되게 추적합니다. 이전 버전에서 사용하던 클릭 및 박스 프롬프트도 계속 지원하지만, 이제는 SAM과 SAM 2에서는 지원하지 않았던 텍스트 프롬프트와 예시 이미에도 응답할 수 있습니다.
SAM 3 모델의 작동 방식#
이제 SAM 3 모델이 어떻게 작동하고 어떻게 학습되었는지 자세히 살펴보겠습니다.
SAM 3 모델 아키텍처 개요#
SAM 3는 단일 시스템에서 개념 프롬프트와 시각적 프롬프트를 지원하기 위해 여러 구성 요소를 결합합니다. 모델의 핵심에는 Meta의 통합 오픈 소스 이미지-텍스트 인코더인 Meta Perception Encoder가 사용됩니다.
이 인코더는 이미지와 짧은 명사구를 모두 처리할 수 있습니다. 간단히 말해, 이를 통해 SAM 3는 이전 버전의 Segment Anything Model보다 언어 특징과 시각적 특징을 더 효과적으로 연결할 수 있습니다.
이 인코더를 기반으로 SAM 3에는 Transformer 모델의 DETR 계열을 기반으로 하는 디텍터가 포함됩니다. 이 디텍터는 이미지에서 객체를 식별하고, 어떤 객체가 사용자의 프롬프트에 해당하는지 시스템이 판단하도록 지원합니다.
특히 동영상 세그먼테이션을 위해 SAM 3는 SAM 2의 메모리 뱅크와 메모리 인코더를 기반으로 하는 추적 구성 요소를 사용합니다. 이를 통해 모델은 프레임 전반에서 객체에 대한 정보를 유지하고 시간이 지나도 객체를 재식별하고 추적할 수 있습니다.

그림 3. 개념을 사용한 세그먼테이션 작동 방식 (출처: scontent)
Segment Anything Model 3를 뒷받침하는 확장 가능한 데이터 엔진#
SAM 3를 학습시키기 위해 Meta는 현재 인터넷에 존재하는 것보다 훨씬 더 많은 어노테이션 데이터를 필요로 했습니다. 고품질 세그멘테이션 마스크와 텍스트 레이블을 대규모로 생성하기는 어렵고, 이미지와 동영상에서 개념의 모든 인스턴스를 완전히 윤곽화하는 작업은 느리고 비용이 많이 듭니다.
이를 해결하기 위해 Meta는 SAM 3 자체, 추가 AI 모델, 인간 어노테이터가 함께 작업하는 새로운 데이터 엔진을 구축했습니다. 워크플로는 SAM 3와 Llama 기반 캡셔닝 모델을 포함한 AI 시스템 파이프라인으로 시작됩니다.
이러한 시스템은 대규모 이미지 및 동영상 컬렉션을 스캔하고, 캡션을 생성하며, 캡션을 텍스트 레이블로 변환하고, 초기 세그멘테이션 마스크 후보를 생성합니다. 그런 다음 인간 및 AI 어노테이터가 이러한 후보를 검토합니다.
마스크 품질 확인과 개념 범위 검증 등의 작업에서 인간의 정확도와 비슷하거나 이를 능가하도록 학습된 AI 어노테이터가 간단한 사례를 필터링합니다. 모델이 여전히 어려움을 겪을 수 있는 더 까다로운 예시에는 사람만 개입합니다.

그림 4. SAM 3 데이터 엔진 (출처)
이 접근 방식은 Meta의 어노테이션 속도를 크게 향상시킵니다. AI 어노테이터가 간단한 사례를 처리하도록 함으로써, 세밀한 도메인에서 파이프라인은 네거티브 프롬프트 처리 시 약 5배, 포지티브 프롬프트 처리 시 36% 더 빨라집니다.
이러한 효율성 덕분에 데이터셋을 400만 개가 넘는 고유 개념으로 확장할 수 있었습니다. AI 제안, 인간의 수정, 업데이트된 모델 예측이 지속적으로 반복되는 과정은 시간이 지날수록 레이블 품질도 향상시키며, SAM 3가 훨씬 더 광범위한 시각적 및 텍스트 기반 개념을 학습하도록 지원합니다.
SAM 3의 성능 향상#
성능 측면에서 SAM 3는 이전 모델보다 뚜렷하게 향상된 결과를 제공합니다. 오픈 보캐뷸러리 개념 탐지와 세그먼테이션을 평가하는 Meta의 새로운 SA-Co 벤치마크에서 SAM 3는 이미지와 동영상 모두에서 이전 시스템의 약 2배에 달하는 성능을 달성합니다.
또한 point-to-mask 및 mask-to-masklet과 같은 대화형 시각 작업에서 SAM 2와 동등하거나 더 뛰어난 성능을 보입니다. Meta는 제로샷 LVIS(학습 예시 없이 희귀 카테고리를 인식해야 하는 작업) 및 객체 카운팅(객체의 모든 인스턴스가 탐지되었는지 측정)과 같은 더 어려운 평가에서도 추가적인 향상이 있었다고 보고하며, 도메인 전반에서 더 강력한 일반화 성능을 보여 줍니다.
이러한 정확도 향상과 더불어 SAM 3는 효율적입니다. H200 GPU에서 탐지된 객체가 100개가 넘는 이미지를 약 30밀리초 만에 처리하며, 동영상에서 여러 객체를 추적할 때도 거의 실시간에 가까운 속도를 유지합니다.
Segment Anything Model 3의 애플리케이션#
이제 SAM 3에 대해 더 잘 이해했으므로, 고급 텍스트 기반 추론부터 과학 연구와 Meta 자체 제품에 이르기까지 실제 애플리케이션에서 SAM 3가 어떻게 사용되는지 살펴보겠습니다.
SAM 3 Agent를 사용한 복잡한 텍스트 쿼리 처리#
SAM 3는 더 큰 멀티모달 언어 모델 내부의 도구로도 사용할 수 있으며, Meta는 이를 SAM 3 Agent라고 부릅니다. 에이전트는 SAM 3에 “elephant”와 같은 짧은 문구를 제공하는 대신, 더 복잡한 질문을 SAM 3가 이해할 수 있는 작은 프롬프트로 나눌 수 있습니다.
예를 들어 사용자가 “What object in the picture is used for controlling and guiding a horse?”라고 질문하면, 에이전트는 다양한 명사구를 시도하고 이를 SAM 3에 전송한 뒤 어떤 마스크가 적절한지 확인합니다. 올바른 객체를 찾을 때까지 계속 구체화합니다.
특수 추론 데이터셋으로 학습하지 않았음에도 SAM 3 Agent는 ReasonSeg 및 OmniLabel과 같이 복잡한 텍스트 쿼리를 위해 설계된 벤치마크에서 우수한 성능을 보입니다. 이는 SAM 3가 언어 이해와 세밀한 시각적 세그먼테이션을 모두 필요로 하는 시스템을 지원할 수 있음을 보여 줍니다.
SAM 3의 과학 및 보전 분야 애플리케이션#
흥미롭게도 SAM 3는 이미 상세한 시각적 레이블이 중요한 연구 환경에서 사용되고 있습니다. Meta는 Conservation X Labs 및 Osa Conservation과 협력하여 10,000개가 넘는 카메라 트랩 동영상으로 구성된 공개 야생동물 모니터링 데이터셋인 SA-FARI를 구축했습니다.
모든 프레임의 모든 동물에 박스와 세그멘테이션 마스크가 지정되어 있으며, 이를 수작업으로 어노테이션하려면 매우 많은 시간이 필요합니다. 마찬가지로 해양 연구에서도 SAM 3는 FathomNet 및 MBARI와 함께 수중 이미지의 인스턴스 세그멘테이션 마스크를 생성하고 새로운 평가 벤치마크를 지원하는 데 사용되고 있습니다.
이러한 데이터셋은 과학자들이 동영상 영상을 더 효율적으로 분석하고, 대규모로 추적하기 어려운 동물과 서식지를 연구하는 데 도움을 줍니다. 연구자들은 이러한 리소스를 활용해 종 식별, 행동 분석, 자동화된 생태 모니터링을 위한 자체 모델을 구축할 수도 있습니다.
Meta가 제품 전반에 SAM 3를 배포하는 방식#
연구 분야에서의 활용뿐 아니라 SAM 3는 Meta의 소비자 제품 전반에서 새로운 기능과 사용 사례를 지원하고 있습니다. 이미 통합되고 있는 몇 가지 방식을 살펴보겠습니다.
- Instagram 편집: 크리에이터는 프레임별 수작업 없이 동영상 속 특정 인물이나 객체에 효과를 적용할 수 있습니다.
- Meta AI 앱 및 웹의 meta.ai: SAM 3는 이미지와 동영상을 수정하고, 향상하고, 리믹스할 수 있는 새로운 도구를 지원합니다.
- Facebook Marketplace의 “View in Room”: SAM 3는 SAM 3D와 함께 작동하여 사용자가 단일 사진을 사용해 집 안에 가구나 장식품을 배치해 미리 볼 수 있도록 합니다.
- Aria Gen 2 research glasses: Segment Anything Model 3는 1인칭 시점에서 손과 객체를 세그먼트화하고 추적하여 AR(증강 현실), 로보틱스, 상황 인식 AI 연구를 지원합니다.
핵심 요점#
SAM 3는 세그먼테이션 분야에서 중요한 진전입니다. 개념 세그먼테이션, 오픈 보캐뷸러리 텍스트 프롬프트, 향상된 추적 기능을 도입합니다. 이미지와 동영상 모두에서 눈에 띄게 향상된 성능을 제공하고 SAM 3D를 추가함으로써, 이 모델 제품군은 비전 AI, 크리에이티브 도구, 과학 연구, 실제 제품을 위한 새로운 가능성을 열어 줍니다.
커뮤니티에 참여하고 GitHub 리포지토리를 살펴보며 AI에 대해 더 알아보세요. 자체 비전 AI 프로젝트를 구축하려는 경우 라이선싱 옵션을 확인해 보세요. 솔루션 페이지를 방문하여 헬스케어 분야의 AI 및 리테일 분야의 Vision AI와 같은 애플리케이션에 대해 더 알아보세요.









