프롬프트 기반 콘셉트 세그멘테이션 이해하기
프롬프트 기반 콘셉트 세그멘테이션과 기존 방법과의 차이, 그리고 YOLOE-26과 같은 관련 모델이 오픈 보캐뷸러리 기능을 지원하는 방식을 살펴보세요.

Vision AI는 빠르게 발전하고 있으며 실제 환경에서 이미지와 비디오를 분석하는 데 널리 사용되고 있습니다. 예를 들어 교통 관리 시스템부터 리테일 분석에 이르는 다양한 애플리케이션에 컴퓨터 비전 모델이 통합되고 있습니다.
이러한 애플리케이션 중 상당수에서 객체 감지 모델과 같은 비전 모델은 차량, 사람, 장비를 비롯한 사전 정의된 객체 집합을 인식하도록 학습됩니다. 학습 중에 이러한 모델에는 레이블이 지정된 많은 예시가 제공되므로 각 객체가 어떻게 보이는지 학습하고 장면에서 다른 객체와 구분할 수 있습니다.
세그멘테이션 작업에서 모델은 한 단계 더 나아가 이러한 객체 주변에 정밀한 픽셀 수준 윤곽선을 생성합니다. 이를 통해 시스템은 이미지에서 각 객체가 정확히 어디에 위치하는지 파악할 수 있습니다.
시스템이 학습한 대상을 인식하기만 하면 되는 경우에는 이 방식이 잘 작동합니다. 그러나 실제 환경에서는 그런 경우가 드뭅니다.
시각적 장면은 일반적으로 동적입니다. 새로운 객체와 시각적 개념이 나타나고 조건이 변하며, 사용자는 원래의 학습 설정에 포함되지 않았던 객체를 세그멘테이션하려는 경우가 많습니다.
이러한 한계는 세그멘테이션에서 특히 분명하게 드러납니다. Vision AI가 계속 발전함에 따라 반복적인 재학습 없이 새로운 개념에 적응할 수 있는 더욱 유연한 세그멘테이션 모델의 필요성이 커지고 있습니다. 이것이 바로 프롬프트 가능한 개념 세그멘테이션(PCS)이 주목받는 이유입니다.
사용자는 고정된 객체 카테고리 목록에 의존하는 대신 텍스트, 시각적 프롬프트 또는 예시 이미지를 사용하여 세그멘테이션하려는 대상을 설명할 수 있습니다. 그러면 이러한 모델은 설명된 개념과 일치하는 모든 영역을 식별하고 세그멘테이션할 수 있으며, 해당 개념이 학습 중에 명시적으로 포함되지 않았더라도 가능합니다.
이 글에서는 프롬프트 가능한 개념 세그멘테이션의 작동 방식, 기존 접근 방식과의 차이점, 그리고 현재 사용되는 분야를 살펴봅니다.
프롬프트 가능한 개념 세그멘테이션이란 무엇인가요?#
대부분의 경우 세그멘테이션 모델은 짧은 객체 유형 목록을 인식하도록 학습됩니다. Vision AI 시스템이 특정 객체 집합만 감지하고 세그멘테이션하면 되는 경우에는 이 방식이 잘 작동합니다.
그러나 실제 애플리케이션에서는 시각적 장면이 동적입니다. 새로운 객체가 나타나고 작업 요구 사항이 변하며, 사용자는 원래 레이블 집합에 포함되지 않은 개념을 세그멘테이션해야 하는 경우가 많습니다. 이러한 상황을 지원하려면 일반적으로 새로운 고품질 데이터와 어노테이션을 수집하고 모델을 재학습해야 하므로 비용이 증가하고 배포가 지연됩니다.
프롬프트 가능한 개념 세그멘테이션은 고정된 레이블 목록에서 선택하는 대신 사용자가 모델에 무엇을 찾아야 하는지 알려줄 수 있도록 하여 이 문제를 해결합니다. 사용자는 찾고 있는 객체나 아이디어를 설명하고, 모델은 이미지에서 일치하는 모든 영역을 강조 표시합니다. 이를 통해 사용자의 의도를 이미지의 실제 픽셀과 훨씬 쉽게 연결할 수 있습니다.

그림 1. 세그멘테이션에 개념 프롬프트를 사용하는 모습(출처)
다양한 유형의 프롬프트로 세그멘테이션 안내하기#
프롬프트 가능한 개념 세그멘테이션을 지원하는 모델은 다양한 유형의 입력을 받을 수 있어 유연합니다. 즉, 텍스트 설명, 시각적 힌트 또는 예시 이미지를 사용하는 등 모델에 무엇을 찾아야 하는지 알려주는 방법이 하나만 있는 것은 아닙니다.
각 접근 방식을 자세히 살펴보겠습니다.
- 텍스트 프롬프트: “스쿨버스” 또는 “종양 영역”과 같은 짧은 구문을 사용하여 세그멘테이션할 개념을 설명할 수 있습니다. 모델은 단어의 의미를 해석하고 일치하는 영역을 식별합니다.
- 시각적 프롬프트: 이미지 내부의 점, 상자 또는 대략적인 스케치를 힌트로 사용하는 프롬프트입니다. 이러한 단서는 어디를 살펴볼지 안내하고 최종 경계의 형태를 결정하는 데 도움을 줍니다.
- 이미지 예시: 참조 이미지 또는 작은 크롭이 관심 개념을 나타냅니다. 모델은 시각적으로 유사한 영역을 검색하고 시각적 외형을 기반으로 이를 세그멘테이션합니다.
PCS와 기존 세그멘테이션의 차이점#
프롬프트 가능한 개념 세그멘테이션의 작동 방식을 살펴보기 전에 다양한 기존 객체 세그멘테이션 방법과 먼저 비교해 보겠습니다.
PCS는 오픈 보캐뷸러리 및 프롬프트 기반 모델을 구현합니다. 프롬프트로 설명된 새로운 아이디어를 처리할 수 있지만 기존 세그멘테이션은 그렇지 못합니다. 기존 세그멘테이션 접근 방식에는 여러 유형이 있으며, 각각 고유한 가정과 한계가 있습니다.
다음은 기존 세그멘테이션의 주요 유형을 간략히 살펴본 내용입니다.
- 시맨틱 세그멘테이션: 이미지의 모든 픽셀을 도로, 건물 또는 사람과 같은 카테고리의 일부로 레이블링합니다. 동일한 레이블을 가진 모든 픽셀을 함께 그룹화하므로 모델은 개별 객체 인스턴스를 구분하지 않습니다.
- 인스턴스 세그멘테이션: 모델이 개별 객체를 식별하고 세그멘테이션하므로 두 사람이나 두 대의 자동차를 서로 다른 항목으로 처리합니다.
- 파놉틱 세그멘테이션: 이 기법은 시맨틱 세그멘테이션과 인스턴스 세그멘테이션을 결합하여 배경 영역과 개별 객체를 모두 포함하는 장면의 전체적인 뷰를 제공합니다.
이러한 모든 접근 방식은 사전 정의된 객체 카테고리 목록에 의존합니다. 해당 범위 내에서는 잘 작동하지만 범위를 벗어난 개념은 잘 처리하지 못합니다. 새로운 특정 객체를 세그멘테이션해야 하는 경우에는 일반적으로 추가 학습 데이터와 모델 파인튜닝이 필요합니다.
PCS는 이러한 상황을 바꾸는 것을 목표로 합니다. 사전 정의된 카테고리에 제한되는 대신 추론 시점에 이미지에서 세그멘테이션하려는 대상을 설명할 수 있도록 합니다.
PCS 모델의 발전#
이제 세그멘테이션 모델이 프롬프트 가능한 개념 세그멘테이션으로 발전해 온 과정을 살펴보겠습니다.
세그멘테이션의 전환을 이끈 대표적인 파운데이션 모델은 SAM, 즉 무엇이든 세그멘테이션하는 모델입니다. 이 모델은 2023년에 소개되었습니다. SAM은 사전 정의된 객체 카테고리에 의존하는 대신 점이나 바운딩 박스와 같은 간단한 시각적 프롬프트를 사용하여 사용자가 세그멘테이션을 안내할 수 있도록 했습니다.
SAM을 사용하면 사용자는 더 이상 레이블을 선택할 필요가 없었습니다. 객체가 있는 위치를 표시하기만 하면 모델이 해당 객체의 마스크를 생성했습니다. 이로써 세그멘테이션은 더욱 유연해졌지만, 사용자는 여전히 모델에 어디를 살펴봐야 하는지 알려줘야 했습니다.
2024년에 출시된 SAM 2는 더 복잡한 장면을 처리하고 프롬프트 가능한 세그멘테이션을 비디오로 확장하여 이 아이디어를 발전시켰습니다. 시각적 프롬프트를 주로 사용하여 세그멘테이션을 안내하면서 다양한 조명 조건, 객체 형태 및 움직임에서의 견고성을 향상했습니다.
SAM 3 모델은 이러한 발전의 최신 단계입니다. 지난해 출시된 이 통합 모델은 시각적 이해와 언어 안내를 결합하여 이미지 및 비디오 세그멘테이션 작업 전반에서 일관된 동작을 지원합니다.
SAM 3을 사용하면 사용자는 가리키거나 그리는 프롬프트에 제한되지 않습니다. 대신 텍스트를 사용하여 세그멘테이션하려는 대상을 설명할 수 있으며, 모델은 이미지 또는 비디오 프레임에서 해당 설명과 일치하는 영역을 검색합니다.
세그멘테이션은 고정된 객체 카테고리가 아닌 개념에 의해 안내되므로 다양한 장면과 시간의 흐름에 걸쳐 오픈 보캐뷸러리 사용을 지원합니다. 실제로 SAM 3은 Wikidata와 같은 소스에서 파생된 온톨로지에 기반하고 대규모 학습 데이터로 확장된, 학습된 대규모 개념 공간에서 작동합니다.

그림 2. SAM 3에 프롬프트를 제공하고 단일 이미지를 세그멘테이션하는 예시(출처)
주로 기하학적 프롬프트에 의존했던 이전 버전과 비교하면 SAM 3은 더욱 유연하고 개념 중심적인 세그멘테이션을 향한 발전을 보여줍니다. 따라서 관심 객체나 아이디어가 변경될 수 있고 항상 사전에 정의할 수는 없는 실제 애플리케이션에 더 적합합니다.
프롬프트 가능한 시각적 세그멘테이션의 작동 방식 살펴보기#
그렇다면 프롬프트 가능한 개념 세그멘테이션은 어떻게 작동할까요? 이는 대규모 사전 학습 비전 모델과 비전-언어 모델을 기반으로 합니다. 이러한 모델은 방대한 이미지 컬렉션과 많은 경우 이미지와 짝지어진 텍스트로 학습됩니다. 이러한 학습을 통해 일반적인 시각적 패턴과 의미를 학습할 수 있습니다.
대부분의 PCS 모델은 Transformer 기반 아키텍처를 사용하며, 전체 이미지를 한 번에 처리하여 서로 다른 영역 간의 관계를 파악합니다. 비전 Transformer는 이미지에서 시각적 특징을 추출하고, 텍스트 인코더는 단어를 모델이 처리할 수 있는 수치 표현으로 변환합니다.
학습 중에 이러한 모델은 정확한 객체 경계를 정의하는 픽셀 수준 마스크, 객체의 대략적인 위치를 나타내는 바운딩 박스, 이미지에 무엇이 나타나는지 설명하는 이미지 수준 레이블 등 다양한 유형의 supervision에서 학습할 수 있습니다. 다양한 종류의 레이블이 지정된 데이터를 사용하여 학습하면 모델이 세부적인 특징과 더 광범위한 시각적 개념을 모두 포착하는 데 도움이 됩니다.
추론 시점, 즉 모델이 실제로 예측을 수행하는 시점에 PCS는 프롬프트 기반 프로세스를 따릅니다. 사용자는 텍스트 설명, 점이나 상자와 같은 시각적 힌트 또는 예시 이미지를 통해 안내를 제공합니다. 모델은 프롬프트와 이미지를 공유된 내부 표현 또는 임베딩으로 인코딩하고, 설명된 개념과 일치하는 영역을 식별합니다.
그런 다음 마스크 디코더가 이 공유 표현을 정밀한 픽셀 수준 세그멘테이션 마스크로 변환합니다. 모델은 시각적 특징과 의미를 연결하므로 학습 중에 명시적으로 포함되지 않았던 새로운 개념도 세그멘테이션할 수 있습니다.
또한 프롬프트를 조정하거나 추가 안내를 제공하여 출력을 개선할 수 있는 경우가 많으며, 이를 통해 모델이 복잡하거나 모호한 장면을 처리하는 데 도움이 됩니다. 이러한 반복적 프로세스는 배포 중 실용적인 최적화를 지원합니다.
프롬프트 가능한 개념 세그멘테이션 모델은 일반적으로 이전에 보지 못한 개념을 얼마나 잘 세그멘테이션하는지, 그리고 다양한 장면에서 얼마나 견고하게 작동하는지를 기준으로 평가됩니다. 벤치마크는 실제 배포 요구 사항을 반영하여 마스크 품질, 일반화 및 계산 효율성에 중점을 두는 경우가 많습니다.
PCS의 실제 활용 사례#
이제 프롬프트 가능한 개념 세그멘테이션이 이미 사용되고 있으며 실질적인 영향을 미치기 시작한 분야를 살펴보겠습니다.
의료 영상을 위한 유연한 이미지 세그멘테이션#
의료 영상에는 수많은 생물학적 구조, 질병 및 스캔 유형이 포함되며 새로운 사례가 매일 등장합니다. 기존 세그멘테이션 모델은 이러한 다양성을 따라가는 데 어려움을 겪습니다.
PCS는 짧고 경직된 목록에서 선택하는 대신 임상의가 찾고자 하는 대상을 설명할 수 있으므로 이 분야에 자연스럽게 적용됩니다. 텍스트 구문이나 시각적 프롬프트를 사용하면 각 새로운 작업마다 모델을 재학습하지 않고도 장기나 우려 영역을 직접 세그멘테이션하는 데 PCS를 사용할 수 있습니다. 이를 통해 다양한 임상 요구 사항을 더 쉽게 처리하고 수동 마스크 작성의 필요성을 줄이며 다양한 영상 유형에서 작업할 수 있습니다.
대표적인 예로 MedSAM-3가 있습니다. MedSAM-3는 의료 영상에서 텍스트 프롬프트가 가능한 PCS를 지원하도록 SAM 3 아키텍처를 적용합니다. 이 모델에는 간이나 신장과 같은 장기 이름, 종양이나 병변과 같은 병변 관련 개념 등 명시적인 해부학적 및 병리학적 용어로 프롬프트를 제공할 수 있습니다. 프롬프트가 주어지면 모델은 의료 이미지에서 해당 영역을 직접 세그멘테이션합니다.
MedSAM-3는 텍스트와 이미지를 모두 추론할 수 있는 멀티모달 대규모 언어 모델(MLLMs 또는 멀티모달 LLMs)도 통합합니다. 이러한 모델은 에이전트가 개입하는 구조로 작동하며, 더 어려운 사례에서 정확도를 향상하기 위해 결과를 반복적으로 개선합니다.

그림 3. 의료 이미지에서 텍스트 프롬프트로 종양을 세그멘테이션하는 MedSAM-3 파이프라인(출처)
MedSAM-3는 X-ray, MRI, CT, 초음파 및 비디오 데이터 전반에서 우수한 성능을 발휘하며, 실제 임상 환경에서 PCS가 더욱 유연하고 효율적인 의료 영상 워크플로를 지원할 수 있음을 보여줍니다.
로봇 수술 및 자동화를 위한 적응형 세그멘테이션#
로봇 수술은 수술 도구를 추적하고 빠르게 변하는 수술 장면을 이해하기 위해 비전 시스템에 의존합니다. 기구는 빠르게 움직이고 조명은 변하며 새로운 도구가 언제든 나타날 수 있으므로 사전 정의된 레이블 시스템을 유지 관리하기가 어렵습니다.
PCS를 사용하면 로봇이 도구를 추적하고 카메라를 안내하며 수술 단계를 실시간으로 따라갈 수 있습니다. 이를 통해 수동 레이블링이 줄어들고 시스템을 다양한 시술에 맞게 더 쉽게 조정할 수 있습니다. 외과의 또는 자동화된 시스템은 “그리퍼”, “메스” 또는 “카메라 도구”와 같은 텍스트 프롬프트를 사용하여 이미지에서 세그멘테이션해야 할 대상을 지정할 수 있습니다.

그림 4. 로봇 수술에 사용되는 수술 도구의 세그멘테이션(출처)
Ultralytics YOLOE-26을 사용한 오픈 보캐뷸러리 세그멘테이션#
프롬프트 가능한 개념 세그멘테이션과 관련된 또 다른 흥미로운 최신 모델은 Ultralytics YOLOE-26입니다. 이 모델은 오픈 보캐뷸러리 및 프롬프트 기반 세그멘테이션을 Ultralytics YOLO 모델 제품군에 도입합니다.
YOLOE-26은 Ultralytics YOLO26 아키텍처를 기반으로 하며 오픈 보캐뷸러리 인스턴스 세그멘테이션을 지원합니다. YOLOE-26을 사용하면 여러 방식으로 세그멘테이션을 안내할 수 있습니다.
짧고 시각적으로 근거가 있는 구문으로 대상 객체를 지정하는 텍스트 프롬프트와 이미지 단서를 기반으로 추가 안내를 제공하는 시각적 프롬프트를 지원합니다. 또한 YOLOE-26에는 제로샷 추론을 위한 프롬프트 없는 모드가 포함되어 있어 사용자 프롬프트 없이도 내장된 보캐뷸러리에서 객체를 감지하고 세그멘테이션할 수 있습니다.
YOLOE-26은 객체 카테고리가 변할 수 있지만 낮은 지연 시간과 안정적인 처리량이 여전히 중요한 비디오 분석, 로보틱스 인식 및 엣지 기반 시스템과 같은 애플리케이션에 적합합니다. 또한 어노테이션 프로세스의 일부를 자동화하여 워크플로를 간소화하므로 데이터 레이블링과 데이터셋 큐레이션에도 특히 유용합니다.
프롬프트 가능한 개념 세그멘테이션의 장단점#
프롬프트 가능한 개념 세그멘테이션을 사용할 때의 주요 이점은 다음과 같습니다.
- 더 빠른 반복 및 프로토타이핑: 데이터셋을 다시 구축하거나 모델을 재학습하는 대신 프롬프트를 변경하여 새로운 세그멘테이션 작업을 빠르게 테스트할 수 있으므로 실험과 개발이 빨라집니다.
- 도메인 간 적응성: 동일한 PCS 모델을 의료 영상, 로보틱스 또는 비디오 분석과 같은 다양한 도메인에 워크플로를 최소한으로 변경하여 적용할 수 있는 경우가 많습니다.
- 대화형 개선: 사용자는 프롬프트를 반복적으로 조정하거나 안내를 추가하여 결과를 개선할 수 있으므로 재학습 없이도 모호한 장면이나 엣지 케이스를 더 쉽게 처리할 수 있습니다.
PCS에는 분명한 장점이 있지만 다음과 같은 한계도 고려해야 합니다.
- 프롬프트 민감도: 프롬프트를 작성하거나 제공하는 방식의 작은 변화가 출력에 영향을 줄 수 있습니다. 너무 모호하거나 지나치게 구체적인 프롬프트는 불완전하거나 잘못된 세그멘테이션으로 이어질 수 있습니다.
- 예측 가능성이 낮은 동작: 모델이 고정된 레이블에서 선택하는 대신 프롬프트를 해석하므로 장면과 입력에 따라 결과의 변동성이 커질 수 있으며, 이는 엄격하게 제어되는 파이프라인에서 문제가 될 수 있습니다.
- 모호한 개념 해석: 일부 개념은 주관적이거나 느슨하게 정의되어 있어 사용자 간 또는 이미지 간 세그멘테이션 결과가 일관되지 않을 수 있습니다.
- 매우 구체적인 대상에 대한 제한적인 신뢰성: 프롬프트 기반 모델은 일반적으로 결함 감지와 같이 미묘한 특징을 정밀하고 일관되게 식별해야 하는, 좁게 정의된 인스턴스별 작업에서 신뢰성이 낮습니다.
프롬프트 가능한 세그멘테이션과 기존 세그멘테이션 중 선택하기#
프롬프트 가능한 세그멘테이션을 살펴보다 보면 어떤 애플리케이션에 가장 적합한지, 그리고 해결하려는 문제에 Ultralytics YOLO26과 같은 기존 컴퓨터 비전 모델이 언제 더 적합한지 궁금할 수 있습니다. 프롬프트 가능한 세그멘테이션은 일반적인 객체에 잘 작동하지만 매우 정밀하고 일관된 결과가 필요한 사용 사례에는 적합하지 않습니다.
결함 감지가 좋은 예입니다. 제조 과정에서 결함은 작은 긁힘, 찌그러짐, 정렬 불량 또는 표면 불규칙성과 같이 작고 미묘한 경우가 많습니다. 또한 재료, 조명 및 생산 조건에 따라 크게 달라질 수 있습니다.
이러한 문제는 간단한 프롬프트로 설명하기 어렵고 범용 모델이 안정적으로 감지하기는 더욱 어렵습니다. 전반적으로 프롬프트 기반 모델은 결함을 놓치거나 불안정한 결과를 생성하는 경향이 있는 반면, 결함 데이터에 특화하여 학습된 모델은 실제 검사 시스템에서 훨씬 더 신뢰할 수 있습니다.
핵심 요점#
프롬프트 가능한 개념 세그멘테이션은 새로운 객체와 아이디어가 항상 등장하는 실제 세계에 맞게 비전 시스템을 더 쉽게 조정할 수 있도록 합니다. 고정된 레이블에 제한되는 대신 사용자는 세그멘테이션하려는 대상을 설명하기만 하면 모델이 나머지를 처리하므로 시간을 절약하고 수작업을 줄일 수 있습니다. 아직 한계가 있지만 PCS는 이미 실제 세그멘테이션 활용 방식을 변화시키고 있으며 향후 비전 시스템의 핵심 구성 요소가 될 가능성이 높습니다.
GitHub 저장소를 방문하고 커뮤니티에 참여하여 AI에 대해 더 알아보세요. 로보틱스의 AI와 제조 분야의 컴퓨터 비전에 대해 알아보려면 솔루션 페이지를 확인하세요. 지금 Vision AI를 시작할 수 있도록 라이선스 옵션을 확인해 보세요!









