Zero-Shot Learning
학습 데이터 없이 객체를 탐지하고 분류하는 제로샷 학습(ZSL)을 살펴보세요. Ultralytics YOLO-World가 실시간 오픈 어휘 탐지를 지원하는 방식을 알아보세요.
제로샷 학습(ZSL)은 인공지능 모델이 학습 단계에서 한 번도 접하지 않은 객체를 인식, 분류 또는 탐지할 수 있도록 하는 머신 러닝 패러다임입니다. 기존의 지도 학습에서는 모델이 식별해야 하는 각 특정 카테고리에 대해 수천 개의 레이블이 지정된 예제가 필요합니다. ZSL은 일반적으로 텍스트 설명, 의미 속성 또는 임베딩을 비롯한 보조 정보를 활용하여 관찰된 클래스와 관찰되지 않은 클래스 간의 격차를 해소함으로써 이러한 엄격한 의존성을 제거합니다. 이 기능을 통해 인공지능(AI) 시스템은 훨씬 더 유연하고 확장성이 높아지며, 가능한 모든 객체에 대한 완전한 데이터를 수집하는 것이 비현실적인 동적 환경을 처리할 수 있습니다.
제로샷 학습의 작동 방식#
ZSL의 핵심 메커니즘은 공유된 의미 공간을 사용하여 익숙한 개념에서 익숙하지 않은 개념으로 지식을 전이하는 것입니다. 모델은 "얼룩말"을 단순히 흑백 줄무늬의 픽셀 패턴을 암기하여 인식하는 대신, 자연어 처리(NLP)에서 도출된 시각적 특징과 의미 속성(예: "말과 유사한 형태", "줄무늬 패턴", "네 개의 다리") 간의 관계를 학습합니다.
이 과정은 이미지와 텍스트 표현을 정렬하는 멀티모달 모델에 의존하는 경우가 많습니다. 예를 들어 OpenAI의 CLIP과 같은 기초 연구는 모델이 자연어 지도 학습을 통해 시각적 개념을 학습할 수 있음을 보여줍니다. ZSL 모델이 관찰되지 않은 객체를 마주하면 시각적 특징을 추출하여 의미 벡터 사전과 비교합니다. 시각적 특징이 새로운 클래스의 의미 설명과 일치하면 모델은 해당 객체를 정확하게 분류할 수 있으며, 이를 통해 효과적으로 "제로샷" 예측을 수행합니다. 이 접근 방식은 방대한 작업 배열에 걸쳐 일반화되는 최신 파운데이션 모델의 핵심 기반입니다.
실제 적용 사례#
제로샷 학습은 시스템이 초기 학습 데이터를 넘어 일반화할 수 있도록 함으로써 다양한 산업 분야의 혁신을 이끌고 있습니다.
-
개방형 어휘 객체 탐지: YOLO-World와 같은 최신 아키텍처는 ZSL을 활용하여 사용자가 정의한 텍스트 프롬프트를 기반으로 객체를 탐지합니다. 이를 통해 사전에 고정된 클래스 목록을 정의하는 것이 불가능한 상황에서도 객체 탐지를 수행할 수 있습니다. 예를 들어 방대한 비디오 아카이브에서 특정 항목을 검색하는 경우가 이에 해당합니다. Google Research의 연구자들은 이러한 개방형 어휘 기능의 한계를 계속해서 확장하고 있습니다.
-
의료 진단: 헬스케어 분야의 AI에서는 희귀 질환에 대한 레이블이 지정된 데이터를 확보하기가 어렵고 비용도 많이 드는 경우가 많습니다. ZSL 모델은 일반적인 질환과 PubMed와 같은 데이터베이스의 의학 문헌에서 확인되는 희귀 증상 설명을 사용하여 학습할 수 있습니다. 이를 통해 방대한 양성 사례 데이터셋 없이도 의료 영상에서 잠재적인 희귀 이상을 표시할 수 있습니다.
-
야생동물 보존: 농업 분야의 AI와 생태학에서는 거의 촬영되지 않는 멸종 위기종을 식별하는 것이 중요합니다. ZSL을 사용하면 보전 활동가들이 Encyclopedia of Life와 같은 생물학 데이터베이스에 정의된 속성 기반 설명을 활용하여 이러한 동물을 탐지할 수 있습니다.
Ultralytics를 사용한 제로샷 탐지#
Ultralytics YOLO-World 모델은 제로샷 학습을 실제로 구현한 대표적인 사례입니다. 이 모델을 사용하면 사용자가 모델을 재학습하지 않고도 런타임에 사용자 지정 클래스를 동적으로 정의할 수 있습니다. 이는 강력한 탐지 백본을 자연어를 이해하는 텍스트 인코더와 연결하여 구현됩니다.
다음 Python 예제에서는 ultralytics 패키지를 사용하여 표준 학습 세트에 명시적으로 포함되지 않았던 객체를 YOLO-World로 탐지하는 방법을 보여줍니다.
from ultralytics import YOLOWorld
# Load a pre-trained YOLO-World model capable of Zero-Shot Learning
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes via text prompts (e.g., specific accessories)
# The model adjusts to detect these new classes without retraining
model.set_classes(["blue backpack", "red apple", "sunglasses"])
# Run inference on an image to detect the new zero-shot classes
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()관련 개념과의 차이점#
ZSL을 완전히 이해하려면 컴퓨터 비전(CV)에서 사용되는 유사한 학습 전략과 구분하는 것이 도움이 됩니다.
- 퓨샷 학습(FSL): ZSL은 대상 클래스의 예제를 전혀 필요로 하지 않는 반면, FSL은 모델에 매우 작은 지원 세트(일반적으로 1~5개의 예제)를 제공하여 적응시킵니다. ZSL은 시각적 예제가 아닌 의미적 추론에 전적으로 의존하므로 일반적으로 더 어려운 문제로 간주됩니다.
- 원샷 학습: 모델이 정확히 하나의 레이블이 지정된 예제로 학습하는 FSL의 하위 집합입니다. ZSL은 새로운 카테고리의 이미지가 단 한 장도 없는 상태에서 작동하므로 근본적으로 다릅니다.
- 전이 학습: 이 광범위한 용어는 한 작업에서 다른 작업으로 지식을 전이하는 것을 의미합니다. ZSL은 의미 속성을 사용하여 새로운 데이터에 대한 기존의 파인 튜닝 없이 관찰되지 않은 클래스로 지식을 전이하는 특정 유형의 전이 학습입니다.
과제와 향후 전망#
ZSL은 엄청난 잠재력을 제공하지만, 학습 중에 습득한 의미 속성이 관찰되지 않은 클래스의 시각적 외관과 완벽하게 매핑되지 않는 도메인 시프트 문제와 같은 과제에 직면해 있습니다. 또한 ZSL 모델은 편향을 겪을 수 있으며, 관찰되지 않은 클래스보다 관찰된 클래스에서 예측 정확도가 훨씬 높게 나타날 수 있습니다.
Stanford University AI Lab과 IEEE Computer Society 같은 기관의 연구는 이러한 한계를 계속해서 해결하고 있습니다. 컴퓨터 비전 도구가 더욱 강력해짐에 따라 ZSL은 표준 기능으로 자리 잡아 대규모 데이터 라벨링 작업에 대한 의존도를 낮출 것으로 예상됩니다. 고급 모델을 배포하기 전에 데이터셋을 효율적으로 관리하려는 팀을 위해 Ultralytics Platform은 어노테이션 및 데이터셋 관리에 필요한 종합적인 도구를 제공합니다.









