Few-shot, zero-shot 및 transfer learning 이해하기
컴퓨터 비전에서 few-shot learning, zero-shot learning 및 transfer learning의 차이점과 이러한 패러다임이 AI 모델 학습에 미치는 영향을 살펴보세요.

인공지능(AI) 시스템은 사람의 개입을 최소화하면서 얼굴 인식, 이미지 분류, 자동차 운전과 같은 복잡한 작업을 처리할 수 있습니다. 이는 데이터를 학습하고 패턴을 인식한 다음, 해당 패턴을 사용해 예측이나 의사 결정을 수행함으로써 가능합니다. AI가 발전함에 따라 AI 모델이 학습하고 적응하며 놀라운 효율성으로 작업을 수행하는 방식이 점점 더 정교해지고 있습니다.
예를 들어, 컴퓨터 비전은 기계가 세상의 시각 정보를 해석하고 이해할 수 있도록 하는 데 중점을 둔 AI 분야입니다. 기존 컴퓨터 비전 모델 개발은 학습을 위해 대규모로 주석이 추가된 데이터셋에 크게 의존합니다. 이러한 데이터를 수집하고 라벨링하는 작업에는 많은 시간과 비용이 들 수 있습니다.
이러한 문제를 해결하기 위해 연구자들은 제한된 예시에서 학습하는 퓨샷 학습(FSL), 보지 못한 객체를 식별하는 제로샷 학습(ZSL), 사전 학습된 모델의 지식을 새로운 작업에 적용하는 전이 학습(TL)과 같은 혁신적인 접근 방식을 도입했습니다.
이 글에서는 이러한 학습 패러다임의 작동 방식과 주요 차이점을 살펴보고 실제应用 사례를 알아보겠습니다. 시작해 보겠습니다!
학습 패러다임 개요#
컴퓨터 비전에서 퓨샷 학습, 제로샷 학습, 전이 학습이 무엇이며 어떻게 작동하는지 살펴보겠습니다.
퓨샷 학습#
퓨샷 학습은 시스템이 적은 수의 예시만 사용해 새로운 객체를 인식하도록 학습하는 방법입니다. 예를 들어 모델에 펭귄, 펠리컨, 퍼핀 사진을 몇 장 보여주면(이 작은 그룹을 "지원 집합"이라고 합니다) 모델은 이러한 새들이 어떻게 생겼는지 학습합니다.
그 후 펭귄과 같은 새로운 사진을 모델에 보여주면, 모델은 이 새로운 사진을 지원 집합의 사진과 비교해 가장 유사한 대상을 선택합니다. 대량의 데이터를 수집하기 어려울 때 이 방법이 유용한 이유는 시스템이 적은 수의 예시만으로도 학습하고 적응할 수 있기 때문입니다.

그림 1. 퓨샷 학습의 작동 방식 개요입니다.
제로샷 학습#
제로샷 학습은 기계가 한 번도 본 적 없는 대상을 해당 대상의 예시 없이도 인식할 수 있도록 하는 방법입니다. 설명과 같은 의미 정보를 사용해 연관성을 형성합니다.
예를 들어 기계가 "작고 복슬복슬한", "몸집이 큰 야생 고양잇과 동물", "긴 얼굴"과 같은 특징을 이해하여 고양이, 사자, 말에 대해 학습했다면, 이 지식을 사용해 호랑이와 같은 새로운 동물을 식별할 수 있습니다. 호랑이를 한 번도 본 적이 없더라도 "검은 줄무늬가 있는 사자와 비슷한 동물"이라는 설명을 사용해 호랑이를 올바르게 식별할 수 있습니다. 이를 통해 기계는 많은 예시 없이도 더 쉽게 학습하고 적응할 수 있습니다.

그림 2. 제로샷 학습은 설명을 사용해 새로운 객체를 식별합니다.
전이 학습#
전이 학습은 모델이 한 작업에서 학습한 내용을 사용해 유사한 새로운 작업을 해결하는 데 도움을 주는 학습 패러다임입니다. 이 기법은 객체 감지, 이미지 분류, 패턴 인식과 같은 컴퓨터 비전 작업에 특히 유용합니다.
예를 들어 컴퓨터 비전에서는 사전 학습된 모델이 동물과 같은 일반적인 객체를 인식한 후, 전이 학습을 통해 다양한 개 품종과 같은 특정 대상을 식별하도록 파인 튜닝할 수 있습니다. 전이 학습은 이전 작업에서 얻은 지식을 재사용하므로 더 작은 데이터셋으로 컴퓨터 비전 모델을 학습하기가 쉬워지고 시간과 노력을 절약할 수 있습니다.

그림 3. 전이 학습의 작동 방식 개요입니다.
어떤 종류의 모델이 전이 학습을 지원하는지 궁금하실 수 있습니다. Ultralytics YOLO11은 이를 수행할 수 있는 컴퓨터 비전 모델의 좋은 예입니다. 이 모델은 먼저 대규모 일반 데이터셋으로 사전 학습되는 최첨단 객체 감지 모델입니다. 이후 더 작은 전문 데이터셋을 사용해 특정 작업에 맞게 파인 튜닝하고 커스텀 학습할 수 있습니다.
학습 패러다임 비교#
퓨샷 학습, 제로샷 학습, 전이 학습에 대해 살펴보았으므로 이제 이들의 차이점을 비교해 보겠습니다.

그림 4. 퓨샷 학습, 제로샷 학습 및 전이 학습의 주요 차이점입니다. 이미지 제공: 저자.
퓨샷 학습은 라벨이 지정된 데이터가 적을 때 유용합니다. AI 모델이 몇 가지 예시만으로 학습할 수 있도록 합니다. 반면 제로샷 학습에는 라벨이 지정된 데이터가 필요하지 않습니다. 대신 설명이나 컨텍스트를 사용해 시스템이 새로운 작업을 처리하도록 지원합니다. 한편 전이 학습은 사전 학습된 모델의 지식을 활용하는 다른 접근 방식을 취하므로, 추가 데이터가 거의 없어도 새로운 작업에 빠르게 적응할 수 있습니다. 각 방법의 강점은 사용 중인 데이터와 작업의 유형에 따라 달라집니다.
다양한 학습 패러다임의 실제 적용 사례#
이러한 학습 패러다임은 이미 여러 분야에서 혁신적인 솔루션으로 복잡한 문제를 해결하며 변화를 만들어 내고 있습니다. 실제 환경에 어떻게 적용할 수 있는지 자세히 살펴보겠습니다.
퓨샷 학습을 활용한 희귀 질환 진단#
퓨샷 학습은 특히 의료 영상 분야에서 의료 부문을 혁신할 수 있습니다. 대량의 데이터가 없어도 몇 가지 예시나 설명만으로 의사가 희귀 질환을 진단하도록 지원할 수 있습니다. 희귀 질환에 대한 대규모 데이터셋을 수집하기 어려운 경우가 많기 때문에, 데이터가 제한적일 때 특히 유용합니다.
예를 들어 SHEPHERD는 퓨샷 학습과 생의학 지식 그래프를 사용해 희귀 유전 질환을 진단합니다. 증상과 검사 결과 같은 환자 정보를 알려진 유전자 및 질환 네트워크에 매핑합니다. 이를 통해 데이터가 제한적인 경우에도 유전적 원인일 가능성이 높은 요인을 파악하고 유사한 사례를 찾을 수 있습니다.

그림 5. Shepherd 모델은 최소한의 데이터로 희귀 질환을 진단합니다.
제로샷 학습을 활용한 식물 질환 감지 개선#
농업에서는 식물 질환을 신속하게 식별하는 것이 중요합니다. 감지가 지연되면 작물에 광범위한 피해가 발생하고 수확량이 감소하며 상당한 재정적 손실이 발생할 수 있기 때문입니다. 기존 방법은 대규모 데이터셋과 전문가 지식에 의존하는 경우가 많지만, 특히 원격 지역이나 자원이 제한된 지역에서는 이러한 요소를 항상 이용할 수 있는 것은 아닙니다. 이때 제로샷 학습과 같은 AI의 발전이 중요한 역할을 합니다.
농부가 토마토와 감자를 재배하면서 잎이 노랗게 변하거나 갈색 반점이 생기는 등의 증상을 발견했다고 가정해 보겠습니다. 제로샷 학습은 대규모 데이터셋 없이도 역병과 같은 질환을 식별하는 데 도움을 줄 수 있습니다. 모델은 증상에 대한 설명을 사용해 이전에 본 적 없는 질환을 분류할 수 있습니다. 이 접근 방식은 빠르고 확장 가능하며 농부가 다양한 식물 문제를 감지할 수 있도록 합니다. 또한 작물 상태를 더욱 효율적으로 모니터링하고 적시에 조치를 취하며 손실을 줄이는 데 도움을 줍니다.

그림 6. 제로샷 학습을 활용한 식물 질환 식별입니다.
자율주행 차량과 전이 학습#
자율주행 차량은 안전하게 주행하기 위해 다양한 환경에 적응해야 하는 경우가 많습니다. 전이 학습을 사용하면 처음부터 학습을 다시 시작하지 않고도 기존 지식을 활용해 새로운 조건에 빠르게 적응할 수 있습니다. 시각 정보를 해석하도록 지원하는 컴퓨터 비전과 결합하면 이러한 기술은 다양한 지형과 기상 조건에서 더욱 원활한 주행을 가능하게 하여 자율주행을 더 효율적이고 안정적으로 만듭니다.
이를 실제로 보여주는 좋은 예는 주차 관리 시스템으로, Ultralytics YOLO11을 사용해 주차 공간을 모니터링합니다. 사전 학습된 객체 감지 모델인 YOLO11은 전이 학습을 사용해 실시간으로 빈 주차 공간과 주차된 공간을 식별하도록 파인 튜닝할 수 있습니다. 주차장 이미지로 구성된 더 작은 데이터셋을 사용해 모델을 학습하면 빈 공간, 만차 공간, 심지어 예약 구역까지 정확하게 감지하는 방법을 학습합니다.

그림 7. Ultralytics YOLO11을 활용한 주차 관리입니다.
이 시스템을 다른 기술과 통합하면 운전자를 가장 가까운 이용 가능한 주차 공간으로 안내하여 탐색 시간과 교통 혼잡을 줄이는 데 도움을 줄 수 있습니다. 전이 학습은 Ultralytics YOLO11의 기존 객체 감지 기능을 기반으로 하므로 처음부터 다시 시작하지 않고도 주차 관리의 구체적인 요구 사항에 맞게 조정할 수 있습니다. 이 접근 방식은 시간과 리소스를 절약하는 동시에 주차 운영을 개선하고 전반적인 사용자 경험을 향상하는 매우 효율적이고 확장 가능한 솔루션을 구현합니다.
학습 패러다임의 새로운 동향#
컴퓨터 비전에서 학습 패러다임의 미래는 더욱 지능적이고 지속 가능한 비전 AI 시스템 개발을 지향하고 있습니다. 특히 퓨샷 학습, 제로샷 학습, 전이 학습을 결합하는 하이브리드 접근 방식의 활용이 증가하는 추세입니다. 이러한 방법의 강점을 결합하면 모델은 최소한의 데이터로 새로운 작업을 학습하고 다양한 분야에 지식을 적용할 수 있습니다.
흥미로운 예로 조정된 딥 임베딩을 사용해 이전 작업에서 얻은 지식과 소량의 새로운 데이터로 모델을 파인 튜닝하는 방법이 있습니다. 이를 통해 제한된 데이터셋을 더 쉽게 활용할 수 있습니다.
이와 마찬가지로 X-shot 학습은 데이터의 양이 서로 다른 작업을 처리하도록 설계되었습니다. 제한적이거나 노이즈가 있는 라벨에서 모델이 학습하는 약한 지도와 명확한 지침을 사용하므로, 사전 예시가 거의 없거나 전혀 없는 경우에도 빠르게 적응할 수 있습니다. 이러한 하이브리드 접근 방식은 서로 다른 학습 방법을 통합하면 AI 시스템이 문제를 더욱 효과적으로 해결하는 데 도움이 될 수 있음을 보여줍니다.
핵심 요점#
퓨샷 학습, 제로샷 학습, 전이 학습은 각각 컴퓨터 비전의 특정 문제를 해결하므로 서로 다른 작업에 적합합니다. 적합한 접근 방식은 구체적인 애플리케이션과 이용 가능한 데이터의 양에 따라 달라집니다. 예를 들어 퓨샷 학습은 데이터가 제한적인 경우 잘 작동하는 반면, 제로샷 학습은 보지 못했거나 익숙하지 않은 클래스를 처리하는 데 적합합니다.
앞으로는 이러한 방법을 결합해 비전, 언어, 오디오를 통합하는 하이브리드 모델을 만드는 것이 핵심 초점이 될 가능성이 높습니다. 이러한 발전은 AI 시스템을 더욱 유연하고 효율적으로 만들고 복잡한 문제를 해결할 수 있는 역량을 높여 해당 분야의 혁신을 위한 새로운 가능성을 열고자 합니다.
저희 커뮤니티에 참여하고 저희 GitHub 저장소를 확인하여 AI에 대해 더 알아보세요. 자율주행 자동차의 AI와 농업 분야의 컴퓨터 비전이 미래를 어떻게 변화시키고 있는지 알아보세요. 시작하려면 이용 가능한 YOLO 라이선스 옵션을 확인하세요!









