Hugging Face의 트랜스포머로 구동되는 오픈 소스 컴퓨터 비전
Hugging Face와 함께 오픈 소스 컴퓨터 비전을 살펴보세요! 전이 학습과 트랜스포머를 배우고 8,000개 이상의 모델을 탐색해 보세요. Merve Noyan과 함께 인사이트와 실용적인 데모를 확인하며 AI 탐색에서 개발자의 혁신을 지원합니다.

YOLO 비전 2023 (YV23) 행사의 주요 내용을 계속 살펴보는 가운데, 효율적인 언어 애플리케이션 개발을 위한 사전 학습 모델을 제공하는 선도적인 NLP 플랫폼 Hugging Face의 Developer Advocacy Engineer인 Merve Noyan을 만나보겠습니다. Merve는 강연에서 오픈 소스 컴퓨터 비전의 세계에 관한 놀라운 인사이트를 공유했습니다.
Transfer learning, Transformer와 오픈 소스 컴퓨터 비전 생태계로 이어지는 매력적인 여정을 함께 살펴보겠습니다.
Transfer learning 공개: 간단한 복습#
Merve는 하나의 신경망에서 다른 신경망으로 지식을 전이할 수 있게 해주는 마법의 도구인 transfer learning에 대한 간단한 입문 설명으로 강연을 시작했습니다. 가장자리와 모서리 같은 범용 특징을 초기 레이어에서 학습한 다음 특정 작업에 맞게 fine-tuning하는 모델을 떠올려 보십시오. 이것이 transfer learning의 핵심이며, 데이터 의존성을 줄이고 정확도를 높여 줍니다.
Merve는 ResNet과 Inception 같은 고전적인 convolutional backbone을 소개하며 앞으로 펼쳐질 혁신적인 여정의 토대를 마련했습니다.
Transformer의 등장: 수수께끼가 풀리다#
Transformer가 특별한 이유는 무엇일까요? Merve는 Transformer가 기존의 convolution 기반 모델과 어떻게 다른지 보여주며 이를 수수께끼에 비유했습니다. 그 비결은 self-supervised learning을 수행하여 레이블이 지정된 데이터 없이도 특징을 포착하는 능력에 있습니다. Merve는 Vision Transformer, Data Efficient Transformer, CLIP, Swin Transformer를 Transformer 기반 모델의 대표 주자로 소개했습니다.
객체 탐지를 위해 설계된 Transformer 모델을 지원하는 Ultralytics와 공통 기반을 마련합니다. 이 모델은 효과적인 하이브리드 인코더, IOU 인식 query 선택, 조정 가능한 추론 속도를 특징으로 합니다. 특히 다른 익숙한 Ultralytics YOLOv8 모델과 동일한 패턴을 따르며, prediction, training, validation, export 옵션을 제공합니다.
모든 것을 한곳에서#
이어서 Merve는 Hugging Face가 제공하는 방대한 리소스를 자세히 소개했습니다. 여기에는 고전적인 컴퓨터 비전 작업을 위한 8,000개 이상의 모델과 멀티모달 애플리케이션을 위한 10,000개의 모델이 포함됩니다. Hugging Face Hub에는 3,000개가 넘는 데이터셋도 있어 개발자와 애호가 모두가 자유롭게 활용할 수 있는 공간을 제공합니다. Merve는 다양한 사용 사례에 바로 사용할 수 있는 모델을 제공하는 Hugging Face의 일관된 API 덕분에 매끄러운 사용자 경험을 누릴 수 있다고 강조했습니다.
Hugging Face를 활용한 실전 경험#
강연은 모델을 얼마나 손쉽게 다룰 수 있는지 보여주는 실용적인 시연으로 이어졌습니다. 모델과 프로세서를 인스턴스화하는 것부터 Trainer API를 사용한 fine-tuning까지, Merve는 Hugging Face Transformers 라이브러리가 개발자의 가장 든든한 도구라는 점을 분명히 보여주었습니다. 또한 사용자의 workflow를 간소화하는 개인적으로 가장 좋아하는 Pipeline API도 소개했습니다.

그림 1. 마드리드의 Google for Startups Campus에서 열린 YV23에서 발표하는 Merve Noyan입니다.
애플리케이션 살펴보기#
Merve는 시각적 질의응답을 위한 Plot 모델, 이미지 캡셔닝을 위한 Blip, 이미지 세그멘테이션을 위한 강력한 Segment Anything 모델 등 뛰어난 애플리케이션을 간략히 소개하며 강연을 마무리했습니다. Hugging Face Ecosystem의 Pipeline API가 특히 주목받았으며, 기술적인 세부 사항을 깊이 파고들지 않고도 모델을 손쉽게 사용할 수 있게 해 줍니다.
마지막으로 Merve는 Elysian Diffusion을 사용해 착시를 만드는 방법을 선보였습니다. 이는 AI의 세계에 재미있는 변화를 더하는 매력적인 경험이었습니다.
한마디로 정리하면!#
결론적으로 Merve의 강연은 오픈 소스 컴퓨터 비전의 무한한 가능성을 탐구하고 싶은 영감을 불러일으켰습니다. Hugging Face는 AI를 누구나 쉽게 접근하고 재미있게 경험할 수 있도록 만들어 개발자가 창의력을 마음껏 발휘하도록 지원했습니다. 오픈 소스 커뮤니티의 미래와 그 안에서 탄생할 놀라운 혁신을 기대합니다!









