Hugging Face의 오픈 소스 도구로 CV 프로젝트 강화하기
Hugging Face의 오픈 소스 도구가 AI 개발을 어떻게 발전시키고 있는지 살펴보는 YOLO Vision 2024 기조연설을 다시 확인해 보세요.

적합한 알고리즘을 선택하는 것은 영향력 있는 컴퓨터 비전 솔루션을 구축하는 과정의 한 부분일 뿐입니다. AI 엔지니어는 대규모 데이터셋을 다루고, 특정 작업에 맞게 모델을 파인 튜닝하며, 실제 환경에서 AI 시스템의 성능을 최적화하는 경우가 많습니다. AI 애플리케이션이 더욱 빠르게 도입되면서 이러한 프로세스를 간소화하는 도구에 대한 수요도 증가하고 있습니다.
Ultralytics가 주최하는 연례 하이브리드 이벤트인 YOLO Vision 2024 (YV24)에서는 AI 전문가와 기술 애호가들이 모여 컴퓨터 비전의 최신 혁신을 살펴보았습니다. 이 이벤트에서는 AI 애플리케이션 개발을 가속화하는 방법 등 다양한 주제에 대한 논의가 이루어졌습니다.
이벤트의 주요 하이라이트 중 하나는 모델 학습, 최적화 및 배포를 간소화하는 오픈 소스 AI 플랫폼 Hugging Face에 관한 기조연설이었습니다. Hugging Face의 머신 러닝 엔지니어인 Pavel Iakubovskii는 이미지에서 객체를 감지하고, 이미지를 여러 그룹으로 분류하며, 특정 예시에 대한 사전 학습 없이 예측하는 작업(제로샷 학습)과 같은 컴퓨터 비전 작업의 워크플로를 Hugging Face 도구가 어떻게 개선하는지 설명했습니다.
Hugging Face Hub는 Ultralytics YOLO11과 같은 다양한 AI 및 컴퓨터 비전 모델을 호스팅하고 이에 대한 액세스를 제공합니다. 이 글에서는 Pavel의 강연의 주요 내용을 요약하고, 개발자가 Hugging Face의 오픈 소스 도구를 사용해 AI 모델을 신속하게 구축하고 배포하는 방법을 살펴봅니다.

그림 1. YV24 무대 위의 Pavel.
Hugging Face Hub로 더 빠른 AI 개발 지원#
Pavel은 다양한 애플리케이션을 위한 사전 학습 모델을 제공하는 오픈 소스 AI 플랫폼으로 Hugging Face를 소개하며 강연을 시작했습니다. 이러한 모델은 자연어 처리(NLP), 컴퓨터 비전, 멀티모달 AI를 비롯한 다양한 AI 분야를 위해 설계되었으며, 시스템이 텍스트, 이미지, 오디오 등 여러 유형의 데이터를 처리할 수 있도록 지원합니다.
Pavel은 Hugging Face Hub가 현재 100만 개가 넘는 모델을 호스팅하고 있으며, 개발자가 특정 프로젝트에 적합한 모델을 쉽게 찾을 수 있다고 설명했습니다. Hugging Face는 모델 학습, 파인 튜닝 및 배포를 위한 도구를 제공하여 AI 개발을 간소화하는 것을 목표로 합니다. 개발자가 다양한 모델을 실험할 수 있으면 AI를 실제 애플리케이션에 통합하는 과정도 간단해집니다.
Hugging Face는 처음에는 NLP로 알려졌지만, 이후 컴퓨터 비전과 멀티모달 AI로 영역을 확장하여 개발자가 더 다양한 AI 작업을 수행할 수 있도록 지원합니다. 또한 개발자가 포럼, Discord, GitHub를 통해 협업하고 인사이트를 공유하며 지원을 받을 수 있는 강력한 커뮤니티를 보유하고 있습니다.
컴퓨터 비전 애플리케이션을 위한 Hugging Face 모델 살펴보기#
Pavel은 Hugging Face의 도구를 사용하면 컴퓨터 비전 애플리케이션을 더 쉽게 구축할 수 있다고 자세히 설명했습니다. 개발자는 이러한 도구를 이미지 분류, 객체 감지, 비전-언어 애플리케이션과 같은 작업에 사용할 수 있습니다.
또한 이러한 컴퓨터 비전 작업의 상당수는 Hugging Face Hub에서 제공되는 사전 학습 모델로 처리할 수 있어 처음부터 학습해야 하는 필요성을 줄이고 시간을 절약할 수 있다고 설명했습니다. 실제로 Hugging Face는 이미지 분류 작업을 위한 13,000개 이상의 사전 학습 모델을 제공하며, 여기에는 음식 분류, 반려동물 분류, 감정 감지를 위한 모델도 포함됩니다.
그는 이러한 모델의 접근성을 강조하며 다음과 같이 말했습니다. "프로젝트에 모델을 직접 학습할 필요조차 없을 것입니다. 커뮤니티의 누군가가 이미 학습한 모델을 Hub에서 찾을 수도 있습니다."
객체 감지를 위한 Hugging Face 모델#
Pavel은 또 다른 예로 컴퓨터 비전의 핵심 기능인 객체 감지에 Hugging Face가 어떻게 도움을 줄 수 있는지 설명했습니다. 객체 감지는 이미지 내 객체를 식별하고 위치를 찾는 데 사용됩니다. 레이블이 지정된 데이터가 제한적인 경우에도 Hugging Face Hub에서 제공되는 사전 학습 모델을 사용하면 객체 감지의 효율성을 높일 수 있습니다.
또한 Hugging Face에서 찾을 수 있는 이 작업을 위해 구축된 여러 모델을 간략히 소개했습니다.
- 실시간 객체 감지 모델: 속도가 중요한 동적 환경에서는 디텍션 Transformer(DETR)와 같은 모델이 실시간 객체 감지 기능을 제공합니다. DETR은 COCO 데이터셋으로 학습되며 멀티스케일 특징을 효율적으로 처리하도록 설계되어 시간에 민감한 애플리케이션에 적합합니다.
- 비전-언어 모델: 이러한 모델은 이미지와 텍스트 처리를 결합하여 AI 시스템이 이미지와 설명을 연결하거나 학습 데이터에 포함되지 않은 객체를 인식할 수 있도록 합니다. CLIP 및 SigLIP이 그 예이며, 텍스트와 시각 정보를 연결해 이미지 검색을 개선하고 맥락을 이해하여 AI 솔루션이 새로운 객체를 식별할 수 있도록 합니다.
- 제로샷 객체 감지 모델: 이미지와 텍스트 간의 관계를 이해하여 이전에 본 적 없는 객체를 식별할 수 있습니다. OwlVit, GroundingDINO, OmDet 등이 그 예이며, 제로샷 학습을 사용해 레이블이 지정된 학습 데이터 없이도 새로운 객체를 감지합니다.
Hugging Face 모델 사용 방법#
이어서 Pavel은 Hugging Face 모델을 직접 활용하는 방법으로 주제를 전환하며 개발자가 모델 탐색, 신속한 테스트, 추가적인 사용자 지정이라는 세 가지 방식으로 모델을 활용할 수 있다고 설명했습니다.
Pavel은 개발자가 코드를 작성하지 않고도 Hugging Face Hub에서 직접 모델을 탐색하고 대화형 인터페이스를 통해 즉시 쉽게 테스트할 수 있는 방법을 시연했습니다. Pavel은 "코드를 한 줄도 작성하거나 컴퓨터에 모델을 다운로드하지 않고도 사용해 볼 수 있습니다."라고 덧붙였습니다. 일부 모델은 크기가 크기 때문에 Hub에서 실행하면 스토리지 및 처리 성능의 제약을 피할 수 있습니다.

그림 2. Hugging Face 모델 사용 방법.
또한 Hugging Face Inference API를 사용하면 개발자가 간단한 API 호출로 AI 모델을 실행할 수 있습니다. 복잡한 설정 없이 빠르게 테스트하거나 개념 증명 프로젝트 및 신속한 프로토타이핑을 진행하는 데 유용합니다.
더 고급 사용 사례에서는 개발자가 Hugging Face Transformers 프레임워크를 사용할 수 있습니다. 이 오픈 소스 도구는 텍스트, 비전 및 오디오 작업을 위한 사전 학습 모델을 제공하며 PyTorch와 TensorFlow를 모두 지원합니다. Pavel은 코드 두 줄만으로 개발자가 Hugging Face Hub에서 모델을 가져와 이미지 프로세서와 같은 전처리 도구에 연결하고, Vision AI 애플리케이션을 위해 이미지 데이터를 분석할 수 있다고 설명했습니다.
Hugging Face로 AI 워크플로 최적화하기#
다음으로 Pavel은 Hugging Face가 AI 워크플로를 어떻게 간소화할 수 있는지 설명했습니다. 그가 다룬 주요 주제 중 하나는 Transformers의 어텐션 메커니즘 최적화였습니다. 어텐션 메커니즘은 입력 데이터에서 가장 관련성이 높은 부분에 집중하도록 돕는 딥러닝 모델의 핵심 기능입니다. 이를 통해 언어 처리 및 컴퓨터 비전과 관련된 작업의 정확도가 향상됩니다. 그러나 상당한 리소스를 필요로 할 수 있습니다.
어텐션 메커니즘을 최적화하면 메모리 사용량을 크게 줄이는 동시에 속도를 향상할 수 있습니다. Pavel은 "예를 들어 더 효율적인 어텐션 구현으로 전환하면 최대 1.8배 더 빠른 성능을 얻을 수 있습니다."라고 설명했습니다.
Hugging Face는 Transformers 프레임워크 내에서 더 효율적인 어텐션 구현을 기본적으로 지원합니다. 개발자는 모델을 로드할 때 대체 어텐션 구현을 지정하기만 하면 이러한 최적화를 활성화할 수 있습니다.
Optimum 및 Torch Compile#
그는 성능에 큰 영향을 주지 않으면서 AI 모델이 사용하는 숫자의 정밀도를 낮춰 모델 크기를 줄이는 기술인 양자화에 대해서도 설명했습니다. 이를 통해 모델이 더 적은 메모리를 사용하고 더 빠르게 실행되므로 스마트폰 및 임베디드 시스템과 같이 처리 성능이 제한된 장치에 더욱 적합해집니다.
효율성을 더욱 높이기 위해 Pavel은 모델을 최적화하고 배포하도록 설계된 도구 모음인 Hugging Face Optimum 라이브러리를 소개했습니다. 개발자는 몇 줄의 코드만으로 양자화 기술을 적용하고 모델을 ONNX (개방형 신경망 교환)과 같은 효율적인 형식으로 변환할 수 있습니다. 이를 통해 클라우드 서버와 엣지 디바이스를 비롯한 다양한 하드웨어에서 모델을 원활하게 실행할 수 있습니다.

그림 3. Pavel이 Optimum 라이브러리와 그 기능을 설명했습니다.
마지막으로 Pavel은 AI 모델의 데이터 처리 방식을 최적화하여 더 빠르고 효율적으로 실행되도록 하는 PyTorch의 기능인 Torch Compile의 이점을 소개했습니다. Hugging Face는 Transformers 및 Optimum 라이브러리에 Torch Compile을 통합하여 개발자가 코드를 거의 변경하지 않고도 이러한 성능 향상의 이점을 활용할 수 있도록 합니다.
Torch Compile은 모델의 연산 구조를 최적화하여 추론 시간을 단축하고 정확도나 품질을 저하시키지 않으면서 초당 프레임 수를 29에서 150으로 높일 수 있습니다.
Hugging Face 도구로 모델 배포하기#
이어서 Pavel은 개발자가 적합한 모델을 선택하고 개발에 가장 적합한 접근 방식을 정한 후 Hugging Face 도구를 사용해 Vision AI 모델을 확장하고 배포하는 방법을 간략히 설명했습니다.
예를 들어 개발자는 Gradio와 Streamlit을 사용해 대화형 AI 애플리케이션을 배포할 수 있습니다. Gradio를 사용하면 개발자가 머신 러닝 모델을 위한 웹 기반 인터페이스를 만들 수 있으며, Streamlit을 사용하면 간단한 Python 스크립트로 대화형 데이터 애플리케이션을 구축할 수 있습니다.
Pavel은 Hugging Face가 제공하는 가이드, 학습 노트북 및 예제 스크립트를 언급하며 “모든 것을 처음부터 작성할 필요는 없습니다.”라고 설명했습니다. 이러한 리소스를 활용하면 모든 것을 처음부터 구축하지 않고도 개발을 빠르게 시작할 수 있습니다.

그림 4. YV24에서 Hugging Face의 기능을 설명하는 Pavel.
Hugging Face Hub의 이점#
Pavel은 기조연설을 마무리하며 Hugging Face Hub 사용의 이점을 요약했습니다. 그는 Hugging Face Hub가 모델 관리와 협업을 어떻게 간소화하는지 강조했습니다. 또한 초보자와 전문가 모두 AI 모델을 이해하고 구현하는 데 도움이 되는 가이드, 노트북 및 튜토리얼을 이용할 수 있다는 점도 언급했습니다.
그는 개발자들에게 플랫폼의 유연성을 활용하도록 권장하며 다음과 같이 설명했습니다. "Hub에는 이미 멋진 Spaces가 많이 있습니다. 비슷한 것을 찾아 공유된 코드를 복제하고, 몇 줄을 수정하고, 모델을 자신의 모델로 교체한 다음 다시 푸시할 수 있습니다."
핵심 요점#
YV24에서 진행한 강연에서 Pavel은 Hugging Face가 AI 모델 학습, 최적화 및 배포를 지원하는 도구를 제공한다고 설명했습니다. 예를 들어 Transformers, Optimum, Torch Compile과 같은 혁신 기술은 개발자가 모델 성능을 향상하는 데 도움을 줄 수 있습니다.
AI 모델의 효율성이 높아짐에 따라 양자화 및 엣지 배포의 발전으로 리소스가 제한된 디바이스에서 모델을 더욱 쉽게 실행할 수 있게 되었습니다. 이러한 개선 사항은 Hugging Face와 같은 도구 및 Ultralytics YOLO11과 같은 고급 컴퓨터 비전 모델과 결합되어 확장 가능하고 고성능인 Vision AI 애플리케이션을 구축하는 데 핵심적인 역할을 합니다.
성장하는 커뮤니티에 참여해 보세요! GitHub 저장소를 살펴보며 AI에 대해 알아보고, YOLO 라이선스를 확인하여 Vision AI 프로젝트를 시작해 보세요. 의료 분야의 컴퓨터 비전이나 농업 분야의 컴퓨터 비전과 같은 혁신에 관심이 있으신가요? 솔루션 페이지를 방문하여 더 자세히 알아보세요!









