YOLO Vision 2026:
비전 AI

FastVLM: Apple, 새로운 고속 비전 언어 모델을 선보이다

Apple이 CVPR 2025에서 FastVLM을 공개했습니다. 이 오픈 소스 비전-언어 모델은 FastViTHD 인코더를 탑재해 첫 토큰 생성 시간 최대 85배의 속도 향상을 제공합니다.

ABAbirami Vina4 min read
Apple의 FastVLM 고속 비전 언어 모델

CVPR 2025 컨퍼런스에서 Apple은 FastVLM이라는 새로운 오픈 소스 AI 모델을 소개했습니다. 이 모델은 이미지와 언어를 모두 이해하도록 설계되었으며, iPhone, iPad, Mac과 같은 Apple 기기에서 실행됩니다. 따라서 데이터를 클라우드로 전송하지 않고도 스마트한 결과를 빠르게 제공할 수 있습니다.

FastVLM이 특히 흥미로운 이유는 매우 빠르고 효율적이기 때문입니다. Apple은 FastViTHD라는 새로운 비전 인코더를 개발했습니다. FastViTHD는 모델이 고품질 이미지를 해석하면서도 메모리와 전력을 적게 사용하도록 지원합니다. 모든 처리가 기기에서 로컬로 수행되므로 사용자 개인정보를 보호하면서 더 빠른 응답 시간을 제공합니다.

이 글에서는 FastVLM의 작동 방식과 차별점, 그리고 이번 Apple의 출시가 일상적인 기기용 AI 애플리케이션에 중요한 발전이 될 수 있는 이유를 살펴보겠습니다.

비전 언어 모델(VLMs) 이해하기#

FastVLM의 특징을 살펴보기 전에 이름에 포함된 “VLM”이 무엇을 의미하는지 알아보겠습니다. 이는 시각적 콘텐츠와 언어를 이해하고 서로 연결하도록 설계된 비전 언어 모델을 의미합니다.

VLMs는 시각적 이해와 언어를 결합하여 사진 설명, 스크린샷에 관한 질문 답변, 문서에서 텍스트 추출과 같은 작업을 수행할 수 있습니다. 비전 언어 모델은 일반적으로 두 부분으로 작동합니다. 한 부분은 이미지를 처리하여 데이터로 변환하고, 다른 부분은 해당 데이터를 해석하여 읽거나 들을 수 있는 응답을 생성합니다.

여러분은 자신도 모르는 사이에 이미 이러한 AI 혁신을 사용하고 있을 수 있습니다. 영수증을 스캔하거나, 신분증을 읽거나, 이미지 캡션을 생성하거나, 저시력 사용자가 화면과 상호작용하도록 지원하는 앱은 백그라운드에서 조용히 실행되는 비전 언어 모델에 의존하는 경우가 많습니다.

FastVLM이란 무엇인가요?#

Apple은 다른 비전 언어 모델과 동일한 작업을 수행하면서도 더 빠른 속도와 강력한 개인정보 보호, 자체 기기에 최적화된 성능을 제공하도록 FastVLM을 개발했습니다. 이미지의 내용을 이해하고 텍스트로 응답할 수 있으며, 클라우드 서버에 의존하는 많은 모델과 달리 FastVLM은 iPhone, iPad 또는 Mac에서 완전히 실행될 수 있습니다.

VLMs는 일반적으로 고해상도 이미지에서 더 뛰어난 성능을 발휘합니다. 예를 들어 아래와 같이 FastVLM은 이미지의 고해상도 버전이 제공되었을 때만 거리 표지판을 “Do Not Enter”로 정확하게 식별할 수 있었습니다. 그러나 고해상도 입력은 대개 모델의 처리 속도를 늦춥니다. 이 지점에서 FastViTHD가 차이를 만듭니다.

저해상도 이미지와 고해상도 이미지에서의 FastVLM 성능

그림 1. 저해상도 이미지와 고해상도 이미지에서의 FastVLM 성능. (출처)

Apple의 새로운 비전 인코더인 FastViTHD는 메모리와 전력을 적게 사용하면서 FastVLM이 고품질 이미지를 더 효율적으로 처리하도록 지원합니다. 특히 FastViTHD는 소형 기기에서도 원활하게 실행될 만큼 가볍습니다.

또한 FastVLM은 FastVLM GitHub 저장소에서 공개적으로 제공되므로, 개발자는 소스 코드에 액세스하고 변경 사항을 적용하며 Apple의 라이선스 조건에 따라 자체 앱에서 사용할 수 있습니다.

FastVLM과 다른 VLM 모델 비교#

다른 비전 언어 모델과 비교할 때 FastVLM은 스마트폰과 노트북 같은 일상적인 기기에서 실행되도록 최적화되었습니다. 성능 테스트에서 FastVLM은 LLaVA-OneVision-0.5B와 같은 모델보다 첫 번째 단어나 출력을 최대 85배 빠르게 생성했습니다.

FastVLM과 다른 모델의 성능 비교

그림 2. FastVLM과 다른 모델의 성능 비교. (출처)

FastVLM이 평가된 몇 가지 표준 벤치마크를 간략히 살펴보겠습니다.

  • DocVQA(문서 시각적 질의응답): 이 벤치마크는 스캔한 양식이나 페이지와 같은 문서의 텍스트 정보를 모델이 얼마나 잘 읽고 이해하는지 평가합니다.
  • TextVQA(텍스트 기반 시각적 질의응답): 텍스트가 포함된 이미지를 해석하고 관련 질문에 정확하게 답하는 모델의 능력을 평가합니다.
  • GQA(그래프 질의응답): 이 작업은 이미지 내 객체와 장면 간의 관계를 이해하도록 하여 모델의 추론 능력을 테스트합니다.
  • MMMU(대규모 다학문 다중 모달 이해): 시각적 이해와 텍스트 이해를 결합하여 광범위한 학문 분야와 형식에 걸친 모델의 성능을 측정합니다.
  • SeedBench(벤치마킹을 위한 향상된 데이터의 표준 평가): 이 벤치마크는 여러 도메인에서 모델의 시각적 이해 및 추론에 대한 일반적인 역량을 평가합니다.

이러한 벤치마크 전반에서 FastVLM은 더 적은 리소스를 사용하면서도 경쟁력 있는 결과를 달성했습니다. 또한 휴대폰, 태블릿, 노트북과 같은 일상적인 기기에 실용적인 비전 AI를 제공합니다.

FastVLM의 효율적인 비전 인코더: FastViTHD#

다음으로 FastVLM의 이미지 처리 성능에서 중요한 역할을 하는 비전 인코더 FastViTHD를 자세히 살펴보겠습니다.

대부분의 비전 언어 모델은 이미지를 토큰이라고 하는 수천 개의 작은 패치로 나눕니다. 토큰이 많을수록 모델이 이미지를 이해하는 데 더 많은 시간과 전력이 필요합니다. 특히 휴대폰이나 노트북에서는 처리 속도가 느려질 수 있습니다.

비전 인코더가 이미지를 처리하는 방식

그림 3. 비전 인코더가 이미지를 처리하는 방식. (출처)

FastViTHD는 더 적은 토큰을 사용하면서도 이미지 전체를 이해하여, 너무 많은 토큰을 처리할 때 발생하는 속도 저하를 방지합니다. FastViTHD는 두 가지 접근 방식을 결합합니다. 패턴과 관계를 모델링하는 데 적합한 Transformer와 시각적 데이터를 효율적으로 처리하는 컨볼루션 레이어입니다. 그 결과 더 빠르게 작동하고 메모리를 적게 사용하는 시스템이 구현됩니다.

Apple에 따르면 FastViTHD는 높은 정확도를 유지하면서도 일부 기존 비전 인코더보다 최대 3.4배 작습니다. 처리 속도를 높이기 위해 덜 중요한 이미지 패치를 제거하는 토큰 프루닝과 같은 모델 최적화 기법에 의존하는 대신, 더 단순하고 간소화된 아키텍처를 통해 효율성을 달성합니다.

FastVLM의 모델 변형과 학습 파이프라인#

Apple은 FastVLM을 0.5B, 1.5B, 7B 파라미터의 세 가지 크기로 출시했습니다("B"는 모델에서 학습 가능한 가중치의 수를 나타내는 billion을 의미합니다). 각 버전은 서로 다른 유형의 기기에 맞도록 설계되었습니다. 소형 모델은 휴대폰과 태블릿에서 실행할 수 있으며, 더 큰 7B 모델은 데스크톱이나 더 높은 성능이 필요한 작업에 적합합니다.

이를 통해 개발자는 자신의 앱에 가장 적합한 구성을 유연하게 선택할 수 있습니다. 동일한 기본 모델 아키텍처를 사용하면서 모바일용으로 빠르고 가벼운 앱을 구축하거나, 대규모 시스템용으로 더 복잡한 앱을 구축할 수 있습니다.

Apple은 비전 및 언어 모델을 정렬하기 위한 프레임워크인 LLaVA‑1.5 파이프라인을 사용하여 FastVLM 모델 변형을 학습했습니다. 언어 구성 요소의 경우 자연스럽고 일관된 텍스트를 생성하는 것으로 알려진 Qwen 및 Vicuna와 같은 기존 오픈 소스 모델을 사용하여 FastVLM을 평가했습니다. 이 설정을 통해 FastVLM은 단순한 이미지와 복잡한 이미지를 모두 처리하고 읽기 쉽고 관련성 높은 응답을 생성할 수 있습니다.

FastVLM의 중요성: 효율적인 AI를 구현한 Apple의 접근 방식#

FastVLM의 효율적인 이미지 처리가 왜 중요한지 궁금할 수 있습니다. 핵심은 클라우드에 의존하지 않고 앱이 실시간으로 얼마나 원활하게 작동할 수 있는지에 있습니다. FastVLM은 최대 1152 x 1152픽셀의 고해상도 이미지를 처리하면서도 기기에서 직접 실행할 수 있을 만큼 빠르고 가볍습니다.

따라서 앱은 모든 처리를 로컬에서 유지하면서 카메라가 보는 내용을 설명하거나, 영수증을 촬영하는 즉시 스캔하거나, 화면의 변화에 응답할 수 있습니다. 이는 교육, 접근성, 생산성, 사진과 같은 분야에서 특히 유용합니다.

FastViTHD는 대용량 이미지를 처리할 때도 효율적이므로 기기의 응답성을 유지하고 발열을 줄이는 데 도움이 됩니다. 가장 작은 모델을 포함한 모든 모델 크기에서 작동하며, 가장 작은 모델은 보급형 iPhone에서도 실행됩니다. 따라서 동일한 AI 기능을 휴대폰, 태블릿, Mac 전반에서 사용할 수 있습니다.

FastVLM의 활용 분야#

FastVLM은 속도, 효율성, 온디바이스 개인정보 보호와 같은 주요 이점 덕분에 광범위한 애플리케이션을 구동할 수 있습니다. 다음은 활용할 수 있는 몇 가지 방법입니다.

  • 문서 읽기: 영수증, 양식 또는 신분증을 스캔하고 관련 정보만 추출할 수 있습니다. 이미지의 특정 영역에 집중할 수 있으므로 빠르고 정확한 텍스트 추출이 필요한 앱에 유용합니다.

  • 이미지 캡션: 사진을 분석하여 이미지에 담긴 내용을 명확하게 설명할 수 있습니다. 이는 카메라 앱, 사진 갤러리 또는 실시간 시각적 이해가 유용한 모든 도구의 기능을 지원합니다.

  • 접근성 지원: FastVLM은 시각장애인 또는 저시력 사용자를 위해 화면 콘텐츠를 설명하여 버튼, 메뉴, 레이아웃 요소를 더 쉽게 탐색하고 사용할 수 있도록 합니다.

  • 온디바이스 AI 어시스턴트: FastVLM은 화면에 표시된 내용을 빠르게 이해해야 하는 AI 어시스턴트와 함께 사용할 수 있습니다. 기기에서 직접 실행되고 데이터를 비공개로 유지하므로, 정보를 클라우드로 전송하지 않고도 텍스트 읽기, 버튼이나 아이콘 식별, 실시간 사용자 안내와 같은 작업을 지원할 수 있습니다.

FastVLM은 텍스트 인식과 시각적 질의응답에 사용할 수 있습니다

그림 4. FastVLM은 텍스트 인식과 시각적 질의응답에 사용할 수 있습니다. (출처)

핵심 요점#

FastVLM은 속도, 개인정보 보호, 효율성을 결합하여 온디바이스 비전 언어 AI를 Apple 기기에 제공합니다. 가벼운 설계와 오픈 소스 출시를 통해 모바일 및 데스크톱 앱 전반에서 실시간 이미지 이해를 지원합니다.

이는 AI를 일상적인 사용에 더욱 실용적이고 접근하기 쉽게 만들며, 개발자에게 유용하고 개인정보 보호에 중점을 둔 애플리케이션을 구축할 수 있는 견고한 기반을 제공합니다. 앞으로 비전 언어 모델은 우리가 기술과 상호작용하는 방식에서 중요한 역할을 할 가능성이 높으며, 일상적인 상황에서 AI를 더욱 반응성 높고 맥락을 인식하며 유용하게 만들 것입니다.

AI에 대해 자세히 알아보려면 GitHub 저장소를 확인해 보세요. 활발한 커뮤니티에 참여하고 자동차 산업의 AI제조 분야의 비전 AI와 같은 분야의 혁신을 살펴보세요. 지금 컴퓨터 비전을 시작하려면 라이선스 옵션을 확인해 보세요.

Explore solutions

항공 이미지를 위한 컴퓨터 비전

항공 이미지를 위한 컴퓨터 비전

Ultralytics YOLO을 활용하여 드론 및 항공 이미지를 농업, 수산업, 환경 모니터링, 자연 보호, 지리 공간 분석을 위한 실시간 인사이트로 변환합니다.
자세히 알아보기
항공우주 분야의 컴퓨터 비전

항공우주 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 항공 모니터링에 비전 AI를 도입하세요. 컴퓨터 비전 솔루션으로 드론, 항공우주 워크플로, 환경 보전 및 지리 공간 산업을 지원합니다.
자세히 알아보기

Ultralytics YOLO 모델로 모든 사이트를 보호하세요. 비전 AI는 경계 모니터링, 위협 탐지, 번호판 인식 및 작업장 안전을 지원합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기
항공 이미지를 위한 컴퓨터 비전

항공 이미지를 위한 컴퓨터 비전

Ultralytics YOLO을 활용하여 드론 및 항공 이미지를 농업, 수산업, 환경 모니터링, 자연 보호, 지리 공간 분석을 위한 실시간 인사이트로 변환합니다.
자세히 알아보기
항공우주 분야의 컴퓨터 비전

항공우주 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 항공 모니터링에 비전 AI를 도입하세요. 컴퓨터 비전 솔루션으로 드론, 항공우주 워크플로, 환경 보전 및 지리 공간 산업을 지원합니다.
자세히 알아보기

Ultralytics YOLO 모델로 모든 사이트를 보호하세요. 비전 AI는 경계 모니터링, 위협 탐지, 번호판 인식 및 작업장 안전을 지원합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기
항공 이미지를 위한 컴퓨터 비전

항공 이미지를 위한 컴퓨터 비전

Ultralytics YOLO을 활용하여 드론 및 항공 이미지를 농업, 수산업, 환경 모니터링, 자연 보호, 지리 공간 분석을 위한 실시간 인사이트로 변환합니다.
자세히 알아보기
항공우주 분야의 컴퓨터 비전

항공우주 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 항공 모니터링에 비전 AI를 도입하세요. 컴퓨터 비전 솔루션으로 드론, 항공우주 워크플로, 환경 보전 및 지리 공간 산업을 지원합니다.
자세히 알아보기

Ultralytics YOLO 모델로 모든 사이트를 보호하세요. 비전 AI는 경계 모니터링, 위협 탐지, 번호판 인식 및 작업장 안전을 지원합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기

AI의 미래를 함께 만들어가세요!

머신러닝의 미래와 함께 여정을 시작하세요