Ultralytics YOLO27:
비전 AI

Florence-2: Microsoft의 최신 비전-언어 모델

효율성을 유지하면서 향상된 객체 탐지, 세그멘테이션 및 제로샷 성능을 제공하는 Microsoft의 비전-언어 모델 Florence-2를 만나보세요.

ABAbirami Vina7 min read
Microsoft의 Florence-2 비전-언어 모델

2024년 6월, Microsoft는 Florence-2를 공개했습니다. Florence-2는 시각 언어 모델(VLM)로, 객체 감지, 세그멘테이션, 이미지 캡셔닝, 그라운딩을 비롯한 다양한 작업을 처리하도록 설계되었습니다. Florence-2는 제로샷 성능에 대한 새로운 벤치마크를 제시합니다. 즉, 특정 작업에 대한 사전 학습 없이도 작업을 수행할 수 있으며, 다른 최신 시각 언어 모델보다 모델 크기가 작다는 장점이 있습니다.

Florence-2는 단순히 또 하나의 모델에 그치지 않습니다. Florence-2의 다재다능함과 향상된 성능은 정확도를 높이고 광범위한 학습의 필요성을 줄여 다양한 산업에 큰 영향을 미칠 가능성이 있습니다. 이 글에서는 Florence-2의 혁신적인 기능을 살펴보고, 다른 VLM과 성능을 비교하며, 잠재적인 활용 분야를 논의합니다.

Florence-2란 무엇인가요?#

Florence-2는 하나의 통합 프레임워크에서 다양한 작업을 처리할 수 있습니다. 이 모델의 뛰어난 기능은 FLD-5B라는 대규모 학습 데이터셋 덕분이기도 합니다. FLD-5B에는 1억 2,600만 개의 이미지에 걸쳐 54억 개의 어노테이션이 포함되어 있습니다. 이 종합적인 데이터셋은 Florence-2가 다양한 비전 작업을 높은 정확도와 효율성으로 처리하는 데 필요한 기능을 갖추도록 특별히 제작되었습니다.

Florence-2가 지원하는 작업을 자세히 살펴보겠습니다.

  • 객체 감지: 이미지 내 객체를 높은 정밀도로 식별하고 위치를 찾을 수 있습니다.
  • 세그멘테이션: 이미지를 의미 있는 세그먼트로 나누어 더 쉽게 분석하고 해석할 수 있도록 하는 작업입니다.
  • 이미지 캡셔닝: Florence-2는 이미지의 맥락과 세부 정보를 제공하는 설명형 캡션을 생성할 수 있습니다.
  • 시각적 그라운딩: 캡션의 특정 구문이나 단어를 이미지 내 해당 영역과 연결할 수 있습니다.
  • 제로샷 성능: 특정 학습 없이도 작업을 수행할 수 있습니다.

Florence-2의 학습 방식 다이어그램

그림 1. Florence-2의 학습 방식 이해하기

이 모델은 텍스트 기반 작업과 영역 기반 작업을 모두 지원합니다. 이미지의 특정 영역과 관련된 작업을 위해 특수 위치 토큰이 모델의 어휘에 추가됩니다. 이러한 토큰은 모델이 객체 주변의 직사각형(박스 표현), 사변형(쿼드 박스 표현), 다변형 도형(폴리곤 표현)과 같은 다양한 형태를 이해하는 데 도움을 줍니다. 모델은 교차 엔트로피 손실이라는 방법을 사용해 학습되며, 이 방법은 예측을 정답과 비교하고 그에 따라 내부 파라미터를 조정함으로써 모델이 학습하도록 합니다.

FLD-5B 데이터셋 생성#

FLD-5B 데이터셋에는 텍스트 설명, 영역과 텍스트의 쌍, 텍스트·구문·영역의 조합 등 다양한 유형의 어노테이션이 포함되어 있습니다. 이 데이터셋은 데이터 수집 및 어노테이션을 포함하는 2단계 프로세스를 통해 생성되었습니다. 이미지는 ImageNet-22k, Object 365, Open Images, Conceptual Captions, LAION과 같은 인기 데이터셋에서 수집했습니다. FLD-5B 데이터셋의 어노테이션은 대부분 합성 데이터로, 사람이 직접 라벨링한 것이 아니라 자동으로 생성되었습니다.

FLD-5B 데이터셋 생성 다이어그램

그림 2. FLD-5B 데이터셋 생성

처음에는 객체 감지나 세그멘테이션과 같은 특정 작업에 특화된 전문 모델이 이러한 어노테이션을 생성했습니다. 그런 다음 어노테이션이 상세하고 정확한지 확인하기 위해 필터링 및 개선 프로세스를 적용했습니다. 노이즈를 제거한 후에는 반복적인 개선 과정을 거쳤으며, 이 과정에서 Florence-2의 출력을 사용해 어노테이션을 지속적으로 업데이트하고 개선했습니다.

Florence-2의 모델 아키텍처 이해하기#

Florence-2의 모델 아키텍처는 시퀀스-투-시퀀스 학습 방식을 따릅니다. 이는 모델이 입력 시퀀스(텍스트 프롬프트가 포함된 이미지 등)를 처리하고 출력 시퀀스(설명이나 라벨 등)를 단계적으로 생성한다는 의미입니다. 시퀀스-투-시퀀스 프레임워크에서는 각 작업을 번역 문제로 취급합니다. 모델이 입력 이미지와 작업별 프롬프트를 받아 이에 해당하는 출력을 생성하는 방식입니다.

Florence-2 시각 언어 모델 아키텍처 다이어그램

그림 3. Florence-2의 시각 언어 모델 아키텍처

모델 아키텍처의 핵심에는 다중 모달 인코더-디코더 Transformer가 있으며, 이미지 인코더와 다중 모달 인코더-디코더를 결합합니다. DaViT(데이터 효율적인 비전 Transformer)라는 이미지 인코더는 입력 이미지를 시각적 토큰 임베딩으로 변환해 처리합니다. 시각적 토큰 임베딩은 이미지의 공간적 정보(사물이 어디에 있는지)와 의미론적 정보(사물이 무엇인지)를 모두 포착하는 압축된 이미지 표현입니다. 그런 다음 이러한 시각적 토큰을 텍스트 임베딩(텍스트 표현)과 결합하여 모델이 텍스트 데이터와 시각 데이터를 원활하게 통합할 수 있도록 합니다.

다른 VLM과 Florence-2 비교하기#

Florence-2는 뛰어난 제로샷 기능을 바탕으로 다른 시각 언어 모델과 차별화됩니다. 다양한 작업에 맞게 조정하기 위해 광범위한 파인튜닝에 의존하는 PaliGemma와 달리, Florence-2는 별도의 조정 없이도 바로 우수한 성능을 발휘합니다. 또한 Florence-2는 GPT-4V와 Flamingo 같은 더 큰 모델과도 경쟁할 수 있습니다. 이러한 모델은 파라미터 수가 훨씬 많은 경우가 많지만, 항상 Florence-2의 성능에 미치지는 못합니다. 예를 들어 Kosmos-2는 파라미터 수가 Florence-2의 두 배를 넘는데도 Florence-2가 더 나은 제로샷 결과를 달성합니다.

벤치마크 테스트에서 Florence-2는 COCO 캡셔닝과 참조 표현 이해와 같은 작업에서 뛰어난 성능을 보였습니다. COCO 데이터셋의 객체 감지 및 세그멘테이션 작업에서 PolyFormer와 UNINEXT 같은 모델보다 우수한 성능을 기록했습니다. 성능과 리소스 효율성이 모두 중요한 실제 애플리케이션에 매우 경쟁력 있는 선택지입니다.

Florence-2의 활용 분야#

Florence-2는 엔터테인먼트, 접근성, 교육 등 다양한 산업에서 사용할 수 있습니다. 더 잘 이해할 수 있도록 몇 가지 예를 살펴보겠습니다.

이미지 캡셔닝의 활용 분야#

스트리밍 플랫폼에서 시청할 콘텐츠를 고를 때 영화 요약을 읽고 선택하는 경우가 있습니다. 그렇다면 플랫폼에서 영화 포스터에 대한 상세한 설명도 제공할 수 있다면 어떨까요? Florence-2는 이미지에 대한 설명형 텍스트를 생성하는 이미지 캡셔닝을 통해 이를 실현할 수 있습니다. Florence-2는 영화 포스터의 상세한 설명을 생성하여 시각 장애가 있는 사용자도 스트리밍 플랫폼을 더 포용적으로 이용할 수 있도록 합니다. Florence-2는 포스터의 인물, 배경, 텍스트와 같은 시각적 요소를 분석해 포스터의 내용과 분위기를 전달하는 상세한 설명을 생성할 수 있습니다. 아래 이미지는 Florence-2가 설명에서 제공할 수 있는 세부 수준을 보여줍니다.

Florence-2가 생성한 이미지 캡션 예시

그림 4. Florence-2가 생성한 이미지 캡션 예시

이미지 캡셔닝이 유용하게 활용될 수 있는 다른 사례는 다음과 같습니다.

  • 전자상거래: 이미지 캡셔닝은 제품 이미지 설명을 상세하게 제공하여 고객이 제품의 기능과 세부 정보를 더 명확하게 이해하도록 도울 수 있습니다.
  • 여행 및 관광: 여행 가이드와 앱에서 랜드마크 및 관광 명소 설명을 상세하게 제공할 수 있습니다.
  • 교육: 이미지 캡셔닝은 교육용 이미지와 다이어그램에 라벨을 지정하고 설명하여 교수와 학습을 지원할 수 있습니다.
  • 부동산: 잠재 구매자에게 부동산 이미지의 특징과 편의 시설을 강조하는 상세한 설명을 제공할 수 있습니다.

요리 중 시각적 그라운딩 활용하기#

Florence-2는 요리 경험을 풍부하게 하는 데에도 사용할 수 있습니다. 예를 들어 온라인 요리책에서 Florence-2를 사용해 복잡한 레시피 이미지의 부분을 시각적으로 그라운딩하고 라벨링할 수 있습니다. 시각적 그라운딩은 이미지의 특정 부분을 해당 설명 텍스트와 연결하여 도움을 줍니다. 각 재료와 단계를 정확하게 라벨링하고 설명할 수 있으므로 가정에서 요리하는 사람이 레시피를 따라 하고 각 구성 요소가 요리에서 어떤 역할을 하는지 이해하기가 쉬워집니다.

Florence-2를 사용한 시각적 그라운딩 예시

그림 5. Florence-2를 사용한 시각적 그라운딩 예시

금융 문서를 위한 영역 기반 OCR#

문서 내 특정 영역에서 텍스트를 추출하는 영역 기반 처리를 적용한 OCR은 회계와 같은 분야에서 유용하게 활용될 수 있습니다. 금융 문서의 지정된 영역을 분석하여 거래 세부 정보, 계좌 번호, 납부 기한과 같은 중요한 정보를 자동으로 추출할 수 있습니다. 수동 데이터 입력의 필요성을 줄여 오류를 최소화하고 처리 시간을 단축합니다. 금융 기관은 이를 사용해 송장 처리, 영수증 대조, 수표 결제와 같은 작업을 간소화할 수 있으며, 그 결과 거래 속도와 고객 서비스 품질을 높일 수 있습니다.

Florence-2를 사용한 영역 기반 OCR 예시

그림 6. Florence-2를 사용한 영역 기반 OCR 추출 예시

산업 애플리케이션에서의 영역 기반 세그멘테이션#

이미지를 집중적인 분석과 상세한 검사를 위해 의미 있는 부분으로 나누는 영역 기반 세그멘테이션은 다양한 프로세스의 정밀도와 효율성을 높이는 산업 애플리케이션을 촉진할 수 있습니다. 이미지 내 특정 영역에 집중함으로써 이 기술은 구성 요소와 제품을 상세하게 검사하고 분석할 수 있도록 합니다. 품질 관리 측면에서는 균열이나 정렬 불량과 같은 자재의 결함 또는 불일치를 식별하여 최고 품질의 제품만 시장에 출시되도록 할 수 있습니다.

Florence-2를 사용한 영역 기반 세그멘테이션 예시

그림 7. Florence-2를 사용한 영역 기반 세그멘테이션 예시

또한 로봇 팔을 특정 부품으로 유도하고 구성 요소의 배치 및 조립을 최적화하여 자동화된 조립 라인을 개선합니다. 마찬가지로 재고 관리에서는 상품의 상태와 위치를 추적하고 모니터링하여 물류 효율성을 높이고 가동 중지 시간을 줄이는 데 도움을 줍니다. 전반적으로 영역 기반 세그멘테이션은 정확도와 생산성을 향상해 산업 환경에서 비용을 절감하고 제품 품질을 높입니다.

핵심 요점#

최근 AI 모델이 높은 성능을 유지하면서도 더 가벼워지는 추세가 나타나고 있습니다. Florence-2는 시각 언어 모델 측면에서 중요한 진전을 보여줍니다. 인상적인 제로샷 성능으로 객체 감지, 세그멘테이션, 이미지 캡셔닝, 그라운딩과 같은 다양한 작업을 처리할 수 있습니다. Florence-2는 크기가 작음에도 효율적이고 다기능적이므로 여러 산업의 애플리케이션에서 매우 유용합니다. Florence-2와 같은 모델은 더 많은 가능성을 제시하며 AI 혁신의 잠재력을 확장하고 있습니다.

GitHub 리포지터리를 방문하고 커뮤니티에 참여하여 AI에 대해 더 알아보세요. 솔루션 페이지에서 제조농업 분야의 AI 애플리케이션에 대해 확인해 보세요. 🚀

Explore solutions

항공 이미지를 위한 컴퓨터 비전

항공 이미지를 위한 컴퓨터 비전

Ultralytics YOLO을 활용하여 드론 및 항공 이미지를 농업, 수산업, 환경 모니터링, 자연 보호, 지리 공간 분석을 위한 실시간 인사이트로 변환합니다.
자세히 알아보기
항공우주 분야의 컴퓨터 비전

항공우주 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 항공 모니터링에 비전 AI를 도입하세요. 컴퓨터 비전 솔루션으로 드론, 항공우주 워크플로, 환경 보전 및 지리 공간 산업을 지원합니다.
자세히 알아보기

Ultralytics YOLO 모델로 모든 사이트를 보호하세요. 비전 AI는 경계 모니터링, 위협 탐지, 번호판 인식 및 작업장 안전을 지원합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기
항공 이미지를 위한 컴퓨터 비전

항공 이미지를 위한 컴퓨터 비전

Ultralytics YOLO을 활용하여 드론 및 항공 이미지를 농업, 수산업, 환경 모니터링, 자연 보호, 지리 공간 분석을 위한 실시간 인사이트로 변환합니다.
자세히 알아보기
항공우주 분야의 컴퓨터 비전

항공우주 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 항공 모니터링에 비전 AI를 도입하세요. 컴퓨터 비전 솔루션으로 드론, 항공우주 워크플로, 환경 보전 및 지리 공간 산업을 지원합니다.
자세히 알아보기

Ultralytics YOLO 모델로 모든 사이트를 보호하세요. 비전 AI는 경계 모니터링, 위협 탐지, 번호판 인식 및 작업장 안전을 지원합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기
항공 이미지를 위한 컴퓨터 비전

항공 이미지를 위한 컴퓨터 비전

Ultralytics YOLO을 활용하여 드론 및 항공 이미지를 농업, 수산업, 환경 모니터링, 자연 보호, 지리 공간 분석을 위한 실시간 인사이트로 변환합니다.
자세히 알아보기
항공우주 분야의 컴퓨터 비전

항공우주 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 항공 모니터링에 비전 AI를 도입하세요. 컴퓨터 비전 솔루션으로 드론, 항공우주 워크플로, 환경 보전 및 지리 공간 산업을 지원합니다.
자세히 알아보기

Ultralytics YOLO 모델로 모든 사이트를 보호하세요. 비전 AI는 경계 모니터링, 위협 탐지, 번호판 인식 및 작업장 안전을 지원합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기

AI의 미래를 함께 만들어가세요!

머신러닝의 미래와 함께 여정을 시작하세요