Florence-2:Microsoftの最新ビジョン・言語モデル
Microsoftのビジョン・言語モデルFlorence-2をご紹介します。高い効率性を備え、物体検出、セグメンテーション、ゼロショット性能が向上しています。

2024年6月、Microsoftは、Florence-2を発表しました。これは、物体検出、セグメンテーション、画像キャプション生成、グラウンディングなど、幅広いタスクに対応するよう設計されたマルチモーダルビジョン・ランゲージモデル(VLM)です。Florence-2は、ゼロショット性能における新たなベンチマークを確立しています。つまり、特定の事前学習を行わなくてもタスクを実行できます。また、最先端の他のビジョン・ランゲージモデルよりも小さいモデルサイズを実現しています。
Florence-2は単なる別のモデルではありません。その汎用性と向上した性能は、精度を高め、広範なトレーニングの必要性を減らすことで、さまざまな業界に大きな影響を与える可能性があります。この記事では、Florence-2の革新的な機能を紹介し、他のVLMと性能を比較するとともに、想定される用途について説明します。
Florence-2とは何ですか?#
Florence-2は、単一の統合フレームワーク内でさまざまなタスクに対応できます。このモデルの優れた能力は、FLD-5Bと呼ばれる大規模なトレーニングデータセットによるところもあります。FLD-5Bには、1億2,600万枚の画像にわたる54億件のアノテーションが含まれています。この包括的なデータセットは、幅広いビジョンタスクを高い精度と効率で処理するために必要な能力をFlorence-2に持たせることを目的として、特別に作成されました。
Florence-2が対応するタスクを詳しく見ていきましょう。
- 物体検出:画像内の物体を高い精度で識別し、その位置を特定できます。
- セグメンテーション:画像を意味のあるセグメントに分割し、分析や解釈を容易にするタスクです。
- 画像キャプション生成:Florence-2は、画像の背景や詳細を伝える説明的なキャプションを生成できます。
- ビジュアルグラウンディング:キャプション内の特定のフレーズや単語を、画像内の対応する領域に関連付けることができます。
- ゼロショット性能:特定のトレーニングなしでタスクを実行できます。

図1. Florence-2のトレーニング方法
このモデルは、テキストベースのタスクと領域ベースのタスクの両方に対応しています。画像内の特定の領域を扱うタスクのために、位置を示す特殊なトークンがモデルの語彙に追加されています。これらのトークンにより、モデルは物体を囲む長方形(ボックス表現)、4辺形(クワッドボックス表現)、多辺形(ポリゴン表現)など、さまざまな形状を理解できます。モデルはクロスエントロピー損失と呼ばれる手法を使用してトレーニングされます。この手法では、予測を正解と比較し、それに応じて内部パラメーターを調整することで学習します。
FLD-5Bデータセットの作成#
FLD-5Bデータセットには、テキストによる説明、領域とテキストのペア、テキスト・フレーズ・領域の組み合わせなど、さまざまな種類のアノテーションが含まれています。このデータセットは、データ収集とアノテーションから成る2段階のプロセスで作成されました。画像は、ImageNet-22k、Object 365、Open Images、Conceptual Captions、LAIONなどの一般的なデータセットから収集されました。FLD-5Bデータセットのアノテーションの大部分は合成データであり、手動でラベル付けするのではなく自動的に生成されています。

図2. FLD-5Bデータセットの作成
まず、物体検出やセグメンテーションなど、特定のタスクに長けた専門モデルがこれらのアノテーションを作成しました。次に、アノテーションが詳細かつ正確になるよう、フィルタリングと強化のプロセスが使用されました。ノイズを除去した後、データセットには反復的な改良が施され、Florence-2の出力を使用してアノテーションが継続的に更新・改善されました。
Florence-2のモデルアーキテクチャを理解する#
Florence-2のモデルアーキテクチャは、シーケンス・ツー・シーケンス学習のアプローチに従っています。これは、モデルが入力シーケンス(テキストプロンプト付きの画像など)を処理し、出力シーケンス(説明やラベルなど)を段階的に生成することを意味します。シーケンス・ツー・シーケンスのフレームワークでは、各タスクが翻訳問題として扱われます。モデルは入力画像とタスク固有のプロンプトを受け取り、対応する出力を生成します。

図3. Florence-2のビジョン・ランゲージモデルアーキテクチャ
モデルアーキテクチャの中核には、マルチモダリティエンコーダー・デコーダーTransformerがあります。これは、画像エンコーダーとマルチモダリティエンコーダー・デコーダーを組み合わせたものです。DaViT(データ効率の高いビジョンTransformer)と呼ばれる画像エンコーダーは、入力画像をビジュアルトークン埋め込みに変換して処理します。ビジュアルトークン埋め込みは、画像の空間情報(物体がどこにあるか)と意味情報(物体が何であるか)の両方を捉えた、画像のコンパクトな表現です。これらのビジュアルトークンはテキスト埋め込み(テキストの表現)と組み合わされ、モデルがテキストデータとビジュアルデータをシームレスに統合できるようにします。
Florence-2と他のVLMの比較#
Florence-2は、優れたゼロショット能力により、他のビジョン・ランゲージモデルとは一線を画しています。さまざまなタスクに適応するために大規模なファインチューニングに依存するPaliGemmaのようなモデルとは異なり、Florence-2は導入直後から優れた性能を発揮します。また、Florence-2はGPT-4VやFlamingoのような大規模モデルとも競合できます。これらのモデルはパラメーター数がはるかに多いことが多い一方で、必ずしもFlorence-2の性能に及ぶとは限りません。例えば、Kosmos-2はパラメーター数が2倍以上あるにもかかわらず、Florence-2はKosmos-2より優れたゼロショット結果を達成しています。
ベンチマークテストでは、Florence-2はCOCOキャプション生成や参照表現理解などのタスクで注目すべき性能を示しています。COCOデータセットの物体検出およびセグメンテーションタスクでは、PolyFormerやUNINEXTなどのモデルを上回りました。性能とリソース効率の両方が重要となる実環境のアプリケーションにおいて、非常に競争力の高い選択肢です。
Florence-2の用途#
Florence-2は、エンターテインメント、アクセシビリティ、教育など、さまざまな業界で利用できます。理解を深めるために、いくつかの例を見ていきましょう。
画像キャプション生成の用途#
ストリーミングプラットフォームで何を見るか決めようとしているとき、選択の参考にするために映画の概要を読むことがあるでしょう。プラットフォームが映画ポスターの詳細な説明も提供できるとしたらどうでしょうか。Florence-2は、画像の説明的なテキストを生成する画像キャプション生成によって、それを可能にします。Florence-2は映画ポスターの詳細な説明を生成できるため、ストリーミングプラットフォームを視覚障害のあるユーザーにとってより包括的なものにできます。ポスターに描かれた人物、風景、テキストなどの視覚要素を分析することで、Florence-2はポスターの内容や雰囲気を伝える詳細な説明を作成できます。下の画像は、Florence-2が説明で提供できる詳細さのレベルを示しています。

図4. Florence-2が生成した画像キャプションの例
画像キャプション生成が役立つその他の例を紹介します。
- Eコマース:画像キャプション生成によって、商品画像の説明を詳しく提供し、顧客が商品の特徴や詳細をより明確に理解できるようにします。
- 旅行・観光:旅行ガイドやアプリで、ランドマークや観光名所の説明を詳しく提供できます。
- 教育:画像キャプション生成によって、教育用の画像や図にラベルを付けて説明し、教育と学習を支援できます。
- 不動産:購入希望者に向けて、物件画像の特徴や設備を強調した詳細な説明を提供できます。
料理中のビジュアルグラウンディングの活用#
Florence-2は、料理体験を豊かにするためにも利用できます。例えば、オンライン料理本でFlorence-2を使用し、複雑なレシピ画像内の各部分をビジュアルグラウンディングしてラベル付けできます。ここでのビジュアルグラウンディングは、画像内の特定部分を対応する説明テキストに結び付けることで役立ちます。各材料や手順に正確なラベルと説明を付けられるため、家庭で料理をする人がレシピに従い、それぞれの要素が料理で果たす役割を理解しやすくなります。

図5. Florence-2を使用したビジュアルグラウンディングの例
金融文書向けの領域ベースOCR#
文書内の特定領域からのテキスト抽出に焦点を当てる領域ベース処理のOCRは、会計などの分野で役立ちます。金融文書の指定された領域を分析し、取引の詳細、口座番号、支払期日などの重要な情報を自動的に抽出できます。手動でのデータ入力の必要性を減らすことで、エラーを最小限に抑え、処理時間を短縮できます。金融機関は、請求書処理、領収書照合、小切手決済などの業務を効率化するために利用でき、より迅速な取引と優れた顧客サービスにつながります。

図6. Florence-2を使用した領域付きOCR抽出の例
産業用途における領域ベースのセグメンテーション#
画像を意味のある部分に分割して集中的な分析や詳細な検査を行う領域ベースのセグメンテーションは、さまざまなプロセスの精度と効率を高める産業用途を促進できます。画像内の特定領域に焦点を当てることで、この技術は部品や製品の詳細な検査と分析を可能にします。品質管理においては、亀裂や位置ずれなど、材料の欠陥や不整合を特定し、高品質な製品だけが市場に出るようにできます。

図7. Florence-2を使用した領域ベースのセグメンテーションの例
また、ロボットアームを特定の部品へ誘導し、部品の配置と組み立てを最適化することで、自動組み立てラインも改善できます。同様に、在庫管理では、商品の状態と位置の追跡・監視を支援し、物流の効率化とダウンタイムの短縮につながります。全体として、領域ベースのセグメンテーションは精度と生産性を高め、産業環境におけるコスト削減と製品品質の向上を実現します。
主なポイント#
高い性能を維持しながら、AIモデルがより軽量化される傾向が見られるようになっています。Florence-2は、ビジョン・ランゲージモデルの分野における大きな前進です。物体検出、セグメンテーション、画像キャプション生成、グラウンディングなどのさまざまなタスクに、優れたゼロショット性能で対応できます。Florence-2は小型でありながら効率的かつ多機能であるため、さまざまな業界のアプリケーションにおいて非常に有用です。Florence-2のようなモデルは、AIイノベーションの可能性を広げ、より多くの選択肢をもたらしています。
GitHubリポジトリにアクセスし、コミュニティに参加して、AIについてさらに詳しく学びましょう。製造および農業におけるAIアプリケーションについては、ソリューションページをご覧ください。🚀









