FastVLM:Appleが新しい高速ビジョン・言語モデルを発表
AppleがCVPR 2025でFastVLMを発表しました。このオープンソースのビジョン・言語モデルはFastViTHDエンコーダーを搭載し、初回トークン生成までの時間を最大85倍高速化します。

CVPR 2025カンファレンスで、AppleはFastVLMという新しいオープンソースAIモデルを発表しました。画像と言語の両方を理解できるように設計されており、iPhone、iPad、MacなどのAppleデバイス上で動作します。これにより、データをクラウドに送信せずに、スマートな結果をすばやく提供できます。
FastVLMが特に興味深いのは、その高速性と効率性です。AppleはFastViTHDという新しいビジョンエンコーダーを開発しました。これにより、メモリと電力の使用量を抑えながら、高品質な画像をモデルが解釈できます。すべての処理がデバイス上でローカルに行われるため、ユーザーのプライバシーを保護しながら、応答時間を短縮できます。
この記事では、FastVLMの仕組み、他のモデルとの違い、そしてこのAppleのリリースがデバイス上での日常的なAIアプリケーションにとって重要な前進となる可能性がある理由について説明します。
ビジョン言語モデル(VLMs)について#
FastVLMの特徴を詳しく見ていく前に、その名前に含まれる「VLM」が何を意味するのかを確認しましょう。これは、視覚コンテンツと言語を理解して結び付けるように設計されたビジョン言語モデルを指します。
VLMsは視覚理解と言語を組み合わせることで、写真の説明、スクリーンショットに関する質問への回答、ドキュメントからのテキスト抽出などのタスクを実行できます。ビジョン言語モデルは通常、2つの部分で構成されます。1つは画像を処理してデータに変換し、もう1つはそのデータを解釈して、読み上げたり画面に表示したりできる応答を生成します。
気付かないうちに、この種のAIイノベーションをすでに利用しているかもしれません。レシートをスキャンするアプリ、身分証明書を読み取るアプリ、画像キャプションを生成するアプリ、視力の低いユーザーの画面操作を支援するアプリなどでは、バックグラウンドでビジョン言語モデルが動作していることがよくあります。
FastVLMとは?#
Appleは、他のビジョン言語モデルと同じタスクを、より高速に、高いプライバシー保護と自社デバイス向けに最適化された性能で実行できるようFastVLMを開発しました。画像の内容を理解してテキストで応答できますが、クラウドサーバーに依存する多くのモデルとは異なり、FastVLMはiPhone、iPad、Mac上で完全に実行できます。
VLMsは一般に、高解像度の画像を使用すると性能が向上します。たとえば、以下に示すように、FastVLMが道路標識を「進入禁止」と正しく識別できたのは、高解像度版の画像を入力した場合だけでした。しかし、高解像度の入力は通常、モデルの処理速度を低下させます。ここでFastViTHDが違いを生み出します。

図1. 低解像度画像と高解像度画像におけるFastVLMの性能。(出典)
Appleの新しいビジョンエンコーダーであるFastViTHDは、メモリと電力の使用量を抑えながら、FastVLMが高品質な画像をより効率的に処理できるようにします。具体的には、FastViTHDは軽量であるため、小型のデバイスでもスムーズに動作します。
また、FastVLMはFastVLMのGitHubリポジトリで公開されており、開発者はソースコードにアクセスして変更を加え、Appleのライセンス条項に従って自身のアプリで利用できます。
FastVLMと他のVLMモデルの比較#
他のビジョン言語モデルと比較すると、FastVLMはスマートフォンやノートパソコンなど、日常的に使用するデバイス上で動作するよう最適化されています。性能テストでは、FastVLMはLLaVA-OneVision-0.5Bなどのモデルよりも、最初の単語または出力を最大85倍高速に生成しました。

図2. FastVLMと他のモデルの性能比較。(出典)
FastVLMが評価された標準ベンチマークの一部を以下に紹介します。
- DocVQA(ドキュメント視覚質問応答): スキャンしたフォームやページなどのドキュメント内のテキスト情報を、モデルがどの程度読み取り、理解できるかを評価するベンチマークです。
- TextVQA(テキストベースの視覚質問応答): テキストを含む画像を解釈し、関連する質問に正確に回答するモデルの能力を評価します。
- GQA(グラフ質問応答): 画像内のオブジェクトとシーンの関係を理解することを求めることで、モデルの推論能力をテストするタスクです。
- MMMU(大規模マルチ分野マルチモーダル理解): 視覚的理解とテキスト理解を組み合わせ、幅広い学術分野と形式にわたるモデルの性能を測定します。
- SeedBench(ベンチマーク用拡張データの標準評価): 複数の領域にわたる視覚理解と推論におけるモデルの汎用能力を検証するベンチマークです。
これらのベンチマーク全体で、FastVLMはより少ないリソースで競争力のある結果を達成しました。スマートフォン、タブレット、ノートパソコンなどの日常的なデバイスに、実用的なビジョンAIをもたらします。
FastVLMの効率的なビジョンエンコーダー:FastViTHD#
次に、FastVLMの画像処理性能で重要な役割を果たすビジョンエンコーダー、FastViTHDについて詳しく見ていきましょう。
ほとんどのビジョン言語モデルは、画像をトークンと呼ばれる数千個の小さなパッチに分割します。トークンが多いほど、モデルが画像を理解するために必要な時間と電力が増えます。そのため、特にスマートフォンやノートパソコンでは処理が遅くなることがあります。

図3. ビジョンエンコーダーによる画像処理の仕組み。(出典)
FastViTHDは、画像全体を理解しながら使用するトークン数を減らすことで、過剰なトークン処理による速度低下を回避します。パターンや関係のモデル化を得意とするTransformerと、視覚データの処理に効率的な畳み込みレイヤーという2つのアプローチを組み合わせています。その結果、より高速に動作し、使用するメモリも少ないシステムを実現しています。
Appleによると、FastViTHDは高い精度を維持しながら、一部の従来型ビジョンエンコーダーより最大3.4倍小型です。処理を高速化するために重要度の低い画像パッチを削除するトークンプルーニングなどのモデル最適化技術に依存するのではなく、よりシンプルで合理化されたアーキテクチャによって効率性を実現しています。
FastVLMのモデルバリエーションとトレーニングパイプライン#
AppleはFastVLMを、0.5B、1.5B、7Bパラメーターの3つのサイズでリリースしました(「B」はbillionを表し、モデル内の学習可能な重みの数を指します)。各バージョンは、異なる種類のデバイスに適合するよう設計されています。小型モデルはスマートフォンやタブレットで動作し、大型の7Bモデルはデスクトップや、より負荷の高いタスクに適しています。
これにより、開発者はアプリに最適なものを柔軟に選択できます。同じ基盤モデルアーキテクチャを使用しながら、モバイル向けに高速で軽量なアプリケーションや、大規模なシステム向けにより複雑なアプリケーションを構築できます。
Appleは、ビジョンモデルと言語モデルを連携させるフレームワークであるLLaVA‑1.5パイプラインを使用して、FastVLMのモデルバリエーションをトレーニングしました。言語コンポーネントでは、自然で一貫性のあるテキスト生成で知られるQwenやVicunaなど、既存のオープンソースモデルを使用してFastVLMを評価しました。この構成により、FastVLMは単純な画像と複雑な画像の両方を処理し、読みやすく関連性の高い応答を生成できます。
FastVLMの意義:Appleによる効率的なAIアプローチ#
FastVLMの効率的な画像処理がなぜ重要なのか、疑問に思うかもしれません。その理由は、クラウドに依存せず、アプリをリアルタイムでどれだけスムーズに動作させられるかにあります。FastVLMは最大1152×1152ピクセルの高解像度画像を処理しながら、デバイス上で直接実行できるほど高速かつ軽量です。
つまり、カメラが捉えた内容の説明、撮影中のレシートのスキャン、画面上の変化への応答などを、すべてローカルで処理できます。教育、アクセシビリティ、生産性、写真撮影などの分野で特に役立ちます。
FastViTHDは大きな画像でも効率的に処理できるため、デバイスの応答性を保ち、発熱も抑えます。最小モデルを含むすべてのモデルサイズで動作し、最小モデルはエントリーレベルのiPhone上で実行できます。つまり、同じAI機能をスマートフォン、タブレット、Macで利用できます。
FastVLMの活用例#
FastVLMは、速度、効率、オンデバイスのプライバシー保護といった主な利点により、幅広いアプリケーションを支えられます。活用方法の例を以下に示します。
-
ドキュメントの読み取り: レシート、フォーム、身分証明書をスキャンし、関連する情報だけを抽出できます。画像内の特定の領域に焦点を当てられるため、高速かつ正確なテキスト抽出が必要なアプリに役立ちます。
-
画像キャプション: 写真を分析し、画像内の内容を明確に説明できます。カメラアプリ、フォトギャラリー、またはリアルタイムの視覚理解を活用するあらゆるツールの機能を支援します。
-
アクセシビリティ支援: FastVLMは、視覚障害のあるユーザーや視力の低いユーザー向けに画面上のコンテンツを説明し、ボタン、メニュー、レイアウト要素をより簡単に操作・利用できるようにします。
-
オンデバイスAIアシスタント: FastVLMは、画面上の内容をすばやく理解する必要があるAIアシスタントと適切に連携できます。デバイス上で直接実行され、データをプライベートに保つため、テキストの読み取り、ボタンやアイコンの識別、ユーザーのリアルタイムでの案内などのタスクを、情報をクラウドに送信せずに支援できます。

図4. FastVLMはテキスト認識と視覚質問応答に利用できます。(出典)
主なポイント#
FastVLMは、速度、プライバシー、効率性を組み合わせ、オンデバイスのビジョン言語AIをAppleデバイスにもたらします。軽量な設計とオープンソースでのリリースにより、モバイルアプリとデスクトップアプリでリアルタイムの画像理解を実現できます。
これにより、AIが日常的な用途でより実用的かつ利用しやすくなり、開発者は有用でプライバシーを重視したアプリケーションを構築するための確かな基盤を得られます。今後、ビジョン言語モデルはテクノロジーとの関わり方において重要な役割を果たし、日常の状況でAIをより応答性が高く、コンテキストを理解し、役立つものにしていく可能性があります。
AIについて詳しく知るには、GitHubリポジトリをご覧ください。活発なコミュニティに参加し、自動車業界におけるAIや製造業におけるビジョンAIなどの分野におけるイノベーションをご確認ください。今すぐコンピュータビジョンを始めるには、ライセンスオプションをご覧ください。









