GoogleのPaliGemma 2:高度なVLMモデルの知見
Googleの新しいビジョン・ランゲージモデル、PaliGemma 2について詳しくご紹介します。これらのモデルは、画像とテキストの理解および分析に役立ちます。

2024年12月5日、Googleは最先端の視覚言語モデル (VLM)の最新版であるPaliGemma 2を発表しました。PaliGemma 2は、キャプションの生成、視覚的な質問への回答、画像内の物体検出など、画像とテキストを組み合わせるタスクに対応できるよう設計されています。
多言語キャプション生成や物体認識においてすでに強力なツールであった初代PaliGemmaを基盤に、PaliGemma 2ではいくつかの重要な改良が加えられています。これには、より大規模なモデルサイズ、高解像度画像への対応、複雑な視覚タスクにおける性能向上が含まれます。これらのアップグレードにより、幅広い用途に対してさらに柔軟かつ効果的になっています。
この記事では、PaliGemma 2の仕組み、主な機能、そして特に力を発揮する用途について詳しく見ていきます。それでは始めましょう。
Gemma 2からPaliGemma 2へ#
PaliGemma 2は、SigLIPビジョンエンコーダーとGemma 2言語モデルという2つの主要なテクノロジーを基盤に構築されています。SigLIPエンコーダーは、画像や動画などの視覚データを処理し、モデルが分析できる特徴に分解します。一方、Gemma 2はテキストを処理し、モデルが多言語の言語を理解して生成できるようにします。これらが組み合わさることで、視覚情報とテキスト情報をシームレスに解釈して結び付けるよう設計されたVLMが形成されます。
PaliGemma 2が大きく前進した点は、そのスケーラビリティと汎用性です。初代とは異なり、PaliGemma 2には30億(3B)、100億(10B)、280億(28B)パラメータの3つのサイズがあります。パラメータはモデル内部の設定のようなもので、データを効果的に学習・処理するのに役立ちます。また、さまざまな画像解像度(迅速なタスク向けの224 x 224ピクセルや、詳細な分析向けの896 x 896など)にも対応しており、幅広い用途に適応できます。

図1. PaliGemma 2の概要。
Gemma 2の高度な言語機能とSigLIPの画像処理を統合することで、PaliGemma 2は大幅に高い知能を実現しています。次のようなタスクに対応できます。
- 画像や動画のキャプション生成:モデルは視覚情報の詳細なテキスト説明を生成できるため、キャプションの自動作成に役立ちます。
- 視覚的質問応答: PaliGemma 2は画像に基づいて質問に回答できます。たとえば、シーン内の物体、人、行動などを識別できます。
- 物体認識:画像内の物体を識別してラベル付けします。たとえば、写真に写る猫、テーブル、車を区別できます。
PaliGemma 2は画像とテキストを個別に処理するだけでなく、それらを意味のある形で結び付けます。たとえば、「猫がテーブルの上に座っている」といったシーン内の関係を理解したり、有名なランドマークを認識しながらコンテキストを付加したりできます。
GoogleのPaliGemma 2 VLMモデルの仕組み#
次に、下の画像に示したグラフを使った例を通じて、PaliGemma 2が視覚データとテキストデータをどのように処理するかを詳しく見ていきます。このグラフをアップロードして、モデルに「このグラフは何を表していますか?」と尋ねるとします。

図2. PaliGemma 2の能力の例。
このプロセスは、PaliGemma 2のSigLIPビジョンエンコーダーが画像を分析し、主要な特徴を抽出することから始まります。グラフの場合、軸、データポイント、ラベルなどの要素の識別が含まれます。エンコーダーは、全体的なパターンと細部の両方を捉えられるように学習されています。また、画像に埋め込まれたテキストを検出・処理するために、光学文字認識 (OCR)も使用します。これらの視覚的特徴は、モデルが処理できる数値表現であるトークンに変換されます。次に、これらのトークンは線形射影レイヤーを使用して調整されます。これは、トークンをテキストデータとシームレスに組み合わせられるようにする技術です。
同時に、Gemma 2言語モデルは付随するクエリを処理し、その意味と意図を判断します。クエリのテキストはトークンに変換され、SigLIPの視覚トークンと組み合わされて、視覚データとテキストデータを結び付ける統一形式であるマルチモーダル表現が作成されます。
この統合された表現を使用して、PaliGemma 2は自己回帰デコーディングによって応答をステップごとに生成します。これは、モデルがすでに処理したコンテキストに基づいて、回答の一部を一度に1つずつ予測する手法です。
PaliGemma 2の主な機能#
仕組みを理解したところで、PaliGemma 2を信頼性の高い視覚言語モデルにしている主な機能を見ていきましょう。
- ファインチューニングの柔軟性:特定のデータセットやタスクに簡単に適応でき、画像キャプション生成、空間推論、医用画像などの用途で高い性能を発揮します。
- 多様な学習データ:WebLIやOpenImagesなどのデータセットで学習されており、高い物体認識能力と多言語出力能力を備えています。
- OCR統合: 画像からテキストを抽出して解釈するための光学文字認識を搭載しており、文書分析やその他のテキストベースのタスクに適しています。
- 多言語出力: 複数の言語でキャプションや応答を生成でき、グローバルな用途に適しています。
- ツールとの統合:Hugging Face Transformers、PyTorch、Kerasなどのフレームワークと互換性があり、簡単なデプロイと実験を可能にします。
PaliGemma 2とPaliGemmaの比較:何が改良されたのでしょうか?#
初代PaliGemmaのアーキテクチャを確認することは、PaliGemma 2の改良点を理解するよい方法です。最も注目すべき変更の1つは、初代のGemma言語モデルがGemma 2に置き換えられたことで、性能と効率の両方が大幅に向上しています。
Gemma 2は9Bおよび27Bパラメータのサイズで提供され、デプロイコストを削減しながら、クラス最高水準の精度と速度を実現するよう設計されています。これは、高性能なGPUからより利用しやすい構成まで、さまざまなハードウェア環境で推論効率が最適化された、再設計されたアーキテクチャによって実現されています。

図3. 初代PaliGemma 2を振り返る。
その結果、PaliGemma 2は非常に高精度なモデルになっています。PaliGemma 2の10Bバージョンは、初代モデルの34.3に対して、Non-Entailment Sentence(NES)スコアが20.3と低く、出力に含まれる事実誤認が少ないことを示しています。これらの進歩により、PaliGemma 2は、詳細なキャプション生成から視覚的質問応答まで、より幅広い用途に対してスケーラブルで正確かつ適応性の高いモデルになっています。
PaliGemma 2の用途:VLMモデルの実社会での活用#
PaliGemma 2は、視覚理解と言語理解をシームレスに組み合わせることで、さまざまな業界を変革する可能性を持っています。たとえばアクセシビリティの観点では、物体、シーン、空間的関係の詳細な説明を生成し、視覚障害のある方々に重要な支援を提供できます。この機能は、ユーザーが周囲の環境をよりよく理解するのに役立ち、日常的なタスクにおける自立性を高めます。

図4. PaliGemma 2は世界をよりアクセシブルな場所にできます。
アクセシビリティに加えて、PaliGemma 2は次のようなさまざまな業界にも影響を与えています。
- Eコマース:画像内の商品を分析・説明することで商品カテゴリ分類を高度化し、在庫管理を簡素化するとともに、ユーザーの検索体験を向上させます。
- ヘルスケア:X線やMRIなどの医用画像を臨床記録と併せて解釈し、より正確で情報に基づいた診断を提供することで、医療従事者を支援します。
- 教育:キャプションを生成し、画像に関するコンテキスト情報を提供することで、教育者による説明的でアクセシブルな学習教材の作成を支援します。
- コンテンツ作成:マルチメディアコンテンツのキャプションや視覚的説明の生成を自動化し、クリエイターの時間を節約します。
実際に試してみる:PaliGemma 2#
PaliGemma 2を試すには、Hugging Faceのインタラクティブデモから始めることができます。画像キャプション生成や視覚的質問応答などのタスクを通じて、その能力を体験できます。画像をアップロードし、それについてモデルに質問するか、シーンの説明を依頼するだけです。

図5. PaliGemma 2のデモ(出典:Hugging Face)。
さらに詳しく知りたい場合は、次の方法で実際に試すことができます。
- 事前学習済みモデル:Hugging FaceやKaggleなどのプラットフォームから、事前学習済みモデルとコードにアクセスできます。これらのリソースには、モデルの利用を始めるために必要なものがすべて含まれています。
- ノートブック:PaliGemma 2に慣れるための包括的なドキュメントとサンプルノートブックが用意されています。推論の例から始め、特定のタスク向けに独自のデータセットでモデルをファインチューニングする実験も行えます。
- 統合: PaliGemma 2は、Hugging Face Transformers、Keras、PyTorch、JAX、Gemma.cppなどの広く利用されているフレームワークと互換性があり、既存のワークフローに簡単に統合できます。
GoogleのPaliGemma 2の長所と短所#
PaliGemma 2の使い始め方を理解したところで、これらのモデルを使用する際に把握しておくべき主な長所と短所を詳しく見ていきましょう。
PaliGemma 2が視覚言語モデルとして際立っている理由は次のとおりです。
- 効率性の向上: Gemma 2の最適化されたアーキテクチャを活用し、PaliGemma 2はデプロイコストを最小限に抑えながら高い性能を発揮します。
- 安全性機能の強化:PaliGemma 2は、バイアスを低減するための事前学習データの堅牢なフィルタリングや、安全性ベンチマークに対する厳格な評価など、学習プロセスに大幅な安全性向上を取り入れています。
- 小規模構成での低レイテンシ: 3Bモデルは推論時間が短く、速度が重要な用途に適しています。たとえば、Eコマースの商品レコメンデーションやライブサポートシステムなどです。
一方で、PaliGemma 2には次のような制限が生じる可能性があります。
- レイテンシ: 高性能である一方、大規模モデルでは、リアルタイムのインタラクティブAIシステムなど、即時応答が求められるタスクにデプロイする際にレイテンシの問題が生じる可能性があります。
- 大規模データセットへの依存: PaliGemma 2の性能は学習データセットの品質と多様性に密接に依存しているため、十分に代表されていない分野や、学習データに含まれていない言語では効果が制限される可能性があります。
- 高いリソース要件: 最適化が施されているにもかかわらず、10Bおよび28Bパラメータのバージョンには大きな計算能力が必要であり、リソースに制約のある小規模な組織では利用しにくい可能性があります。
主なポイント#
PaliGemma 2は、スケーラビリティ、ファインチューニングの柔軟性、精度が向上した、視覚言語モデリングにおける興味深い進歩です。アクセシビリティソリューションやEコマースから、ヘルスケア診断、教育まで、幅広い用途で役立つツールとして活用できます。
計算リソース要件や高品質なデータへの依存などの制限はありますが、その強みから、視覚データとテキストデータを統合する複雑なタスクに取り組むための実用的な選択肢となっています。PaliGemma 2は、研究者や開発者がマルチモーダルアプリケーションにおけるAIの可能性を探究し、拡張するための堅牢な基盤を提供できます。
GitHubリポジトリとコミュニティを確認して、AIに関する議論に参加しましょう。農業やヘルスケアでAIがどのように進展しているかもご覧ください! 🚀









