GoogleのPaliGemma 2:高度なVLMモデルへの洞察
Googleの新しいビジョン言語モデル「PaliGemma 2」を詳しく見ていきます。これらのモデルは、画像とテキストの両方を理解し、分析するのに役立ちます。

2024年12月5日、Googleは最先端のvision-language model (VLM)の最新バージョンであるPaliGemma 2を発表しました。PaliGemma 2は、キャプションの生成、視覚的質問応答、ビジュアル内のオブジェクト検出など、画像とテキストを組み合わせたタスクを処理するように設計されています。
多言語のキャプション生成やオブジェクト認識ですでに強力なツールであった従来のPaliGemmaを基盤として構築されたPaliGemma 2には、いくつかの重要な改良が加えられています。これらには、より大きなモデルサイズのサポート、高解像度画像のサポート、および複雑な視覚タスクにおけるbetter performanceが含まれます。これらのアップグレードにより、幅広い用途に対してさらに柔軟で効果的なものとなっています。
この記事では、PaliGemma 2の仕組み、主要な機能、そして輝きを放つアプリケーションなど、その詳細を掘り下げます。それでは始めましょう!
Gemma 2からPaliGemma 2へ#
PaliGemma 2は、SigLIPビジョンエンコーダーとGemma 2言語モデルという2つの主要テクノロジーに基づいて構築されています。SigLIPエンコーダーは、画像や動画などのvisual dataを処理し、モデルが分析できる特徴に分割します。一方、Gemma 2はテキストを処理し、モデルが多言語の言語を理解して生成できるようにします。これらが一体となってVLMを形成し、視覚情報とテキスト情報をシームレスに解釈して結びつけるように設計されています。
PaliGemma 2が大きな飛躍を遂げた理由は、そのスケーラビリティと汎用性にあります。オリジナル版とは異なり、PaliGemma 2には30億(3B)、100億(10B)、280億(28B)パラメータの3つのサイズがあります。これらのパラメータはモデルの内部設定のようなもので、データを効率的に学習し処理するのに役立ちます。また、さまざまな画像解像度(例えば、クイックタスク用の224 x 224ピクセルや詳細分析用の896 x 896など)をサポートしており、さまざまなアプリケーションに適応可能です。

Fig 1. PaliGemma 2の概要。
Gemma 2の高度な言語能力とSigLIPの画像処理を統合することで、PaliGemma 2は大幅にインテリジェントになりました。以下のようなタスクを処理可能です:
- Captioning images or videos: モデルはビジュアルの詳細なテキスト説明を生成できるため、キャプションの自動作成に役立ちます。
- 視覚的な質問応答: PaliGemma 2は、シーン内の物体、人、行動の特定など、画像に基づいた質問に回答できます。
- Object recognition: 写真内の猫、テーブル、車を区別するなど、画像内のオブジェクトを識別してラベル付けします。
PaliGemma 2は画像とテキストを個別に処理するだけでなく、それらを意味のある方法で統合します。例えば、シーン内の関係性を理解して「猫がテーブルの上に座っている」と認識したり、有名なランドマークを認識しながらコンテキストを追加したりすることが可能です。
GoogleのPaliGemma 2 VLMモデルの仕組み#
次に、以下の図のグラフを使用して、PaliGemma 2が視覚データとテキストデータをどのように処理するかをより深く理解するために、例を追っていきましょう。このグラフをアップロードして、モデルに「このグラフは何を表していますか?」と尋ねたと仮定します。

Fig 2. PaliGemma 2の能力の例。
プロセスは、PaliGemma 2のSigLIPビジョンエンコーダーによる画像の分析とextract key featuresから始まります。グラフの場合、これには軸、データポイント、ラベルなどの要素の特定が含まれます。エンコーダーは、幅広いパターンと詳細な細部の両方を捉えるようにトレーニングされています。また、optical character recognition (OCR)を使用して、画像に埋め込まれたテキストを検出し、処理します。これらの視覚的特徴は、モデルが処理できる数値表現であるトークンに変換されます。次に、これらのトークンは線形射影層を使用して調整され、テキストデータとシームレスに結合できるようにするテクニックが適用されます。
同時に、Gemma 2言語モデルが付属のクエリを処理して、その意味と意図を判断します。クエリからのテキストはトークンに変換され、これらがSigLIPからのビジュアルトークンと組み合わされて、視覚データとテキストデータをリンクする統合フォーマットであるmultimodal representationが作成されます。
この統合された表現を使用して、PaliGemma 2は自己回帰デコーディングを通じて段階的に応答を生成します。これは、モデルがすでに処理したコンテキストに基づいて、一度に答えの一部ずつを予測する手法です。
PaliGemma 2の主要な機能#
その仕組みを理解したところで、PaliGemma 2を信頼できるビジョン言語モデルにしている主な機能を探ってみましょう:
- Fine-tuning flexibility: 特定のデータセットやタスクに簡単に適応し、画像キャプション、空間推論、medical imagingなどのアプリケーションで優れたパフォーマンスを発揮します。
- Diverse training data: WebLIやOpenImagesなどのデータセットでトレーニングされており、強力なオブジェクト認識能力と多言語出力機能を備えています。
- OCR統合: 画像からテキストを抽出・解釈するための光学式文字認識が含まれており、ドキュメント分析やその他のテキストベースのタスクに最適です。
- 多言語出力: キャプションや回答を複数の言語で生成でき、グローバルなアプリケーションに最適です。
- Integration with tools: Hugging Face Transformers、PyTorch、Kerasなどのフレームワークと互換性があり、簡単なデプロイと実験が可能です。
PaliGemma 2とPaliGemmaの比較:何が改善されたのか?#
PaliGemmaの最初のバージョンのアーキテクチャを見ると、PaliGemma 2の強化点がよくわかります。最も注目すべき変更点の1つは、オリジナルのGemma言語モデルがGemma 2に置き換わったことであり、これによりパフォーマンスと効率の両面で実質的な向上がもたらされました。
9Bおよび27Bのパラメータサイズで提供されるGemma 2は、deployment costsを削減しながら、クラス最高水準の精度と速度を提供するように設計されました。これは、強力なGPUsからよりアクセシブルな構成まで、さまざまなハードウェア構成で推論効率を最適化するように再設計されたアーキテクチャによって実現されています。

Fig 3. PaliGemma 2の最初のバージョンの振り返り。
その結果、PaliGemma 2は非常にaccurateなモデルとなっています。PaliGemma 2の10Bバージョンは、元のモデルの34.3と比較して、非含意文(NES)スコアが20.3と低くなっており、出力における事実誤認が少ないことを意味します。これらの進歩により、PaliGemma 2はよりスケーラブルで、正確になり、詳細なキャプションから視覚的質問応答まで、より幅広いアプリケーションに適応できるようになります。
PaliGemma 2のアプリケーション:VLMモデルの実世界での使用例#
PaliGemma 2は、視覚と言語の理解をシームレスに結合することで、産業を再定義する可能性を秘めています。たとえば、accessibilityに関して、オブジェクト、シーン、空間関係の詳細な説明を生成し、視覚障害のある個人に不可欠な支援を提供できます。この機能は、ユーザーが自分の環境をよりよく理解するのに役立ち、日常のタスクに関してより大きな自立を提供します。

Fig 4. PaliGemma 2は世界をよりアクセシブルな場所にすることができます。
アクセシビリティに加えて、PaliGemma 2は以下の分野を含むさまざまな業界で影響を与えています:
- E-commerce: モデルは、画像内のアイテムを分析して説明することにより、製品のカテゴリ分類を強化し、在庫管理を簡素化し、ユーザーの検索エクスペリエンスを向上させます。
- Healthcare: X線やMRIなどの医用画像と臨床メモを解釈して医療従事者をサポートし、より正確で情報に基づいた診断を提供します。
- Education: PaliGemma 2は、キャプションの生成や画像のコンテキスト情報の提供を通じて、教育者が説明的でアクセシブルな学習教材を作成するのに役立ちます。
- Content Creation: モデルは、マルチメディアコンテンツのキャプションや視覚的説明を生成するプロセスを自動化し、クリエイターの時間を節約します。
実際に試してみる:PaliGemma 2#
PaliGemma 2を試すには、Hugging Faceの対話型デモから始めることができます。これにより、画像キャプションや視覚的な質問回答といったタスクにおける能力を探ることができます。単に画像をアップロードし、モデルにそれに関する質問をしたり、シーンの説明を求めたりしてみてください。

図5. PaliGemma 2のデモ (出典: Hugging Face)。
さらに詳しく掘り下げたい場合は、以下のように実際に操作してみることができます:
- Pre-trained models: Hugging FaceやKaggleなどのプラットフォームから、事前トレーニング済みモデルとコードにアクセスできます。これらのリソースには、モデルの操作を開始するために必要なすべてが含まれています。
- Notebooks: PaliGemma 2に慣れるための包括的なドキュメントとサンプルノートブックが用意されています。推論の例から始めて、特定のタスクのために独自のデータセットでモデルを微調整する実験を行うことができます。
- 統合: PaliGemma 2は、Hugging Face Transformers、Keras、PyTorch、JAX、Gemma.cppなどの広く使用されているフレームワークと互換性があり、既存のワークフローに簡単に統合できます。
GoogleのPaliGemma 2の長所と短所#
PaliGemma 2の開始方法を理解したところで、これらのモデルを使用する際に留意すべき主な長所と短所を詳しく見ていきましょう。
PaliGemma 2がビジョン言語モデルとして際立っている理由は次のとおりです:
- 効率の向上: Gemma 2の最適化されたアーキテクチャを活用することで、PaliGemma 2は高いパフォーマンスを提供しつつ、デプロイコストを最小限に抑えます。
- Enhanced safety features: PaliGemma 2には、バイアスを軽減するための事前トレーニングデータの堅牢なフィルタリングや、安全性ベンチマークに対する厳格な評価など、トレーニングプロセスにおける大幅な安全性の向上が含まれています。
- Low latency for smaller configurations: 3Bモデルは推論時間が短いため、e-commerce product recommendationsやライブサポートシステムなど、速度が重要なユースケースに適しています。
一方、PaliGemma 2が制限に直面する可能性がある分野は以下の通りです:
- レイテンシ:強力ではありますが、大規模なモデルは、リアルタイム対話型AIシステムなど、即時の応答が必要なタスクにデプロイされた場合にレイテンシの問題に直面する可能性があります。
- 大規模データセットへの依存: PaliGemma 2のパフォーマンスは、トレーニングデータセットの品質と多様性に密接に関連しており、これがトレーニングデータに含まれていない過小評価されたドメインや言語での有効性を制限する可能性があります。
- High resource requirements: 最適化にもかかわらず、10Bおよび28Bパラメータバージョンはsignificant computational powerを要求するため、リソースが限られた小規模な組織ではアクセスしにくくなっています。
重要なポイント#
PaliGemma 2は、スケーラビリティ、ファインチューニングの柔軟性、および精度の向上を提供し、ビジョン言語モデリングにおける魅力的な進歩です。アクセシビリティソリューションやEコマースから、医療診断や教育に至るまで、幅広いアプリケーションで価値あるツールとして機能します。
計算要件や高品質データへの依存といった制限はありますが、その強みによって、視覚データとテキストデータを統合する複雑なタスクに取り組むための実用的な選択肢となっています。PaliGemma 2は、研究者や開発者がマルチモーダルアプリケーションにおけるAIの可能性を探求・拡大するための強固な基盤を提供します。
GitHub repositoryとcommunityをチェックして、AIの会話に参加しましょう。AIがagricultureやhealthcareでどのように進展を遂げているかについてお読みください! 🚀






