コンピュータービジョンタスクでGoogle Gemini 2.5を実際に活用
物体検出、画像キャプショニング、ビジョンAIソリューション向けのOCRなどのコンピュータービジョンタスクで、Google Gemini 2.5を実際に活用する方法をご覧ください。

AIの進歩は急速で、新たなイノベーションがほぼ毎日のように話題になっています。最近の画期的な進展の一つが、3月26日にリリースされたGoogle DeepMindの最新マルチモーダルモデル、Gemini 2.5です。従来の大規模言語モデル (LLMs)は、大量のデータから学習して人間のようなテキストを生成できますが、Gemini 2.5はそれを超えています。
Gemini 2.5は、画像、音声、動画を処理できる「思考モデル」として設計されています。推論能力とコーディング能力が強化されています。特に、機械が物体検出、画像キャプション生成、光学文字認識 (OCR)などの視覚データを解釈・分析するコンピュータービジョンタスクでも、非常に優れた性能を発揮します。

図1. Gemini 2.5を使用して画像の内容を理解する例です。
この記事では、Gemini 2.5のコンピュータービジョン機能を実際に体験できるUltralyticsのノートブックの一つを紹介します。また、Gemini 2.5の主な機能を詳しく確認し、実際のアプリケーション向けにコンピュータービジョンソリューションを構築する方法も紹介します。それでは始めましょう。
Gemini 2.5の概要:機能と性能#
先日リリースされたGemini 2.5シリーズの最初のバージョンは、Gemini 2.5 Proの実験的リリースです。回答を提示する前に内容を検討することで、複雑な問題に対応できるよう設計されています。強化学習(モデルがフィードバックから学習する手法)や思考連鎖プロンプティング(問題を段階的に解決するアプローチ)などの手法を使用します。
主な特徴の一つは、非常に大きなコンテキストウィンドウです。100万トークン(およそ100万語または語の一部)を保持でき、将来的には200万トークンまで拡大される予定です。これにより、モデルは一度に大量の情報を取り込むことができ、より詳細で正確な結果につながります。
言語処理に加えて、Gemini 2.5は次のコンピュータービジョンタスクに使用できます。
-
物体検出:画像内の物体を識別して位置を特定する処理です。監視や自動運転車などのアプリケーションに使用できます。
-
画像キャプション生成:画像を説明するテキストを生成するタスクです。視覚コンテンツをより利用しやすく、理解しやすくします。
-
光学文字認識:画像内のテキストを編集可能な機械可読テキストに変換する技術です。文書のデジタル化やデータ入力の自動化に役立ちます。
Google Gemini 2.5と他のモデルのベンチマークおよび比較#
現在のAI分野には複数のマルチモーダルモデルが存在するため、Gemini 2.5 Proがそれらと比べてどの程度の性能を発揮するのかを理解することが重要です。GoogleのDeepMindが公開したベンチマーク結果によると、Gemini 2.5 Proはさまざまなタスクで優れた性能を示しています。
例えば、多くの科目を対象とした難関試験を再現し、高度な推論力と一般知識を評価するHumanity’s Last Examというテストでは、Gemini 2.5 Proのスコアは約18.8%で、約14%のOpenAIのo3-miniなどのモデルを上回っています。

図2. Gemini 2.5 Proのベンチマーク性能の概要です。
数学やコーディングの課題でも非常に優れた性能を発揮し、多くの場合、OpenAI GPT-4.5、Claude 3.7 Sonnet、Grok 3 Beta、DeepSeek R1などのモデルと同等以上の性能を示しています。これは、複雑なタスクへの対応力と大量のデータを処理する能力を示しています。
Gemini 2.5を実際に使ってみる:Google Gemini APIの使用方法#
Gemini 2.5 Proは複数のプラットフォームで利用できます。Google AI Studioで試したり、Gemini Advancedユーザー向けのGeminiアプリからアクセスしたりできます。Google DeepMindはリリース時の発表で、このモデルが間もなくVertex AIでもサポートされる予定だと説明しています。これらのアクセス方法により、開発者はGemini 2.5 Proを実際のAIアプリケーションで簡単に利用できます。
ただし、Google Gemini APIを使用して、複雑なセットアップなしに数分で使い始めたい場合や、コンピュータービジョン機能への理解を深めたい場合は、Gemini 2.5 Proを使用した物体検出や画像キャプション生成などのタスクを紹介するUltralyticsのノートブックを確認してください。ノートブックでできることを詳しく見ていきましょう。
Google Gemini 2.5ノートブックで推論をセットアップする#
Ultralyticsのノートブックを使ってGoogle Gemini 2.5を利用するには、まずGoogle AI StudioでAPIキーを生成する必要があります。このキーを使うとGemini APIにアクセスでき、モデルを利用できるようになります。
APIキーを取得したら、必要なライブラリが環境にインストールされていることを確認してください。これにはUltralyticsとGoogleのAIツールキットのパッケージが含まれます。この手順はノートブックで明確に説明されているため、指示に従ってワークスペースを簡単にセットアップできます。
すべての設定が完了したら、以下に示すようにAPIキーを入力してGemini APIに接続できます。これにより、ワークスペースとモデルの間に接続が確立されます。その後、Gemini 2.5に画像やテキストプロンプトを送信できるようになります。
基本的には、画像と「この画像内の物体を検出してください」や「見えているものを説明してください」といった簡単な指示をモデルに渡すと、必要な結果が返されます。このシンプルなプロセスにより、Gemini 2.5のコンピュータービジョン機能を簡単に試し始めることができます。
Google Gemini 2.5による物体検出#
ノートブックの主な例の一つが、Gemini 2.5 Proを使用した物体検出です。この例では、画像と物体検出用の簡単なプロンプトをモデルに渡します。
モデルは画像を処理し、検出した各物体について座標とラベルのセットを返します。これらの座標は正規化された形式で示されます。次に、Ultralytics Pythonパッケージの関数を使用して、正規化された値を画像の実際の寸法に合わせ、以下に示すように各物体の周囲に明確なバウンディングボックスを描画します。

図3. Google Gemini 2.5を使用した物体検出です。
Gemini 2.5を使用した画像キャプション生成#
ノートブックのもう一つの興味深い例が、Gemini 2.5 Proを使用した画像キャプション生成です。この例では、画像内の内容を説明する詳細なキャプションを生成するよう求めるプロンプトと画像をモデルに渡します。
モデルは視覚コンテンツを分析し、画像の内容とコンテキストの両方を捉えた、複数の文で構成されることが多い説明文を返します。この機能は、アクセシビリティの向上、視覚情報の要約、さらにはクリエイティブなストーリーテリングの強化に役立ちます。
Google GeminiモデルによるOCR精度の向上#
Gemini 2.5 Proの画像内テキストを読み取る能力を活用するコンピュータービジョンタスクがOCRです。ノートブックでは、テキストを含む画像と、そのテキストを抽出するためのプロンプトをモデルに渡せます。モデルは画像を処理し、以下に示すように、検出したテキストとそのテキストが存在する座標の両方を返します。
次に、Ultralytics Pythonパッケージの関数を使用して、これらの正規化された座標を画像の実際の寸法に変換し、テキスト領域の周囲にバウンディングボックスを描画します。このアノテーション付き出力によりテキストの位置が明確になるため、文書のデジタル化、データ入力の自動化、アクセシビリティの向上に役立ちます。

図4. Google Gemini 2.5を使用した画像内のテキストデータの抽出です。
Google Gemini 2.5の実世界でのアプリケーション#
Google Gemini 2.5 Proをさまざまなコンピュータービジョンタスクに使用する方法を確認したところで、これらの機能を活用できる実世界のアプリケーションを見ていきましょう。
例えば、Gemini 2.5 Proの物体検出機能を使うと、大量の画像セットに自動でラベルを付けて整理できるため、データセットの作成やコンテンツ管理などの作業を大幅に高速化できます。また、小売業や農業などの分野で画像を分析することもできます。例えば、棚に並んだ商品の検出や、農場の写真から作物のストレスの兆候を特定することが可能です。

図5. Gemini 2.5 Proによる植物の健康状態の分析です。
一方、モデルの画像キャプション生成機能は、視覚障害のあるユーザーが画像の内容を理解するのに役立ちます。例えば、混雑した通りの写真がある場合、車両の種類、歩行者の活動状況、さらに光の手がかりに基づく時間帯まで含めて、シーンを詳しく説明するキャプションをモデルが生成できます。
さらに、Gemini 2.5のOCR機能はさまざまなアプリケーションで利用できます。例えば、ページやレシートをスキャンして印刷文書をデジタル化できます。この機能は、データ入力タスクの自動化、フォームの処理、名刺や看板からのテキストの読み取りにも適しています。
全体として、Google Gemini 2.5 Proは幅広い実用的なAIアプリケーションへの道を開きます。
主なポイント#
Google Gemini 2.5 Proは、テキストの生成と分析にとどまらず、物体検出、画像キャプション生成、OCRなどのコンピュータービジョンタスクにも使用できます。大規模なコンテキストウィンドウと強化された推論機能により、実世界のシナリオで適切に機能する、詳細でコンテキストを考慮した結果を生成します。
AIモデルが進化し続ける中、Gemini 2.5 Proのようなツールにより、さまざまな業界で複雑な問題を解決しやすくなっています。視覚理解から言語処理まで幅広いタスクに対応できる柔軟なマルチモーダルソリューションを求める組織が増えるにつれ、AIはさらに広く導入されていくと考えられます。
私たちのコミュニティに参加して、GitHubリポジトリで最先端のAIプロジェクトについて学びましょう。ソリューションページで農業におけるVision AIの活用例と製造業におけるAIの役割をご覧ください。ライセンスプランを確認して、今すぐコンピュータービジョンソリューションを構築しましょう。









