コンピュータビジョンタスクにおけるGoogle Gemini 2.5の実践
物体検出、画像キャプション、Vision AIソリューション向けのOCRなどのコンピュータビジョンタスクにおいて、Google Gemini 2.5を実際に活用する方法をご覧ください。

AIの進化は非常に速く、ほぼ毎日新しいイノベーションがニュースの話題になっています。そのような最近の画期的な成果の1つが、3月26日にリリースされたGoogle DeepMindによる最新のマルチモーダルモデルであるGemini 2.5です。従来のLarge Language Models (LLMs)は、膨大な量のデータから学習して人間のようなテキストを生成できますが、Gemini 2.5はそれにとどまりません。
画像、音声、動画を処理できる「思考モデル」として設計されています。推論スキルとコーディングスキルが向上しています。興味深いことに、機械が視覚データを解釈して分析するcomputer vision tasks(物体検出、画像キャプション生成、光学的文字認識(OCR)など)においても、非常に優れたパフォーマンスを発揮します。

図1。Gemini 2.5を使用して画像の内容を理解する例。
この記事では、Gemini 2.5のコンピュータビジョン機能を実際に体験するのに役立つUltralyticsのノートブックの1つを順を追って説明します。また、Gemini 2.5の主な機能を詳しく見ていき、実世界でのアプリケーション向けのcomputer vision solutionsを構築するためにどのように使用できるかを紹介します。それでは始めましょう!
Gemini 2.5の概要:機能と性能#
Gemini 2.5モデルシリーズの第一弾としてリリースされたのは、試験的な「Gemini 2.5 Pro」です。このモデルは、回答を出す前にプロセスを熟考することで複雑な問題を解決するように設計されています。強化学習(モデルがフィードバックから学習する手法)や思考の連鎖(Chain-of-Thought、問題を段階的に解決するアプローチ)といった手法を採用しています。
主要な機能の一つに巨大なコンテキストウィンドウがあります。これは100万トークン(約100万語やその断片)を保持でき、将来的には200万まで拡大される見込みです。つまり、モデルは一度に大量の情報を入力として受け取ることができ、より詳細で正確な結果を出力できることを意味します。
言語処理に加え、Gemini 2.5は以下のコンピュータビジョンタスクに活用できます。
-
Object detection: 画像内の物体を特定し、その位置を特定するプロセスです。監視や自動運転車などのアプリケーションで使用できます。
-
画像キャプション生成:このタスクでは、画像に対して説明的なテキストを生成します。これにより、視覚コンテンツがよりアクセスしやすく、理解しやすくなります。
-
Optical character recognition: この技術は、画像に含まれるテキストを編集可能な機械可読テキストに変換します。文書のデジタル化やデータ入力の自動化に役立ちます。
Google Gemini 2.5のベンチマークと他モデルとの比較#
現在AI分野には複数のマルチモーダルモデルが存在するため、Gemini 2.5 Proがそれらとどのように比較されるかを理解することが重要です。Google DeepMindが共有したベンチマーク結果に基づくと、Gemini 2.5 Proは幅広いタスクで非常に優れた性能を示しています。
例えば、「Humanity’s Last Exam」と呼ばれるテストでは、多くの教科を網羅する難易度の高い試験をシミュレートし、高度な推論と一般知識を評価します。Gemini 2.5 Proは約18.8%のスコアを記録し、約14%のOpenAIのo3-miniなどのモデルを上回っています。

Fig 2. Gemini 2.5 Proのベンチマークパフォーマンスの概要。
また、数学やコーディングの課題でも非常に優れたパフォーマンスを発揮し、OpenAI GPT-4.5、Claude 3.7 Sonnet、Grok 3 Beta、DeepSeek R1などのモデルのパフォーマンスに匹敵するかそれを上回ることが多く、複雑なタスクを処理して大量のデータを処理する能力を示しています。
Gemini 2.5を体験する:Google Gemini APIの使い方#
Gemini 2.5 Proは複数のプラットフォームで利用可能です。Google AI Studioで試用できるほか、Gemini AdvancedユーザーであればGeminiアプリを通じてアクセスできます。Google DeepMindは発表の中で、このモデルが近日中にVertex AIでもサポートされる予定であると述べています。これらのアクセスポイントにより、開発者はGemini 2.5 Proを実世界のAIアプリケーションに容易に組み込めます。
ただし、Google Gemini APIを使用し、複雑な設定なしでわずか数分で開始したい場合や、そのコンピュータビジョン機能をより深く理解したい場合は、Gemini 2.5 Proを使用した物体検出や画像キャプション生成などのタスクを紹介するUltralytics notebookを確認できます。ノートブックで期待できる内容について詳しく見ていきましょう。
Google Gemini 2.5ノートブックを用いた推論環境の構築#
Ultralyticsのノートブックを使い始めてGoogle Gemini 2.5を使用するには、まずGoogle AI Studioを通じてAPIキーを生成する必要があります。このキーによりGemini APIへのアクセス権が付与され、モデルを使用できるようになります。
APIキーを取得したら、環境に必要なライブラリ(UltralyticsやGoogleのAIツールキットのパッケージなど)がインストールされていることを確認してください。この手順はノートブックに明確に記載されているため、手順に従ってワークスペースを簡単に設定できます。
構成が完了したら、APIキーを入力して(以下参照)Gemini APIに接続します。これにより、ワークスペースとモデルの間にリンクが作成されます。その後は、画像やテキストのプロンプトをGemini 2.5に送信する準備が整います。
基本的に、画像と簡単な命令(「この画像内の物体を検出して」や「何が見えるか説明して」など)をモデルに提供すると、必要な結果が返されます。この直感的なプロセスにより、Gemini 2.5のコンピュータビジョン機能の探索を容易に開始できます。
Google Gemini 2.5による物体検出#
ノートブックにおける重要な例の一つが、Gemini 2.5 Proを使用した物体検出です。この例では、画像と物体検出のための簡単なプロンプトをモデルに提供します。
モデルは画像を処理し、検出した各オブジェクトの一連の座標とラベルを返します。これらの座標は正規化された形式で提供されます。その後、Ultralytics Python packageの関数を使用して、これらの正規化された値を画像の実際の寸法に合わせて変換し、以下に示すように各オブジェクトの周囲に明確なバウンディングボックスを描画します。

図3。Google Gemini 2.5を用いた物体検出。
Gemini 2.5を用いた画像キャプション生成#
ノートブックのもう1つの興味深い例は、Gemini 2.5 Proを使用したimage captioningです。この例では、モデルに画像と、画像の内容を説明する詳細なキャプションの生成を求めるプロンプトを提供します。
モデルは視覚的内容を分析し、内容と文脈を捉えた説明文(多くの場合、複数の文で構成される)を返します。この機能は、アクセシビリティの向上や視覚情報の要約、さらにはクリエイティブなストーリーテリングの強化にも役立ちます。
Google GeminiモデルによるOCR精度の向上#
Gemini 2.5 Proの「画像内のテキストを読む能力」を活用したコンピュータビジョンタスクがOCRです。ノートブックでは、テキストを含む画像と、そのテキストを抽出するプロンプトをモデルに提供します。モデルは画像を処理し、検出されたテキストと、そのテキストが配置されている座標を返します(以下参照)。
その後、Ultralytics Pythonパッケージの関数を使用して、これらの正規化された座標を画像の実際の寸法に変換し、テキスト領域の周囲にbounding boxesを描画します。この注釈付き出力により、テキストの位置が明確になり、文書のデジタル化、データ入力の自動化、アクセシビリティの向上のために役立ちます。

図4。Google Gemini 2.5を使用して画像内のテキストデータを抽出する様子。
Google Gemini 2.5の実世界のアプリケーション#
Google Gemini 2.5 Proを様々なコンピュータビジョンタスクに活用する方法を確認したところで、これらの機能が役立ついくつかの実世界のアプリケーションを探ってみましょう。
たとえば、Gemini 2.5 Proの物体検出機能は、大規模な画像セットの自動ラベル付けと整理に役立ち、datasetの作成やコンテンツ管理などのタスクをはるかに高速にします。また、小売や農業などの分野で画像を分析するためにも使用できます(たとえば、棚にある製品の検出や、農場の写真での作物ストレスの兆候の特定など)。

図5。Gemini 2.5 Proが植物の健康状態を分析する様子。
一方で、このモデルの画像キャプション生成機能は、視覚障害を持つユーザーが画像の内容を理解する手助けとなります。例えば、混雑した通りの写真がある場合、モデルは車両の種類、歩行者の活動状況、照明のヒントに基づく時間帯など、詳細を説明するキャプションを生成する可能性があります。
さらに、Gemini 2.5のOCR機能は多様なアプリケーションで使用できます。例えば、ページや領収書をスキャンすることで印刷文書をデジタル化できます。この機能は、データ入力タスクの自動化やフォーム処理、名刺や看板からのテキスト読み取りに最適です。
全体として、Google Gemini 2.5 Proは幅広い実用的なAIアプリケーションへの扉を開きます。
重要なポイント#
Google Gemini 2.5 Proは、テキストの生成や分析を超えて、物体検出、画像キャプション生成、OCRといったコンピュータビジョンタスクに活用できます。巨大なコンテキストウィンドウと強化された推論能力により、実環境のシナリオで十分に機能する詳細でコンテキストを理解した結果を生み出します。
AIモデルが進化し続ける中、Gemini 2.5 Proのようなツールは、業界全体で複雑な問題を解決することをより容易にしています。視覚的な理解から言語処理まで、幅広いタスクをこなせる柔軟でマルチモーダルなソリューションを求める組織が増えるにつれ、AIのより広範な採用が進むことになるでしょう。
our communityに参加して、GitHub repositoryで最先端のAIプロジェクトについて学びましょう。ソリューションページでVision AI in agricultureのアプリケーションや、AI in manufacturingの役割を確認してください。our licensing plansを調べて、今すぐコンピュータビジョンソリューションを構築しましょう!






