亲自体验 Google Gemini 2.5 的计算机视觉任务
了解如何亲自使用 Google Gemini 2.5 完成目标检测、图像字幕生成和 OCR 等计算机视觉任务,为 Vision AI 解决方案提供支持。

AI 技术发展迅速,新的创新几乎每天都会登上头条。最近的一项突破是 Gemini 2.5,这是 Google DeepMind 于 3 月 26 日发布的最新多模态模型。传统的大型语言模型 (LLMs)可以从海量数据中学习并生成类似人类的文本,而 Gemini 2.5 的能力远不止于此。
它被设计为一种“思考模型”,能够处理图像、音频和视频。它还增强了推理和编码能力。有趣的是,它在计算机视觉任务方面也表现出色。在这些任务中,机器需要解读和分析视觉数据,例如目标检测、图像描述和光学字符识别 (OCR)。

图 1. 使用 Gemini 2.5 理解图像内容的示例。
本文将带你了解 Ultralytics 的一个笔记本,它可以帮助你亲自体验 Gemini 2.5 的计算机视觉能力。我们还将深入了解 Gemini 2.5 的主要功能,并展示如何使用它为实际应用构建计算机视觉解决方案。让我们开始吧!
Gemini 2.5 概览:功能与能力#
刚刚发布的 Gemini 2.5 系列中的首个版本,是 Gemini 2.5 Pro 的实验版本。它旨在通过在回答前先进行思考来处理复杂问题。它采用了强化学习(模型从反馈中学习)和思维链提示(分步骤解决问题的方法)等技术。
它的一项主要功能是超大的上下文窗口,可容纳 100 万个 token(大约相当于 100 万个单词或词片段),预计还将扩展到 200 万个。这意味着模型可以一次性接收大量信息,从而生成更详细、更准确的结果。
除了处理语言之外,Gemini 2.5 还可用于以下计算机视觉任务:
-
目标检测:这是识别和定位图像中目标的过程。它可用于监控或自动驾驶汽车等应用。
-
图像描述:此任务会为图像生成描述性文本,让视觉内容更易于访问和理解。
-
光学字符识别:这项技术会将图像中的文本转换为可编辑、可由机器读取的文本。它适用于文档数字化和数据录入自动化。
Google Gemini 2.5 与其他模型的基准测试和比较#
目前 AI 领域中有多种多模态模型,因此了解 Gemini 2.5 Pro 与它们相比的表现非常重要。根据 Google DeepMind 分享的基准测试结果,Gemini 2.5 Pro 在一系列任务中都展现出令人印象深刻的性能。
例如,在名为 Humanity’s Last Exam 的测试中,该测试模拟了一场涵盖多个学科并考察高级推理和通识知识的高难度考试,Gemini 2.5 Pro 的得分约为 18.8%,超过了 OpenAI 的 o3-mini 等模型,后者的得分约为 14%。

图 2. Gemini 2.5 Pro 基准测试性能概览。
它在数学和编码挑战中也表现出色,通常可以达到或超过 OpenAI GPT-4.5、Claude 3.7 Sonnet、Grok 3 Beta 和 DeepSeek R1 等模型的性能,展现出处理复杂任务和大量数据的能力。
亲自体验 Gemini 2.5:如何使用 Google Gemini API#
Gemini 2.5 Pro 可在多个平台上使用。你可以在 Google AI Studio 中进行试验,也可以通过 Gemini 应用向 Gemini Advanced 用户使用它。在发布公告中,Google DeepMind 还提到该模型很快将获得 Vertex AI 的支持。这些访问方式让开发者可以轻松地将 Gemini 2.5 Pro 用于实际 AI 应用。
不过,如果你想使用 Google Gemini API,在几分钟内完成入门而无需复杂配置,并希望更好地了解其计算机视觉能力,可以查看这个展示如何使用 Gemini 2.5 Pro 完成目标检测和图像描述等任务的 Ultralytics 笔记本。下面让我们详细了解你可以在该笔记本中体验到的内容。
使用 Google Gemini 2.5 笔记本设置推理#
要开始使用 Ultralytics 笔记本和 Google Gemini 2.5,你首先需要通过 Google AI Studio 生成 API 密钥。使用此密钥即可访问 Gemini API,从而使用该模型。
获得 API 密钥后,请确保环境中已安装必要的库,包括来自 Ultralytics 的软件包和 Google 的 AI 工具包。笔记本中清楚地介绍了这一步骤,你可以轻松按照说明设置工作区。
完成所有配置后,你可以输入 API 密钥来连接 Gemini API(如下所示),从而在工作区和模型之间建立连接。之后,你就可以向 Gemini 2.5 发送图像和文本提示了。
简单来说,你可以向模型提供一张图像和一条简单指令(例如“检测此图像中的目标”或“描述你看到的内容”),模型则会返回你需要的结果。这一直接的过程让你可以轻松开始探索 Gemini 2.5 的计算机视觉能力。
使用 Google Gemini 2.5 进行目标检测#
笔记本中的一个重点示例是使用 Gemini 2.5 Pro 进行目标检测。在此示例中,你需要向模型提供一张图像和一条用于检测目标的简单提示。
模型会处理图像,并为其找到的每个目标返回一组坐标和标签;这些坐标采用归一化形式。随后,来自 Ultralytics Python 软件包的函数会将这些归一化值转换为与图像实际尺寸相匹配的值,并在每个目标周围绘制清晰的边界框,如下所示。

图 3. 使用 Google Gemini 2.5 进行目标检测。
使用 Gemini 2.5 进行图像描述#
笔记本中的另一个有趣示例是使用 Gemini 2.5 Pro 进行图像描述。在此示例中,你需要向模型提供一张图像和一条提示,让它生成详细说明图像内容的描述。
模型随后会分析视觉内容并返回一段叙述,通常由多个句子组成,涵盖图像的内容和上下文。这项功能有助于提升可访问性、总结视觉信息,甚至增强创意叙事。
使用 Google Gemini 模型提升 OCR 准确性#
OCR 是一项利用 Gemini 2.5 Pro 读取图像中文本能力的计算机视觉任务。在笔记本中,你可以向模型提供一张包含文本的图像,并附上一条提取该文本的提示。模型会处理图像,并返回检测到的文本及其所在位置的坐标,如下所示。
随后,Ultralytics Python 软件包中的函数会将这些归一化坐标转换为图像的实际尺寸,并在文本区域周围绘制边界框。这一带标注的输出可以清楚地显示文本所在位置,适用于文档数字化、数据录入自动化和提升可访问性。

图 4. 使用 Google Gemini 2.5 提取图像中的文本数据。
Google Gemini 2.5 的实际应用#
现在我们已经了解了如何使用 Google Gemini 2.5 Pro 完成各种计算机视觉任务,下面来探索一些可以应用这些能力的实际场景。
例如,Gemini 2.5 Pro 的目标检测能力可以帮助自动标注和整理大量图像,让数据集创建或内容管理等任务变得更加高效。它还可用于分析零售和农业等领域中的图像,例如检测货架上的商品,或识别农场照片中作物受胁迫的迹象。

图 5. Gemini 2.5 Pro 分析植物健康状况。
与此同时,模型的图像描述功能可以帮助视障用户理解图像中的内容。例如,如果你有一张繁忙街道的照片,模型可能会生成一段详细描述场景的文字,包括车辆类型、行人活动,甚至根据光照线索判断时间段。
此外,Gemini 2.5 的 OCR 功能还可用于多种应用。例如,你可以通过扫描页面或收据将印刷文档数字化。这项能力非常适合自动化数据录入任务、处理表单,甚至读取名片和标牌上的文本。
总的来说,Google Gemini 2.5 Pro 为各种实用 AI 应用打开了大门。
要点总结#
Google Gemini 2.5 Pro 不仅能生成和分析文本,还可用于目标检测、图像描述和 OCR 等计算机视觉任务。凭借超大的上下文窗口和增强的推理能力,它可以生成详细且理解上下文的结果,并很好地适用于实际场景。
随着 AI 模型不断发展,Gemini 2.5 Pro 等工具正让各行业更容易解决复杂问题。随着越来越多的组织寻求能够处理从视觉理解到语言处理等广泛任务的灵活多模态解决方案,AI 很可能会得到更广泛的应用。
加入我们的社区,并在我们的 GitHub 代码库中了解前沿 AI 项目。在我们的解决方案页面上查看视觉 AI 在农业中的应用以及AI 在制造业中的作用。探索我们的许可方案,立即构建计算机视觉解决方案!









