YOLO Vision 2026:
Vision AI

Начни работать с Google Gemini 2.5 для задач компьютерного зрения

Узнай, как начать работу с Google Gemini 2.5 для задач компьютерного зрения, таких как обнаружение объектов, создание описаний изображений и распознавание текста (OCR) для решений Vision AI.

ABAbirami Vina5 min read
Использование Google Gemini 2.5 для задач компьютерного зрения

Достижения в области ИИ развиваются быстро, и новые инновации попадают в заголовки газет почти каждый день. Одним из таких недавних прорывов стал Gemini 2.5, новейшая мультимодальная модель от Google DeepMind, запущенная 26 марта. Хотя традиционные Large Language Models (LLMs) могут обучаться на огромных объемах данных для генерации текста, похожего на человеческий, Gemini 2.5 идет дальше.

Она создана как «мыслящая модель», способная обрабатывать изображения, аудио и видео. У нее улучшены навыки рассуждения и написания кода. Интересно, что она также демонстрирует исключительные результаты в computer vision tasks, где машины интерпретируют и анализируют визуальные данные, такие как обнаружение объектов, создание подписей к изображениям и оптическое распознавание символов (OCR).

Using Gemini 2.5 to understand the contents of an image

Рис. 1. Пример использования Gemini 2.5 для понимания содержимого изображения.

В этой статье мы рассмотрим один из блокнотов Ultralytics, который поможет тебе познакомиться с возможностями компьютерного зрения Gemini 2.5. Мы также подробнее изучим ключевые особенности Gemini 2.5 и покажем, как ее можно использовать для создания computer vision solutions в реальных приложениях. Давай начнем!

Обзор Gemini 2.5: возможности и функции#

Первая версия в серии моделей Gemini 2.5, которая была только что выпущена — это экспериментальный релиз Gemini 2.5 Pro. Она разработана для решения сложных задач путем обдумывания своих ответов перед их выдачей. Она использует такие методы, как обучение с подкреплением (где модель учится на обратной связи) и цепочка рассуждений (пошаговый подход к решению задач).

Одной из ее ключевых особенностей является огромное контекстное окно, которое может вместить 1 миллион токенов (примерно миллион слов или их частей) и, как ожидается, вырастет до 2 миллионов. Это означает, что модель может воспринимать много информации сразу, что приводит к более детальным и точным результатам.

Помимо обработки языка, Gemini 2.5 можно использовать для следующих задач компьютерного зрения:

  • Object detection: это процесс определения и поиска объектов на изображении. Его можно использовать в таких приложениях, как видеонаблюдение или беспилотные автомобили.

  • Описание изображений: эта задача включает в себя генерацию описательного текста для изображения. Это делает визуальный контент более доступным и понятным.

  • Optical character recognition: эта технология преобразует текст на изображениях в редактируемый, машиночитаемый текст. Она полезна для оцифровки документов и автоматизации ввода данных.

Тестирование и сравнение Google Gemini 2.5 с другими моделями#

Сегодня в сфере ИИ существует несколько мультимодальных моделей, поэтому важно понимать, как Gemini 2.5 Pro соотносится с ними. Основываясь на результатах тестирования, представленных Google DeepMind, Gemini 2.5 Pro демонстрирует впечатляющую производительность в ряде задач.

Например, в тесте под названием Humanity’s Last Exam, который имитирует сложный экзамен, охватывающий множество дисциплин и проверяющий продвинутые рассуждения и общие знания, Gemini 2.5 Pro набирает около 18,8%, превосходя модели, такие как o3-mini от OpenAI, которая набирает около 14%.

An overview of Gemini 2.5 Pro's benchmark performance

Fig 2. Обзор результатов тестирования Gemini 2.5 Pro.

Она также очень хорошо справляется с математическими задачами и задачками по кодированию, часто превосходя или соответствуя производительности таких моделей, как OpenAI GPT-4.5, Claude 3.7 Sonnet, Grok 3 Beta и DeepSeek R1, демонстрируя свою способность справляться со сложными задачами и обрабатывать большие объемы данных.

Начинаем работу с Gemini 2.5: как использовать Google Gemini API#

Gemini 2.5 Pro доступна на нескольких платформах. Ты можешь экспериментировать с ней в Google AI Studio и получить доступ через приложение Gemini для пользователей Gemini Advanced. В анонсе запуска Google DeepMind также упомянули, что модель скоро будет поддерживаться на Vertex AI. Эти точки доступа облегчают разработчикам использование Gemini 2.5 Pro для реальных ИИ-приложений.

Однако, если ты хочешь использовать Google Gemini API и начать работу всего за несколько минут без сложной настройки, а также получить лучшее представление о ее возможностях компьютерного зрения, ты можешь заглянуть в Ultralytics notebook, в котором демонстрируются такие задачи, как обнаружение объектов и создание подписей к изображениям с помощью Gemini 2.5 Pro. Давай подробно рассмотрим, что тебя ждет в этом блокноте.

Настройка логического вывода с помощью ноутбука Google Gemini 2.5#

Чтобы начать работу с блокнотом Ultralytics и использовать Google Gemini 2.5, тебе сначала нужно сгенерировать ключ API через Google AI Studio. Этот ключ дает тебе доступ к Gemini API, чтобы ты мог использовать модель.

Как только у тебя появится ключ API, убедись, что в твоем окружении установлены необходимые библиотеки — сюда входят пакеты от Ultralytics и инструментарий ИИ от Google. Этот шаг четко описан в блокноте, так что ты сможешь легко следовать инструкциям по настройке своего рабочего пространства.

После настройки всего необходимого ты сможешь подключиться к Gemini API, введя свой API-ключ (как показано ниже), что создаст связь между твоей рабочей средой и моделью. После этого ты будешь готов отправлять изображения и текстовые запросы в Gemini 2.5.

По сути, ты можешь предоставить изображение и простую инструкцию (например, «найди объекты на этом изображении» или «опиши то, что ты видишь») модели, и она вернет тебе нужные результаты. Этот простой процесс позволяет легко начать изучение возможностей компьютерного зрения в Gemini 2.5.

Обнаружение объектов с Google Gemini 2.5#

Один из ключевых примеров в ноутбуке — обнаружение объектов с помощью Gemini 2.5 Pro. В этом примере ты предоставляешь модели изображение и простой запрос для обнаружения объектов.

Модель обрабатывает изображение и возвращает набор координат и меток для каждого найденного объекта; эти координаты задаются в нормализованном виде. Затем функции из Ultralytics Python package используются для преобразования этих нормализованных значений в соответствии с фактическими размерами изображения и прорисовки четких границ вокруг каждого объекта, как показано ниже.

Using Google Gemini 2.5 for object detection

Рис. 3. Использование Google Gemini 2.5 для обнаружения объектов.

Описание изображений с помощью Gemini 2.5#

Другой интересный пример в блокноте — это image captioning с использованием Gemini 2.5 Pro. В этом примере ты передаешь модели изображение и промт с просьбой создать подробную подпись, описывающую то, что находится на изображении.

Затем модель анализирует визуальный контент и возвращает повествование, часто отформатированное как несколько предложений, которое отражает как содержание, так и контекст изображения. Эта функция полезна для улучшения доступности, обобщения визуальной информации и даже улучшения творческого повествования.

Повышение точности OCR с помощью моделей Google Gemini#

Задача компьютерного зрения, которая использует способность Gemini 2.5 Pro читать текст на изображениях, — это OCR. В ноутбуке ты можешь предоставить модели изображение, содержащее текст, вместе с запросом на извлечение этого текста. Модель обрабатывает изображение и возвращает как обнаруженный текст, так и координаты, где этот текст находится, как показано ниже.

Затем функции из пакета Python Ultralytics используются для преобразования этих нормализованных координат в фактические размеры изображения и прорисовки bounding boxes вокруг областей текста. Такой размеченный вывод позволяет четко понять, где расположен текст, что полезно для оцифровки документов, автоматизации ввода данных и повышения доступности.

Extracting textual data in an image using Google Gemini 2.5

Рис. 4. Извлечение текстовых данных на изображении с использованием Google Gemini 2.5.

Реальные применения Google Gemini 2.5#

Теперь, когда мы разобрали, как Google Gemini 2.5 Pro может быть использована для различных задач компьютерного зрения, давай изучим некоторые реальные приложения, где можно применить эти возможности.

Способность Gemini 2.5 Pro обнаруживать объекты, например, может помочь автоматически маркировать и упорядочивать большие наборы изображений, что делает такие задачи, как создание dataset или управление контентом, намного быстрее. Ее также можно использовать для анализа изображений в таких областях, как розничная торговля и сельское хозяйство — например, для обнаружения товаров на полках или выявления признаков стресса у сельскохозяйственных культур на фотографиях ферм.

Gemini 2.5 Pro analyzing a plant's health

Рис. 5. Gemini 2.5 Pro анализирует состояние растения.

Тем временем, функция описания изображений в модели может помочь пользователям с нарушениями зрения понять, что изображено на картинке. Например, если у тебя есть фотография оживленной улицы, модель может создать описание, которое детально описывает сцену, упоминая типы транспортных средств, активность пешеходов и даже время суток, основываясь на признаках освещения.

В дополнение к этому, функциональность OCR в Gemini 2.5 может быть использована в самых разных приложениях. Например, ты можешь оцифровывать печатные документы путем сканирования страниц или квитанций. Эта возможность идеально подходит для автоматизации задач ввода данных, обработки форм или даже чтения текста с визитных карточек и вывесок.

В целом, Google Gemini 2.5 Pro открывает двери для широкого спектра практических ИИ-приложений.

Основные выводы#

Выходя за рамки простого создания и анализа текста, Google Gemini 2.5 Pro может использоваться для задач компьютерного зрения, таких как обнаружение объектов, описание изображений и OCR. Благодаря своему массивному контекстному окну и улучшенным возможностям рассуждения, она выдает детальные, контекстно-зависимые результаты, которые хорошо работают в реальных сценариях.

По мере того как модели ИИ продолжают развиваться, такие инструменты, как Gemini 2.5 Pro, облегчают решение сложных проблем в различных отраслях. Вероятно, мы увидим еще более широкое внедрение ИИ, поскольку все больше организаций ищут гибкие, мультимодальные решения, способные справляться с широким кругом задач, от визуального понимания до обработки языка.

Стань частью our community и узнавай о передовых проектах в сфере ИИ в нашем GitHub repository. Посмотри на применение Vision AI in agriculture и роль AI in manufacturing на наших страницах решений. Изучи our licensing plans и создавай решения компьютерного зрения уже сегодня!

Explore solutions

Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше

Давай строить будущее ИИ вместе!

Начни свой путь в будущее машинного обучения