Google PaliGemma 2: обзор продвинутых VLM-моделей
Вместе с нами подробнее рассмотрим новые зрительно-языковые модели Google: PaliGemma 2. Эти модели помогают понимать и анализировать изображения и текст.

5 декабря 2024 года Google представила PaliGemma 2 — последнюю версию своей передовой модели компьютерного зрения и языка (VLM). PaliGemma 2 предназначена для выполнения задач, объединяющих изображения и текст, таких как создание подписей, ответы на вопросы по изображениям и обнаружение объектов на визуальных материалах.
Развивая оригинальную PaliGemma, которая уже была эффективным инструментом для многоязычного создания подписей и распознавания объектов, PaliGemma 2 предлагает несколько важных улучшений. К ним относятся модели большего размера, поддержка изображений с более высоким разрешением и улучшенная производительность в сложных задачах компьютерного зрения. Благодаря этим обновлениям модель стала ещё более гибкой и эффективной для широкого спектра применений.
В этой статье мы подробнее рассмотрим PaliGemma 2, включая принцип её работы, ключевые возможности и области применения, в которых она особенно эффективна. Давай начнём!
От Gemma 2 к PaliGemma 2#
PaliGemma 2 построена на основе двух ключевых технологий: энкодера компьютерного зрения SigLIP и языковой модели Gemma 2. Энкодер SigLIP обрабатывает визуальные данные, например изображения или видео, и преобразует их в признаки, которые модель может анализировать. Gemma 2 тем временем обрабатывает текст, позволяя модели понимать и генерировать многоязычный текст. Вместе они образуют VLM, предназначенную для бесшовной интерпретации и объединения визуальной и текстовой информации.
PaliGemma 2 делает значительный шаг вперёд благодаря масштабируемости и универсальности. В отличие от оригинальной версии, PaliGemma 2 выпускается в трёх размерах: 3 миллиарда (3B), 10 миллиардов (10B) и 28 миллиардов (28B) параметров. Эти параметры можно сравнить с внутренними настройками модели: они помогают ей эффективно обучаться и обрабатывать данные. Модель также поддерживает разные разрешения изображений — например, 224 x 224 пикселя для быстрых задач и 896 x 896 для детального анализа, — благодаря чему адаптируется к различным применениям.

Рис. 1. Обзор PaliGemma 2.
Объединение продвинутых языковых возможностей Gemma 2 с обработкой изображений SigLIP делает PaliGemma 2 значительно интеллектуальнее. Модель может выполнять такие задачи, как:
- Создание подписей к изображениям или видео: модель может генерировать подробные текстовые описания визуальных материалов, что делает её полезной для автоматического создания подписей.
- Ответы на вопросы по изображениям: PaliGemma 2 может отвечать на вопросы по изображениям, например определять объекты, людей или действия в сцене.
- Распознавание объектов: модель определяет объекты на изображении и присваивает им метки, например различает кошку, стол или автомобиль на фотографии.
PaliGemma 2 не просто обрабатывает изображения и текст по отдельности — она осмысленно объединяет их. Например, модель может понимать взаимосвязи в сцене, распознавая, что «Кошка сидит на столе», или определять объекты с учётом контекста, например узнавать известную достопримечательность.
Как работают VLM-модели PaliGemma 2 от Google#
Далее мы разберём пример с графиком, показанным на изображении ниже, чтобы лучше понять, как PaliGemma 2 обрабатывает визуальные и текстовые данные. Предположим, ты загружаешь этот график и спрашиваешь модель: «Что представляет собой этот график?»

Рис. 2. Пример возможностей PaliGemma 2.
Процесс начинается с анализа изображений энкодером компьютерного зрения SigLIP в PaliGemma 2 и извлечения ключевых признаков. Для графика это включает определение таких элементов, как оси, точки данных и подписи. Энкодер обучен улавливать как общие закономерности, так и мелкие детали. Он также использует оптическое распознавание символов (OCR) для обнаружения и обработки текста, встроенного в изображение. Эти визуальные признаки преобразуются в токены — числовые представления, которые модель может обрабатывать. Затем токены корректируются с помощью линейного проекционного слоя — метода, обеспечивающего их бесшовное объединение с текстовыми данными.
Одновременно языковая модель Gemma 2 обрабатывает сопутствующий запрос, чтобы определить его смысл и намерение. Текст запроса преобразуется в токены, которые объединяются с визуальными токенами SigLIP для создания мультимодального представления — единого формата, связывающего визуальные и текстовые данные.
Используя это интегрированное представление, PaliGemma 2 пошагово генерирует ответ с помощью авторегрессионного декодирования — метода, при котором модель предсказывает очередную часть ответа на основе уже обработанного контекста.
Ключевые возможности PaliGemma 2#
Теперь, когда мы разобрались, как работает PaliGemma 2, давай рассмотрим ключевые особенности, делающие её надёжной моделью компьютерного зрения и языка:
- Гибкость дообучения: модель легко адаптируется к конкретным наборам данных и задачам, хорошо показывая себя в таких применениях, как создание подписей к изображениям, пространственное мышление и анализ медицинских изображений.
- Разнообразные обучающие данные: модель обучена на таких наборах данных, как WebLI и OpenImages, что обеспечивает ей широкие возможности распознавания объектов и генерации многоязычного вывода.
- Интеграция OCR: включает оптическое распознавание символов для извлечения и интерпретации текста на изображениях, что делает модель идеальной для анализа документов и других задач, связанных с текстом.
- Многоязычный вывод: модель генерирует подписи и ответы на нескольких языках, что идеально подходит для глобальных применений.
- Интеграция с инструментами: модель совместима с такими фреймворками, как Hugging Face Transformers, PyTorch и Keras, что упрощает развёртывание и эксперименты.
Сравнение PaliGemma 2 и PaliGemma: что улучшилось?#
Изучение архитектуры первой версии PaliGemma — хороший способ увидеть улучшения в PaliGemma 2. Одно из наиболее заметных изменений — замена исходной языковой модели Gemma на Gemma 2, что существенно повысило производительность и эффективность.
Gemma 2, доступная в версиях с 9B и 27B параметров, разработана для обеспечения лучшей в своём классе точности и скорости при одновременном снижении затрат на развёртывание. Это достигается благодаря переработанной архитектуре, оптимизированной для эффективного вывода на различных конфигурациях оборудования — от мощных GPU до более доступных вариантов.

Рис. 3. Возвращаясь к первой версии PaliGemma 2.
В результате PaliGemma 2 стала высокоточной моделью. Версия PaliGemma 2 с 10B параметров достигает более низкого показателя Non-Entailment Sentence (NES), равного 20,3, по сравнению с 34,3 у оригинальной модели, что означает меньшее количество фактических ошибок в выводе. Эти улучшения делают PaliGemma 2 более масштабируемой, точной и адаптируемой к широкому спектру применений — от создания подробных подписей до ответов на вопросы по изображениям.
Применения PaliGemma 2: реальные сценарии использования VLM-моделей#
PaliGemma 2 может преобразить целые отрасли благодаря бесшовному объединению визуального и языкового понимания. Например, в сфере доступности модель может генерировать подробные описания объектов, сцен и пространственных взаимосвязей, оказывая важную помощь людям с нарушениями зрения. Эта возможность помогает пользователям лучше понимать окружающую среду и обеспечивает им большую самостоятельность в повседневных задачах.

Рис. 4. PaliGemma 2 может сделать мир более доступным.
Помимо доступности, PaliGemma 2 уже применяется в различных отраслях, включая:
- Электронная коммерция: модель улучшает категоризацию товаров, анализируя и описывая объекты на изображениях, что упрощает управление запасами и делает поиск удобнее для пользователей.
- Здравоохранение: модель помогает медицинским специалистам интерпретировать медицинские изображения, такие как рентгеновские снимки и МРТ, вместе с клиническими заметками, чтобы ставить более точные и обоснованные диагнозы.
- Образование: PaliGemma 2 помогает преподавателям создавать информативные и доступные учебные материалы, генерируя подписи и предоставляя контекстную информацию для изображений.
- Создание контента: модель автоматизирует создание подписей и визуальных описаний для мультимедийного контента, экономя время авторов.
Попробуй сам: PaliGemma 2#
Чтобы попробовать PaliGemma 2, начни с интерактивной демонстрации Hugging Face. Она позволяет изучить возможности модели в таких задачах, как создание подписей к изображениям и ответы на вопросы по изображениям. Просто загрузи изображение и задай модели вопросы о нём или попроси описать сцену.

Рис. 5. Демонстрация PaliGemma 2 (источник: Hugging Face).
Если хочешь изучить тему глубже, вот как можно перейти к практике:
- Предобученные модели: ты можешь получить предобученные модели и код на таких платформах, как Hugging Face и Kaggle. Эти ресурсы содержат всё необходимое, чтобы начать работать с моделью.
- Ноутбуки: доступна подробная документация и примеры ноутбуков, которые помогут тебе познакомиться с PaliGemma 2. Можно начать с примеров вывода и поэкспериментировать с дообучением модели на собственном наборе данных для конкретных задач.
- Интеграции: PaliGemma 2 совместима с широко используемыми фреймворками, такими как Hugging Face Transformers, Keras, PyTorch, JAX и Gemma.cpp, что позволяет без лишних усилий интегрировать её в существующие рабочие процессы.
Преимущества и недостатки PaliGemma 2 от Google#
Теперь, когда мы разобрались, как начать работу с PaliGemma 2, давай подробнее рассмотрим её ключевые преимущества и недостатки, которые стоит учитывать при использовании этих моделей.
Вот что выделяет PaliGemma 2 среди моделей компьютерного зрения и языка:
- Повышение эффективности: благодаря оптимизированной архитектуре Gemma 2 PaliGemma 2 обеспечивает высокую производительность при минимальных затратах на развёртывание.
- Улучшенные функции безопасности: PaliGemma 2 включает значительные улучшения безопасности в процессе обучения, например тщательную фильтрацию данных для предобучения, снижающую предвзятость, и строгую оценку по тестам безопасности.
- Низкая задержка в небольших конфигурациях: модель 3B обеспечивает более быстрое выполнение вывода, что делает её подходящей для сценариев, где скорость критически важна, например для рекомендаций товаров в электронной коммерции или систем поддержки в реальном времени.
А вот в каких областях PaliGemma 2 может столкнуться с ограничениями:
- Задержка: несмотря на высокую мощность, у более крупных моделей могут возникать проблемы с задержкой, особенно при развёртывании для задач, требующих немедленных ответов, таких как интерактивные AI-системы реального времени.
- Зависимость от больших наборов данных: производительность PaliGemma 2 тесно связана с качеством и разнообразием обучающих наборов данных, что может ограничивать её эффективность в недостаточно представленных предметных областях или на языках, отсутствующих в обучающих данных.
- Высокие требования к ресурсам: несмотря на оптимизации, версии с 10B и 28B параметров требуют значительных вычислительных ресурсов, что делает их менее доступными для небольших организаций с ограниченными ресурсами.
Основные выводы#
PaliGemma 2 — впечатляющее достижение в области моделирования компьютерного зрения и языка, предлагающее улучшенную масштабируемость, гибкость дообучения и точность. Она может стать ценным инструментом для задач, связанных с решениями в сфере доступности, электронной коммерцией, диагностикой в здравоохранении и образованием.
Хотя у модели есть ограничения, включая требования к вычислительным ресурсам и зависимость от высококачественных данных, её преимущества делают PaliGemma 2 практичным выбором для решения сложных задач, объединяющих визуальные и текстовые данные. PaliGemma 2 может стать надёжной основой для исследователей и разработчиков, изучающих и расширяющих возможности AI в мультимодальных приложениях.
Присоединяйся к обсуждению AI: загляни в наш репозиторий GitHub и сообщество. Узнай, как AI помогает развивать сельское хозяйство и здравоохранение! 🚀









