Florence-2: новейшая визуально-языковая модель Microsoft
Познакомься с Florence-2 — визуально-языковой моделью Microsoft, которая обеспечивает улучшенное обнаружение объектов, сегментацию и производительность в режиме zero-shot при высокой эффективности.

В июне 2024 года Microsoft представила Florence-2 — мультимодальную визуально-языковую модель (VLM), предназначенную для выполнения широкого спектра задач, включая обнаружение объектов, сегментацию, создание подписей к изображениям и визуальное сопоставление. Florence-2 устанавливает новый ориентир для производительности в режиме zero-shot, то есть может выполнять задачи без предварительного специального обучения, и отличается меньшим размером модели по сравнению с другими передовыми визуально-языковыми моделями.
Florence-2 — это не просто ещё одна модель: её универсальность и повышенная производительность способны значительно повлиять на различные отрасли, повысив точность и сократив необходимость в длительном обучении. В этой статье мы рассмотрим инновационные возможности Florence-2, сравним её производительность с другими VLM и обсудим потенциальные варианты применения.
Что такое Florence-2?#
Florence-2 может выполнять различные задачи в рамках единой унифицированной архитектуры. Впечатляющие возможности модели отчасти обусловлены её огромным обучающим набором данных под названием FLD-5B. FLD-5B включает 5,4 миллиарда аннотаций для 126 миллионов изображений. Этот комплексный набор данных был создан специально для наделения Florence-2 возможностями, необходимыми для выполнения широкого спектра задач компьютерного зрения с высокой точностью и эффективностью.
Рассмотрим подробнее задачи, которые поддерживает Florence-2:
- Обнаружение объектов: модель может с высокой точностью идентифицировать объекты на изображениях и определять их местоположение.
- Сегментация: эта задача заключается в разделении изображения на значимые сегменты для упрощения анализа и интерпретации.
- Создание подписей к изображениям: Florence-2 может генерировать описательные подписи к изображениям, содержащие контекст и подробности.
- Визуальное сопоставление: модель может связывать определённые фразы или слова в подписи с соответствующими областями изображения.
- Производительность в режиме zero-shot: модель может выполнять задачи без специального обучения.

Рис. 1. Как обучалась Florence-2.
Модель поддерживает задачи как на основе текста, так и на основе областей. Для задач, связанных с определёнными областями изображения, в словарь модели добавляются специальные токены местоположения. Эти токены помогают модели распознавать различные формы, например прямоугольники вокруг объектов (представление в виде рамки), четырёхугольники (представление в виде четырёхугольной рамки) и многоугольники (представление в виде полигона). Модель обучается с использованием метода, называемого функцией потерь кросс-энтропии, который помогает ей учиться, сравнивая предсказания с правильными ответами и соответствующим образом корректируя внутренние параметры.
Создание набора данных FLD-5B#
Набор данных FLD-5B включает различные типы аннотаций: текстовые описания, пары областей и текста, а также комбинации текста, фраз и областей. Он был создан в два этапа, включавших сбор и аннотирование данных. Изображения были получены из популярных наборов данных, таких как ImageNet-22k, Object 365, Open Images, Conceptual Captions и LAION. Аннотации в наборе данных FLD-5B в основном синтетические, то есть сгенерированы автоматически, а не размечены вручную.

Рис. 2. Создание набора данных FLD-5B.
Сначала специализированные модели, хорошо справляющиеся с конкретными задачами, такими как обнаружение объектов или сегментация, создавали эти аннотации. Затем применялся процесс фильтрации и улучшения, чтобы убедиться в их подробности и точности. После удаления шумов набор данных проходил итеративное уточнение: выходные данные Florence-2 использовались для постоянного обновления и улучшения аннотаций.
Архитектура модели Florence-2#
Архитектура модели Florence-2 основана на подходе обучения «последовательность в последовательность». Это означает, что модель обрабатывает входную последовательность (например, изображение с текстовым запросом) и пошагово генерирует выходную последовательность (например, описание или метку). В рамках подхода «последовательность в последовательность» каждая задача рассматривается как задача перевода: модель получает входное изображение и запрос, специфичный для задачи, а затем генерирует соответствующий результат.

Рис. 3. Архитектура визуально-языковой модели Florence-2.
В основе архитектуры модели лежит мультимодальный трансформерный энкодер-декодер, объединяющий энкодер изображений и мультимодальный энкодер-декодер. Энкодер изображений, называемый DaViT (эффективный по данным визуальный Transformer), обрабатывает входные изображения, преобразуя их во встраивания визуальных токенов — компактные представления изображения, содержащие пространственную (где находятся объекты) и семантическую (что это за объекты) информацию. Затем эти визуальные токены объединяются с текстовыми встраиваниями (представлениями текста), позволяя модели бесшовно объединять текстовые и визуальные данные.
Сравнение Florence-2 с другими VLM#
Florence-2 выделяется среди других визуально-языковых моделей впечатляющими возможностями в режиме zero-shot. В отличие от моделей вроде PaliGemma, которые полагаются на масштабную тонкую настройку для адаптации к различным задачам, Florence-2 хорошо работает сразу после запуска. Кроме того, Florence-2 способна конкурировать с более крупными моделями, такими как GPT-4V и Flamingo, у которых часто гораздо больше параметров, но производительность не всегда превосходит Florence-2. Например, Florence-2 показывает лучшие результаты в режиме zero-shot, чем Kosmos-2, несмотря на то, что у Kosmos-2 более чем вдвое больше параметров.
В ходе сравнительных тестов Florence-2 продемонстрировала впечатляющую производительность в таких задачах, как создание подписей для COCO и понимание реферирующих выражений. В задачах обнаружения объектов и сегментации на наборе данных COCO она превзошла такие модели, как PolyFormer и UNINEXT. Это конкурентоспособный выбор для реальных приложений, где критически важны и производительность, и эффективное использование ресурсов.
Применение Florence-2#
Florence-2 можно использовать во множестве отраслей, таких как развлечения, доступность, образование и других. Рассмотрим несколько примеров, чтобы лучше понять возможности модели.
Применение создания подписей к изображениям#
Когда ты находишься на стриминговой платформе и выбираешь, что посмотреть, ты можешь прочитать краткое содержание фильма, чтобы принять решение. А что, если бы платформа также могла предоставить подробное описание постера фильма? Florence-2 делает это возможным благодаря созданию подписей к изображениям — генерации описательного текста для изображений. Florence-2 может создавать подробные описания постеров фильмов, делая стриминговые платформы более доступными для пользователей с нарушениями зрения. Анализируя визуальные элементы постера, такие как персонажи, декорации и текст, Florence-2 может создавать подробные описания, передающие содержание и настроение постера. Изображение ниже показывает уровень детализации, который Florence-2 может обеспечить в своём описании.

Рис. 4. Пример подписи к изображению, созданной Florence-2.
Вот ещё несколько примеров того, где создание подписей к изображениям может быть полезно:
- Электронная коммерция: создание подписей к изображениям может предоставлять подробные описания изображений товаров, помогая покупателям лучше понимать характеристики и особенности продукции.
- Путешествия и туризм: технология может предоставлять подробные описания достопримечательностей и туристических объектов в путеводителях и приложениях.
- Образование: создание подписей к изображениям может размечать и описывать учебные изображения и схемы, помогая в преподавании и обучении.
- Недвижимость: технология может предоставлять подробные описания изображений объектов недвижимости, выделяя характеристики и удобства, важные для потенциальных покупателей.
Использование визуального сопоставления во время готовки#
Florence-2 также можно использовать для улучшения кулинарного опыта. Например, онлайн-поваренная книга может применять Florence-2 для визуального сопоставления и обозначения частей сложного изображения рецепта. Визуальное сопоставление помогает связать определённые части изображения с соответствующим описательным текстом. Каждый ингредиент и этап можно точно обозначить и объяснить, благодаря чему домашним поварам проще следовать рецепту и понимать роль каждого компонента в блюде.

Рис. 5. Пример визуального сопоставления с использованием Florence-2.
Распознавание текста по областям для финансовых документов#
OCR с обработкой по областям, при которой внимание сосредоточено на извлечении текста из определённых частей документа, может пригодиться в таких сферах, как бухгалтерский учёт. Выделенные области финансовых документов можно анализировать для автоматического извлечения важной информации, например сведений о транзакциях, номеров счетов и сроков оплаты. Сокращая необходимость ручного ввода данных, технология уменьшает количество ошибок и ускоряет обработку. Финансовые учреждения могут использовать её для оптимизации таких задач, как обработка счетов, сверка квитанций и клиринг чеков, что приводит к ускорению транзакций и повышению качества обслуживания клиентов.

Рис. 6. Пример извлечения текста с помощью OCR по областям с использованием Florence-2.
Сегментация по областям в промышленных приложениях#
Сегментация по областям, которая заключается в разделении изображения на значимые части для целевого анализа и детальной проверки, может способствовать развитию промышленных приложений, повышающих точность и эффективность различных процессов. Сосредоточившись на определённых областях изображения, эта технология позволяет подробно проверять и анализировать компоненты и продукцию. В сфере контроля качества она может выявлять дефекты или несоответствия в материалах, например трещины или смещения, гарантируя, что на рынок попадёт только продукция высшего качества.

Рис. 7. Пример сегментации на основе областей с использованием Florence-2.
Она также улучшает работу автоматизированных сборочных линий, направляя роботизированные манипуляторы к определённым деталям и оптимизируя размещение и сборку компонентов. Аналогично, в сфере управления запасами она помогает отслеживать и контролировать состояние и местоположение товаров, повышая эффективность логистики и сокращая простои. В целом сегментация по областям повышает точность и производительность, что приводит к снижению затрат и улучшению качества продукции в промышленной среде.
Основные выводы#
Мы начинаем наблюдать тенденцию: модели AI становятся легче, сохраняя при этом высокую производительность. Florence-2 знаменует собой значительный шаг вперёд в области визуально-языковых моделей. Она может выполнять различные задачи, такие как обнаружение объектов, сегментация, создание подписей к изображениям и визуальное сопоставление, демонстрируя впечатляющую производительность в режиме zero-shot. Несмотря на меньший размер, Florence-2 эффективна и многофункциональна, что делает её чрезвычайно полезной для приложений в различных отраслях. Такие модели, как Florence-2, открывают новые возможности и расширяют потенциал инноваций в области AI.
Узнай больше об AI, посетив наш репозиторий на GitHub и присоединившись к нашему сообществу. Загляни на страницы наших решений, чтобы узнать о применении AI в сферах производства и сельского хозяйства. 🚀









