Ultralytics YOLO27:
Компьютерное зрение на базе ИИ

Florence-2: новейшая визуально-языковая модель Microsoft

Познакомься с Florence-2 — визуально-языковой моделью Microsoft, которая обеспечивает улучшенное обнаружение объектов, сегментацию и производительность в режиме zero-shot при высокой эффективности.

ABAbirami Vina7 min read
Визуально-языковая модель Florence-2 от Microsoft

В июне 2024 года Microsoft представила Florence-2 — мультимодальную визуально-языковую модель (VLM), предназначенную для выполнения широкого спектра задач, включая обнаружение объектов, сегментацию, создание подписей к изображениям и визуальное сопоставление. Florence-2 устанавливает новый ориентир для производительности в режиме zero-shot, то есть может выполнять задачи без предварительного специального обучения, и отличается меньшим размером модели по сравнению с другими передовыми визуально-языковыми моделями.

Florence-2 — это не просто ещё одна модель: её универсальность и повышенная производительность способны значительно повлиять на различные отрасли, повысив точность и сократив необходимость в длительном обучении. В этой статье мы рассмотрим инновационные возможности Florence-2, сравним её производительность с другими VLM и обсудим потенциальные варианты применения.

Что такое Florence-2?#

Florence-2 может выполнять различные задачи в рамках единой унифицированной архитектуры. Впечатляющие возможности модели отчасти обусловлены её огромным обучающим набором данных под названием FLD-5B. FLD-5B включает 5,4 миллиарда аннотаций для 126 миллионов изображений. Этот комплексный набор данных был создан специально для наделения Florence-2 возможностями, необходимыми для выполнения широкого спектра задач компьютерного зрения с высокой точностью и эффективностью.

Рассмотрим подробнее задачи, которые поддерживает Florence-2:

  • Обнаружение объектов: модель может с высокой точностью идентифицировать объекты на изображениях и определять их местоположение.
  • Сегментация: эта задача заключается в разделении изображения на значимые сегменты для упрощения анализа и интерпретации.
  • Создание подписей к изображениям: Florence-2 может генерировать описательные подписи к изображениям, содержащие контекст и подробности.
  • Визуальное сопоставление: модель может связывать определённые фразы или слова в подписи с соответствующими областями изображения.
  • Производительность в режиме zero-shot: модель может выполнять задачи без специального обучения.

Схема обучения Florence-2

Рис. 1. Как обучалась Florence-2.

Модель поддерживает задачи как на основе текста, так и на основе областей. Для задач, связанных с определёнными областями изображения, в словарь модели добавляются специальные токены местоположения. Эти токены помогают модели распознавать различные формы, например прямоугольники вокруг объектов (представление в виде рамки), четырёхугольники (представление в виде четырёхугольной рамки) и многоугольники (представление в виде полигона). Модель обучается с использованием метода, называемого функцией потерь кросс-энтропии, который помогает ей учиться, сравнивая предсказания с правильными ответами и соответствующим образом корректируя внутренние параметры.

Создание набора данных FLD-5B#

Набор данных FLD-5B включает различные типы аннотаций: текстовые описания, пары областей и текста, а также комбинации текста, фраз и областей. Он был создан в два этапа, включавших сбор и аннотирование данных. Изображения были получены из популярных наборов данных, таких как ImageNet-22k, Object 365, Open Images, Conceptual Captions и LAION. Аннотации в наборе данных FLD-5B в основном синтетические, то есть сгенерированы автоматически, а не размечены вручную.

Схема создания набора данных FLD-5B

Рис. 2. Создание набора данных FLD-5B.

Сначала специализированные модели, хорошо справляющиеся с конкретными задачами, такими как обнаружение объектов или сегментация, создавали эти аннотации. Затем применялся процесс фильтрации и улучшения, чтобы убедиться в их подробности и точности. После удаления шумов набор данных проходил итеративное уточнение: выходные данные Florence-2 использовались для постоянного обновления и улучшения аннотаций.

Архитектура модели Florence-2#

Архитектура модели Florence-2 основана на подходе обучения «последовательность в последовательность». Это означает, что модель обрабатывает входную последовательность (например, изображение с текстовым запросом) и пошагово генерирует выходную последовательность (например, описание или метку). В рамках подхода «последовательность в последовательность» каждая задача рассматривается как задача перевода: модель получает входное изображение и запрос, специфичный для задачи, а затем генерирует соответствующий результат.

Схема архитектуры визуально-языковой модели Florence-2

Рис. 3. Архитектура визуально-языковой модели Florence-2.

В основе архитектуры модели лежит мультимодальный трансформерный энкодер-декодер, объединяющий энкодер изображений и мультимодальный энкодер-декодер. Энкодер изображений, называемый DaViT (эффективный по данным визуальный Transformer), обрабатывает входные изображения, преобразуя их во встраивания визуальных токенов — компактные представления изображения, содержащие пространственную (где находятся объекты) и семантическую (что это за объекты) информацию. Затем эти визуальные токены объединяются с текстовыми встраиваниями (представлениями текста), позволяя модели бесшовно объединять текстовые и визуальные данные.

Сравнение Florence-2 с другими VLM#

Florence-2 выделяется среди других визуально-языковых моделей впечатляющими возможностями в режиме zero-shot. В отличие от моделей вроде PaliGemma, которые полагаются на масштабную тонкую настройку для адаптации к различным задачам, Florence-2 хорошо работает сразу после запуска. Кроме того, Florence-2 способна конкурировать с более крупными моделями, такими как GPT-4V и Flamingo, у которых часто гораздо больше параметров, но производительность не всегда превосходит Florence-2. Например, Florence-2 показывает лучшие результаты в режиме zero-shot, чем Kosmos-2, несмотря на то, что у Kosmos-2 более чем вдвое больше параметров.

В ходе сравнительных тестов Florence-2 продемонстрировала впечатляющую производительность в таких задачах, как создание подписей для COCO и понимание реферирующих выражений. В задачах обнаружения объектов и сегментации на наборе данных COCO она превзошла такие модели, как PolyFormer и UNINEXT. Это конкурентоспособный выбор для реальных приложений, где критически важны и производительность, и эффективное использование ресурсов.

Применение Florence-2#

Florence-2 можно использовать во множестве отраслей, таких как развлечения, доступность, образование и других. Рассмотрим несколько примеров, чтобы лучше понять возможности модели.

Применение создания подписей к изображениям#

Когда ты находишься на стриминговой платформе и выбираешь, что посмотреть, ты можешь прочитать краткое содержание фильма, чтобы принять решение. А что, если бы платформа также могла предоставить подробное описание постера фильма? Florence-2 делает это возможным благодаря созданию подписей к изображениям — генерации описательного текста для изображений. Florence-2 может создавать подробные описания постеров фильмов, делая стриминговые платформы более доступными для пользователей с нарушениями зрения. Анализируя визуальные элементы постера, такие как персонажи, декорации и текст, Florence-2 может создавать подробные описания, передающие содержание и настроение постера. Изображение ниже показывает уровень детализации, который Florence-2 может обеспечить в своём описании.

Пример подписи к изображению, созданной Florence-2

Рис. 4. Пример подписи к изображению, созданной Florence-2.

Вот ещё несколько примеров того, где создание подписей к изображениям может быть полезно:

  • Электронная коммерция: создание подписей к изображениям может предоставлять подробные описания изображений товаров, помогая покупателям лучше понимать характеристики и особенности продукции.
  • Путешествия и туризм: технология может предоставлять подробные описания достопримечательностей и туристических объектов в путеводителях и приложениях.
  • Образование: создание подписей к изображениям может размечать и описывать учебные изображения и схемы, помогая в преподавании и обучении.
  • Недвижимость: технология может предоставлять подробные описания изображений объектов недвижимости, выделяя характеристики и удобства, важные для потенциальных покупателей.

Использование визуального сопоставления во время готовки#

Florence-2 также можно использовать для улучшения кулинарного опыта. Например, онлайн-поваренная книга может применять Florence-2 для визуального сопоставления и обозначения частей сложного изображения рецепта. Визуальное сопоставление помогает связать определённые части изображения с соответствующим описательным текстом. Каждый ингредиент и этап можно точно обозначить и объяснить, благодаря чему домашним поварам проще следовать рецепту и понимать роль каждого компонента в блюде.

Пример визуального сопоставления с использованием Florence-2

Рис. 5. Пример визуального сопоставления с использованием Florence-2.

Распознавание текста по областям для финансовых документов#

OCR с обработкой по областям, при которой внимание сосредоточено на извлечении текста из определённых частей документа, может пригодиться в таких сферах, как бухгалтерский учёт. Выделенные области финансовых документов можно анализировать для автоматического извлечения важной информации, например сведений о транзакциях, номеров счетов и сроков оплаты. Сокращая необходимость ручного ввода данных, технология уменьшает количество ошибок и ускоряет обработку. Финансовые учреждения могут использовать её для оптимизации таких задач, как обработка счетов, сверка квитанций и клиринг чеков, что приводит к ускорению транзакций и повышению качества обслуживания клиентов.

Пример OCR по областям с использованием Florence-2

Рис. 6. Пример извлечения текста с помощью OCR по областям с использованием Florence-2.

Сегментация по областям в промышленных приложениях#

Сегментация по областям, которая заключается в разделении изображения на значимые части для целевого анализа и детальной проверки, может способствовать развитию промышленных приложений, повышающих точность и эффективность различных процессов. Сосредоточившись на определённых областях изображения, эта технология позволяет подробно проверять и анализировать компоненты и продукцию. В сфере контроля качества она может выявлять дефекты или несоответствия в материалах, например трещины или смещения, гарантируя, что на рынок попадёт только продукция высшего качества.

Пример сегментации по областям с использованием Florence-2

Рис. 7. Пример сегментации на основе областей с использованием Florence-2.

Она также улучшает работу автоматизированных сборочных линий, направляя роботизированные манипуляторы к определённым деталям и оптимизируя размещение и сборку компонентов. Аналогично, в сфере управления запасами она помогает отслеживать и контролировать состояние и местоположение товаров, повышая эффективность логистики и сокращая простои. В целом сегментация по областям повышает точность и производительность, что приводит к снижению затрат и улучшению качества продукции в промышленной среде.

Основные выводы#

Мы начинаем наблюдать тенденцию: модели AI становятся легче, сохраняя при этом высокую производительность. Florence-2 знаменует собой значительный шаг вперёд в области визуально-языковых моделей. Она может выполнять различные задачи, такие как обнаружение объектов, сегментация, создание подписей к изображениям и визуальное сопоставление, демонстрируя впечатляющую производительность в режиме zero-shot. Несмотря на меньший размер, Florence-2 эффективна и многофункциональна, что делает её чрезвычайно полезной для приложений в различных отраслях. Такие модели, как Florence-2, открывают новые возможности и расширяют потенциал инноваций в области AI.

Узнай больше об AI, посетив наш репозиторий на GitHub и присоединившись к нашему сообществу. Загляни на страницы наших решений, чтобы узнать о применении AI в сферах производства и сельского хозяйства. 🚀

Explore solutions

Компьютерное зрение для аэрофотоснимков

Компьютерное зрение для аэрофотоснимков

Превращай кадры с дронов и аэрофотоснимки в аналитику в реальном времени для сельского хозяйства, аквакультуры, экологического мониторинга, охраны природы и геопространственного анализа с помощью Ultralytics YOLO.
Узнать больше
Компьютерное зрение в аэрокосмической отрасли

Компьютерное зрение в аэрокосмической отрасли

Внедри компьютерное зрение в воздушный мониторинг с моделями Ultralytics YOLO. Обеспечь дроны, аэрокосмические рабочие процессы, задачи охраны природы и геопространственные отрасли решениями на базе компьютерного зрения.
Узнать больше

Защити каждый объект с помощью моделей Ultralytics YOLO. Компьютерное зрение обеспечивает мониторинг периметра, обнаружение угроз, распознавание номерных знаков и безопасность на рабочем месте.
Узнать больше
Компьютерное зрение в робототехнике

Компьютерное зрение в робототехнике

Оснащай более умные машины моделями Ultralytics YOLO. Vision AI в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Компьютерное зрение в логистике

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI обеспечивает инспекцию посылок, сортировку, отслеживание транспорта и мониторинг безопасности на складах в реальном времени.
Узнать больше
Компьютерное зрение в розничной торговле

Компьютерное зрение в розничной торговле

Переосмысли розничную торговлю с помощью моделей Ultralytics YOLO. Vision AI обеспечивает отслеживание запасов, мониторинг полок, управление очередями и более глубокое понимание поведения клиентов.
Узнать больше
Компьютерное зрение в здравоохранении

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с моделями Ultralytics YOLO. Vision AI в здравоохранении обеспечивает более быструю обработку медицинских изображений, более точную диагностику и интеллектуальный мониторинг пациентов.
Узнать больше
Компьютерное зрение в производстве

Компьютерное зрение в производстве

Оптимизируй производство с моделями Ultralytics YOLO. Vision AI обеспечивает контроль качества, обнаружение дефектов, соблюдение требований к PPE и автоматизацию сборочной линии.
Узнать больше
Компьютерное зрение в автомобильной отрасли

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. Vision AI повышает безопасность дорог, эффективность систем помощи водителю и уровень автоматизации автомобилей, делая дороги умнее.
Узнать больше
Компьютерное зрение в сельском хозяйстве

Компьютерное зрение в сельском хозяйстве

Добавь Vision AI в умное сельское хозяйство с моделями Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание поголовья и точное земледелие для более высоких и эффективных урожаев.
Узнать больше
Компьютерное зрение для аэрофотоснимков

Компьютерное зрение для аэрофотоснимков

Превращай кадры с дронов и аэрофотоснимки в аналитику в реальном времени для сельского хозяйства, аквакультуры, экологического мониторинга, охраны природы и геопространственного анализа с помощью Ultralytics YOLO.
Узнать больше
Компьютерное зрение в аэрокосмической отрасли

Компьютерное зрение в аэрокосмической отрасли

Внедри компьютерное зрение в воздушный мониторинг с моделями Ultralytics YOLO. Обеспечь дроны, аэрокосмические рабочие процессы, задачи охраны природы и геопространственные отрасли решениями на базе компьютерного зрения.
Узнать больше

Защити каждый объект с помощью моделей Ultralytics YOLO. Компьютерное зрение обеспечивает мониторинг периметра, обнаружение угроз, распознавание номерных знаков и безопасность на рабочем месте.
Узнать больше
Компьютерное зрение в робототехнике

Компьютерное зрение в робототехнике

Оснащай более умные машины моделями Ultralytics YOLO. Vision AI в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Компьютерное зрение в логистике

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI обеспечивает инспекцию посылок, сортировку, отслеживание транспорта и мониторинг безопасности на складах в реальном времени.
Узнать больше
Компьютерное зрение в розничной торговле

Компьютерное зрение в розничной торговле

Переосмысли розничную торговлю с помощью моделей Ultralytics YOLO. Vision AI обеспечивает отслеживание запасов, мониторинг полок, управление очередями и более глубокое понимание поведения клиентов.
Узнать больше
Компьютерное зрение в здравоохранении

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с моделями Ultralytics YOLO. Vision AI в здравоохранении обеспечивает более быструю обработку медицинских изображений, более точную диагностику и интеллектуальный мониторинг пациентов.
Узнать больше
Компьютерное зрение в производстве

Компьютерное зрение в производстве

Оптимизируй производство с моделями Ultralytics YOLO. Vision AI обеспечивает контроль качества, обнаружение дефектов, соблюдение требований к PPE и автоматизацию сборочной линии.
Узнать больше
Компьютерное зрение в автомобильной отрасли

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. Vision AI повышает безопасность дорог, эффективность систем помощи водителю и уровень автоматизации автомобилей, делая дороги умнее.
Узнать больше
Компьютерное зрение в сельском хозяйстве

Компьютерное зрение в сельском хозяйстве

Добавь Vision AI в умное сельское хозяйство с моделями Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание поголовья и точное земледелие для более высоких и эффективных урожаев.
Узнать больше
Компьютерное зрение для аэрофотоснимков

Компьютерное зрение для аэрофотоснимков

Превращай кадры с дронов и аэрофотоснимки в аналитику в реальном времени для сельского хозяйства, аквакультуры, экологического мониторинга, охраны природы и геопространственного анализа с помощью Ultralytics YOLO.
Узнать больше
Компьютерное зрение в аэрокосмической отрасли

Компьютерное зрение в аэрокосмической отрасли

Внедри компьютерное зрение в воздушный мониторинг с моделями Ultralytics YOLO. Обеспечь дроны, аэрокосмические рабочие процессы, задачи охраны природы и геопространственные отрасли решениями на базе компьютерного зрения.
Узнать больше

Защити каждый объект с помощью моделей Ultralytics YOLO. Компьютерное зрение обеспечивает мониторинг периметра, обнаружение угроз, распознавание номерных знаков и безопасность на рабочем месте.
Узнать больше
Компьютерное зрение в робототехнике

Компьютерное зрение в робототехнике

Оснащай более умные машины моделями Ultralytics YOLO. Vision AI в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Компьютерное зрение в логистике

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI обеспечивает инспекцию посылок, сортировку, отслеживание транспорта и мониторинг безопасности на складах в реальном времени.
Узнать больше
Компьютерное зрение в розничной торговле

Компьютерное зрение в розничной торговле

Переосмысли розничную торговлю с помощью моделей Ultralytics YOLO. Vision AI обеспечивает отслеживание запасов, мониторинг полок, управление очередями и более глубокое понимание поведения клиентов.
Узнать больше
Компьютерное зрение в здравоохранении

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с моделями Ultralytics YOLO. Vision AI в здравоохранении обеспечивает более быструю обработку медицинских изображений, более точную диагностику и интеллектуальный мониторинг пациентов.
Узнать больше
Компьютерное зрение в производстве

Компьютерное зрение в производстве

Оптимизируй производство с моделями Ultralytics YOLO. Vision AI обеспечивает контроль качества, обнаружение дефектов, соблюдение требований к PPE и автоматизацию сборочной линии.
Узнать больше
Компьютерное зрение в автомобильной отрасли

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. Vision AI повышает безопасность дорог, эффективность систем помощи водителю и уровень автоматизации автомобилей, делая дороги умнее.
Узнать больше
Компьютерное зрение в сельском хозяйстве

Компьютерное зрение в сельском хозяйстве

Добавь Vision AI в умное сельское хозяйство с моделями Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание поголовья и точное земледелие для более высоких и эффективных урожаев.
Узнать больше

Давай вместе создавать будущее AI!

Начни свой путь в будущее машинного обучения