FastVLM: Apple представляет свою новую быструю мультимодальную модель
Apple представляет FastVLM на конференции CVPR 2025. Эта модель зрения-языка с открытым исходным кодом оснащена энкодером FastViTHD, обеспечивающим до 85 раз более быстрое время получения первого токена.

На конференции CVPR 2025 компания Apple представила новую открытую ИИ-модель под названием FastVLM. Она создана для понимания как изображений, так и текста и работает на устройствах Apple, таких как iPhone, iPad и Mac. Это значит, что она может быстро выдавать интеллектуальные результаты без отправки твоих данных в облако.
Что делает FastVLM особенно интересной, так это её скорость и эффективность. Apple разработала новый визуальный энкодер FastViTHD, который помогает модели интерпретировать высококачественные изображения, потребляя при этом меньше памяти и энергии. Вся обработка происходит локально на устройстве, что обеспечивает быстрый отклик при сохранении конфиденциальности твоих данных.
В этой статье мы разберем, как работает FastVLM, в чем её уникальность и почему этот релиз от Apple может стать важным шагом вперед для повседневных ИИ-приложений на твоих устройствах.
Что такое мультимодальные модели (VLM)#
Прежде чем мы углубимся в то, что делает FastVLM особенной, давай разберем, что означает аббревиатура «VLM» в ее названии. Она относится к модели «зрение-язык», которая предназначена для понимания и связи визуального контента с текстом.
VLM объединяют визуальное восприятие и язык, позволяя выполнять такие задачи, как описание фото, ответы на вопросы о скриншоте или извлечение текста из документа. Обычно такие модели работают в две части: одна обрабатывает изображение и превращает его в данные, а вторая интерпретирует их, чтобы сгенерировать понятный тебе ответ.
Возможно, ты уже пользовался подобными инновациями, даже не осознавая этого. Приложения, которые сканируют чеки, считывают ID-карты, создают описания к фото или помогают слабовидящим людям взаимодействовать с экраном, часто полагаются на VLM, незаметно работающие в фоновом режиме.
Что такое FastVLM?#
Apple создала FastVLM для выполнения тех же задач, что и другие подобные модели, но с большей скоростью, повышенной конфиденциальностью и оптимизацией для работы на собственных устройствах. Она может понимать содержание изображения и отвечать текстом, но в отличие от многих моделей, зависящих от облачных серверов, FastVLM может работать полностью на твоем iPhone, iPad или Mac.
Как правило, VLM лучше работают с изображениями высокого разрешения. Например, как показано ниже, FastVLM могла корректно распознать дорожный знак «Въезд запрещен» только при подаче изображения в высоком качестве. Однако ввод в высоком разрешении обычно замедляет работу моделей. Именно здесь FastViTHD меняет ситуацию.

Рис. 1. Производительность FastVLM на изображениях с низким и высоким разрешением. (Источник)
Новый визуальный энкодер Apple, FastViTHD, помогает FastVLM обрабатывать изображения высокого качества эффективнее, используя меньше памяти и питания. В частности, FastViTHD достаточно легкий, чтобы плавно работать даже на компактных устройствах.
Кроме того, FastVLM доступна публично в репозитории FastVLM на GitHub, где разработчики могут получить доступ к исходному коду, вносить изменения и использовать её в своих приложениях в соответствии с лицензионными условиями Apple.
Сравнение FastVLM с другими VLM#
По сравнению с другими мультимодальными моделями, FastVLM оптимизирована для запуска на повседневных устройствах, таких как смартфоны и ноутбуки. В тестах производительности FastVLM генерировала первое слово или результат до 85 раз быстрее, чем модели типа LLaVA-OneVision-0.5B.

Рис. 2. Сравнение производительности FastVLM с другими моделями. (Источник)
Вот краткий обзор некоторых стандартных бенчмарков, на которых тестировалась FastVLM:
- DocVQA (Document Visual Question Answering): этот бенчмарк оценивает, насколько хорошо модель может читать и понимать текстовую информацию в документах, например, в отсканированных формах или на страницах.
- TextVQA (Text-based Visual Question Answering): оценивает способность модели интерпретировать изображения, содержащие встроенный текст, и точно отвечать на связанные с ними вопросы.
- GQA (Graph Question Answering): эта задача проверяет навыки рассуждения модели, требуя понимания связей между объектами и сценами на изображении.
- MMMU (Massive Multi-discipline Multimodal Understanding): измеряет эффективность работы модели в широком спектре академических дисциплин и форматов, сочетая визуальное и текстовое понимание.
- SeedBench (Standard Evaluation of Enhanced Data for Benchmarking): этот бенчмарк исследует общие возможности модели в визуальном понимании и рассуждении в различных доменах.
В этих бенчмарках FastVLM показала конкурентные результаты, используя при этом меньше ресурсов. Она приносит практический искусственный интеллект для работы с изображениями на повседневные устройства, такие как телефоны, планшеты и ноутбуки.
Эффективный визуальный энкодер FastVLM: FastViTHD#
Давай теперь подробнее рассмотрим FastViTHD, визуальный энкодер, который играет важнейшую роль в производительности обработки изображений FastVLM.
Большинство мультимодальных моделей разбивают изображение на тысячи мелких фрагментов, называемых токенами. Чем больше токенов, тем больше времени и энергии нужно модели для понимания изображения. Это может замедлять работу, особенно на телефонах или ноутбуках.

Рис. 3. Как визуальный энкодер обрабатывает изображение. (Источник)
FastViTHD позволяет избежать замедления, возникающего при обработке слишком большого количества токенов, используя их в меньшем количестве и при этом сохраняя понимание всего изображения. Она объединяет два подхода: трансформеры, которые хорошо моделируют паттерны и связи, и сверточные слои, эффективные при обработке визуальных данных. В результате получается система, которая работает быстрее и использует меньше памяти.
По данным Apple, FastViTHD до 3,4 раза меньше некоторых традиционных визуальных энкодеров, сохраняя при этом высокую точность. Вместо того чтобы полагаться на такие методы оптимизации моделей, как прунинг токенов (удаление менее важных фрагментов изображения для ускорения обработки), она достигает эффективности за счет более простой и оптимизированной архитектуры.
Варианты модели FastVLM и конвейер обучения#
Apple выпустила FastVLM в трех размерах: 0.5B, 1.5B и 7B параметров (где «B» означает миллиард, что относится к числу обучаемых весов в модели). Каждая версия спроектирована под разные типы устройств. Меньшие модели могут работать на телефонах и планшетах, тогда как более крупная 7B модель лучше подходит для настольных систем или более требовательных задач.
Это дает разработчикам гибкость в выборе того, что лучше всего подходит для их приложений. Ты можешь создать что-то быстрое и легкое для мобильных устройств или что-то более сложное для крупных систем, используя одну и ту же архитектуру модели.
Apple обучила варианты модели FastVLM с использованием пайплайна LLaVA-1.5 — фреймворка для согласования визуальных и языковых моделей. Для языкового компонента они оценили FastVLM с помощью существующих открытых моделей, таких как Qwen и Vicuna, которые известны генерацией естественного и связного текста. Такая установка позволяет FastVLM обрабатывать как простые, так и сложные изображения и выдавать читаемые, релевантные ответы.
Значимость FastVLM: эффективный подход Apple к ИИ#
Возможно, тебе интересно, почему эффективная обработка изображений FastVLM имеет такое значение? Всё сводится к тому, насколько плавно приложения могут работать в реальном времени, не полагаясь на облако. FastVLM может работать с изображениями высокого разрешения, до 1152 на 1152 пикселей, оставаясь достаточно быстрой и легкой для работы непосредственно на твоем устройстве.
Это значит, что приложения могут описывать то, что видит камера, сканировать чеки по мере их съемки или реагировать на изменения на экране, сохраняя при этом все данные локально. Это особенно полезно в таких сферах, как образование, доступность, продуктивность и фотографии.
Поскольку FastViTHD эффективен даже при работе с крупными изображениями, это помогает устройствам оставаться отзывчивыми и не перегреваться. Он работает со всеми размерами моделей, включая самую маленькую, которая запускается на базовых iPhone. Это значит, что одни и те же ИИ-функции могут работать на телефонах, планшетах и Mac.
Применение FastVLM#
FastVLM может стать основой для множества приложений благодаря своим ключевым преимуществам: скорости, эффективности и локальной конфиденциальности. Вот несколько способов её использования:
-
Чтение документов: модель может сканировать чеки, бланки или удостоверения личности и извлекать только нужную информацию. Она умеет концентрироваться на определенных областях изображения, что полезно для приложений, которым требуется быстрое и точное извлечение текста.
-
Описания изображений: анализируя фото, она может генерировать четкое описание того, что на нем изображено. Это поддерживает функции в приложениях камеры, фотогалереях или любом инструменте, которому полезно визуальное понимание в реальном времени.
-
Поддержка доступности: FastVLM может описывать содержимое экрана для незрячих или слабовидящих пользователей, делая кнопки, меню и элементы интерфейса более простыми для навигации и использования.
-
Локальные ИИ-ассистенты: FastVLM отлично работает с ИИ-помощниками, которым нужно быстро понимать, что происходит на экране. Поскольку она работает непосредственно на устройстве и хранит данные приватно, она может помогать с такими задачами, как чтение текста, идентификация кнопок или иконок, а также сопровождение пользователей в реальном времени без необходимости отправлять информацию в облако.

Рис. 4. FastVLM можно использовать для распознавания текста и визуального ответа на вопросы. (Источник)
Основные выводы#
FastVLM переносит визуальный ИИ на устройства Apple, сочетая в себе скорость, конфиденциальность и эффективность. Благодаря своей легкости и открытому исходному коду, она обеспечивает понимание изображений в реальном времени в мобильных и настольных приложениях.
Это делает ИИ более практичным и доступным для повседневного использования, а также дает разработчикам надежную основу для создания полезных и ориентированных на приватность приложений. Заглядывая в будущее, можно сказать, что мультимодальные модели будут играть важную роль в том, как мы взаимодействуем с технологиями, делая ИИ более отзывчивым, контекстно-зависимым и полезным в повседневных ситуациях.
Изучи наш репозиторий GitHub, чтобы узнать больше об ИИ. Присоединяйся к нашему активному сообществу и открывай для себя инновации в таких секторах, как ИИ в автомобильной промышленности и компьютерное зрение в производстве. Чтобы начать работу с компьютерным зрением уже сегодня, ознакомься с нашими вариантами лицензирования.






