FastVLM: Apple представляет новую быструю Vision-Language-модель
Apple представляет FastVLM на CVPR 2025. Эта модель Vision-Language с открытым исходным кодом использует энкодер FastViTHD и обеспечивает ускорение времени до получения первого токена до 85 раз.

На конференции CVPR 2025 Apple представила новую модель ИИ с открытым исходным кодом под названием FastVLM. Она умеет понимать изображения и язык и работает на таких устройствах Apple, как iPhone, iPad и Mac. Это позволяет быстро получать интеллектуальные результаты без отправки данных в облако.
FastVLM особенно интересна своей скоростью и эффективностью. Apple разработала новый энкодер компьютерного зрения FastViTHD, который помогает модели интерпретировать изображения высокого качества, используя меньше памяти и энергии. Вся обработка выполняется непосредственно на устройстве, что ускоряет время отклика и сохраняет конфиденциальность пользователей.
В этой статье мы разберёмся, как работает FastVLM, чем она отличается от других моделей и почему этот релиз Apple может стать важным шагом вперёд для повседневных приложений ИИ на твоих устройствах.
Что такое модели компьютерного зрения и языка (VLMs)#
Прежде чем перейти к особенностям FastVLM, разберёмся, что означает «VLM» в её названии. Это модель компьютерного зрения и языка, предназначенная для понимания визуального содержимого и его связи с языком.
VLMs объединяют визуальное понимание и язык, благодаря чему могут описывать фотографии, отвечать на вопросы по снимку экрана или извлекать текст из документа. Модели компьютерного зрения и языка обычно состоят из двух частей: одна обрабатывает изображение и преобразует его в данные, а другая интерпретирует эти данные и формирует ответ, который можно прочитать или услышать.
Возможно, ты уже пользовался такими инновациями в области ИИ, даже не замечая этого. Приложения, которые сканируют чеки, считывают удостоверения личности, создают подписи к изображениям или помогают людям со слабым зрением взаимодействовать с экранами, часто незаметно используют работающие в фоновом режиме модели компьютерного зрения и языка.
Что такое FastVLM?#
Apple создала FastVLM для выполнения тех же задач, что и другие модели компьютерного зрения и языка, но с более высокой скоростью, усиленной конфиденциальностью и оптимизированной производительностью на собственных устройствах. Она может понимать содержимое изображения и отвечать текстом, но, в отличие от многих моделей, зависящих от облачных серверов, FastVLM полностью работает на iPhone, iPad или Mac.
VLMs обычно лучше работают с изображениями высокого разрешения. Например, как показано ниже, FastVLM смогла правильно определить дорожный знак «Въезд запрещён» только при использовании изображения в высоком разрешении. Однако входные данные высокого разрешения обычно замедляют работу моделей. Именно здесь FastViTHD помогает изменить ситуацию.

Рис. 1. Производительность FastVLM на изображениях с низким и высоким разрешением. (Источник)
Новый энкодер компьютерного зрения Apple FastViTHD помогает FastVLM эффективнее обрабатывать изображения высокого качества, используя меньше памяти и энергии. В частности, FastViTHD достаточно лёгкий, чтобы стабильно работать даже на небольших устройствах.
Кроме того, FastVLM доступна публично в репозитории FastVLM на GitHub, где разработчики могут получить доступ к исходному коду, вносить изменения и использовать модель в собственных приложениях в соответствии с условиями лицензии Apple.
Сравнение FastVLM с другими моделями VLM#
По сравнению с другими моделями компьютерного зрения и языка FastVLM оптимизирована для работы на повседневных устройствах, таких как смартфоны и ноутбуки. В тестах производительности FastVLM генерировала первое слово или результат до 85 раз быстрее, чем такие модели, как LLaVA-OneVision-0.5B.

Рис. 2. Сравнение производительности FastVLM с другими моделями. (Источник)
Ниже приведены некоторые стандартные бенчмарки, на которых оценивалась FastVLM:
- DocVQA (визуальные вопросы и ответы по документам): этот бенчмарк оценивает, насколько хорошо модель может читать и понимать текстовую информацию в документах, например отсканированных формах или страницах.
- TextVQA (визуальные вопросы и ответы на основе текста): этот бенчмарк оценивает способность модели интерпретировать изображения со встроенным текстом и точно отвечать на связанные с ним вопросы.
- GQA (вопросы и ответы по графам): эта задача проверяет способность модели рассуждать, требуя от неё понимать взаимосвязи между объектами и сценами на изображении.
- MMMU (масштабное мультимодальное понимание в различных дисциплинах): этот бенчмарк измеряет производительность модели в широком спектре академических предметов и форматов, объединяя визуальное и текстовое понимание.
- SeedBench (стандартная оценка расширенных данных для бенчмаркинга): этот бенчмарк исследует общие возможности модели в области визуального понимания и рассуждений в различных сферах.
Во всех этих бенчмарках FastVLM показала конкурентоспособные результаты, используя при этом меньше ресурсов. Она делает практический ИИ для компьютерного зрения доступным на повседневных устройствах, таких как телефоны, планшеты и ноутбуки.
Эффективный энкодер компьютерного зрения FastVLM: FastViTHD#
Теперь подробнее рассмотрим FastViTHD — энкодер компьютерного зрения, который играет ключевую роль в производительности FastVLM при обработке изображений.
Большинство моделей компьютерного зрения и языка разбивают изображение на тысячи небольших фрагментов, называемых токенами. Чем больше токенов, тем больше времени и энергии требуется модели для понимания изображения. Это может замедлять работу, особенно на телефонах и ноутбуках.

Рис. 3. Как энкодер компьютерного зрения обрабатывает изображение. (Источник)
FastViTHD избегает замедления, связанного с обработкой слишком большого количества токенов, используя меньшее их число и при этом сохраняя понимание всего изображения. Она объединяет два подхода: трансформеры, хорошо моделирующие закономерности и взаимосвязи, и свёрточные слои, эффективно обрабатывающие визуальные данные. В результате получается система, которая работает быстрее и использует меньше памяти.
По данным Apple, FastViTHD до 3,4 раза меньше некоторых традиционных энкодеров компьютерного зрения, сохраняя при этом высокую точность. Вместо использования таких методов оптимизации моделей, как pruning токенов (удаление менее важных фрагментов изображения для ускорения обработки), она достигает эффективности благодаря более простой и оптимизированной архитектуре.
Варианты модели FastVLM и конвейер обучения#
Apple выпустила FastVLM в трёх вариантах размера: 0.5B, 1.5B и 7B параметров (где «B» означает миллиард и обозначает количество обучаемых весов в модели). Каждый вариант рассчитан на разные типы устройств. Меньшие модели могут работать на телефонах и планшетах, а более крупная модель 7B лучше подходит для настольных компьютеров или более ресурсоёмких задач.
Это даёт разработчикам возможность выбрать наиболее подходящий вариант для своих приложений. Они могут создать быстрое и лёгкое решение для мобильных устройств или более сложную систему для крупных платформ, используя при этом одну и ту же базовую архитектуру модели.
Apple обучала варианты модели FastVLM с использованием конвейера LLaVA‑1.5 — фреймворка для согласования моделей компьютерного зрения и языковых моделей. Для языкового компонента команда оценила FastVLM с помощью существующих моделей с открытым исходным кодом, таких как Qwen и Vicuna, известных способностью генерировать естественный и связный текст. Такая конфигурация позволяет FastVLM обрабатывать как простые, так и сложные изображения и выдавать понятные, релевантные ответы.
Значение FastVLM: эффективный подход Apple к ИИ#
Возможно, ты задаёшься вопросом: почему эффективная обработка изображений FastVLM так важна? Всё сводится к тому, насколько плавно приложения могут работать в реальном времени без зависимости от облака. FastVLM обрабатывает изображения высокого разрешения размером до 1152 × 1152 пикселей и при этом остаётся достаточно быстрой и лёгкой для работы непосредственно на устройстве.
Это позволяет приложениям описывать то, что видит камера, сканировать чеки по мере их съёмки или реагировать на изменения на экране, сохраняя все данные локально. Особенно полезно это в таких областях, как образование, специальные возможности, продуктивность и фотография.
Поскольку FastViTHD эффективно работает даже с большими изображениями, она помогает сохранять отзывчивость устройств и предотвращает их перегрев. Она совместима со всеми размерами моделей, включая самую маленькую, которая работает на базовых моделях iPhone. Это означает, что одни и те же функции ИИ могут работать на телефонах, планшетах и Mac.
Применение FastVLM#
FastVLM может поддерживать широкий спектр приложений благодаря таким ключевым преимуществам, как скорость, эффективность и конфиденциальность обработки на устройстве. Вот несколько вариантов использования:
-
Чтение документов: модель может сканировать чеки, формы или удостоверения личности и извлекать только релевантную информацию. Она может фокусироваться на определённых областях изображения, что полезно для приложений, которым требуется быстрое и точное извлечение текста.
-
Подписи к изображениям: анализируя фотографию, модель может создавать понятное описание её содержимого. Это поддерживает функции приложений камеры, фотогалерей и любых инструментов, которым требуется понимание визуальной информации в реальном времени.
-
Поддержка специальных возможностей: FastVLM может описывать содержимое экрана для слепых пользователей и пользователей со слабым зрением, упрощая навигацию и взаимодействие с кнопками, меню и элементами макета.
-
ИИ-ассистенты на устройстве: FastVLM хорошо подходит для ИИ-ассистентов, которым нужно быстро понимать содержимое экрана. Поскольку она работает непосредственно на устройстве и сохраняет конфиденциальность данных, модель может помогать с такими задачами, как чтение текста, распознавание кнопок или значков и навигация в реальном времени без отправки информации в облако.

Рис. 4. FastVLM можно использовать для распознавания текста и визуальных вопросов и ответов. (Источник)
Основные выводы#
FastVLM переносит ИИ для компьютерного зрения и языка на устройства Apple, сочетая скорость, конфиденциальность и эффективность. Благодаря лёгкой архитектуре и выпуску с открытым исходным кодом она обеспечивает понимание изображений в реальном времени в мобильных и настольных приложениях.
Это делает ИИ более практичным и доступным для повседневного использования и даёт разработчикам надёжную основу для создания полезных приложений с акцентом на конфиденциальность. В дальнейшем модели компьютерного зрения и языка, вероятно, будут играть важную роль в нашем взаимодействии с технологиями, делая ИИ более отзывчивым, контекстно-зависимым и полезным в повседневных ситуациях.
Изучи наш репозиторий на GitHub, чтобы узнать больше об ИИ. Присоединяйся к нашему активному сообществу и знакомься с инновациями в таких сферах, как ИИ в автомобильной отрасли и ИИ для компьютерного зрения в производстве. Чтобы начать заниматься компьютерным зрением уже сегодня, ознакомься с нашими вариантами лицензирования.









