FastVLM : Apple présente son nouveau modèle rapide de vision et langage
Apple dévoile FastVLM à CVPR 2025. Ce modèle open source de vision et langage intègre l’encodeur FastViTHD et offre une accélération pouvant atteindre 85 × du délai avant le premier token.

Lors de la conférence CVPR 2025, Apple a présenté un nouveau modèle d’IA open source appelé FastVLM. Il est conçu pour comprendre à la fois les images et le langage, et fonctionne sur des appareils Apple comme les iPhone, les iPad et les Mac. Cela signifie qu’il peut fournir rapidement des résultats intelligents, sans envoyer tes données vers le cloud.
Ce qui rend FastVLM particulièrement intéressant, c’est sa rapidité et son efficacité. Apple a développé un nouvel encodeur de vision appelé FastViTHD, qui aide le modèle à interpréter des images de haute qualité tout en utilisant moins de mémoire et d’énergie. Tout le traitement s’effectue localement sur l’appareil, ce qui accélère les temps de réponse tout en préservant la confidentialité des utilisateurs.
Dans cet article, nous allons découvrir le fonctionnement de FastVLM, ce qui le distingue et pourquoi cette sortie d’Apple pourrait représenter une avancée importante pour les applications d’IA du quotidien sur tes appareils.
Comprendre les modèles vision-langage (VLMs)#
Avant d’examiner ce qui rend FastVLM spécial, voyons ce que signifie « VLM » dans son nom. Il s’agit d’un modèle vision-langage, conçu pour comprendre le contenu visuel et l’associer au langage.
Les VLMs associent la compréhension visuelle et le langage, ce qui leur permet d’effectuer des tâches comme décrire une photo, répondre à des questions sur une capture d’écran ou extraire du texte d’un document. Les modèles vision-langage fonctionnent généralement en deux parties : l’une traite l’image et la convertit en données, tandis que l’autre interprète ces données pour générer une réponse que tu peux lire ou entendre.
Tu as peut-être déjà utilisé ce type d’innovation en IA sans même t’en rendre compte. Les applications qui numérisent les reçus, lisent les cartes d’identité, génèrent des légendes d’image ou aident les personnes malvoyantes à interagir avec leurs écrans s’appuient souvent sur des modèles vision-langage qui fonctionnent discrètement en arrière-plan.
Qu’est-ce que FastVLM ?#
Apple a conçu FastVLM pour effectuer les mêmes tâches que les autres modèles vision-langage, mais avec une plus grande rapidité, une meilleure confidentialité et des performances optimisées sur ses propres appareils. Il peut comprendre le contenu d’une image et répondre avec du texte, mais contrairement à de nombreux modèles qui dépendent de serveurs cloud, FastVLM peut fonctionner entièrement sur ton iPhone, ton iPad ou ton Mac.
Les VLMs sont généralement plus performants avec des images haute résolution. Par exemple, comme illustré ci-dessous, FastVLM ne pouvait identifier correctement un panneau de signalisation comme « Sens interdit » que lorsqu’il recevait une version haute résolution de l’image. Cependant, les entrées haute résolution ralentissent généralement les modèles. C’est là que FastViTHD fait la différence.

Fig. 1. Performances de FastVLM sur des images basse et haute résolution. (Source)
Le nouvel encodeur de vision d’Apple, FastViTHD, aide FastVLM à traiter plus efficacement les images de haute qualité, en utilisant moins de mémoire et d’énergie. Plus précisément, FastViTHD est suffisamment léger pour fonctionner correctement, même sur des appareils plus compacts.
FastVLM est également disponible publiquement dans le dépôt GitHub de FastVLM, où les développeurs peuvent accéder au code source, le modifier et l’utiliser dans leurs propres applications conformément aux conditions de licence d’Apple.
Comparaison de FastVLM avec d’autres modèles VLM#
Comparé à d’autres modèles vision-langage, FastVLM est optimisé pour fonctionner sur des appareils du quotidien comme les smartphones et les ordinateurs portables. Lors de tests de performance, FastVLM a généré son premier mot ou résultat jusqu’à 85 fois plus rapidement que des modèles comme LLaVA-OneVision-0.5B.

Fig. 2. Comparaison des performances de FastVLM avec celles d’autres modèles. (Source)
Voici un aperçu de certains benchmarks standards sur lesquels FastVLM a été évalué :
- DocVQA (Réponse à des questions visuelles sur des documents) : ce benchmark évalue la capacité du modèle à lire et comprendre les informations textuelles contenues dans des documents, comme des formulaires numérisés ou des pages.
- TextVQA (Réponse à des questions visuelles fondées sur du texte) : il évalue la capacité du modèle à interpréter des images contenant du texte intégré et à répondre précisément aux questions associées.
- GQA (Réponse à des questions sur des graphes) : cette tâche évalue les capacités de raisonnement du modèle en lui demandant de comprendre les relations entre les objets et les scènes d’une image.
- MMMU (Compréhension multimodale multidisciplinaire à grande échelle) : il mesure les performances du modèle dans un large éventail de matières et de formats universitaires, en combinant la compréhension visuelle et textuelle.
- SeedBench (Évaluation standard de données améliorées pour le benchmarking) : ce benchmark étudie les capacités générales du modèle en matière de compréhension visuelle et de raisonnement dans plusieurs domaines.
Sur l’ensemble de ces benchmarks, FastVLM a obtenu des résultats compétitifs tout en utilisant moins de ressources. Il apporte une IA visuelle pratique sur des appareils du quotidien comme les téléphones, les tablettes et les ordinateurs portables.
L’encodeur de vision efficace de FastVLM : FastViTHD#
Examinons maintenant de plus près FastViTHD, l’encodeur de vision qui joue un rôle essentiel dans les performances de traitement d’image de FastVLM.
La plupart des modèles vision-langage divisent une image en milliers de petites zones appelées tokens. Plus le nombre de tokens est élevé, plus le modèle a besoin de temps et d’énergie pour comprendre l’image. Cela peut ralentir le traitement, notamment sur les téléphones et les ordinateurs portables.

Fig. 3. Fonctionnement d’un encodeur de vision lors du traitement d’une image. (Source)
FastViTHD évite le ralentissement lié au traitement d’un trop grand nombre de tokens en en utilisant moins, tout en comprenant l’intégralité de l’image. Il combine deux approches : les transformers, qui modélisent efficacement les motifs et les relations, et les couches convolutionnelles, qui traitent efficacement les données visuelles. Le résultat est un système plus rapide et moins gourmand en mémoire.
Selon Apple, FastViTHD est jusqu’à 3,4 fois plus petit que certains encodeurs de vision traditionnels, tout en maintenant une grande précision. Au lieu de s’appuyer sur des techniques d’optimisation de modèle comme l’élagage des tokens (suppression des zones d’image moins importantes pour accélérer le traitement), il atteint son efficacité grâce à une architecture plus simple et rationalisée.
Les variantes de modèle et le pipeline d’entraînement de FastVLM#
Apple a lancé FastVLM en trois tailles différentes : 0.5B, 1.5B et 7B paramètres (« B » signifie milliard et désigne le nombre de poids entraînables du modèle). Chaque version est conçue pour s’adapter à différents types d’appareils. Les modèles plus petits peuvent fonctionner sur des téléphones et des tablettes, tandis que le modèle 7B convient mieux aux ordinateurs de bureau ou aux tâches plus exigeantes.
Cela donne aux développeurs la flexibilité de choisir la solution la mieux adaptée à leurs applications. Ils peuvent créer une solution rapide et légère pour les appareils mobiles ou une solution plus complexe pour les systèmes plus puissants, tout en utilisant la même architecture de modèle sous-jacente.
Apple a entraîné les variantes de modèle FastVLM à l’aide du pipeline LLaVA‑1.5, un framework destiné à aligner les modèles de vision et les modèles de langage. Pour le composant de langage, l’entreprise a évalué FastVLM avec des modèles open source existants comme Qwen et Vicuna, connus pour générer du texte naturel et cohérent. Cette configuration permet à FastVLM de traiter des images simples comme complexes et de produire des réponses lisibles et pertinentes.
L’importance de FastVLM : l’approche efficace d’Apple en matière d’IA#
Tu te demandes peut-être pourquoi le traitement efficace des images de FastVLM est important. Tout dépend de la fluidité avec laquelle les applications peuvent fonctionner en temps réel sans dépendre du cloud. FastVLM peut traiter des images haute résolution allant jusqu’à 1152 × 1152 pixels, tout en restant suffisamment rapide et léger pour fonctionner directement sur ton appareil.
Cela signifie que les applications peuvent décrire ce que voit la caméra, numériser des reçus au moment de leur capture ou réagir aux changements à l’écran, tout en conservant l’ensemble des données en local. C’est particulièrement utile dans des domaines comme l’éducation, l’accessibilité, la productivité et la photographie.
Comme FastViTHD reste efficace même avec de grandes images, il contribue à maintenir la réactivité et la température des appareils. Il fonctionne avec toutes les tailles de modèle, y compris la plus petite, qui peut fonctionner sur des iPhone d’entrée de gamme. Les mêmes fonctionnalités d’IA peuvent donc être utilisées sur les téléphones, les tablettes et les Mac.
Applications de FastVLM#
FastVLM peut alimenter un large éventail d’applications grâce à ses principaux avantages, comme la rapidité, l’efficacité et la confidentialité sur l’appareil. Voici quelques exemples d’utilisation :
-
Lecture de documents : il peut numériser des reçus, des formulaires ou des cartes d’identité et n’en extraire que les informations pertinentes. Il peut se concentrer sur des zones précises d’une image, ce qui est utile pour les applications nécessitant une extraction de texte rapide et précise.
-
Légendes d’image : en analysant une photo, il peut générer une description claire de son contenu. Cela permet d’ajouter des fonctionnalités aux applications d’appareil photo, aux galeries de photos ou à tout outil bénéficiant d’une compréhension visuelle en temps réel.
-
Prise en charge de l’accessibilité : FastVLM peut décrire le contenu affiché à l’écran pour les utilisateurs aveugles ou malvoyants, afin de faciliter la navigation et l’utilisation des boutons, des menus et des éléments de mise en page.
-
Assistants d’IA sur l’appareil : FastVLM peut être utilisé efficacement avec des assistants d’IA qui doivent comprendre rapidement ce qui est affiché à l’écran. Comme il fonctionne directement sur l’appareil et protège la confidentialité des données, il peut aider à lire du texte, identifier des boutons ou des icônes et guider les utilisateurs en temps réel, sans avoir besoin d’envoyer des informations vers le cloud.

Fig. 4. FastVLM peut être utilisé pour la reconnaissance de texte et la réponse à des questions visuelles. (Source)
Points clés à retenir#
FastVLM apporte une IA vision-langage directement sur les appareils Apple, en combinant rapidité, confidentialité et efficacité. Grâce à sa conception légère et à sa mise à disposition en open source, il permet la compréhension d’images en temps réel dans les applications mobiles et de bureau.
Cela contribue à rendre l’IA plus pratique et accessible au quotidien, tout en fournissant aux développeurs une base solide pour créer des applications utiles et axées sur la confidentialité. À l’avenir, il est probable que les modèles vision-langage jouent un rôle important dans notre façon d’interagir avec la technologie, en rendant l’IA plus réactive, plus consciente du contexte et plus utile dans les situations du quotidien.
Explore notre dépôt GitHub pour en savoir plus sur l’IA. Rejoins notre communauté active et découvre les innovations dans des secteurs comme l’IA dans l’industrie automobile et l’IA visuelle dans l’industrie manufacturière. Pour commencer dès aujourd’hui avec la vision par ordinateur, consulte nos options de licence.









