FastVLM: a Apple apresenta o seu novo modelo rápido de linguagem e visão
A Apple apresenta o FastVLM na CVPR 2025. Este modelo de linguagem e visão open source inclui o encoder FastViTHD e oferece uma redução de até 85 × no tempo até ao primeiro token.

Na conferência CVPR 2025, a Apple apresentou um novo modelo de IA de código aberto chamado FastVLM. Foi desenvolvido para compreender imagens e linguagem, e funciona em dispositivos Apple, como iPhones, iPads e Macs. Isto significa que consegue fornecer resultados inteligentes rapidamente, sem enviar os teus dados para a nuvem.
O que torna o FastVLM particularmente interessante é a sua rapidez e eficiência. A Apple desenvolveu um novo codificador de visão chamado FastViTHD, que ajuda o modelo a interpretar imagens de alta qualidade usando menos memória e energia. Todo o processamento ocorre localmente no dispositivo, resultando em tempos de resposta mais rápidos e preservando a privacidade do utilizador.
Neste artigo, vamos explorar como o FastVLM funciona, o que o distingue e por que razão este lançamento da Apple pode representar um avanço significativo para aplicações de IA do dia a dia nos teus dispositivos.
Compreender os modelos de visão e linguagem (VLMs)#
Antes de analisarmos o que torna o FastVLM especial, vamos explicar o significado de “VLM” no seu nome. Refere-se a um modelo de visão e linguagem, concebido para compreender e relacionar conteúdo visual com linguagem.
Os VLMs combinam compreensão visual e linguagem, permitindo-lhes realizar tarefas como descrever uma fotografia, responder a perguntas sobre uma captura de ecrã ou extrair texto de um documento. Os modelos de visão e linguagem normalmente funcionam em duas partes: uma processa a imagem e converte-a em dados, enquanto a outra interpreta esses dados para gerar uma resposta que podes ler ou ouvir.
É possível que já tenhas usado este tipo de inovação de IA sem sequer te aperceberes. As aplicações que digitalizam recibos, leem cartões de identificação, geram legendas para imagens ou ajudam pessoas com baixa visão a interagir com os seus ecrãs recorrem frequentemente a modelos de visão e linguagem que funcionam discretamente em segundo plano.
O que é o FastVLM?#
A Apple desenvolveu o FastVLM para realizar as mesmas tarefas que outros modelos de visão e linguagem, mas com maior velocidade, mais privacidade e desempenho otimizado nos seus próprios dispositivos. Consegue compreender o conteúdo de uma imagem e responder com texto, mas, ao contrário de muitos modelos que dependem de servidores na nuvem, o FastVLM pode funcionar inteiramente no teu iPhone, iPad ou Mac.
Os VLMs geralmente têm um desempenho melhor com imagens de alta resolução. Por exemplo, como mostrado abaixo, o FastVLM só conseguiu identificar corretamente um sinal de trânsito como “Do Not Enter” quando recebeu uma versão de alta resolução da imagem. No entanto, as entradas de alta resolução normalmente tornam os modelos mais lentos. É aqui que o FastViTHD faz a diferença.

Fig. 1. Desempenho do FastVLM em imagens de baixa e alta resolução. (Fonte)
O novo codificador de visão da Apple, FastViTHD, ajuda o FastVLM a processar imagens de alta qualidade de forma mais eficiente, usando menos memória e energia. Mais concretamente, o FastViTHD é suficientemente leve para funcionar de forma fluida até em dispositivos mais pequenos.
Além disso, o FastVLM está disponível publicamente no repositório do FastVLM no GitHub, onde os programadores podem aceder ao código-fonte, fazer alterações e utilizá-lo nas suas próprias aplicações de acordo com os termos de licença da Apple.
Comparação do FastVLM com outros modelos VLM#
Em comparação com outros modelos de visão e linguagem, o FastVLM está otimizado para funcionar em dispositivos do dia a dia, como smartphones e portáteis. Nos testes de desempenho, o FastVLM gerou a sua primeira palavra ou saída até 85 vezes mais rapidamente do que modelos como o LLaVA-OneVision-0.5B.

Fig. 2. Comparação do desempenho do FastVLM com outros modelos. (Fonte)
Eis uma amostra de alguns dos benchmarks padrão em que o FastVLM foi avaliado:
- DocVQA (Perguntas e respostas visuais sobre documentos): Este benchmark avalia a capacidade do modelo de ler e compreender informações textuais em documentos, como formulários digitalizados ou páginas.
- TextVQA (Perguntas e respostas visuais baseadas em texto): Avalia a capacidade do modelo de interpretar imagens que contêm texto incorporado e responder corretamente a perguntas relacionadas.
- GQA (Perguntas e respostas sobre gráficos): Esta tarefa testa as capacidades de raciocínio do modelo, exigindo que compreenda as relações entre objetos e cenas numa imagem.
- MMMU (Compreensão multimodal massiva multidisciplinar): Mede o desempenho do modelo numa vasta gama de disciplinas e formatos académicos, combinando compreensão visual e textual.
- SeedBench (Avaliação padrão de dados melhorados para benchmarking): Este benchmark explora as capacidades gerais do modelo em compreensão visual e raciocínio em vários domínios.
Nestes benchmarks, o FastVLM alcançou resultados competitivos usando menos recursos. Leva a IA de visão prática para dispositivos do dia a dia, como telemóveis, tablets e portáteis.
O codificador de visão eficiente do FastVLM: FastViTHD#
De seguida, vamos analisar mais de perto o FastViTHD, o codificador de visão que desempenha um papel fundamental no desempenho do FastVLM no processamento de imagens.
A maioria dos modelos de visão e linguagem divide uma imagem em milhares de pequenos fragmentos chamados tokens. Quanto mais tokens houver, mais tempo e energia o modelo precisa para compreender a imagem. Isto pode tornar o processo lento, especialmente em telemóveis ou portáteis.

Fig. 3. Como um codificador de visão processa uma imagem. (Fonte)
O FastViTHD evita a lentidão associada ao processamento de demasiados tokens usando menos tokens, sem deixar de compreender a imagem completa. Combina duas abordagens: transformers, que são eficazes na modelação de padrões e relações, e camadas convolucionais, que são eficientes no processamento de dados visuais. O resultado é um sistema mais rápido e que utiliza menos memória.
Segundo a Apple, o FastViTHD é até 3,4 vezes mais pequeno do que alguns codificadores de visão tradicionais, mantendo uma elevada precisão. Em vez de depender de técnicas de otimização de modelos, como a poda de tokens (remoção dos fragmentos de imagem menos importantes para acelerar o processamento), alcança eficiência através de uma arquitetura mais simples e otimizada.
Variantes do modelo FastVLM e pipeline de treino#
A Apple lançou o FastVLM em três tamanhos diferentes: 0.5B, 1.5B e 7B parâmetros (em que "B" significa mil milhões, referindo-se ao número de pesos treináveis do modelo). Cada versão foi concebida para diferentes tipos de dispositivos. Os modelos mais pequenos podem funcionar em telemóveis e tablets, enquanto o modelo 7B maior é mais adequado para computadores de secretária ou tarefas mais exigentes.
Isto dá aos programadores a flexibilidade de escolher o que funciona melhor para as suas aplicações. Podem criar algo rápido e leve para dispositivos móveis ou algo mais complexo para sistemas maiores, utilizando sempre a mesma arquitetura de modelo subjacente.
A Apple treinou as variantes do modelo FastVLM usando o pipeline LLaVA‑1.5, uma estrutura para alinhar modelos de visão e linguagem. Para o componente de linguagem, avaliou o FastVLM usando modelos de código aberto existentes, como Qwen e Vicuna, conhecidos por gerar texto natural e coerente. Esta configuração permite ao FastVLM processar imagens simples e complexas e produzir respostas legíveis e relevantes.
A importância do FastVLM: a abordagem eficiente da Apple à IA#
Podes estar a perguntar-te: por que razão é importante o processamento eficiente de imagens do FastVLM? A resposta está na capacidade de as aplicações funcionarem de forma fluida em tempo real sem dependerem da nuvem. O FastVLM consegue processar imagens de alta resolução, até 1152 por 1152 píxeis, mantendo-se suficientemente rápido e leve para funcionar diretamente no teu dispositivo.
Isto significa que as aplicações podem descrever o que a câmara vê, digitalizar recibos à medida que são capturados ou responder a alterações no ecrã, mantendo tudo localmente. É especialmente útil em áreas como educação, acessibilidade, produtividade e fotografia.
Como o FastViTHD é eficiente até no processamento de imagens grandes, ajuda a manter os dispositivos responsivos e frescos. Funciona com todos os tamanhos de modelo, incluindo o mais pequeno, que funciona em iPhones de entrada de gama. Isto significa que as mesmas funcionalidades de IA podem funcionar em telemóveis, tablets e Macs.
Aplicações do FastVLM#
O FastVLM pode alimentar uma vasta gama de aplicações, graças a benefícios essenciais como velocidade, eficiência e privacidade no dispositivo. Eis algumas formas de o utilizar:
-
Leitura de documentos: Pode digitalizar recibos, formulários ou cartões de identificação e extrair apenas as informações relevantes. Consegue concentrar-se em áreas específicas de uma imagem, o que é útil para aplicações que precisam de extração de texto rápida e precisa.
-
Legendas de imagens: Ao analisar uma fotografia, pode gerar uma descrição clara do que aparece na imagem. Isto permite funcionalidades em aplicações de câmara, galerias de fotografias ou qualquer ferramenta que beneficie de compreensão visual em tempo real.
-
Suporte à acessibilidade: O FastVLM pode descrever o conteúdo apresentado no ecrã a utilizadores cegos ou com baixa visão, tornando botões, menus e elementos de disposição mais fáceis de navegar e utilizar.
-
Assistentes de IA no dispositivo: O FastVLM pode funcionar bem com assistentes de IA que precisam de compreender rapidamente o que está no ecrã. Como funciona diretamente no dispositivo e mantém os dados privados, pode ajudar em tarefas como ler texto, identificar botões ou ícones e orientar os utilizadores em tempo real, sem precisar de enviar informações para a nuvem.

Fig. 4. O FastVLM pode ser utilizado para reconhecimento de texto e perguntas e respostas visuais. (Fonte)
Principais conclusões#
O FastVLM leva a IA de visão e linguagem para dispositivos Apple, combinando velocidade, privacidade e eficiência. Com o seu design leve e lançamento de código aberto, permite a compreensão de imagens em tempo real em aplicações móveis e de desktop.
Isto ajuda a tornar a IA mais prática e acessível para utilização quotidiana e oferece aos programadores uma base sólida para criarem aplicações úteis e focadas na privacidade. No futuro, é provável que os modelos de visão e linguagem desempenhem um papel importante na forma como interagimos com a tecnologia, tornando a IA mais responsiva, consciente do contexto e útil em situações do dia a dia.
Explora o nosso repositório no GitHub para saberes mais sobre IA. Junta-te à nossa comunidade ativa e descobre inovações em setores como IA no setor automóvel e IA de visão na indústria transformadora. Para começares hoje com visão computacional, consulta as nossas opções de licenciamento.









