FastVLM: Apple presenta su nuevo modelo rápido de visión y lenguaje
Apple presenta FastVLM en CVPR 2025. Este modelo de visión y lenguaje de código abierto incorpora el codificador FastViTHD y ofrece una generación del primer token hasta 85 × más rápida.

En la conferencia CVPR 2025, Apple presentó un nuevo modelo de IA de código abierto llamado FastVLM. Está diseñado para entender tanto imágenes como lenguaje, y funciona en dispositivos Apple como iPhones, iPads y Macs. Esto significa que puede ofrecer resultados inteligentes rápidamente, sin enviar tus datos a la nube.
Lo que hace especialmente interesante a FastVLM es su rapidez y eficiencia. Apple desarrolló un nuevo codificador de visión llamado FastViTHD, que ayuda al modelo a interpretar imágenes de alta calidad usando menos memoria y energía. Todo el procesamiento tiene lugar localmente en el dispositivo, lo que permite obtener tiempos de respuesta más rápidos y preservar la privacidad del usuario.
En este artículo, veremos cómo funciona FastVLM, qué lo diferencia y por qué este lanzamiento de Apple podría suponer un avance importante para las aplicaciones de IA de uso cotidiano en tus dispositivos.
Comprender los modelos de lenguaje y visión (VLMs)#
Antes de profundizar en lo que hace especial a FastVLM, veamos qué significa «VLM» en su nombre. Hace referencia a un modelo de lenguaje y visión, diseñado para comprender y relacionar el contenido visual con el lenguaje.
Los VLMs combinan la comprensión visual y el lenguaje, lo que les permite realizar tareas como describir una foto, responder preguntas sobre una captura de pantalla o extraer texto de un documento. Los modelos de lenguaje y visión suelen funcionar en dos partes: una procesa la imagen y la convierte en datos, mientras que la otra interpreta esos datos para generar una respuesta que puedes leer o escuchar.
Es posible que ya hayas utilizado este tipo de innovación de IA sin darte cuenta. Las aplicaciones que escanean recibos, leen documentos de identidad, generan pies de foto o ayudan a las personas con baja visión a interactuar con sus pantallas suelen basarse en modelos de lenguaje y visión que funcionan discretamente en segundo plano.
¿Qué es FastVLM?#
Apple creó FastVLM para realizar las mismas tareas que otros modelos de lenguaje y visión, pero con mayor velocidad, más privacidad y un rendimiento optimizado en sus propios dispositivos. Puede comprender el contenido de una imagen y responder con texto, pero, a diferencia de muchos modelos que dependen de servidores en la nube, FastVLM puede funcionar completamente en tu iPhone, iPad o Mac.
Por lo general, los VLMs funcionan mejor con imágenes de alta resolución. Por ejemplo, como se muestra a continuación, FastVLM solo pudo identificar correctamente una señal de tráfico como «Do Not Enter» cuando recibió una versión de alta resolución de la imagen. Sin embargo, las entradas de alta resolución suelen ralentizar los modelos. Aquí es donde FastViTHD marca la diferencia.

Fig. 1. Rendimiento de FastVLM con imágenes de baja y alta resolución. (Fuente)
El nuevo codificador de visión de Apple, FastViTHD, ayuda a FastVLM a procesar imágenes de alta calidad de forma más eficiente, utilizando menos memoria y energía. En concreto, FastViTHD es lo bastante ligero como para funcionar sin problemas incluso en dispositivos más pequeños.
Además, FastVLM está disponible públicamente en el repositorio de FastVLM en GitHub, donde los desarrolladores pueden acceder al código fuente, realizar cambios y utilizarlo en sus propias aplicaciones de acuerdo con las condiciones de licencia de Apple.
Comparación de FastVLM con otros modelos VLM#
En comparación con otros modelos de lenguaje y visión, FastVLM está optimizado para funcionar en dispositivos de uso cotidiano, como smartphones y portátiles. En las pruebas de rendimiento, FastVLM generó su primera palabra o salida hasta 85 veces más rápido que modelos como LLaVA-OneVision-0.5B.

Fig. 2. Comparación del rendimiento de FastVLM con otros modelos. (Fuente)
Estos son algunos de los benchmarks estándar en los que se ha evaluado FastVLM:
- DocVQA (Respuesta a preguntas visuales sobre documentos): Este benchmark evalúa hasta qué punto el modelo puede leer y comprender información textual en documentos, como formularios escaneados o páginas.
- TextVQA (Respuesta a preguntas visuales basada en texto): Evalúa la capacidad del modelo para interpretar imágenes que contienen texto incrustado y responder con precisión a preguntas relacionadas.
- GQA (Respuesta a preguntas sobre gráficos): Esta tarea pone a prueba la capacidad de razonamiento del modelo al exigirle que comprenda las relaciones entre objetos y escenas dentro de una imagen.
- MMMU (Comprensión multimodal masiva multidisciplinar): Mide el rendimiento del modelo en una amplia variedad de materias y formatos académicos, combinando la comprensión visual y textual.
- SeedBench (Evaluación estándar de datos mejorados para benchmarking): Este benchmark analiza las capacidades generales del modelo en comprensión visual y razonamiento en múltiples ámbitos.
En estos benchmarks, FastVLM obtuvo resultados competitivos utilizando menos recursos. Acerca la IA de visión práctica a dispositivos de uso cotidiano, como teléfonos, tabletas y portátiles.
El eficiente codificador de visión de FastVLM: FastViTHD#
A continuación, examinaremos más de cerca FastViTHD, el codificador de visión que desempeña un papel crucial en el rendimiento de procesamiento de imágenes de FastVLM.
La mayoría de los modelos de lenguaje y visión dividen una imagen en miles de pequeños fragmentos llamados tokens. Cuantos más tokens haya, más tiempo y energía necesita el modelo para comprender la imagen. Esto puede ralentizar el proceso, especialmente en teléfonos o portátiles.

Fig. 3. Cómo procesa una imagen un codificador de visión. (Fuente)
FastViTHD evita la ralentización asociada al procesamiento de demasiados tokens utilizando menos, sin dejar de comprender la imagen completa. Combina dos enfoques: transformers, que son eficaces para modelar patrones y relaciones, y capas convolucionales, que procesan los datos visuales de forma eficiente. El resultado es un sistema que funciona más rápido y utiliza menos memoria.
Según Apple, FastViTHD es hasta 3,4 veces más pequeño que algunos codificadores de visión tradicionales, manteniendo al mismo tiempo una alta precisión. En lugar de depender de técnicas de optimización de modelos, como la poda de tokens (eliminación de los fragmentos de imagen menos importantes para acelerar el procesamiento), logra la eficiencia mediante una arquitectura más sencilla y optimizada.
Variantes del modelo FastVLM y flujo de entrenamiento#
Apple ha lanzado FastVLM en tres tamaños diferentes: 0.5B, 1.5B y 7B parámetros (donde «B» significa mil millones y hace referencia al número de pesos entrenables del modelo). Cada versión está diseñada para adaptarse a distintos tipos de dispositivos. Los modelos más pequeños pueden funcionar en teléfonos y tabletas, mientras que el modelo 7B más grande es más adecuado para ordenadores de sobremesa o tareas más exigentes.
Esto ofrece a los desarrolladores la flexibilidad de elegir la opción que mejor funcione para sus aplicaciones. Pueden crear algo rápido y ligero para dispositivos móviles o algo más complejo para sistemas de mayor tamaño, utilizando en ambos casos la misma arquitectura subyacente del modelo.
Apple entrenó las variantes del modelo FastVLM utilizando el flujo LLaVA‑1.5, un marco para alinear modelos de visión y lenguaje. Para el componente lingüístico, evaluaron FastVLM con modelos de código abierto existentes, como Qwen y Vicuna, conocidos por generar texto natural y coherente. Esta configuración permite a FastVLM procesar imágenes sencillas y complejas, y producir respuestas legibles y relevantes.
La importancia de FastVLM: la propuesta eficiente de Apple para la IA#
Quizá te preguntes por qué es importante el procesamiento eficiente de imágenes de FastVLM. La clave está en que las aplicaciones pueden funcionar con fluidez en tiempo real sin depender de la nube. FastVLM puede gestionar imágenes de alta resolución, de hasta 1152 × 1152 píxeles, manteniendo una velocidad y ligereza suficientes para funcionar directamente en tu dispositivo.
Esto significa que las aplicaciones pueden describir lo que ve la cámara, escanear recibos mientras se capturan o responder a los cambios en la pantalla, manteniéndolo todo en local. Es especialmente útil en ámbitos como la educación, la accesibilidad, la productividad y la fotografía.
Como FastViTHD es eficiente incluso con imágenes grandes, ayuda a mantener los dispositivos ágiles y frescos. Funciona con todos los tamaños de modelo, incluido el más pequeño, que se ejecuta en iPhones básicos. Esto significa que las mismas funciones de IA pueden funcionar en teléfonos, tabletas y Macs.
Aplicaciones de FastVLM#
FastVLM puede impulsar una amplia variedad de aplicaciones gracias a ventajas clave como la velocidad, la eficiencia y la privacidad en el dispositivo. Estas son algunas de sus posibles aplicaciones:
-
Lectura de documentos: Puede escanear recibos, formularios o documentos de identidad y extraer únicamente la información relevante. Puede centrarse en zonas específicas de una imagen, lo que resulta útil para aplicaciones que necesitan una extracción de texto rápida y precisa.
-
Pies de foto: Al analizar una fotografía, puede generar una descripción clara de lo que aparece en la imagen. Esto permite incorporar funciones en aplicaciones de cámara, galerías de fotos o cualquier herramienta que se beneficie de la comprensión visual en tiempo real.
-
Asistencia de accesibilidad: FastVLM puede describir el contenido de la pantalla a usuarios ciegos o con baja visión, facilitando la navegación y el uso de botones, menús y elementos de diseño.
-
Asistentes de IA en el dispositivo: FastVLM puede funcionar bien con asistentes de IA que necesitan comprender rápidamente lo que aparece en la pantalla. Como se ejecuta directamente en el dispositivo y mantiene los datos privados, puede ayudar con tareas como leer texto, identificar botones o iconos y guiar a los usuarios en tiempo real sin tener que enviar información a la nube.

Fig. 4. FastVLM puede utilizarse para el reconocimiento de texto y la respuesta a preguntas visuales. (Fuente)
Conclusiones clave#
FastVLM incorpora IA de lenguaje y visión en el dispositivo a los dispositivos Apple, combinando velocidad, privacidad y eficiencia. Gracias a su diseño ligero y a su lanzamiento como código abierto, permite comprender imágenes en tiempo real en aplicaciones móviles y de escritorio.
Esto ayuda a hacer que la IA sea más práctica y accesible para el uso cotidiano, y proporciona a los desarrolladores una base sólida para crear aplicaciones útiles centradas en la privacidad. De cara al futuro, es probable que los modelos de lenguaje y visión desempeñen un papel importante en nuestra forma de interactuar con la tecnología, haciendo que la IA sea más receptiva, consciente del contexto y útil en situaciones cotidianas.
Explora nuestro repositorio de GitHub para obtener más información sobre la IA. Únete a nuestra comunidad activa y descubre innovaciones en sectores como la IA en la industria automovilística y la IA de visión en la fabricación. Para empezar hoy mismo con la visión artificial, consulta nuestras opciones de licencia.









