Google PaliGemma 2: Perspectivas sobre modelos VLM avanzados
Únete a nosotros mientras analizamos más de cerca los nuevos modelos de lenguaje visual de Google: PaliGemma 2. Estos modelos pueden ayudar a comprender y analizar tanto imágenes como texto.

El 5 de diciembre de 2024, Google presentó PaliGemma 2, la versión más reciente de su avanzado vision-language model (VLM). PaliGemma 2 está diseñado para gestionar tareas que combinan imágenes y texto, como generar pies de foto, responder preguntas visuales y detectar objetos en recursos visuales.
Basándose en el PaliGemma original, que ya era una herramienta sólida para subtitulado multilingüe y reconocimiento de objetos, PaliGemma 2 aporta varias mejoras clave. Entre ellas se incluyen tamaños de modelo más grandes, compatibilidad con imágenes de mayor resolución y better performance en tareas visuales complejas. Estas actualizaciones lo hacen aún más flexible y eficaz para una amplia gama de usos.
En este artículo, analizaremos más de cerca PaliGemma 2, incluido su funcionamiento, sus características clave y las aplicaciones en las que destaca. ¡Empecemos!
De Gemma 2 a PaliGemma 2#
PaliGemma 2 se basa en dos tecnologías clave: el codificador visual SigLIP y el modelo de lenguaje Gemma 2. El codificador SigLIP procesa visual data, como imágenes o vídeos, y los desglosa en características que el modelo puede analizar. Por su parte, Gemma 2 gestiona el texto, permitiendo que el modelo comprenda y genere lenguaje multilingüe. Juntos forman un VLM diseñado para interpretar y conectar información visual y textual de forma fluida.
Lo que hace que PaliGemma 2 sea un gran paso adelante es su escalabilidad y versatilidad. A diferencia de la versión original, PaliGemma 2 viene en tres tamaños: 3 mil millones (3B), 10 mil millones (10B) y 28 mil millones (28B) de parámetros. Estos parámetros son como los ajustes internos del modelo, que le ayudan a aprender y procesar datos de manera eficaz. También admite diferentes resoluciones de imagen (p. ej., 224 x 224 píxeles para tareas rápidas y 896 x 896 para análisis detallados), lo que lo hace adaptable a diversas aplicaciones.

Fig 1. Una perspectiva general de PaliGemma 2.
La integración de las capacidades lingüísticas avanzadas de Gemma 2 con el procesamiento de imágenes de SigLIP hace que PaliGemma 2 sea significativamente más inteligente. Puede gestionar tareas como:
- Subtitulado de imágenes o vídeos: El modelo puede generar descripciones textuales detalladas de elementos visuales, lo que resulta útil para crear subtítulos de forma automática.
- Respuesta visual a preguntas: PaliGemma 2 puede responder preguntas basadas en imágenes, como identificar objetos, personas o acciones en una escena.
- Reconocimiento de objetos: Identifica y etiqueta objetos dentro de una imagen, como distinguir entre un gato, una mesa o un coche en una foto.
PaliGemma 2 va más allá del procesamiento de imágenes y texto por separado: los reúne de manera significativa. Por ejemplo, puede entender las relaciones en una escena, como reconocer que "El gato está sentado sobre la mesa", o identificar objetos añadiendo contexto, como reconocer un monumento famoso.
Cómo funcionan los modelos VLM PaliGemma 2 de Google#
A continuación, veremos un ejemplo utilizando el gráfico que se muestra en la imagen de abajo para comprender mejor cómo procesa PaliGemma 2 los datos visuales y textuales. Digamos que subes este gráfico y le preguntas al modelo: "¿Qué representa este gráfico?"

Fig 2. Un ejemplo de las capacidades de PaliGemma 2.
El proceso comienza con el codificador visual SigLIP de PaliGemma 2 para analizar las imágenes y extraer características clave. En el caso de un gráfico, esto incluye identificar elementos como ejes, puntos de datos y etiquetas. El codificador está entrenado para capturar tanto patrones amplios como detalles precisos. También utiliza optical character recognition (OCR) para detectar y procesar cualquier texto incrustado en la imagen. Estas características visuales se convierten en tokens, que son representaciones numéricas que el modelo puede procesar. A continuación, estos tokens se ajustan mediante una capa de proyección lineal, una técnica que garantiza que puedan combinarse sin problemas con los datos textuales.
Al mismo tiempo, el modelo de lenguaje Gemma 2 procesa la consulta adjunta para determinar su significado e intención. El texto de la consulta se convierte en tokens, y estos se combinan con los tokens visuales de SigLIP para crear una representación multimodal, un formato unificado que vincula los datos visuales y textuales.
Utilizando esta representación integrada, PaliGemma 2 genera una respuesta paso a paso a través de la decodificación autorregresiva, un método en el que el modelo predice una parte de la respuesta a la vez según el contexto que ya ha procesado.
Capacidades clave de PaliGemma 2#
Ahora que hemos comprendido cómo funciona, exploremos las características clave que hacen de PaliGemma 2 un modelo de lenguaje y visión fiable:
- Flexibilidad de ajuste fino: Se adapta fácilmente a conjuntos de datos y tareas específicos, rindiendo bien en aplicaciones como el subtitulado de imágenes, el razonamiento espacial y la imagen médica.
- Datos de entrenamiento diversos: Entrenado con conjuntos de datos como WebLI y OpenImages, lo que le otorga sólidas capacidades de reconocimiento de objetos y funciones de salida multilingüe.
- Integración de OCR: Incluye reconocimiento óptico de caracteres para extraer e interpretar texto de imágenes, lo que lo hace ideal para el análisis de documentos y otras tareas basadas en texto.
- Salidas multilingües: Genera subtítulos y respuestas en varios idiomas, ideal para aplicaciones globales.
- Integración con herramientas: Es compatible con frameworks como Hugging Face Transformers, PyTorch y Keras, lo que facilita su despliegue y experimentación.
Comparación entre PaliGemma 2 y PaliGemma: ¿Qué ha mejorado?#
Echar un vistazo a la arquitectura de la primera versión de PaliGemma es una buena forma de ver las mejoras de PaliGemma 2. Uno de los cambios más notables es la sustitución del modelo de lenguaje Gemma original por Gemma 2, lo que aporta mejoras sustanciales tanto en rendimiento como en eficiencia.
Gemma 2, disponible en tamaños de 9B y 27B parámetros, fue diseñado para ofrecer una precisión y velocidad líderes en su clase al tiempo que reduce los costes de despliegue. Lo consigue gracias a una arquitectura rediseñada y optimizada para la eficiencia de inferencia en varias configuraciones de hardware, desde GPUs potentes hasta configuraciones más accesibles.

Fig 3. Mirando atrás a la primera versión de PaliGemma 2.
Como resultado, PaliGemma 2 es un modelo muy preciso. La versión de 10B de PaliGemma 2 alcanza una puntuación Non-Entailment Sentence (NES) más baja de 20,3, en comparación con el 34,3 del modelo original, lo que se traduce en menos errores factuales en sus resultados. Estos avances hacen que PaliGemma 2 sea más escalable, preciso y adaptable a una gama más amplia de aplicaciones, desde el subtitulado detallado hasta la respuesta visual a preguntas.
Aplicaciones de PaliGemma 2: Usos reales de los modelos VLM#
PaliGemma 2 tiene el potencial de redefinir industrias al combinar de forma fluida la comprensión visual y del lenguaje. Por ejemplo, en lo que respecta a la accesibilidad, puede generar descripciones detalladas de objetos, escenas y relaciones espaciales, proporcionando una ayuda crucial a las personas con discapacidad visual. Esta capacidad ayuda a los usuarios a entender mejor sus entornos, ofreciendo una mayor autonomía en las tareas cotidianas.

Fig 4. PaliGemma 2 puede hacer que el mundo sea un lugar más accesible.
Además de la accesibilidad, PaliGemma 2 está teniendo un impacto en diversas industrias, incluyendo:
- Comercio electrónico: El modelo mejora la categorización de productos mediante el análisis y la descripción de los artículos en las imágenes, lo que simplifica la gestión del inventario y mejora la experiencia de búsqueda para los usuarios.
- Sanidad: Apoya a los profesionales médicos interpretando imágenes médicas, como radiografías y resonancias magnéticas, junto con notas clínicas para proporcionar diagnósticos más precisos e informados.
- Educación: PaliGemma 2 ayuda a los educadores a crear materiales de aprendizaje descriptivos y accesibles mediante la generación de subtítulos y el suministro de información contextual para las imágenes.
- Creación de contenido: El modelo automatiza el proceso de generación de subtítulos y descripciones visuales para contenidos multimedia, ahorrando tiempo a los creadores.
Pruébalo tú mismo: PaliGemma 2#
Para probar PaliGemma 2, puedes empezar con la demostración interactiva de Hugging Face. Te permite explorar sus capacidades en tareas como el subtitulado de imágenes y la respuesta visual a preguntas. Simplemente sube una imagen y hazle preguntas al modelo sobre ella o solicita una descripción de la escena.

Fig 5. Una demostración de PaliGemma 2 (Fuente: Hugging Face).
Si deseas profundizar, aquí te explico cómo puedes empezar:
- Modelos preentrenados: Puedes acceder a modelos preentrenados y código desde plataformas como Hugging Face y Kaggle. Estos recursos proporcionan todo lo necesario para empezar a trabajar con el modelo.
- Notebooks: Hay documentación exhaustiva y notebooks de ejemplo para familiarizarte con PaliGemma 2. Puedes empezar con ejemplos de inferencia y experimentar ajustando el modelo con tu propio conjunto de datos para tareas específicas.
- Integraciones: PaliGemma 2 es compatible con marcos ampliamente utilizados como Hugging Face Transformers, Keras, PyTorch, JAX y Gemma.cpp, lo que te permite integrarlo en tus flujos de trabajo existentes sin esfuerzo.
Pros y contras del PaliGemma 2 de Google#
Una vez comprendido cómo empezar con PaliGemma 2, analicemos más de cerca sus fortalezas y debilidades principales que debes tener en cuenta al utilizar estos modelos.
Esto es lo que hace que PaliGemma 2 destaque como modelo de lenguaje y visión:
- Ganancias en eficiencia: Aprovechando la arquitectura optimizada de Gemma 2, PaliGemma 2 ofrece un alto rendimiento mientras minimiza los costes de despliegue.
- Funciones de seguridad mejoradas: PaliGemma 2 incluye mejoras de seguridad significativas en su proceso de entrenamiento, como un filtrado robusto de los datos de preentrenamiento para reducir sesgos y una evaluación rigurosa frente a puntos de referencia de seguridad.
- Baja latencia para configuraciones más pequeñas: El modelo de 3B ofrece tiempos de inferencia más rápidos, lo que lo hace adecuado para casos de uso en los que la velocidad es crítica, como recomendaciones de productos en comercio electrónico o sistemas de soporte en directo.
Mientras tanto, aquí hay algunas áreas donde PaliGemma 2 puede tener limitaciones:
- Latencia: Aunque es potente, los modelos más grandes pueden enfrentar problemas de latencia, especialmente cuando se implementan para tareas que requieren respuestas inmediatas, como sistemas de IA interactivos en tiempo real.
- Dependencia de grandes conjuntos de datos: El rendimiento de PaliGemma 2 está estrechamente ligado a la calidad y diversidad de sus conjuntos de datos de entrenamiento, lo que podría limitar su eficacia en dominios subrepresentados o idiomas no incluidos en los datos de entrenamiento.
- Altos requisitos de recursos: A pesar de las optimizaciones, las versiones con parámetros de 10B y 28B exigen una potencia de cálculo significativa, lo que las hace menos accesibles para organizaciones más pequeñas con recursos limitados.
Conclusiones clave#
PaliGemma 2 es un avance fascinante en el modelado de lenguaje y visión, que ofrece una mayor escalabilidad, flexibilidad de ajuste fino y precisión. Puede servir como una herramienta valiosa para aplicaciones que van desde soluciones de accesibilidad y comercio electrónico hasta diagnósticos de atención sanitaria y educación.
Aunque tiene limitaciones, como los requisitos computacionales y la dependencia de datos de alta calidad, sus fortalezas lo convierten en una opción práctica para abordar tareas complejas que integran datos visuales y textuales. PaliGemma 2 puede proporcionar una base sólida para que investigadores y desarrolladores exploren y amplíen el potencial de la IA en aplicaciones multimodales.
Forma parte de la conversación sobre IA echando un vistazo a nuestro GitHub repository y a nuestra community. ¡Lee sobre cómo la IA está avanzando en la agricultura y la sanidad! 🚀






