Ultralytics YOLO27:
IA visual

PaliGemma 2 de Google: perspectivas sobre los modelos VLM avanzados

Acompáñanos a analizar más de cerca los nuevos modelos de lenguaje y visión de Google: PaliGemma 2. Estos modelos pueden ayudar a comprender y analizar tanto imágenes como texto.

ABAbirami Vina10 min read
El modelo de lenguaje y visión PaliGemma 2 de Google

El 5 de diciembre de 2024, Google presentó PaliGemma 2, la versión más reciente de su vanguardista modelo de visión y lenguaje (VLM). PaliGemma 2 está diseñado para realizar tareas que combinan imágenes y texto, como generar subtítulos, responder preguntas visuales y detectar objetos en imágenes.

Basado en el PaliGemma original, que ya era una herramienta sólida para generar subtítulos multilingües y reconocer objetos, PaliGemma 2 incorpora varias mejoras importantes. Entre ellas se incluyen tamaños de modelo mayores, compatibilidad con imágenes de mayor resolución y un mejor rendimiento en tareas visuales complejas. Estas mejoras lo hacen aún más flexible y eficaz para una amplia variedad de usos.

En este artículo, analizaremos más detenidamente PaliGemma 2, incluido su funcionamiento, sus principales características y las aplicaciones en las que destaca. ¡Empecemos!

De Gemma 2 a PaliGemma 2#

PaliGemma 2 se basa en dos tecnologías clave: el codificador visual SigLIP y el modelo de lenguaje Gemma 2. El codificador SigLIP procesa datos visuales, como imágenes o vídeos, y los descompone en características que el modelo puede analizar. Por su parte, Gemma 2 procesa el texto, lo que permite al modelo comprender y generar lenguaje multilingüe. Juntos, forman un VLM diseñado para interpretar y conectar información visual y textual sin fisuras.

Lo que convierte a PaliGemma 2 en un gran avance son su escalabilidad y versatilidad. A diferencia de la versión original, PaliGemma 2 está disponible en tres tamaños: 3.000 millones (3B), 10.000 millones (10B) y 28.000 millones (28B) de parámetros. Estos parámetros son como los ajustes internos del modelo y le ayudan a aprender y procesar datos de forma eficaz. También admite distintas resoluciones de imagen (por ejemplo, 224 x 224 píxeles para tareas rápidas y 896 x 896 para análisis detallados), lo que permite adaptarlo a diversas aplicaciones.

Descripción general de PaliGemma 2

Fig. 1 Descripción general de PaliGemma 2.

La integración de las avanzadas capacidades lingüísticas de Gemma 2 con el procesamiento de imágenes de SigLIP hace que PaliGemma 2 sea mucho más inteligente. Puede realizar tareas como:

  • Generación de subtítulos para imágenes o vídeos: el modelo puede generar descripciones textuales detalladas de elementos visuales, lo que resulta útil para crear subtítulos automáticamente.
  • Respuesta a preguntas visuales: PaliGemma 2 puede responder preguntas basándose en imágenes, como identificar objetos, personas o acciones en una escena.
  • Reconocimiento de objetos: identifica y etiqueta objetos dentro de una imagen, como distinguir entre un gato, una mesa o un coche en una fotografía.

PaliGemma 2 va más allá de procesar imágenes y texto por separado: los combina de forma significativa. Por ejemplo, puede comprender las relaciones en una escena, como reconocer que «El gato está sentado en la mesa», o identificar objetos y añadir contexto, como reconocer un monumento famoso.

Cómo funcionan los modelos VLM PaliGemma 2 de Google#

A continuación, veremos un ejemplo utilizando el gráfico que aparece en la imagen inferior para comprender mejor cómo PaliGemma 2 procesa datos visuales y textuales. Supongamos que subes este gráfico y preguntas al modelo: «¿Qué representa este gráfico?»

Un ejemplo de las capacidades de PaliGemma 2

Fig. 2 Un ejemplo de las capacidades de PaliGemma 2.

El proceso comienza con el codificador visual SigLIP de PaliGemma 2, que analiza las imágenes y extrae las características clave. En el caso de un gráfico, esto incluye identificar elementos como ejes, puntos de datos y etiquetas. El codificador está entrenado para captar tanto patrones generales como detalles minuciosos. También utiliza el reconocimiento óptico de caracteres (OCR) para detectar y procesar cualquier texto incrustado en la imagen. Estas características visuales se convierten en tokens, que son representaciones numéricas que el modelo puede procesar. A continuación, estos tokens se ajustan mediante una capa de proyección lineal, una técnica que garantiza que puedan combinarse sin fisuras con datos textuales.

Al mismo tiempo, el modelo de lenguaje Gemma 2 procesa la consulta asociada para determinar su significado e intención. El texto de la consulta se convierte en tokens, que se combinan con los tokens visuales de SigLIP para crear una representación multimodal, un formato unificado que vincula datos visuales y textuales.

Mediante esta representación integrada, PaliGemma 2 genera una respuesta paso a paso mediante decodificación autorregresiva, un método en el que el modelo predice una parte de la respuesta cada vez basándose en el contexto que ya ha procesado.

Principales capacidades de PaliGemma 2#

Ahora que hemos entendido cómo funciona, exploremos las características clave que convierten a PaliGemma 2 en un modelo de visión y lenguaje fiable:

  • Flexibilidad de ajuste fino: se adapta fácilmente a conjuntos de datos y tareas específicos, y ofrece un buen rendimiento en aplicaciones como la generación de subtítulos para imágenes, el razonamiento espacial y las imágenes médicas.
  • Datos de entrenamiento diversos: se ha entrenado con conjuntos de datos como WebLI y OpenImages, lo que le proporciona sólidas capacidades de reconocimiento de objetos y generación de resultados multilingües.
  • Integración de OCR: incluye reconocimiento óptico de caracteres para extraer e interpretar texto de imágenes, por lo que resulta ideal para el análisis de documentos y otras tareas basadas en texto.
  • Resultados multilingües: genera subtítulos y respuestas en varios idiomas, por lo que resulta ideal para aplicaciones globales.
  • Integración con herramientas: es compatible con frameworks como Hugging Face Transformers, PyTorch y Keras, lo que facilita su implementación y experimentación.

Comparación entre PaliGemma 2 y PaliGemma: ¿qué ha mejorado?#

Examinar la arquitectura de la primera versión de PaliGemma es una buena forma de apreciar las mejoras de PaliGemma 2. Uno de los cambios más destacados es la sustitución del modelo de lenguaje Gemma original por Gemma 2, que aporta mejoras sustanciales tanto en rendimiento como en eficiencia.

Gemma 2, disponible en tamaños de 9B y 27B parámetros, se diseñó para ofrecer una precisión y velocidad líderes en su categoría, al tiempo que reduce los costes de implementación. Lo consigue mediante una arquitectura rediseñada y optimizada para mejorar la eficiencia de la inferencia en distintas configuraciones de hardware, desde GPU potentes hasta configuraciones más accesibles.

Una mirada retrospectiva a la primera versión de PaliGemma

Fig. 3 Una mirada retrospectiva a la primera versión de PaliGemma 2.

Como resultado, PaliGemma 2 es un modelo muy preciso. La versión 10B de PaliGemma 2 obtiene una puntuación Non-Entailment Sentence (NES) inferior, de 20,3, frente a los 34,3 del modelo original, lo que significa que comete menos errores factuales en sus resultados. Estos avances hacen que PaliGemma 2 sea más escalable, preciso y adaptable a una gama más amplia de aplicaciones, desde la generación detallada de subtítulos hasta la respuesta a preguntas visuales.

Aplicaciones de PaliGemma 2: usos reales de los modelos VLM#

PaliGemma 2 tiene el potencial de transformar diversos sectores al combinar sin fisuras la comprensión visual y lingüística. Por ejemplo, en materia de accesibilidad, puede generar descripciones detalladas de objetos, escenas y relaciones espaciales, proporcionando una asistencia fundamental a las personas con discapacidad visual. Esta capacidad ayuda a los usuarios a comprender mejor su entorno y les ofrece mayor independencia en las tareas cotidianas.

PaliGemma 2 puede hacer del mundo un lugar más accesible

Fig. 4 PaliGemma 2 puede hacer del mundo un lugar más accesible.

Además de la accesibilidad, PaliGemma 2 está teniendo un impacto en diversos sectores, entre ellos:

  • Comercio electrónico: el modelo mejora la categorización de productos al analizar y describir artículos en imágenes, lo que simplifica la gestión del inventario y mejora la experiencia de búsqueda de los usuarios.
  • Sanidad: ayuda a los profesionales sanitarios a interpretar imágenes médicas, como radiografías y resonancias magnéticas, junto con notas clínicas para proporcionar diagnósticos más precisos y fundamentados.
  • Educación: PaliGemma 2 ayuda a los educadores a crear materiales de aprendizaje descriptivos y accesibles mediante la generación de subtítulos y el suministro de información contextual para las imágenes.
  • Creación de contenido: el modelo automatiza el proceso de generación de subtítulos y descripciones visuales para contenido multimedia, lo que ahorra tiempo a los creadores.

Pruébalo tú mismo: PaliGemma 2#

Para probar PaliGemma 2, puedes empezar con la demo interactiva de Hugging Face. Te permite explorar sus capacidades en tareas como la generación de subtítulos para imágenes y la respuesta a preguntas visuales. Solo tienes que subir una imagen y hacer preguntas al modelo sobre ella o pedirle una descripción de la escena.

Una demo de PaliGemma 2

Fig. 5. Una demo de PaliGemma 2 (fuente: Hugging Face).

Si quieres profundizar, estos son los pasos para ponerlo en práctica:

  • Modelos preentrenados: puedes acceder a modelos preentrenados y código desde plataformas como Hugging Face y Kaggle. Estos recursos te proporcionan todo lo necesario para empezar a trabajar con el modelo.
  • Cuadernos: hay documentación completa y cuadernos de ejemplo para familiarizarte con PaliGemma 2. Puedes empezar con ejemplos de inferencia y experimentar con el ajuste fino del modelo en tu propio conjunto de datos para tareas específicas.
  • Integraciones: PaliGemma 2 es compatible con frameworks ampliamente utilizados como Hugging Face Transformers, Keras, PyTorch, JAX y Gemma.cpp, lo que te permite integrarlo fácilmente en tus flujos de trabajo existentes.

Ventajas e inconvenientes de PaliGemma 2 de Google#

Ahora que hemos visto cómo empezar a utilizar PaliGemma 2, examinemos más detenidamente sus principales puntos fuertes y limitaciones que debes tener en cuenta al usar estos modelos.

Esto es lo que hace destacar a PaliGemma 2 como modelo de visión y lenguaje:

  • Mejoras de eficiencia: al aprovechar la arquitectura optimizada de Gemma 2, PaliGemma 2 ofrece un alto rendimiento y minimiza los costes de implementación.
  • Funciones de seguridad mejoradas: PaliGemma 2 incluye mejoras de seguridad importantes en su proceso de entrenamiento, como un filtrado sólido de los datos de preentrenamiento para reducir los sesgos y una evaluación rigurosa frente a benchmarks de seguridad.
  • Baja latencia en configuraciones más pequeñas: el modelo 3B ofrece tiempos de inferencia más rápidos, por lo que es adecuado para casos de uso en los que la velocidad es fundamental, como las recomendaciones de productos en comercio electrónico o los sistemas de asistencia en directo.

Por otro lado, estas son algunas áreas en las que PaliGemma 2 puede presentar limitaciones:

  • Latencia: aunque los modelos más grandes son potentes, pueden presentar problemas de latencia, especialmente cuando se implementan para tareas que requieren respuestas inmediatas, como los sistemas de IA interactivos en tiempo real.
  • Dependencia de grandes conjuntos de datos: el rendimiento de PaliGemma 2 está estrechamente ligado a la calidad y diversidad de sus conjuntos de datos de entrenamiento, lo que podría limitar su eficacia en ámbitos poco representados o en idiomas que no estén incluidos en los datos de entrenamiento.
  • Requisitos elevados de recursos: pese a las optimizaciones, las versiones de 10B y 28B parámetros requieren una potencia computacional considerable, lo que las hace menos accesibles para organizaciones pequeñas con recursos limitados.

Conclusiones clave#

PaliGemma 2 es un avance fascinante en el modelado de visión y lenguaje, ya que ofrece una escalabilidad, flexibilidad de ajuste fino y precisión mejoradas. Puede servir como una herramienta valiosa para aplicaciones que abarcan desde soluciones de accesibilidad y comercio electrónico hasta diagnósticos sanitarios y educación.

Aunque presenta limitaciones, como sus requisitos computacionales y su dependencia de datos de alta calidad, sus puntos fuertes lo convierten en una opción práctica para abordar tareas complejas que integran datos visuales y textuales. PaliGemma 2 puede proporcionar una base sólida para que investigadores y desarrolladores exploren y amplíen el potencial de la IA en aplicaciones multimodales.

Forma parte de la conversación sobre IA consultando nuestro repositorio de GitHub y nuestra comunidad. ¡Descubre cómo la IA está avanzando en la agricultura y la sanidad! 🚀

Explore solutions

Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático