Comprender los modelos de lenguaje y visión y sus aplicaciones
Descubre los modelos de lenguaje y visión, cómo funcionan y sus diversas aplicaciones en IA. Descubre cómo estos modelos combinan capacidades visuales y lingüísticas.

En un artículo anterior, exploramos cómo GPT-4o puede comprender y describir imágenes mediante palabras. También estamos viendo esta capacidad en otros modelos nuevos, como Google Gemini y Claude 3. Hoy profundizamos en este concepto para explicar cómo funcionan los modelos de visión y lenguaje y cómo combinan datos visuales y textuales.
Estos modelos pueden utilizarse para realizar una amplia variedad de tareas impresionantes, como generar descripciones detalladas de fotografías, responder a preguntas sobre imágenes e incluso crear contenido visual nuevo basándose en descripciones textuales. Al integrar información visual y lingüística de forma fluida, los modelos de visión y lenguaje están cambiando nuestra manera de interactuar con la tecnología y comprender el mundo que nos rodea.
Cómo funcionan los modelos de visión y lenguaje#
Antes de analizar dónde pueden utilizarse los modelos de visión y lenguaje (VLMs), entendamos qué son y cómo funcionan. Los VLMs son modelos avanzados de IA que combinan las capacidades de los modelos de visión y de lenguaje para trabajar tanto con imágenes como con texto. Estos modelos reciben imágenes junto con sus descripciones textuales y aprenden a relacionarlas. La parte visual del modelo captura detalles de las imágenes, mientras que la parte lingüística comprende el texto. Este trabajo conjunto permite a los VLMs comprender y analizar tanto imágenes como texto.
Estas son las capacidades principales de los modelos de visión y lenguaje:
- Descripción de imágenes: Generar texto descriptivo basándose en el contenido de las imágenes.
- Respuesta a preguntas visuales (VQA): Responder a preguntas relacionadas con el contenido de una imagen.
- Texto a generación de imágenes: Crear imágenes basándose en descripciones textuales.
- Recuperación de imágenes y texto: Encontrar imágenes relevantes para una consulta de texto determinada y viceversa.
- Creación de contenido multimodal: Combinar imágenes y texto para generar contenido nuevo.
- Comprensión de escenas y detección de objetos: Identificar y categorizar objetos y detalles dentro de una imagen.

Fig. 1. Un ejemplo de las capacidades de un modelo de visión y lenguaje.
A continuación, exploraremos las arquitecturas y técnicas de aprendizaje habituales de los VLMs que utilizan modelos conocidos como CLIP, SimVLM y VisualGPT.
Aprendizaje contrastivo#
El aprendizaje contrastivo es una técnica que ayuda a los modelos a aprender comparando las diferencias entre puntos de datos. Calcula en qué medida se parecen o se diferencian las instancias y trata de minimizar la pérdida contrastiva, que mide estas diferencias. Es especialmente útil en el aprendizaje semisupervisado, donde un pequeño conjunto de ejemplos etiquetados guía al modelo para etiquetar datos nuevos que no ha visto. Por ejemplo, para comprender el aspecto de un gato, el modelo lo compara con imágenes similares de gatos y con imágenes de perros. Al identificar características como la estructura facial, el tamaño corporal y el pelaje, las técnicas de aprendizaje contrastivo pueden diferenciar entre un gato y un perro.

Fig. 2. Cómo funciona el aprendizaje contrastivo.
CLIP es un modelo de visión y lenguaje que utiliza el aprendizaje contrastivo para relacionar descripciones textuales con imágenes. Funciona en tres pasos sencillos. Primero, entrena las partes del modelo que comprenden tanto el texto como las imágenes. Segundo, convierte las categorías de un conjunto de datos en descripciones textuales. Tercero, identifica la descripción que mejor coincide con una imagen determinada. Gracias a este método, el modelo CLIP puede realizar predicciones precisas incluso en tareas para las que no se ha entrenado específicamente.
PrefixLM#
PrefixLM es una técnica de procesamiento del lenguaje natural (NLP) utilizada para entrenar modelos. Comienza con parte de una frase (un prefijo) y aprende a predecir la palabra siguiente. En los modelos de visión y lenguaje, PrefixLM ayuda al modelo a predecir las palabras siguientes basándose en una imagen y en un fragmento de texto determinado. Utiliza un Transformer de visión (ViT), que divide una imagen en pequeños fragmentos, cada uno de los cuales representa una parte de la imagen, y los procesa en secuencia.

Fig. 3. Un ejemplo del entrenamiento de un VLM que utiliza la técnica PrefixLM.
SimVLM es un VLM que utiliza la técnica de aprendizaje PrefixLM. Utiliza una arquitectura Transformer más sencilla que la de los modelos anteriores, pero obtiene mejores resultados en varias pruebas. La arquitectura de su modelo consiste en aprender a asociar imágenes con prefijos de texto mediante un codificador Transformer y, después, generar texto mediante un decodificador Transformer.
Fusión multimodal con atención cruzada#
La fusión multimodal con atención cruzada es una técnica que mejora la capacidad de un modelo de visión y lenguaje preentrenado para comprender y procesar datos visuales. Funciona añadiendo capas de atención cruzada al modelo, lo que le permite prestar atención a la información visual y textual al mismo tiempo.
Así es como funciona:
- Se identifican y resaltan los objetos clave de una imagen.
- Un codificador visual procesa los objetos resaltados y convierte la información visual a un formato que el modelo puede comprender.
- La información visual se transmite a un decodificador, que interpreta la imagen utilizando los conocimientos del modelo de lenguaje preentrenado.
VisualGPT es un buen ejemplo de un modelo que utiliza esta técnica. Incluye una función especial denominada unidad de activación autorreanimable (SRAU), que ayuda al modelo a evitar un problema habitual llamado gradientes evanescentes. Los gradientes evanescentes pueden hacer que los modelos pierdan información importante durante el entrenamiento, pero SRAU mantiene un buen rendimiento del modelo.

Fig. 4. Arquitectura del modelo VisualGPT.
Aplicaciones de los modelos de visión y lenguaje#
Los modelos de visión y lenguaje están teniendo un impacto en diversos sectores. Desde mejorar las plataformas de comercio electrónico hasta hacer que Internet sea más accesible, las posibles aplicaciones de los VLMs son muy interesantes. Exploremos algunas de ellas.
Generación de descripciones de productos#
Cuando compras por Internet, ves descripciones detalladas de cada producto, pero crear esas descripciones puede llevar mucho tiempo. Los VLMs agilizan este proceso automatizando su generación. Las tiendas online pueden generar directamente descripciones detalladas y precisas a partir de imágenes de productos utilizando modelos de visión y lenguaje.
Las descripciones de productos de alta calidad ayudan a los motores de búsqueda a identificar productos basándose en atributos específicos mencionados en la descripción. Por ejemplo, una descripción que contenga «manga larga» y «cuello de algodón» ayuda a los clientes a encontrar más fácilmente una «camisa de algodón de manga larga». También ayuda a los clientes a encontrar rápidamente lo que buscan y, a su vez, aumenta las ventas y su satisfacción.

Fig. 5. Un ejemplo de una descripción de producto generada por IA.
Los modelos de IA generativa, como BLIP-2, son ejemplos de VLMs sofisticados que pueden predecir directamente los atributos de los productos a partir de imágenes. BLIP-2 utiliza varios componentes para comprender y describir con precisión los productos de comercio electrónico. Comienza procesando y comprendiendo los aspectos visuales del producto mediante un codificador de imágenes. Después, un Transformer de consulta interpreta esta información visual en el contexto de preguntas o tareas específicas. Por último, un modelo de lenguaje grande genera descripciones de productos detalladas y precisas.
Hacer que Internet sea más accesible#
Los modelos de visión y lenguaje pueden hacer que Internet sea más accesible mediante la descripción de imágenes, especialmente para las personas con discapacidad visual. Tradicionalmente, los usuarios deben introducir descripciones del contenido visual en sitios web y redes sociales. Por ejemplo, cuando publicas algo en Instagram, puedes añadir texto alternativo para los lectores de pantalla. Sin embargo, los VLMs pueden automatizar este proceso.
Cuando un VLM ve la imagen de un gato sentado en un sofá, puede generar la descripción «Un gato sentado en un sofá», lo que hace que la escena sea clara para los usuarios con discapacidad visual. Los VLMs utilizan técnicas como el prompting de pocos ejemplos, mediante el que aprenden a partir de unos pocos pares de imágenes y descripciones, y el prompting de cadena de pensamiento, que les ayuda a descomponer lógicamente escenas complejas. Estas técnicas hacen que las descripciones generadas sean más coherentes y detalladas.

Fig. 6. Uso de la IA para generar descripciones de imágenes.
Con este fin, la función «Obtener descripciones de imágenes de Google» de Google Chrome genera automáticamente descripciones para las imágenes que no tienen texto alternativo. Aunque estas descripciones generadas por IA pueden no ser tan detalladas como las escritas por personas, siguen proporcionando información valiosa.
Ventajas y limitaciones de los modelos de visión y lenguaje#
Los modelos de visión y lenguaje (VLMs) ofrecen muchas ventajas al combinar datos visuales y textuales. Algunas de las principales ventajas son:
- Mejor interacción entre personas y máquinas: Permiten que los sistemas comprendan y respondan tanto a entradas visuales como textuales, mejorando los asistentes virtuales, los chatbots y la robótica.
- Diagnóstico y análisis avanzados: Ayudan en el ámbito médico mediante el análisis de imágenes y la generación de descripciones, ofrecen a los profesionales sanitarios una segunda opinión y permiten detectar anomalías.
- Narración interactiva y entretenimiento: Generan narrativas atractivas combinando entradas visuales y textuales para mejorar la experiencia de los usuarios en los videojuegos y la realidad virtual.
A pesar de sus impresionantes capacidades, los modelos de visión y lenguaje también presentan ciertas limitaciones. Estos son algunos aspectos que debes tener en cuenta al utilizar VLMs:
- Altos requisitos computacionales: Entrenar e implementar VLMs requiere recursos computacionales considerables, lo que los hace costosos y menos accesibles.
- Dependencia de los datos y sesgo: Los VLMs pueden producir resultados sesgados si se entrenan con conjuntos de datos poco diversos o sesgados, lo que puede perpetuar estereotipos y desinformación.
- Comprensión contextual limitada: Los VLMs pueden tener dificultades para comprender el contexto o la visión general y generar resultados demasiado simplificados o incorrectos.
Conclusiones clave#
Los modelos de visión y lenguaje tienen un potencial increíble en muchos ámbitos, como el comercio electrónico y la sanidad. Al combinar datos visuales y textuales, pueden impulsar la innovación y transformar sectores. Sin embargo, es esencial desarrollar estas tecnologías de forma responsable y ética para garantizar que se utilicen de manera justa. A medida que los VLMs sigan evolucionando, mejorarán tareas como la búsqueda basada en imágenes y las tecnologías de asistencia.
¡Sigue aprendiendo sobre IA y únete a nuestra comunidad! Explora nuestro repositorio de GitHub para ver cómo utilizamos la IA para crear soluciones innovadoras en sectores como la industria manufacturera y la sanidad. 🚀









