YOLO Vision 2026:
IA de visión

Entendiendo los modelos de lenguaje visual y sus aplicaciones

Aprende sobre los modelos de lenguaje visual, cómo funcionan y sus diversas aplicaciones en IA. Descubre cómo estos modelos combinan capacidades visuales y lingüísticas.

ABAbirami Vina6 min read
Modelos de lenguaje visual que combinan la comprensión de imágenes y texto

En un artículo anterior, exploramos cómo GPT-4o puede comprender y describir imágenes usando palabras. También estamos viendo esta capacidad en otros modelos nuevos como Google Gemini y Claude 3. Hoy profundizamos en este concepto para explicar cómo funcionan los modelos de lenguaje visual y cómo combinan datos visuales y textuales.

Estos modelos se pueden utilizar para realizar una serie de tareas impresionantes, como generar pies de foto detallados, responder preguntas sobre imágenes e incluso crear nuevo contenido visual basado en descripciones textuales. Al integrar perfectamente la información visual y lingüística, los modelos de visión y lenguaje están cambiando nuestra forma de interactuar con la tecnología y entender el mundo que nos rodea.

Cómo funcionan los modelos de visión y lenguaje#

Antes de ver dónde se pueden utilizar los modelos de visión y lenguaje (VLM), comprendamos qué son y cómo funcionan. Los VLM son modelos avanzados de IA que combinan las capacidades de los modelos de visión y lenguaje para manejar tanto imágenes como texto. Estos modelos toman imágenes junto con sus descripciones textuales y aprenden a conectar ambas. La parte de visión del modelo captura detalles de las imágenes, mientras que la parte de lenguaje entiende el texto. Este trabajo en equipo permite a los VLM entender y analizar tanto imágenes como texto.

Estas son las capacidades clave de los modelos de visión y lenguaje:

  • Creación de subtítulos para imágenes: Generación de texto descriptivo basado en el contenido de las imágenes.
  • Respuesta visual a preguntas (VQA): Responder preguntas relacionadas con el contenido de una imagen.
  • De texto a Generación de imágenes: Creación de imágenes basadas en descripciones textuales.
  • Recuperación de imagen-texto: Búsqueda de imágenes relevantes para una consulta de texto dada y viceversa.
  • Creación de contenido multimodal: Combinación de imágenes y texto para generar contenido nuevo.
  • Comprensión de escenas y Detección de objetos: Identificación y categorización de objetos y detalles dentro de una imagen.

Ejemplo de las capacidades de un modelo de lenguaje visual

Fig 1. Un ejemplo de las capacidades de un modelo de lenguaje visual.

A continuación, exploremos las arquitecturas VLM comunes y las técnicas de aprendizaje utilizadas por modelos conocidos como CLIP, SimVLM y VisualGPT.

Aprendizaje contrastivo#

El aprendizaje contrastivo es una técnica que ayuda a los modelos a aprender comparando las diferencias entre los puntos de datos. Calcula cuán similares o diferentes son las instancias y tiene como objetivo minimizar la pérdida contrastiva, que mide estas diferencias. Es especialmente útil en el aprendizaje semisupervisado, donde un pequeño conjunto de ejemplos etiquetados guía al modelo para etiquetar datos nuevos y no vistos. Por ejemplo, para entender cómo es un gato, el modelo lo compara con imágenes de gatos y perros similares. Al identificar características como la estructura facial, el tamaño corporal y el pelaje, las técnicas de aprendizaje contrastivo pueden diferenciar entre un gato y un perro.

Diagrama de cómo funciona el aprendizaje contrastivo

Fig 2. Cómo funciona el aprendizaje contrastivo.

CLIP es un modelo de lenguaje visual que utiliza el aprendizaje contrastivo para relacionar descripciones de texto con imágenes. Funciona en tres sencillos pasos. Primero, entrena las partes del modelo que comprenden tanto el texto como las imágenes. Segundo, convierte las categorías de un conjunto de datos en descripciones de texto. Tercero, identifica la descripción que mejor coincide con una imagen dada. Gracias a este método, el modelo CLIP puede realizar predicciones precisas incluso en tareas para las que no ha sido entrenado específicamente.

PrefixLM#

PrefixLM es una técnica de procesamiento del lenguaje natural (NLP) utilizada para entrenar modelos. Comienza con parte de una oración (un prefijo) y aprende a predecir la siguiente palabra. En los modelos de visión y lenguaje, PrefixLM ayuda al modelo a predecir las siguientes palabras basándose en una imagen y un fragmento de texto determinado. Utiliza un Vision Transformer (ViT), que divide una imagen en pequeños parches, cada uno representando una parte de la imagen, y los procesa en secuencia.

Ejemplo de entrenamiento de un VLM utilizando la técnica PrefixLM

Fig 3. Un ejemplo de entrenamiento de un VLM que utiliza la técnica PrefixLM.

SimVLM es un VLM que utiliza la técnica de aprendizaje PrefixLM. Emplea una arquitectura de Transformer más sencilla en comparación con modelos anteriores, pero logra mejores resultados en varias pruebas. Su arquitectura de modelo consiste en aprender a asociar imágenes con prefijos de texto mediante un codificador de transformer y, a continuación, generar texto utilizando un decodificador de transformer.

Fusión multimodal con atención cruzada#

La fusión multimodal con atención cruzada es una técnica que mejora la capacidad de un modelo de visión y lenguaje preentrenado para comprender y procesar datos visuales. Funciona añadiendo capas de atención cruzada al modelo, lo que le permite prestar atención a la información visual y textual al mismo tiempo.

Así es como funciona:

  • Se identifican y resaltan los objetos clave de una imagen.
  • Los objetos resaltados son procesados por un codificador visual, traduciendo la información visual a un formato que el modelo pueda entender.
  • La información visual se pasa a un decodificador, que interpreta la imagen utilizando el conocimiento del modelo de lenguaje preentrenado.

VisualGPT es un buen ejemplo de un modelo que utiliza esta técnica. Incluye una característica especial llamada unidad de activación autorresucitable (SRAU), que ayuda al modelo a evitar un problema común conocido como desvanecimiento de gradientes. El desvanecimiento de gradientes puede hacer que los modelos pierdan información importante durante el entrenamiento, pero SRAU mantiene alto el rendimiento del modelo.

Diagrama de la arquitectura del modelo VisualGPT

Fig 4. Arquitectura del modelo VisualGPT.

Aplicaciones de los modelos de visión y lenguaje#

Los modelos de visión y lenguaje están teniendo un impacto en una variedad de industrias. Desde la mejora de las plataformas de comercio electrónico hasta hacer que internet sea más accesible, las posibles aplicaciones de los VLM son emocionantes. Exploremos algunas de estas aplicaciones.

Generación de descripciones de productos#

Cuando compras en línea, ves descripciones detalladas de cada producto, pero crear esas descripciones puede llevar mucho tiempo. Los VLM agilizan este proceso al automatizar la generación de dichas descripciones. Los minoristas en línea pueden generar directamente descripciones detalladas y precisas a partir de las imágenes de los productos utilizando modelos de lenguaje visual.

Las descripciones de productos de alta calidad ayudan a los motores de búsqueda a identificar productos basándose en atributos específicos mencionados en la descripción. Por ejemplo, una descripción que contiene "manga larga" y "cuello de algodón" ayuda a los clientes a encontrar una "camisa de algodón de manga larga" más fácilmente. También ayuda a los clientes a encontrar lo que quieren rápidamente y, a su vez, aumenta las ventas y la satisfacción del cliente.

Ejemplo de una descripción de producto generada por IA

Fig 5. Un ejemplo de una descripción de producto generada por IA.

Los modelos de Inteligencia Artificial Generativa, como BLIP-2, son ejemplos de VLM sofisticados capaces de predecir atributos de productos directamente a partir de imágenes. BLIP-2 utiliza varios componentes para comprender y describir con precisión productos de comercio electrónico. Comienza procesando y comprendiendo los aspectos visuales del producto con un codificador de imágenes. A continuación, un transformer de consultas interpreta esta información visual en el contexto de preguntas o tareas específicas. Por último, un modelo de lenguaje grande genera descripciones de productos detalladas y precisas.

Hacer que internet sea más accesible#

Los modelos de lenguaje visual pueden hacer que internet sea más accesible mediante el subtitulado de imágenes, especialmente para personas con discapacidad visual. Tradicionalmente, los usuarios necesitan introducir descripciones del contenido visual en sitios web y redes sociales. Por ejemplo, al publicar en Instagram, puedes añadir texto alternativo para lectores de pantalla. Sin embargo, los VLM pueden automatizar este proceso.

Cuando un VLM ve la imagen de un gato sentado en un sofá, puede generar el pie de foto "Un gato sentado en un sofá", haciendo que la escena sea clara para los usuarios con discapacidad visual. Los VLM utilizan técnicas como el prompting de pocos disparos (few-shot), donde aprenden de algunos ejemplos de pares imagen-pie de foto, y el prompting de cadena de pensamiento, que les ayuda a desglosar escenas complejas de forma lógica. Estas técnicas hacen que los pies de foto generados sean más coherentes y detallados.

Uso de la IA para generar subtítulos de imágenes

Fig 6. Uso de la IA para generar subtítulos de imágenes.

En este sentido, la función de Google "Obtener descripciones de imágenes de Google" en Chrome genera automáticamente descripciones para imágenes que no tienen texto alternativo. Aunque es posible que estas descripciones generadas por IA no sean tan detalladas como las escritas por humanos, siguen aportando información valiosa.

Beneficios y limitaciones de los modelos de visión y lenguaje#

Los modelos de visión y lenguaje (VLM) ofrecen muchas ventajas al combinar datos visuales y textuales. Algunos de los beneficios clave incluyen:

  • Mejor interacción humano-máquina: Permiten que los sistemas entiendan y respondan a entradas tanto visuales como textuales, mejorando los asistentes virtuales, los chatbots y la robótica.
  • Diagnóstico y análisis avanzados: Ayudan en el sector médico mediante el análisis de imágenes y la generación de descripciones, apoyando a los profesionales de la salud con segundas opiniones y detección de anomalías.
  • Narración interactiva y entretenimiento: Generan narrativas atractivas combinando entradas visuales y textuales para mejorar las experiencias de usuario en juegos y realidad virtual.

A pesar de sus impresionantes capacidades, los modelos de visión y lenguaje también tienen ciertas limitaciones. Aquí hay algunas cosas a tener en cuenta cuando se trata de VLM:

  • Altos requisitos computacionales: El entrenamiento y la implementación de los VLM requieren recursos computacionales sustanciales, lo que los encarece y reduce su accesibilidad.
  • Dependencia de datos y sesgo: Los VLM pueden producir resultados sesgados si se entrenan con conjuntos de datos no diversos o sesgados, lo que puede perpetuar estereotipos y desinformación.
  • Comprensión limitada del contexto: Los VLM pueden tener dificultades para entender el panorama general o el contexto y generar resultados simplificados en exceso o incorrectos.

Conclusiones clave#

Los modelos de lenguaje visual tienen un potencial increíble en muchos campos, como el comercio electrónico y la sanidad. Al combinar datos visuales y textuales, pueden impulsar la innovación y transformar industrias. No obstante, desarrollar estas tecnologías de forma responsable y ética resulta fundamental para garantizar que se utilicen de manera justa. A medida que los VLM sigan evolucionando, mejorarán tareas como la búsqueda basada en imágenes y las tecnologías de asistencia.

Para seguir aprendiendo sobre IA, ¡conéctate con nuestra comunidad! Explora nuestro repositorio de GitHub para ver cómo utilizamos la IA a fin de crear soluciones innovadoras en sectores como la fabricación y la sanidad. 🚀

Explore solutions

Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu viaje con el futuro del aprendizaje automático