Ultralytics YOLO27:
IA visual

Mejora de aplicaciones de IA con RAG y visión artificial

Descubre cómo combinar la generación aumentada por recuperación (RAG) con la visión artificial ayuda a los sistemas de IA a interpretar documentos, elementos visuales y contenidos complejos del mundo real.

ABAbirami Vina10 min read
Mejora de aplicaciones de IA con RAG y visión artificial

El uso de herramientas de IA como ChatGPT o Gemini se está convirtiendo rápidamente en una forma habitual de buscar información. Tanto si redactas un mensaje como si resumes un documento o respondes a una pregunta, estas herramientas suelen ofrecer una solución más rápida y sencilla.

Pero si has utilizado modelos de lenguaje de gran tamaño (LLMs) varias veces, probablemente hayas notado sus limitaciones. Cuando reciben consultas muy específicas o relacionadas con información reciente, pueden responder con datos incorrectos y, a menudo, hacerlo con total seguridad.

Esto ocurre porque los LLM independientes se basan exclusivamente en los datos con los que se entrenaron. No tienen acceso a las últimas actualizaciones ni a conocimientos especializados que estén fuera de ese conjunto de datos. Por tanto, sus respuestas pueden estar desactualizadas o ser inexactas.

Para ayudar a resolver este problema, los investigadores han desarrollado un método denominado generación aumentada mediante recuperación (RAG). RAG mejora los modelos de lenguaje al permitirles incorporar información reciente y relevante de fuentes fiables al responder a las consultas.

En este artículo, veremos cómo funciona RAG y cómo mejora las herramientas de IA al recuperar información relevante y actualizada. También analizaremos cómo funciona junto con la visión por ordenador, un campo de la inteligencia artificial centrado en interpretar datos visuales, para ayudar a los sistemas a comprender no solo texto, sino también imágenes, diseños y documentos visualmente complejos.

Comprender la generación aumentada mediante recuperación (RAG)#

Cuando hacemos una pregunta a un chatbot de IA, normalmente esperamos algo más que una respuesta que suene bien. Lo ideal es que una buena respuesta sea clara, precisa y realmente útil. Para conseguirlo, el modelo de IA necesita algo más que capacidades lingüísticas; también necesita acceso a la información adecuada, especialmente en temas específicos o relacionados con información reciente.

RAG es una técnica que ayuda a cubrir esta carencia. Combina la capacidad del modelo de lenguaje para comprender y generar texto con la potencia de recuperar información relevante de fuentes externas. En lugar de depender exclusivamente de sus datos de entrenamiento, el modelo incorpora activamente contenido de apoyo de bases de conocimiento fiables mientras formula su respuesta.

Principales casos de uso de RAG

Fig. 1. Principales casos de uso de RAG. Imagen del autor.

Puedes imaginarlo como hacerle una pregunta a alguien y que esa persona consulte una referencia fiable antes de responder. La respuesta sigue estando expresada con sus propias palabras, pero se basa en la información más relevante y actualizada.

Este enfoque ayuda a los LLM a responder con respuestas más completas, precisas y adaptadas a la consulta del usuario, lo que los hace mucho más fiables en aplicaciones reales donde la precisión es realmente importante.

Cómo funciona RAG#

RAG mejora la forma en que responde un modelo de lenguaje de gran tamaño mediante la introducción de dos pasos clave: recuperación y generación. Primero, recupera información relevante de una base de conocimiento externa. Después, utiliza esa información para generar una respuesta bien formulada y consciente del contexto.

Veamos un ejemplo sencillo para entender cómo funciona este proceso. Imagina que utilizas un asistente de IA para gestionar tus finanzas personales y quieres comprobar si has respetado tu objetivo de gasto del mes.

El proceso comienza cuando haces al asistente una pregunta como «¿He respetado mi presupuesto este mes?». En lugar de basarse únicamente en lo aprendido durante el entrenamiento, el sistema utiliza un recuperador para buscar en tus registros financieros más recientes, como extractos bancarios o resúmenes de transacciones. Se centra en comprender la intención de tu pregunta y recopila la información más relevante.

Una vez recuperada esa información, el modelo de lenguaje toma el relevo. Procesa tanto tu pregunta como los datos extraídos de tus registros para generar una respuesta clara y útil. En lugar de enumerar datos sin procesar, la respuesta resume tus gastos y te ofrece una conclusión directa y significativa, como confirmar si has cumplido tu objetivo y señalar las principales áreas de gasto.

Este enfoque ayuda al LLM a proporcionar respuestas que no solo son precisas, sino que también se basan en tu información real y actualizada, lo que hace que la experiencia sea mucho más útil que la de un modelo que trabaja únicamente con datos de entrenamiento estáticos.

Comprender cómo funciona RAG

Fig. 2. Comprender cómo funciona RAG.

La necesidad de sistemas RAG multimodales#

Por lo general, la información no siempre se comparte en texto plano. Desde exploraciones médicas y diagramas hasta diapositivas de presentaciones y documentos escaneados, los elementos visuales suelen contener detalles importantes. Los LLM tradicionales, diseñados principalmente para leer y comprender texto, pueden tener dificultades con este tipo de contenido.

Sin embargo, RAG puede utilizarse junto con la visión por ordenador para cubrir esa carencia. Al combinarse, ambos forman lo que se conoce como un sistema RAG multimodal: una configuración capaz de gestionar tanto texto como elementos visuales, lo que ayuda a los chatbots de IA a ofrecer respuestas más precisas y completas.

En el centro de este enfoque se encuentran los modelos de visión y lenguaje (VLMs), diseñados para procesar y razonar sobre ambos tipos de entrada. En esta configuración, RAG recupera la información más relevante de grandes fuentes de datos, mientras que el VLM, habilitado por la visión por ordenador, interpreta imágenes, diseños y diagramas.

Esto resulta especialmente útil para documentos del mundo real, como formularios escaneados, informes médicos o diapositivas de presentaciones, en los que los detalles esenciales pueden encontrarse tanto en el texto como en los elementos visuales. Por ejemplo, al analizar un documento que incluye imágenes junto a tablas y párrafos, un sistema multimodal puede extraer los elementos visuales, generar un resumen de lo que muestran y combinarlo con el texto circundante para ofrecer una respuesta más completa y útil.

RAG multimodal que utiliza imágenes y texto para ofrecer mejores respuestas

Fig. 3. El RAG multimodal utiliza imágenes y texto para ofrecer mejores respuestas.

Aplicaciones de RAG para datos visuales#

Ahora que hemos explicado qué es RAG y cómo funciona con la visión por ordenador, veamos algunos ejemplos del mundo real y proyectos de investigación que muestran cómo se utiliza este enfoque.

Comprender documentos visuales con VisRAG#

Imagina que intentas extraer información útil de un informe financiero o de un documento jurídico escaneado. Este tipo de archivos suele incluir no solo texto, sino también tablas, gráficos y diseños que ayudan a explicar la información. Un modelo de lenguaje convencional podría pasar por alto estos elementos visuales o interpretarlos incorrectamente, lo que daría lugar a respuestas incompletas o inexactas.

VisRAG fue creado por investigadores para abordar este problema. Es una canalización RAG basada en VLM que trata cada página como una imagen, en lugar de procesar únicamente el texto. Esto permite al sistema comprender tanto el contenido como su estructura visual. Como resultado, puede encontrar las partes más relevantes y ofrecer respuestas más claras, precisas y basadas en el contexto completo del documento.

VisRAG lee documentos como imágenes para capturar el contenido y el diseño

Fig. 4. VisRAG puede leer documentos como imágenes para capturar el contenido textual y el diseño.

Respuesta a preguntas visuales con RAG#

La respuesta visual a preguntas (VQA) es una tarea en la que un sistema de IA responde a preguntas sobre imágenes. Muchos sistemas de VQA existentes se centran en responder preguntas sobre un único documento sin necesidad de buscar información adicional; esto se conoce como entorno cerrado.

VDocRAG es un marco de RAG que adopta un enfoque más realista. Integra VQA con la capacidad de recuperar primero los documentos relevantes. Esto resulta útil en situaciones reales en las que la pregunta de un usuario puede aplicarse a uno de muchos documentos y el sistema necesita encontrar el adecuado antes de responder. Para ello, VDocRAG utiliza VLM para analizar documentos como imágenes, conservando tanto su texto como su estructura visual.

Esto hace que VDocRAG sea especialmente útil en aplicaciones como la búsqueda empresarial, la automatización de documentos y la atención al cliente. Puede ayudar a los equipos a extraer rápidamente respuestas de documentos complejos con formato visual, como manuales o archivos de políticas, en los que comprender el diseño es tan importante como leer las palabras.

La diferencia entre VDocRAG y las soluciones basadas en LLM

Fig. 5. La diferencia entre VDocRAG y las soluciones basadas en LLM.

Mejora de la descripción de imágenes con RAG#

La descripción de imágenes consiste en generar una descripción escrita de lo que sucede en una imagen. Se utiliza en diversas aplicaciones: desde hacer más accesible el contenido en línea hasta impulsar la búsqueda de imágenes y respaldar los sistemas de moderación y recomendación de contenido.

Sin embargo, generar descripciones precisas no siempre resulta fácil para los modelos de IA. Es especialmente difícil cuando la imagen muestra algo diferente de aquello con lo que se entrenó el modelo. Muchos sistemas de descripción dependen en gran medida de los datos de entrenamiento, por lo que, ante escenas desconocidas, sus descripciones pueden resultar vagas o inexactas.

Para abordar este problema, los investigadores desarrollaron Re-ViLM, un método que incorpora la generación aumentada mediante recuperación (RAG) a la descripción de imágenes. En lugar de generar una descripción desde cero, Re-ViLM recupera pares similares de imagen y texto de una base de datos y los utiliza para guiar la salida de la descripción.

Este enfoque basado en la recuperación ayuda al modelo a fundamentar sus descripciones en ejemplos relevantes, mejorando tanto la precisión como la fluidez. Los primeros resultados muestran que Re-ViLM genera descripciones más naturales y conscientes del contexto al utilizar ejemplos reales, lo que ayuda a reducir las descripciones vagas o inexactas.

Re-ViLM mejora las descripciones de imágenes al recuperar ejemplos visuales y textuales

Fig. 6. Re-ViLM mejora las descripciones de imágenes al recuperar ejemplos visuales y textuales.

Ventajas y desventajas del uso de RAG para comprender datos visuales#

Estas son, a grandes rasgos, las ventajas de aplicar técnicas de generación aumentada mediante recuperación para recuperar y utilizar información visual:

  • Capacidades mejoradas de resumen: Los resúmenes pueden incorporar información de elementos visuales, como tendencias de gráficos o elementos de infografías, y no solo del texto.
  • Búsqueda y recuperación más robustas: Los pasos de recuperación pueden identificar páginas visuales relevantes incluso cuando no hay palabras clave en el texto, mediante la comprensión basada en imágenes.
  • Compatibilidad con documentos escaneados, escritos a mano o basados en imágenes: Las canalizaciones RAG habilitadas por VLM pueden procesar contenido que resultaría ilegible para los modelos que solo trabajan con texto.

A pesar de estas ventajas, todavía hay algunas limitaciones que debes tener en cuenta al utilizar RAG para trabajar con datos visuales. Estas son algunas de las principales:

  • Elevados requisitos informáticos: Analizar imágenes y texto utiliza más memoria y capacidad de procesamiento, lo que puede ralentizar el rendimiento o aumentar los costes.
  • Problemas de privacidad de los datos y seguridad: Los documentos visuales, especialmente en sectores como la sanidad o las finanzas, pueden contener información confidencial que complica los flujos de trabajo de recuperación y procesamiento.
  • Tiempos de inferencia más largos: Como el procesamiento visual añade complejidad, generar respuestas puede llevar más tiempo que en los sistemas que solo trabajan con texto.

Conclusiones clave#

La generación aumentada mediante recuperación está mejorando la forma en que los modelos de lenguaje de gran tamaño responden a las preguntas, ya que les permite obtener información relevante y actualizada de fuentes externas. Cuando se combinan con la visión por ordenador, estos sistemas pueden procesar no solo texto, sino también contenido visual, como gráficos, tablas, imágenes y documentos escaneados, lo que da lugar a respuestas más precisas y completas.

Este enfoque hace que los LLM sean más adecuados para tareas del mundo real que implican documentos complejos. Al combinar la recuperación y la comprensión visual, estos modelos pueden interpretar diversos formatos de forma más eficaz y proporcionar información útil en contextos prácticos y cotidianos.

¡Únete a nuestra creciente comunidad! Explora nuestro repositorio de GitHub para profundizar en la IA. ¿Listo para iniciar tus propios proyectos de visión por ordenador? Consulta nuestras opciones de licencia. Descubre más sobre la IA en la sanidad y la visión por ordenador en el comercio minorista en nuestras páginas de soluciones.

Explore solutions

Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático