Retrieval Augmented Generation (RAG)
Explora cómo la generación aumentada mediante recuperación (RAG) optimiza los LLM con datos en tiempo real. Aprende a crear pipelines multimodales con Ultralytics YOLO26 para RAG visual.
La generación aumentada mediante recuperación (RAG) es una técnica avanzada en el campo de la inteligencia artificial que optimiza el resultado de un modelo de lenguaje grande (LLM) al consultar una base de conocimientos autorizada externa a sus datos de entrenamiento. Los modelos generativos tradicionales se basan únicamente en la información estática aprendida durante su entrenamiento inicial, lo que puede dar lugar a respuestas desactualizadas o imprecisiones expresadas con seguridad, conocidas como alucinaciones. RAG cierra esta brecha al recuperar información relevante y actualizada de fuentes externas —como bases de datos de empresas, noticias actuales o manuales técnicos— y proporcionársela al modelo como contexto antes de generar una respuesta. Este proceso garantiza que los resultados de la IA no solo sean lingüísticamente coherentes, sino también fácticamente precisos y fundamentados en datos concretos.
Cómo funcionan los sistemas RAG#
La arquitectura de un sistema RAG suele constar de dos fases principales: recuperación y generación. Este flujo de trabajo permite a los desarrolladores mantener un modelo fundacional sin necesidad de realizar costosos reentrenamientos frecuentes.
-
Recuperación: Cuando un usuario envía una consulta, el sistema realiza primero una búsqueda semántica en un sistema de almacenamiento especializado denominado base de datos vectorial. Esta base de datos contiene datos que se han convertido en representaciones numéricas conocidas como embeddings, lo que permite al sistema encontrar información conceptualmente similar en lugar de limitarse a hacer coincidir palabras clave.
-
Generación: Los documentos o fragmentos de datos relevantes encontrados durante la recuperación se combinan con la pregunta original del usuario. A continuación, este prompt enriquecido se envía al modelo generativo. El modelo utiliza el contexto proporcionado para sintetizar una respuesta, garantizando que se base en los hechos recuperados. Para profundizar en el funcionamiento, IBM ofrece una guía completa sobre los flujos de trabajo de RAG.
RAG visual: integración de la visión artificial#
Aunque RAG se basa tradicionalmente en texto, el auge del aprendizaje multimodal ha introducido el «RAG visual». En este escenario, los modelos de visión artificial actúan como mecanismo de recuperación. Analizan imágenes o secuencias de vídeo para extraer datos textuales estructurados —como nombres de objetos, cantidades o actividades— que después se introducen en un LLM para responder a preguntas sobre la escena visual.
Por ejemplo, un desarrollador puede utilizar YOLO26 para detectar objetos en una imagen y pasar esa lista de objetos a un modelo de texto para generar un informe descriptivo.
from ultralytics import YOLO
# Load the YOLO26 model for state-of-the-art detection
model = YOLO("yolo26n.pt")
# Perform inference to 'retrieve' visual facts from an image
results = model("https://ultralytics.com/images/bus.jpg")
# Extract class names to build a text context for an LLM
detected_classes = [model.names[int(c)] for c in results[0].boxes.cls]
context_string = f"The scene contains: {', '.join(detected_classes)}."
print(context_string)
# Output example: "The scene contains: bus, person, person, person."Aplicaciones en el mundo real#
RAG está transformando sectores al permitir que los agentes de IA accedan de forma segura a datos propios o en tiempo real.
- Bases de conocimientos empresariales: Las empresas utilizan RAG para crear chatbots internos que responden a las preguntas de los empleados sobre políticas de RR. HH. o documentación técnica. Al conectar un LLM con un repositorio de documentos actualizado, el sistema evita proporcionar información obsoleta sobre las políticas. Para obtener más información sobre las implementaciones empresariales, consulta la descripción general de Google Cloud sobre RAG en Vertex AI.
- Asistencia para la toma de decisiones clínicas: En la IA en el sector sanitario, los sistemas RAG pueden recuperar el historial del paciente y artículos recientes de investigación médica para ayudar a los médicos en el diagnóstico, garantizando que las recomendaciones tengan en cuenta los estudios clínicos más recientes.
- Asistentes inteligentes para el comercio minorista: Las aplicaciones que utilizan IA en el comercio minorista aprovechan RAG para consultar bases de datos de inventario actualizadas. Si un cliente pregunta a un chatbot: «¿Tienes estas zapatillas de running en la talla 10?», el modelo recupera los niveles de existencias en tiempo real antes de responder, evitando la frustración causada por artículos agotados.
RAG frente a fine-tuning#
Es fundamental distinguir RAG del fine-tuning, ya que resuelven problemas diferentes.
- RAG (Generación aumentada mediante recuperación): Es ideal para acceder a datos dinámicos que cambian con frecuencia (por ejemplo, precios de acciones o noticias) o a datos privados que no están presentes en el conjunto de entrenamiento público. Se centra en proporcionar información nueva durante la ejecución.
- Fine-tuning: Es ideal para adaptar el comportamiento, el estilo o la terminología del modelo. Consiste en actualizar los pesos del modelo con un conjunto de datos específico. Aunque el fine-tuning ayuda al modelo a aprender un patrón lingüístico concreto (como la jerga médica), no le proporciona acceso a hechos en tiempo real. Consulta la guía de OpenAI sobre fine-tuning frente a RAG para conocer marcos de toma de decisiones.
Conceptos relacionados#
- LangChain: Un framework de código abierto popular diseñado específicamente para simplificar la creación de aplicaciones RAG mediante la conexión de recuperadores y LLM.
- Grafo de conocimiento: Una forma estructurada de representar datos que puede utilizarse como fuente de recuperación y que ofrece relaciones con mayor riqueza contextual que la simple similitud vectorial.
- Prompt engineering: El arte de diseñar entradas para guiar al modelo. RAG es, en esencia, una forma automatizada de prompt engineering en la que el «prompt» se enriquece mediante programación con datos recuperados.
- Ultralytics Platform: Mientras que RAG se ocupa del componente de generación de texto, plataformas como esta son esenciales para gestionar el preprocesamiento de datos y el entrenamiento de los modelos de visión que proporcionan datos visuales a las canalizaciones RAG multimodales.









