Retrieval Augmented Generation (RAG)
Explora cómo la generación aumentada por recuperación (RAG) optimiza los LLM con datos en tiempo real. Aprende a crear tuberías multimodales usando Ultralytics YOLO26 para RAG visual.
Retrieval Augmented Generation (RAG) es una técnica avanzada en el campo de la inteligencia artificial que optimiza la salida de un Large Language Model (LLM) haciendo referencia a una base de conocimientos autorizada externa a sus datos de entrenamiento. Los modelos generativos tradicionales dependen únicamente de la información estática aprendida durante su entrenamiento inicial, lo que puede provocar respuestas desactualizadas o imprecisiones seguras conocidas como hallucinations. RAG cierra esta brecha recuperando información relevante y actualizada de fuentes externas —como bases de datos de empresas, noticias actuales o manuales técnicos— y alimentándola al modelo como contexto antes de que se genere una respuesta. Este proceso garantiza que las salidas de la IA no solo sean lingüísticamente coherentes, sino también fácticamente precisas y basadas en datos específicos.
Cómo funcionan los sistemas RAG#
La arquitectura de un sistema RAG normalmente implica dos fases principales: recuperación y generación. Este flujo de trabajo permite a los desarrolladores mantener un foundation model sin la costosa necesidad de un reentrenamiento frecuente.
-
Retrieval: Cuando un usuario envía una consulta, el sistema primero realiza una semantic search en un sistema de almacenamiento especializado llamado vector database. Esta base de datos contiene datos que se han convertido en representaciones numéricas conocidas como embeddings, lo que permite al sistema encontrar información conceptualmente similar en lugar de simplemente coincidir con palabras clave.
-
Generation: Los documentos relevantes o fragmentos de datos encontrados durante la recuperación se combinan con la pregunta original del usuario. Este aviso enriquecido se envía al modelo generativo. El modelo utiliza este contexto proporcionado para sintetizar una respuesta, asegurando que la respuesta se base en los hechos recuperados. Para profundizar en la mecánica, IBM provides a comprehensive guide on RAG workflows.
RAG visual: integración de visión por ordenador#
Si bien RAG se basa tradicionalmente en texto, el auge del multi-modal learning ha introducido el "RAG visual". En este escenario, los modelos de computer vision actúan como mecanismo de recuperación. Analizan imágenes o flujos de video para extraer datos textuales estructurados —como nombres de objetos, recuentos o actividades—, que luego se introducen en un LLM para responder preguntas sobre la escena visual.
Por ejemplo, un desarrollador puede usar YOLO26 para detectar objetos en una imagen y pasar esa lista de objetos a un modelo de texto para generar un informe descriptivo.
from ultralytics import YOLO
# Load the YOLO26 model for state-of-the-art detection
model = YOLO("yolo26n.pt")
# Perform inference to 'retrieve' visual facts from an image
results = model("https://ultralytics.com/images/bus.jpg")
# Extract class names to build a text context for an LLM
detected_classes = [model.names[int(c)] for c in results[0].boxes.cls]
context_string = f"The scene contains: {', '.join(detected_classes)}."
print(context_string)
# Output example: "The scene contains: bus, person, person, person."Aplicaciones en el mundo real#
RAG está transformando las industrias al permitir que los AI agents accedan a datos propietarios o en tiempo real de forma segura.
- Enterprise Knowledge Bases: Las empresas utilizan RAG para crear chatbots internos que responden a las preguntas de los empleados sobre políticas de recursos humanos o documentación técnica. Al conectar un LLM a un repositorio de documentos en vivo, el sistema evita proporcionar información de políticas obsoletas. Para obtener más información sobre las implementaciones empresariales, consulta Google Cloud's overview of RAG in Vertex AI.
- Clinical Decision Support: En AI in healthcare, los sistemas RAG pueden recuperar el historial del paciente y artículos de investigación médica recientes para ayudar a los médicos en el diagnóstico, asegurando que el consejo considere los estudios clínicos más recientes.
- Smart Retail Assistants: Las aplicaciones que utilizan AI in retail aprovechan RAG para verificar bases de datos de inventario en vivo. Si un cliente le pregunta a un chatbot: "¿Tiene estas zapatillas de running en la talla 10?", el modelo recupera los niveles de stock en tiempo real antes de responder, evitando la frustración por artículos agotados.
RAG frente al ajuste fino (fine-tuning)#
Es crucial distinguir RAG del fine-tuning, ya que resuelven problemas diferentes.
- RAG (Generación aumentada por recuperación): Ideal para acceder a datos dinámicos que cambian con frecuencia (por ejemplo, precios de acciones, noticias) o datos privados no presentes en el conjunto de entrenamiento público. Se centra en proporcionar nueva información durante el tiempo de ejecución.
- Fine-Tuning: Ideal para adaptar el comportamiento, el estilo o la terminología del modelo. Implica actualizar los model weights en un conjunto de datos específico. Si bien el ajuste fino ayuda a un modelo a aprender un patrón de lenguaje específico (como la jerga médica), no otorga acceso a hechos en tiempo real. Consulta OpenAI's guide on fine-tuning vs. RAG para conocer los marcos de toma de decisiones.
Conceptos relacionados#
- LangChain: Un marco de código abierto popular diseñado específicamente para simplificar la creación de aplicaciones RAG mediante el encadenamiento de recuperadores y LLMs.
- Knowledge Graph: Una forma estructurada de representar datos que se puede utilizar como fuente de recuperación, ofreciendo relaciones más ricas en contexto que la simple similitud vectorial.
- Prompt Engineering: El arte de elaborar entradas para guiar al modelo. RAG es esencialmente una forma automatizada de ingeniería de avisos donde el "aviso" se enriquece con datos recuperados programáticamente.
- Ultralytics Platform: Si bien RAG se encarga del lado de generación de texto, plataformas como esta son esenciales para gestionar el data preprocessing y el entrenamiento de los modelos de visión que alimentan los datos visuales en las canalizaciones RAG multimodales.






