Contextual Retrieval
Aprende cómo la recuperación contextual mejora RAG con fragmentos adaptados a los documentos, búsqueda híbrida y reordenación; explora también Ultralytics YOLO26 para aportar contexto visual multimodal.
La recuperación contextual es una técnica de preprocesamiento que mejora la generación aumentada por recuperación (RAG) al añadir una breve explicación específica del documento a cada fragmento de datos antes de indexarlo. Presentada en la guía de Anthropic sobre recuperación contextual de 2024, ayuda a los sistemas de búsqueda a entender dónde encaja un pasaje que, de otro modo, sería ambiguo, lo que mejora las pruebas que se proporcionan a un modelo de lenguaje de gran tamaño. (anthropic.com)
Cómo funciona la recuperación contextual#
La RAG estándar divide los documentos en fragmentos y los convierte en embeddings. Sin embargo, un fragmento como «los ingresos aumentaron un 3 %» puede omitir la empresa, el periodo de información y el tipo de documento. La recuperación contextual utiliza el documento completo para generar un prefijo conciso, como «Este pasaje describe los resultados financieros del segundo trimestre de 2025 de ACME», antes de indexar el texto combinado.
Un flujo de trabajo típico incluye:
- Fragmentación semántica: Divide los documentos en pasajes coherentes que se ajusten a los límites de recuperación y del modelo. El objetivo principal de la fragmentación es que las fuentes grandes se puedan buscar sin superar la ventana de contexto del modelo.
- Generación de contexto: Utiliza un modelo para resumir la relación de cada fragmento con su fuente, siguiendo un proceso como el del recetario de embeddings contextuales de Claude.
- Búsqueda híbrida: Indexa fragmentos contextualizados con vectores densos y métodos léxicos, como la clasificación de palabras clave BM25.
- Reordenación: Reordena los candidatos recuperados mediante comparaciones más profundas entre la consulta y los fragmentos antes de enviar las mejores pruebas al generador.
Anthropic informó de que los embeddings contextuales combinados con BM25 contextual redujeron en un 49 % su tasa de fallos de recuperación en los 20 primeros resultados, mientras que añadir la reordenación produjo una reducción del 67 % en sus pruebas. Los resultados varían según el conjunto de datos, por lo que estas cifras deben considerarse referencias de evaluación y no garantías. (anthropic.com)
Recuperación contextual en visión artificial#
En la RAG multimodal, el contexto del documento puede incluir objetos detectados, descripciones de imágenes, marcas de tiempo, ubicaciones de cámaras o eventos de vídeo circundantes. El ejemplo siguiente utiliza Ultralytics YOLO26 para crear contexto consultable para una imagen:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg")[0]
labels = [model.names[int(cls)] for cls in result.boxes.cls.tolist()]
context = f"Street-scene image containing: {', '.join(labels)}."
print(context)El texto generado se puede anteponer a la descripción de una imagen o a un registro de metadatos antes de generar el embedding. Los desarrolladores pueden explorar los flujos de trabajo de predicción de YOLO y la búsqueda de similitud visual relacionados.
Aplicaciones en el mundo real#
- Búsqueda empresarial y jurídica: Los asistentes de políticas conservan los nombres de los documentos, las fechas, los departamentos y las relaciones entre cláusulas, lo que reduce las respuestas engañosas derivadas de pasajes aislados.
- Sistemas de mantenimiento visual: La maquinaria detectada, los tipos de defectos y las ubicaciones de las instalaciones proporcionan contexto a las imágenes antes de que el sistema recupere manuales de reparación o registros de inspección.
- Educación personalizada: Los agentes de aprendizaje pueden combinar el diálogo con el estudiante y los registros de actividad para recuperar orientación relevante para la tarea actual del estudiante.
Técnicas relacionadas y buenas prácticas#
La recuperación contextual se diferencia de la ingeniería de contexto, que gestiona toda la información que se proporciona a un modelo durante la ejecución. También se diferencia de la investigación sobre fragmentación tardía, que genera embeddings de un documento completo antes de agrupar las representaciones de los tokens en fragmentos. Una evaluación comparativa de 2025 determinó que la recuperación contextual es eficaz para preservar la coherencia semántica, pero requiere más recursos computacionales. (arxiv.org)
Las prácticas recomendadas actuales incluyen probar varios tamaños de fragmento, conservar los metadatos de origen, combinar la recuperación densa y por palabras clave, y medir la exhaustividad, la precisión, la fundamentación y la integridad de las respuestas con la guía de Microsoft para evaluar RAG. Las investigaciones más recientes, como SAGE precise retrieval, favorecen la segmentación semántica y la selección dinámica de fragmentos, mientras que un benchmark de recuperación de 2026 respalda la recuperación híbrida y la reordenación neuronal para documentos complejos de texto y tablas. Los equipos que desarrollan sistemas de conocimiento visual pueden utilizar Ultralytics Platform para anotar conjuntos de datos, entrenar modelos de visión, desplegar endpoints y supervisar los componentes que proporcionan contexto visual estructurado.






