Contextual Retrieval
Aprende cómo la recuperación contextual mejora RAG con fragmentos conscientes del documento, búsqueda híbrida y reordenamiento, y explora Ultralytics YOLO26 para contexto visual multimodal.
La recuperación contextual es una técnica de preprocesamiento que mejora la retrieval-augmented generation (RAG) añadiendo una breve explicación específica del documento a cada fragmento de datos antes de indexarlo. Introducida en la guía de recuperación contextual de Anthropic de 2024, ayuda a los sistemas de búsqueda a entender a dónde pertenece un fragmento que de otro modo sería ambiguo, mejorando la evidencia suministrada a un modelo de lenguaje grande. (anthropic.com)
Link to this sectionCómo funciona la recuperación contextual#
El RAG estándar divide los documentos en fragmentos y los convierte en embeddings. Sin embargo, un fragmento como "los ingresos aumentaron un 3%" puede omitir la empresa, el periodo de informes y el tipo de documento. La recuperación contextual utiliza el documento completo para generar un prefijo conciso, como "Este pasaje describe los resultados financieros del segundo trimestre de 2025 de ACME", antes de indexar el texto combinado.
Un flujo de trabajo típico incluye:
- Semantic Chunking: Divide los documentos en pasajes coherentes que se ajusten a los límites de recuperación y del modelo. El propósito principal de la fragmentación es hacer que las fuentes grandes sean buscables sin superar la ventana de contexto del modelo.
- Generación de contexto: Utiliza un modelo para resumir la relación de cada fragmento con su fuente, siguiendo un proceso como el recetario de embeddings contextuales de Claude.
- Hybrid Search: Indexa los fragmentos contextualizados con vectores densos y métodos léxicos como la clasificación por palabras clave BM25.
- Reranking: Reordena los candidatos recuperados utilizando comparaciones más profundas entre la consulta y el fragmento antes de enviar la mejor evidencia al generador.
Anthropic informó que los embeddings contextuales combinados con el BM25 contextual redujeron su tasa de fallos de recuperación en los primeros 20 puestos en un 49%, mientras que añadir el reranking produjo una reducción del 67% en sus pruebas. Los resultados varían según el conjunto de datos, por lo que estas cifras deben tratarse como puntos de referencia y no como garantías. (anthropic.com)
Link to this sectionRecuperación contextual en visión artificial#
En el multimodal RAG, el contexto del documento puede incluir objetos detectados, subtítulos de imágenes, marcas de tiempo, ubicaciones de cámaras o eventos de vídeo circundantes. El siguiente ejemplo utiliza Ultralytics YOLO26 para crear contexto de búsqueda para una imagen:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg")[0]
labels = [model.names[int(cls)] for cls in result.boxes.cls.tolist()]
context = f"Street-scene image containing: {', '.join(labels)}."
print(context)El texto generado se puede anteponer a la leyenda de una imagen o a un registro de metadatos antes de realizar el embedding. Los desarrolladores pueden explorar los flujos de trabajo de predicción de YOLO y la búsqueda de similitud visual relacionados.
Link to this sectionAplicaciones en el mundo real#
- Enterprise and Legal Search: Los asistentes de políticas conservan los nombres de los documentos, las fechas, los departamentos y las relaciones entre cláusulas, reduciendo las respuestas engañosas procedentes de pasajes aislados.
- Visual Maintenance Systems: La maquinaria detectada, los tipos de defectos y las ubicaciones de las instalaciones contextualizan las imágenes antes de que el sistema recupere los manuales de reparación o los registros de inspección.
- Personalized Education: Los agentes de aprendizaje pueden combinar el diálogo del estudiante con los registros de actividad para recuperar la orientación relevante para la tarea actual del alumno.
Link to this sectionTécnicas relacionadas y mejores prácticas#
La recuperación contextual difiere de la context engineering, que gestiona toda la información suministrada a un modelo en tiempo de ejecución. También difiere de la investigación sobre late chunking, que realiza el embedding de un documento completo antes de agrupar las representaciones de los tokens en fragmentos. Una evaluación comparativa de 2025 descubrió que la recuperación contextual es eficaz para preservar la coherencia semántica, pero exige más recursos computacionales. (arxiv.org)
Las mejores prácticas actuales incluyen probar varios tamaños de fragmentos, conservar los metadatos de origen, combinar la recuperación densa y por palabras clave, y medir la recuperación, la precisión, la fundamentación y la exhaustividad de las respuestas con la guía de evaluación de RAG de Microsoft. Las investigaciones más recientes, como SAGE precise retrieval, favorecen la segmentación semántica y la selección dinámica de fragmentos, mientras que un benchmark de recuperación de 2026 respalda la recuperación híbrida y el reranking neuronal para documentos complejos de texto y tablas. Los equipos que crean sistemas de conocimiento visual pueden usar Ultralytics Platform para anotar conjuntos de datos, entrenar modelos de visión, desplegar puntos de conexión y monitorizar los componentes que suministran contexto visual estructurado.






