Late Chunking
Aprende c3mo el fragmentado tard3o (late chunking) crea incrustaciones (embeddings) con conocimiento del contexto, mejora la precisi3n de la recuperaci3n y de RAG, y preserva el significado del documento en fragmentos de texto relacionados.
El late chunking es una técnica de incrustación de documentos que preserva el contexto circundante mediante la codificación de un documento largo antes de producir incrustaciones para sus secciones más pequeñas. En lugar de dividir el texto primero e incrustar cada fragmento de forma independiente, utiliza un modelo de contexto largo para crear representaciones de tokens conscientes del contexto, y luego agrupa los tokens pertenecientes a cada fragmento en un vector separado. Las embeddings resultantes siguen siendo adecuadas para la recuperación mientras transportan información del documento más amplio.
Cómo funciona el Late Chunking#
Una tubería de recuperación convencional normalmente sigue este orden: dividir, codificar, almacenar. Esto es eficiente, pero un fragmento aislado puede contener frases como “el componente”, “este resultado” o “falló” sin identificar a qué se refieren.
El late chunking cambia el orden:
- El documento se divide en tokens, mientras se registran los límites de los fragmentos deseados.
- La secuencia completa de tokens, o la porción más grande que se ajuste a la context window del modelo, pasa a través de un transformer de contexto largo.
- A través del attention mechanism del modelo, cada representación de token incorpora información de otros tokens en ese contexto.
- Los vectores de tokens se agrupan según los límites registrados y se combinan, comúnmente mediante agrupación de medias, para producir una incrustación por fragmento.
La distinción clave es el tiempo: los límites siguen existiendo, pero se aplican después de la codificación contextual en lugar de antes. La Jina AI explanation of late chunking proporciona una comparación visual de estos dos órdenes de procesamiento.
Por qué importa la preservación del contexto#
El troceado ayuda a que los documentos se ajusten a los límites del modelo y permite que los sistemas de búsqueda recuperen pasajes precisos. La Microsoft’s document chunking guidance señala que representar un documento grande completo con un solo vector también puede comprimir demasiadas ideas en una sola representación.
Sin embargo, los fragmentos más pequeños aumentan el riesgo de pérdida de contexto. Considera estos pasajes adyacentes:
- “La bomba XR-12 está instalada junto al colector de refrigeración”.
- “Debe reemplazarse después de 10 000 horas de funcionamiento”.
Incrustado de forma independiente, el segundo pasaje no identifica qué significa “ello”. Con el late chunking, sus representaciones de tokens ya han prestado atención a la “bomba XR-12”, lo que hace que el pasaje sea más útil para una consulta como “¿Cuándo se debe reemplazar la bomba XR-12?”
El late chunking es especialmente relevante para la retrieval-augmented generation, donde los pasajes seleccionados proporcionan un contexto de base a un modelo de lenguaje. El Google Cloud RAG overview más amplio explica cómo la recuperación conecta las incrustaciones, la búsqueda vectorial y la generación fundamentada.
Métodos de troceado y recuperación relacionados#
El late chunking resuelve un problema diferente al de varias técnicas con nombres similares:
- Semantic chunking elige los límites en función de los cambios de significado. El late chunking determina cuándo ocurre la codificación contextual, por lo que ambas técnicas se pueden combinar.
- Contextual retrieval enriquece los fragmentos con texto explicativo adicional o metadatos antes de la indexación. El late chunking transfiere el contexto implícitamente a través de las representaciones de tokens.
- Chunk overlap repite texto cerca de los límites vecinos. Puede preservar pistas locales pero aumenta el tamaño del índice y puede crear resultados duplicados. La Cohere’s chunking strategy guide analiza cómo el tamaño de los fragmentos y la superposición afectan a la recuperación.
- Late interaction almacena múltiples vectores a nivel de token y los compara durante la recuperación. El late chunking normalmente almacena un vector agrupado por fragmento, lo que lo hace compatible con una vector database convencional.
Un reordenador también es complementario en lugar de equivalente: reordena los candidatos recuperados después de la búsqueda inicial, como lo ilustra el Google Cloud ranking workflow.
Implementación práctica#
Algunas API de incrustación exponen el late chunking directamente. La siguiente solicitud envía pasajes ordenados de un documento a la Jina Embedding API y devuelve una incrustación contextual para cada pasaje:
import os
import requests
chunks = [
"The XR-12 pump is installed beside the cooling manifold.",
"It must be replaced after 10,000 operating hours.",
]
payload = {
"model": "jina-embeddings-v3",
"task": "retrieval.passage",
"late_chunking": True,
"input": chunks,
}
headers = {"Authorization": f"Bearer {os.environ['JINA_API_KEY']}"}
response = requests.post(
"https://api.jina.ai/v1/embeddings",
headers=headers,
json=payload,
timeout=30,
)
response.raise_for_status()
print(len(response.json()["data"]))El recuento de salidas coincide con el número de fragmentos de entrada, pero cada vector refleja el contexto compartido del documento. Un flujo de trabajo alternativo autogestionado codifica la secuencia completa de tokens y agrupa los tramos posteriormente, como se demuestra en la late chunking implementation for vector search de Elastic.
Aplicaciones del mundo real y orientación#
Dos aplicaciones prácticas muestran dónde importa este contexto:
- Asistentes de conocimiento técnico: Los manuales de productos a menudo presentan una pieza una vez y luego se refieren a ella indirectamente. El late chunking ayuda a un sistema de soporte a recuperar el paso de mantenimiento correcto en lugar de otro pasaje que contenga un lenguaje genérico similar.
- Búsqueda de informes de visión artificial: Un computer vision and RAG workflow puede combinar detecciones, notas de inspección, subtítulos y registros de mantenimiento. Después de que Ultralytics YOLO26 detecte equipos o defectos, el late chunking puede mejorar la recuperación en el informe textual asociado. Los registros visuales también se pueden explorar utilizando un image similarity search workflow.
Utiliza el late chunking cuando los documentos contengan referencias cruzadas, pronombres, definiciones o dependencias narrativas. Mantén los fragmentos relacionados en el orden del documento, respeta el límite de contexto del modelo de incrustación, conserva los encabezados y los metadatos de origen, y evalúa la recuperación con consultas realistas. Agrega costos de codificación porque se procesan más tokens juntos, por lo que las incrustaciones de fragmentos independientes pueden seguir siendo preferibles para registros cortos y autónomos.






