Late Chunking
Aprende como o late chunking cria embeddings com consciência de contexto, melhora a recuperação e a precisão do RAG, e preserva o significado do documento em blocos de texto relacionados.
O late chunking é uma técnica de incorporação de documentos que preserva o contexto circundante ao codificar um documento longo antes de produzir embeddings para suas seções menores. Em vez de dividir o texto primeiro e incorporar cada chunk de forma independente, ele usa um modelo de contexto longo para criar representações de tokens sensíveis ao contexto, agrupando em seguida os tokens pertencentes a cada chunk em um vetor separado. Os embeddings resultantes continuam adequados para a recuperação, carregando informações de todo o documento.
Como o Late Chunking Funciona#
Um pipeline de recuperação convencional normalmente segue esta ordem: dividir, codificar, armazenar. Isso é eficiente, mas um chunk isolado pode conter frases como "o componente", "este resultado" ou "falhou" sem identificar a que elas se referem.
O late chunking altera essa ordem:
- O documento é dividido em tokens, enquanto os limites desejados dos chunks são registrados.
- A sequência completa de tokens, ou a maior parte que couber na context window do modelo, passa por um transformer de contexto longo.
- Através do attention mechanism do modelo, a representação de cada token incorpora informações de outros tokens nesse contexto.
- Os vetores de tokens são agrupados de acordo com os limites registrados e combinados, comumente por meio de agrupamento por média (mean pooling), para produzir um embedding por chunk.
A principal distinção é o momento: os limites ainda existem, mas são aplicados após a codificação contextual em vez de antes dela. A Jina AI explanation of late chunking fornece uma comparação visual dessas duas ordens de processamento.
Por Que a Preservação de Contexto é Importante#
A divisão em chunks ajuda os documentos a se ajustarem aos limites do modelo e permite que os sistemas de busca recuperem passagens precisas. A Microsoft’s document chunking guidance observa que representar um documento longo inteiro com um único vetor também pode comprimir ideias demais em uma única representação.
No entanto, chunks menores aumentam o risco de perda de contexto. Considere estas passagens adjacentes:
- “A bomba XR-12 está instalada ao lado do coletor de resfriamento.”
- “Ela deve ser substituída após 10.000 horas de funcionamento.”
Incorporada independentemente, a segunda passagem não identifica o que "ela" significa. Com o late chunking, suas representações de tokens já prestaram atenção na "bomba XR-12", tornando a passagem mais útil para uma consulta como "Quando a bomba XR-12 deve ser substituída?"
O late chunking é especialmente relevante para a retrieval-augmented generation, onde as passagens selecionadas fornecem o contexto de base para um modelo de linguagem. A visão geral mais ampla do Google Cloud RAG overview explica como a recuperação conecta embeddings, busca vetorial e geração fundamentada.
Métodos Relacionados de Chunking e Recuperação#
O late chunking resolve um problema diferente de várias técnicas com nomes semelhantes:
- Semantic chunking escolhe limites com base em mudanças de significado. O late chunking determina quando ocorre a codificação contextual, portanto, as duas técnicas podem ser combinadas.
- Contextual retrieval enriquece os chunks com texto explicativo adicional ou metadados antes da indexação. O late chunking, por sua vez, transfere o contexto implicitamente por meio de representações de tokens.
- Chunk overlap repete texto próximo aos limites vizinhos. Ele pode preservar pistas locais, mas aumenta o tamanho do índice e pode criar resultados duplicados. O guia de estratégia de chunking da Cohere’s chunking strategy guide discute como o tamanho do chunk e a sobreposição afetam a recuperação.
- Late interaction armazena vários vetores em nível de token e os compara durante a recuperação. O late chunking normalmente armazena um vetor agrupado por chunk, tornando-o compatível com um vector database convencional.
Um reranker também é complementar, em vez de equivalente: ele reordena os candidatos recuperados após a busca inicial, conforme ilustrado pelo Google Cloud ranking workflow.
Implementação Prática#
Algumas APIs de embedding expõem o late chunking diretamente. A solicitação a seguir envia passagens ordenadas de um documento para a Jina Embedding API e retorna um embedding contextual para cada passagem:
import os
import requests
chunks = [
"The XR-12 pump is installed beside the cooling manifold.",
"It must be replaced after 10,000 operating hours.",
]
payload = {
"model": "jina-embeddings-v3",
"task": "retrieval.passage",
"late_chunking": True,
"input": chunks,
}
headers = {"Authorization": f"Bearer {os.environ['JINA_API_KEY']}"}
response = requests.post(
"https://api.jina.ai/v1/embeddings",
headers=headers,
json=payload,
timeout=30,
)
response.raise_for_status()
print(len(response.json()["data"]))A contagem de saída corresponde ao número de chunks de entrada, mas cada vetor reflete o contexto compartilhado do documento. Um fluxo de trabalho alternativo autogerenciado codifica a sequência completa de tokens e agrupa os trechos posteriormente, conforme demonstrado na late chunking implementation for vector search da Elastic.
Aplicações Práticas e Orientações#
Duas aplicações práticas mostram onde esse contexto é importante:
- Assistentes de conhecimento técnico: Os manuais de produtos geralmente introduzem uma peça uma vez e depois se referem a ela indiretamente. O late chunking ajuda um sistema de suporte a recuperar a etapa de manutenção correta em vez de outra passagem contendo linguagem genérica semelhante.
- Busca de relatórios de visão computacional: Um computer vision and RAG workflow pode combinar detecções, notas de inspeção, legendas e registros de manutenção. Após o Ultralytics YOLO26 detectar equipamentos ou defeitos, o late chunking pode melhorar a recuperação no relatório textual associado. Os registros visuais também podem ser explorados usando um image similarity search workflow.
Use o late chunking quando os documentos contiverem referências cruzadas, pronomes, definições ou dependências narrativas. Mantenha os chunks relacionados na ordem do documento, respeite o limite de contexto do modelo de embedding, retenha títulos e metadados de origem e avalie a recuperação com consultas realistas. Ele adiciona custo de codificação porque mais tokens são processados juntos, de modo que embeddings de chunks independentes podem continuar preferíveis para registros curtos e auto-suficientes.






