Late Chunking
Erfahre, wie Late Chunking kontextbezogene Embeddings erstellt, die Retrieval- und RAG-Genauigkeit verbessert und die Dokumentenbedeutung über verwandte Textabschnitte hinweg bewahrt.
Late Chunking ist eine Dokument-Embedding-Technik, die den umgebenden Kontext bewahrt, indem sie ein langes Dokument kodiert, bevor Embeddings für dessen kleinere Abschnitte erstellt werden. Anstatt Text zuerst aufzuteilen und jeden Chunk unabhängig voneinander zu betten, wird ein Modell für langen Kontext verwendet, um kontextbewusste Token-Repräsentationen zu erstellen, und anschließend werden die zu jedem Chunk gehörenden Token in einem separaten Vektor zusammengefasst. Die resultierenden embeddings eignen sich weiterhin für den Abruf und transportieren gleichzeitig Informationen aus dem breiteren Dokument.
Wie Late Chunking funktioniert#
Eine herkömmliche Abrufpipeline folgt normalerweise dieser Reihenfolge: aufteilen, kodieren, speichern. Das ist effizient, aber ein isolierter Chunk kann Phrasen wie „die Komponente“, „dieses Ergebnis“ oder „es ist fehlgeschlagen“ enthalten, ohne zu identifizieren, worauf sie sich beziehen.
Late Chunking ändert diese Reihenfolge:
- Das Dokument wird in tokens unterteilt, während seine gewünschten Chunk-Grenzen aufgezeichnet werden.
- Die vollständige Token-Sequenz oder der größte Teil, der in das context window des Modells passt, wird durch einen transformer für langen Kontext geleitet.
- Durch den attention mechanism des Modells übernimmt jede Token-Repräsentation Informationen von anderen Token in diesem Kontext.
- Token-Vektoren werden entsprechend den aufgezeichneten Grenzen gruppiert und üblicherweise durch Mittelwertbildung (Mean Pooling) kombiniert, um ein Embedding pro Chunk zu erzeugen.
Der entscheidende Unterschied ist der Zeitpunkt: Grenzen existieren nach wie vor, sie werden jedoch nach der kontextuellen Kodierung anstatt davor angewendet. Die Jina AI explanation of late chunking bietet einen visuellen Vergleich dieser beiden Verarbeitungsreihenfolgen.
Warum Kontextbewahrung wichtig ist#
Chunking hilft dabei, dass Dokumente in die Modellgrenzen passen, und ermöglicht es Suchsystemen, präzise Passagen abzurufen. Microsoft’s document chunking guidance weist darauf hin, dass die Repräsentation eines gesamten großen Dokuments mit einem einzigen Vektor auch zu viele Ideen in eine einzige Repräsentation komprimieren kann.
Kleinere Chunks erhöhen jedoch das Risiko eines Kontextverlusts. Betrachte diese benachbarten Passagen:
- „Die Pumpe XR-12 ist neben dem Kühlverteiler installiert.“
- „Sie muss nach 10.000 Betriebsstunden ausgetauscht werden.“
Wenn die zweite Passage unabhängig voneinander gebettet wird, ist nicht erkennbar, was mit „sie“ gemeint ist. Beim Late Chunking wurden ihre Token-Repräsentationen bereits auf die „Pumpe XR-12“ ausgerichtet, wodurch die Passage für eine Abfrage wie „Wann sollte die Pumpe XR-12 ausgetauscht werden?“ nützlicher wird.
Late Chunking ist besonders relevant für retrieval-augmented generation, wo ausgewählte Passagen einem Sprachmodell einen begründenden Kontext liefern. Die umfassendere Google Cloud RAG overview erklärt, wie der Abruf Embeddings, Vektorsuche und begründete Generierung miteinander verbindet.
Verwandte Chunking- und Abrufmethoden#
Late Chunking löst ein anderes Problem als mehrere ähnlich benannte Techniken:
- Semantic chunking wählt Grenzen basierend auf Bedeutungsänderungen aus. Late Chunking bestimmt, wann die kontextuelle Kodierung stattfindet, sodass beide Techniken kombiniert werden können.
- Contextual retrieval reichert Chunks vor der Indizierung mit zusätzlichem erklärenden Text oder Metadaten an. Late Chunking überträgt den Kontext stattdessen implizit durch Token-Repräsentationen.
- Chunk-Überlappung (Chunk Overlap) wiederholt Text in der Nähe benachbarter Grenzen. Sie kann lokale Hinweise bewahren, erhöht jedoch die Indexgröße und kann doppelte Ergebnisse erzeugen. Cohere’s chunking strategy guide erörtert, wie sich Chunk-Größe und Überlappung auf den Abruf auswirken.
- Late Interaction speichert mehrere Vektoren auf Token-Ebene und vergleicht sie während des Abrufs. Late Chunking speichert typischerweise einen gepoolten Vektor pro Chunk, wodurch es mit einer herkömmlichen vector database kompatibel ist.
Ein Reranker ist zudem eher ergänzend als äquivalent: Er sortiert abgerufene Kandidaten nach der initialen Suche neu, wie der Google Cloud ranking workflow veranschaulicht.
Praktische Implementierung#
Einige Embedding-APIs stellen Late Chunking direkt zur Verfügung. Die folgende Anfrage sendet geordnete Passagen aus einem Dokument an die Jina Embedding API und gibt für jede Passage ein kontextuelles Embedding zurück:
import os
import requests
chunks = [
"The XR-12 pump is installed beside the cooling manifold.",
"It must be replaced after 10,000 operating hours.",
]
payload = {
"model": "jina-embeddings-v3",
"task": "retrieval.passage",
"late_chunking": True,
"input": chunks,
}
headers = {"Authorization": f"Bearer {os.environ['JINA_API_KEY']}"}
response = requests.post(
"https://api.jina.ai/v1/embeddings",
headers=headers,
json=payload,
timeout=30,
)
response.raise_for_status()
print(len(response.json()["data"]))Die Anzahl der Ausgaben entspricht der Anzahl der Eingabe-Chunks, aber jeder Vektor spiegelt den gemeinsamen Dokumentkontext wider. Ein alternativer, selbst verwalteter Workflow kodiert die vollständige Token-Sequenz und fasst die Abschnitte im Anschluss zusammen, wie in der late chunking implementation for vector search von Elastic demonstriert wird.
Praxisnahe Anwendungen und Leitlinien#
Zwei praktische Anwendungen zeigen, wo dieser Kontext wichtig ist:
- Technische Wissensassistenten: Produkthandbücher stellen ein Teil oft einmal vor und verweisen später indirekt darauf. Late Chunking hilft einem Support-System dabei, den korrekten Wartungsschritt abzurufen anstelle einer anderen Passage, die ähnliche allgemeine Sprache enthält.
- Suche nach Berichten in der Computer Vision: Ein computer vision and RAG workflow kann Erkennungen, Inspektionsnotizen, Beschriftungen und Wartungsaufzeichnungen kombinieren. Nachdem Ultralytics YOLO26 Ausrüstung oder Defekte erkannt hat, kann Late Chunking den Abruf im zugehörigen Textbericht verbessern. Visuelle Aufzeichnungen können auch mithilfe eines image similarity search workflow untersucht werden.
Verwende Late Chunking, wenn Dokumente Querverweise, Pronomen, Definitionen oder narrative Abhängigkeiten enthalten. Behalte verwandte Chunks in der Dokumentreihenfolge bei, respektiere das Kontextlimit des Embedding-Modells, behalte Überschriften und Quellmetadaten bei und evaluiere den Abruf mit realistischen Abfragen. Es erhöht die Kodierungskosten, da mehr Token gemeinsam verarbeitet werden, sodass unabhängige Chunk-Embeddings für kurze, in sich geschlossene Datensätze weiterhin zu bevorzugen sein können.






