IT-lexikon AI & ML Late chunking

Late chunking

AI & ML In English → Uppdaterad: 2026-05-29

En RAG-teknik (Jina AI, 2024) där man kör hela dokumentet genom en long-context-embeddingmodell FÖRST, och delar upp i chunks EFTERÅT — genom att poola token-embeddingarna per chunk. Varje chunk-embedding bär då sammanhang från hela dokumentet.

Problem den löser: vid vanlig ("naiv") chunking embeddas varje bit isolerat → en chunk som säger "han grundade det 1998" tappar vem "han" är, eftersom namnet stod i en tidigare chunk. Late chunking kör först hela dokumentet genom modellen (så token-embeddingarna sett all kontext) och poolar sedan ihop tokens till chunk-vektorer i efterhand → varje chunk "minns" det omgivande sammanhanget (pronomen, referenser, ämnet). Vinst: bättre retrieval för dokument fulla av referenser och samband, utan att lagra mer. Kräver en embeddingmodell med tillräckligt långt kontextfönster. En modern förfining ovanpå semantic chunking. Hör ihop med semantic chunking och embedding-modell.

← Tillbaka till lexikonet