Semantic chunking
Att dela upp ett dokument vid punkter där ämnet faktiskt skiftar, i stället för vid en fast teckengräns. Mäter likheten mellan på varandra följande meningar och sätter en chunk-gräns där likheten faller — så att varje chunk håller ihop ett sammanhängande ämne.
Mekanik: embedda varje mening, jämför grannmeningar; när likheten mellan två meningar sjunker under ett tröskelvärde har ämnet bytt → sätt en gräns där. Resultatet blir chunks av varierande längd som var och en handlar om en sak, vilket ger renare embeddings och bättre matchning än godtycklig uppdelning mitt i ett resonemang. Avvägning: dyrare att förbereda (embedda allt först) och kräver tröskeltrimning. Skiljer sig från fast-storlek-chunking (enkelt men klumpigt) och struktur-baserad (efter rubriker). Ett steg mot smartare RAG-indexering, ofta i samspel med late chunking. Hör ihop med chunking och late chunking.