IT-lexikon AI & ML Kontextkomprimering

Kontextkomprimering

AI & ML In English → Uppdaterad: 2026-07-30

Att krympa det hämtade materialet i en RAG-pipeline innan det skickas till modellen — genom att filtrera bort irrelevanta delar eller sammanfatta. Sparar tokens (kostnad/latens) och minskar bruset som annars distraherar modellen.

Varför: en grov hämtning drar ofta in chunks som bara delvis är relevanta, plus rent brus. Att skicka allt rått slösar kontextfönster, höjer kostnaden och kan faktiskt försämra svaret (modellen "lost in the middle" eller distraherad av irrelevant text). Kontextkomprimering kör ett mellansteg som extraherar bara de relevanta meningarna ur varje chunk, eller sammanfattar dem, så att bara det väsentliga når modellen. Metoder: en mindre LLM som extraherar/sammanfattar, extraktiv filtrering per mening, eller relevansfiltrering med en reranker. Avvägning: ett extra steg (latens/kostnad) som lönar sig när hämtningen är bullrig. Besläktat med reranking men fokus på att korta ned, inte ordna om. Hör ihop med reranker och kontextfönster.

← Tillbaka till lexikonet