IT-lexikon AI & ML PagedAttention

PagedAttention

AI & ML In English → Uppdaterad: 2026-05-23

Virtual memory-trick för KV-cache som låter LLM-servrar batcha flera requests utan att slösa GPU-minne.

Uppfunnit av vLLM-folket på Berkeley (2023). Klassiskt allokerar man en contiguous KV-cache per request, vilket leder till intern fragmentering (du reserverar för max kontext men använder bara en bråkdel). PagedAttention delar in cachen i fasta "pages" (typ 16 tokens) och har en page table per sekvens — precis som operativsystemets virtual memory. Resultat: 2–4x throughput-ökning, plats för fler samtidiga användare.

← Tillbaka till lexikonet