PagedAttention
Virtual memory-trick för KV-cache som låter LLM-servrar batcha flera requests utan att slösa GPU-minne.
Uppfunnit av vLLM-folket på Berkeley (2023). Klassiskt allokerar man en contiguous KV-cache per request, vilket leder till intern fragmentering (du reserverar för max kontext men använder bara en bråkdel). PagedAttention delar in cachen i fasta "pages" (typ 16 tokens) och har en page table per sekvens — precis som operativsystemets virtual memory. Resultat: 2–4x throughput-ökning, plats för fler samtidiga användare.