KV cache
Cachen som lagrar attention-mekanismens "key"- och "value"-vektorer för redan bearbetade tokens, så de inte behöver räknas om för varje ny token som genereras. Helt avgörande för att autoregressiv text-generering ska vara snabb.
Varför: en LLM genererar en token i taget, och varje ny token behöver "titta på" alla tidigare tokens via attention. Utan cache skulle hela sekvensen räknas om vid varje steg (kvadratiskt slöseri). KV-cachen sparar key/value-vektorerna för alla tidigare tokens; vid varje nytt steg beräknas bara den nya tokenens vektorer och jämförs mot cachen. Problem: cachen växer linjärt med sekvenslängden OCH med batchstorleken och blir snabbt den dominerande minnesförbrukaren vid lång kontext → en flaskhals för genomströmning. Lösningar: PagedAttention (effektiv minneshantering), grouped-query attention (färre KV-huvuden), och KV-cache-kvantisering. Den centrala datastrukturen i LLM-inferens. Hör ihop med grouped-query attention och continuous batching.