Context window Kontextfönster
Det maximala antalet tokens en LLM kan behandla på en gång — prompt plus svar. Allt modellen "ser" måste få plats här. Har vuxit explosionsartat: från ~2k tokens (GPT-3) till hundratusentals eller miljoner i moderna modeller.
Varför det spelar roll: kontextfönstret avgör hur mycket dokument, historik och instruktioner man kan ge en modell samtidigt. Större fönster möjliggör att stoppa in hela böcker, kodbaser eller långa RAG-resultat. Men "stort fönster" är inte gratis: kostnaden och latensen växer (ofta kvadratiskt med uppmärksamhet), och modeller lider av "lost in the middle" — de minns början och slutet bättre än mitten av en lång kontext. "Needle in a haystack"-tester mäter hur väl en modell hittar en specifik detalj i en lång kontext. Därför är RAG (hämta bara det relevanta) ofta bättre än att bara fylla fönstret. Hör ihop med context-length extension och RAG.