Test-time compute
Idén att lägga mer beräkning vid inferens (inte träning) — låt modellen tänka längre, generera fler kandidatsvar, och välja det bästa.
Forskning från DeepMind och OpenAI 2024 visade att en mindre modell som får 10× mer inference-budget kan slå en 10× större modell med standard-decoding. Tekniker: long chain-of-thought (o1, R1), best-of-N sampling, tree search (ToT), process reward models.
Skiftet förändrade ekonomin för LLM-deployment — inference dyrare per query, men träning amortiserad. Hela "reasoning model"-paradigmet är test-time-compute scaling i praktiken.