Reasoning-modeller "thinking models"
LLM:er tränade att producera långa interna "thinking"-spår före svaret — bättre på matte, kod, logik. Kostar mycket mer per query.
OpenAI släppte o1-preview september 2024 — visade att test-time compute (låta modellen "tänka" längre) ger samma kvalitetshopp som att göra modellen större. Efterföljarna: o3, DeepSeek-R1 (öppen vikter, januari 2025), Claude med extended thinking, Gemini 2 Thinking, Grok 4 Heavy. Tränas typiskt med reinforcement learning på problem där rätt svar är verifierbart (matte, kod). Kostar 5–50× mer än vanliga modeller per query men löser problem som tidigare var omöjliga.