OpenAI o1
OpenAIs första reasoning-modell (september 2024) — släpper en intern "thinking" CoT-fas innan svar och visade att test-time-compute kan slå ren parameter-skalning.
Tränad via RL där belöningssignalen är korrekta slutsvar på matte- och kod-problem. Modellen lär sig att producera långa interna resonemang (delvis dolda för användaren). Slog tidigare SOTA på AIME, USAMO och Codeforces med marginal.
Triggade hela "reasoning model"-vågen: DeepSeek-R1, QwQ, Gemini Thinking, Claude Extended Thinking, GPT o3/o4. Trade-off: dyrt och långsamt — svar tar sekunder till minuter.