RL Reinforcement Learning
ML-paradigm där en agent lär sig genom trial-and-error i en miljö, belönt/straffad av en reward-signal. Inget märkt data behövs — agenten genererar sin egen.
Klassiska genombrott: DeepMinds Atari-spelande DQN (2013), AlphaGo (2016), AlphaZero (2017), OpenAI Five (Dota, 2018). Modern revival via LLM: RLHF (alignment), RLVR (Reinforcement Learning from Verifiable Rewards för matte/kod) drev DeepSeek-R1 (2025). Algoritmer: Q-learning, Policy Gradient, PPO (Proximal Policy Optimization — OpenAI go-to), DPO. Stökigt och kostsamt — kräver miljoner episoder. RL "from scratch" är fortfarande forskningsfront.