RL Reinforcement Learning
ML paradigm where an agent learns by trial-and-error in an environment, rewarded/penalized by a reward signal. No labeled data needed — the agent generates its own.
Classic breakthroughs: DeepMind's Atari-playing DQN (2013), AlphaGo (2016), AlphaZero (2017), OpenAI Five (Dota, 2018). Modern revival via LLMs: RLHF (alignment), RLVR (Reinforcement Learning from Verifiable Rewards for math/code) drove DeepSeek-R1 (2025). Algorithms: Q-learning, Policy Gradient, PPO (Proximal Policy Optimization — OpenAI's go-to), DPO. Messy and costly — requires millions of episodes. RL "from scratch" is still a research frontier.