Reinforcement learning RL
ML-paradigm där en agent lär sig genom belöning — försök, få feedback, bli bättre.
Bakgrund till AlphaGo, robotik, självkörande bilar. Drev RLHF som finishen på alla moderna LLMs. Krävande att designa rätt belöningsfunktion — fel reward, fel beteende.