DPO Direct Preference Optimization
Enklare alternativ till RLHF — träna direkt på preferens-par utan separat reward-modell.
Stanford 2023. RLHF kräver: SFT → reward model → PPO. DPO hoppar över reward model och PPO. Stabilare, billigare, ofta lika bra. Driver mycket av modern open source-finetuning. Llama 3 och senare modeller använder DPO eller varianter.