IT-lexikon AI & ML DPO

DPO Direct Preference Optimization

AI & ML In English → Uppdaterad: 2026-05-23

Enklare alternativ till RLHF — träna direkt på preferens-par utan separat reward-modell.

Stanford 2023. RLHF kräver: SFT → reward model → PPO. DPO hoppar över reward model och PPO. Stabilare, billigare, ofta lika bra. Driver mycket av modern open source-finetuning. Llama 3 och senare modeller använder DPO eller varianter.

← Tillbaka till lexikonet