PPO Proximal Policy Optimization
Standard-RL-algoritmen för LLM-träning (RLHF-fasen) — uppdaterar policy "försiktigt" så den inte avviker för långt från föregående version.
John Schulman m.fl. på OpenAI (2017). Använder en "clipped surrogate objective" som begränsar policy-update till en region runt gamla policyn — undviker krasch-träning som A2C kunde lida av. Default-valet i InstructGPT/ChatGPT-träning, Claude-träning, Llama 2/3-träning. Kräver dock en separat value model (lika stor som policy) ⇒ minneshungrigt. GRPO (DeepSeek) eliminerar value model och blev populär 2024+. DPO är ett annat enklare alternativ.