IT-lexikon AI & ML GRPO

GRPO Group Relative Policy Optimization

AI & ML In English → Uppdaterad: 2026-05-23

DeepSeeks RL-algoritm för att träna reasoning-modeller — billigare än PPO, eliminerar value model genom att jämföra grupper av sampling-svar.

Introducerad i DeepSeek-Math (april 2024), populariserad av DeepSeek-R1 (januari 2025). PPO behöver en separat värdemodell (lika stor som policy-modellen) — GRPO sampla N svar på samma prompt, beräknar relativ fördel mot gruppmedelvärdet, skippar värdemodellen. Sparar ~50 % minne under träning. Tillsammans med rule-based rewards (verifierbara matte/kod-svar) enable träning av reasoning utan dyr human preference labeling.

← Tillbaka till lexikonet