IT-lexikon AI & ML Knowledge distillation

Knowledge distillation

AI & ML In English → Uppdaterad: 2026-05-24

Träna en liten "student"-modell att härma en stor "teacher" — kopierar inte bara dess output utan dess sannolikhetsfördelning över output, vilket bär mycket mer information.

Hinton et al. (2015). Student-loss = kombination av cross-entropy mot hard labels och KL-divergens mot teacher-softmax (mjukad med en "temperatur"). Resultat: 10× mindre modell med kanske 90 % av kvaliteten.

Bakom moderna small-modell-vinster: DistilBERT, Gemma (distilled från Gemini), TinyLlama, Mistral 7B (delvis). Också central i DeepSeek-R1:s distillering till mindre reasoning-modeller.

← Tillbaka till lexikonet