Learning rate
Hur stora steg ML-modellen tar när den uppdaterar vikter — den viktigaste hyperparametern.
För högt: modellen "studsar" och divergerar. För lågt: tar evigheter att träna. Modern praxis: warmup + decay-schema, eller "cosine annealing".
Hur stora steg ML-modellen tar när den uppdaterar vikter — den viktigaste hyperparametern.
För högt: modellen "studsar" och divergerar. För lågt: tar evigheter att träna. Modern praxis: warmup + decay-schema, eller "cosine annealing".