Training Träning
Att lära ett neuralt nätverk via gradient descent — exempel-data + förlustfunktion + backprop. Många faser i moderna LLM:er.
Klassisk pipeline: Pretraining (massiv unsupervised på rådata, byggar grundmodell) → SFT (Supervised Fine-Tuning på instruktioner) → RLHF/RLAIF (alignment med människor/AI som feedback) → RLVR (Reinforcement Learning from Verifiable Rewards, för matte/kod). Kostnaden tippad framåt: GPT-4 sägs ha kostat ~$100M att pretraina. Senare faser är billigare men kritiska för kvalitet.