SFT Supervised Fine-Tuning
Första finetuning-steget efter pre-training — träna på prompt+svar-par för att lära modellen följa instruktioner.
Före RLHF/DPO. Datasetet är hand-skrivna eller curaterade exempel: "fråga X → bra svar Y". Mindre dataset (10k-100k exempel) men hög kvalitet. Steg 1 → SFT, steg 2 → RLHF eller DPO. Ihopa = "Instruct"-modell.