IT-lexikon AI & ML SFT

SFT Supervised Fine-Tuning

AI & ML In English → Uppdaterad: 2026-05-23

Första finetuning-steget efter pre-training — träna på prompt+svar-par för att lära modellen följa instruktioner.

Före RLHF/DPO. Datasetet är hand-skrivna eller curaterade exempel: "fråga X → bra svar Y". Mindre dataset (10k-100k exempel) men hög kvalitet. Steg 1 → SFT, steg 2 → RLHF eller DPO. Ihopa = "Instruct"-modell.

← Tillbaka till lexikonet