QLoRA
Quantized LoRA — en teknik (2023) som gör det möjligt att finjustera mycket stora modeller på en enda konsument-GPU genom att hålla basmodellen i 4-bitars kvantisering och bara träna små LoRA-adaptrar ovanpå. Demokratiserade fine-tuning.
Mekanik: basmodellens frusna vikter lagras i ett kompakt 4-bitars format (NF4, "NormalFloat"), vilket drastiskt sänker minnesbehovet; under träning av-kvantiseras vikterna på flygande fot för beräkning, men gradienterna uppdaterar bara de små LoRA-adaptrarna (inte basmodellen). Resultat: man kan finjustera en 65B-modell på en enda 48 GB-GPU — något som tidigare krävde ett kluster. Innovationer i pappret: 4-bit NormalFloat, dubbel kvantisering, och paged optimizers. Avvägning: en liten kvalitetsförlust från kvantiseringen, men nära full-precision-resultat i praktiken. Byggde vidare på LoRA och gjorde fine-tuning tillgängligt för hobbyister och små team. Hör ihop med LoRA-adapter och PEFT.