Kvantisering (LLM)
Att lagra en modells vikter med lägre numerisk precision (t.ex. 4 eller 8 bitar i stället för 16) för att minska minnesbehovet och snabba upp inferensen. Gör det möjligt att köra stora modeller på blygsam hårdvara — med en liten kvalitetsförlust.
Mekanik: vikterna mappas från flyttal (FP16/BF16) till färre bitar (INT8, INT4, eller format som NF4). En 70B-modell som kräver ~140 GB i FP16 kan krympas till ~35 GB i 4-bit → får plats på en enda GPU. Vinst: lägre minne, snabbare (mindre data att flytta), billigare inferens. Pris: en viss noggrannhetsförlust som växer ju aggressivare man kvantiserar (4-bit är ofta en bra balans; 2-bit börjar märkas tydligt). Metoder: GPTQ, AWQ (post-training, smart om vilka vikter som är känsliga), och GGUF-formatet för llama.cpp. Skiljer sig från QLoRA (som kvantiserar för TRÄNING); detta gäller inferens. En av de viktigaste teknikerna för att köra LLM:er lokalt. Hör ihop med GGUF och QLoRA.