Quantization
Krympa en ML-modell genom att lagra vikter i färre bitar — 32-bit floats → 8-bit ints, eller till och med 4-bit.
4x mindre minne, 4x snabbare inference, med liten kvalitetsförlust. Möjliggör att köra 70B-modeller på en gaming-GPU. Bakgrunden till GGUF, AWQ, GPTQ.