IT-lexikon AI & ML GGUF

GGUF

AI & ML In English → Uppdaterad: 2026-07-30

Ett filformat (efterträdare till GGML) för att paketera kvantiserade språkmodeller i en enda fil, designat för llama.cpp och lokal körning. De facto-standarden för att distribuera modeller som hobbyister kör på egen hårdvara.

Egenskaper: en GGUF-fil innehåller vikter (i valfri kvantiseringsnivå, t.ex. Q4_K_M, Q5_K_S, Q8_0), arkitektur och all metadata (tokenizer, hyperparametrar) i ett paket → ladda ned en fil och kör. Stöder att köra delvis på CPU och delvis på GPU ("offloading" av lager), vilket gör att även modeller större än GPU-minnet kan köras. Namngivningen Q4_K_M etc. anger bitar och kvantiseringsschema (avvägning storlek vs kvalitet). Ekosystem: Hugging Face fullt av GGUF-konverteringar, körs av llama.cpp, Ollama, LM Studio, Jan. Skiljer sig från GPU-fokuserade format (safetensors + AWQ/GPTQ för vLLM). Ryggraden i den lokala LLM-rörelsen. Hör ihop med kvantisering och llama.cpp.

← Tillbaka till lexikonet