IT-lexikon AI & ML Grouped-query attention (GQA)

Grouped-query attention (GQA)

AI & ML In English → Uppdaterad: 2026-07-30

En attention-variant där flera query-huvuden delar på samma uppsättning key/value-huvuden, i stället för att var och en har egna. Krymper KV-cachen rejält (snabbare inferens, mindre minne) med minimal kvalitetsförlust. Standard i Llama 2/3, Mistral m.fl.

Bakgrund: i vanlig multi-head attention (MHA) har varje huvud egna Q-, K- och V-projektioner → KV-cachen blir stor. Den extrema motsatsen, multi-query attention (MQA), låter alla query-huvuden dela ETT enda KV-huvud → minimal cache men viss kvalitetsförlust. GQA är mellanvägen: dela in query-huvudena i grupper, där varje grupp delar ett KV-huvud (t.ex. 32 query-huvuden, 8 KV-huvuden). Vinst: nästan MHA:s kvalitet med nära MQA:s minnesbesparing → mindre KV-cache, högre genomströmning, längre kontext. Eftersom KV-cachen ofta är inferensflaskhalsen är detta en av de mest impactfulla arkitekturvalen i moderna modeller. Hör ihop med KV-cache och multi-head latent attention.

← Tillbaka till lexikonet