IT-lexikon AI & ML Multi-head latent attention (MLA)

Multi-head latent attention (MLA)

AI & ML In English → Uppdaterad: 2026-07-30

En attention-arkitektur (DeepSeek, 2024) som komprimerar key/value till en liten latent vektor i stället för att cacha fulla K/V per huvud — vilket krymper KV-cachen ännu mer än GQA. En nyckel bakom DeepSeeks låga inferenskostnad.

Idé: i stället för att lagra fullstora key- och value-vektorer (som MHA) eller dela huvuden (som GQA), projicerar MLA ned K och V till en gemensam, lågrangs "latent" representation som cachas; de fulla K/V rekonstrueras på flygande fot vid behov. Resultat: en mycket mindre KV-cache (DeepSeek rapporterar storleksordningar mindre än MHA) → längre kontext, högre genomströmning och lägre minneskostnad, med bibehållen modellkvalitet. Det var en av de tekniker som lät DeepSeek-modellerna köras ovanligt billigt. Skiljer sig från GQA (som minskar antalet KV-huvuden) genom att i stället komprimera KV-innehållet via lågrangs-projektion. Ett av de mer uppmärksammade arkitekturframstegen 2024. Hör ihop med grouped-query attention och KV-cache.

← Tillbaka till lexikonet