Attention-mekanism
Neural mekanism för att fokusera på relevanta delar av input. Bahdanau et al. (2014) introducerade för översättning. Vaswani et al. (2017) generaliserade till self-attention → Transformer.
Matematisk kärna: softmax(QK^T / √d) · V. Q (query), K (key), V (value) är linjära projektioner av input. Multi-head attention kör flera attention-heads parallellt. Quadratisk komplexitet i sekvenslängd är klassisk begränsning → mycket forskning på efficient attention (Flash Attention, sparse attention, linear attention, Mamba/SSMs som alternativ). Cross-attention kopplar två sekvenser (encoder-decoder); self-attention kopplar samma sekvens med sig själv.