Transformer-arkitektur
Neural arkitektur som ersatte RNN:er och CNN:er för sekvensmodellering. Vaswani et al., "Attention Is All You Need", Google, 2017.
Bygger på self-attention. Två varianter: encoder-only (BERT — förståelse), decoder-only (GPT — generering), encoder-decoder (T5, BART — översättning). Skalning till hundratals miljarder parametrar gav LLM-revolutionen. Moderna evolutioner: Mixture of Experts, Mamba (state space alternativ), DiT (Diffusion Transformer för bild/video). Papperet är ett av mest citerade i datavetenskap någonsin.