Flash Attention
Smart implementering av attention-mekanismen — använder snabbminne på GPU effektivt, 2-4x snabbare med samma resultat.
Tri Dao 2022. Nyckeln: undvik att materialisera N×N attention-matrisen i långsamt GPU-minne. Möjliggjorde långa context windows. v2 och v3 ytterligare optimeringar. Standard idag i alla seriösa LLM-träningskoder.