IT-lexikon AI & ML Flash Attention

Flash Attention

AI & ML In English → Uppdaterad: 2026-05-23

Smart implementering av attention-mekanismen — använder snabbminne på GPU effektivt, 2-4x snabbare med samma resultat.

Tri Dao 2022. Nyckeln: undvik att materialisera N×N attention-matrisen i långsamt GPU-minne. Möjliggjorde långa context windows. v2 och v3 ytterligare optimeringar. Standard idag i alla seriösa LLM-träningskoder.

← Tillbaka till lexikonet