Mixture of Experts MoE
Neuralt nätverk där bara en delmängd av "experter" aktiveras per token — billigare inferens vid samma kapacitet.
Idén är gammal (Jacobs 1991) men skalades av Googles Switch Transformer (2021) och GShard. En router-modul väljer t.ex. 2 av 8 expert-FFN per token. Resultat: en 7B-aktiv-parameter-modell med 56B totalt får 56B-modellens kunskap till 7B-inferens-kostnad. Mistrals Mixtral 8x7B (2023), DeepSeek-V3 och GPT-4 (rapporterat) kör MoE. Trade-off: minne ökar (alla experter måste hållas) men beräkning sjunker.