MoE Mixture of Experts
Modellarkitektur med flera "expert-nätverk" — bara några aktiveras per token, så stora modeller blir billiga att köra.
Mixtral 8x7B = 8 experter med 7B vardera, men bara 2 körs samtidigt. Skalbart: kan ha biljoner parametrar utan att alla körs varje gång. Driver moderna stora modeller.