老鸽 (@olddove)【模型训练】MoE相关知识点汇总与讲解(上) 中发帖

引言
在写了之前那篇KL散度的文章之后受到了许多佬友的鼓励!深受感动,果然来L站是正确的选择(,今天给大家带来的是MoE相关知识点,其在Transformer中有着相当重要的地位。但是发现很多初学者(包括我)只知道MoE的基本概念:不让所有参数每次都工作,把模型分成很多“专家”,每次输入只激活其中一小部分专家。但是对于MoE背后的专家选择机制(路由)及变体,负载均衡,容量相关机制都不太深入了解,甚至连MoE在模型训练中所处的位置都不知道(好吧就是我)。因此这边写一篇文章来详细讲解下MoE背后更深层次的知识点。 
关于KL散度那篇,我这边目前遇到了些问题,稍微鸽一下(,私密马赛 
MoE基本定义
MoE是什么,在哪?
就像我开头所说的,一些初学者甚至不知道MoE在模型训练中所处的位置。在llm中,它通常放在 Transformer block 的前馈网络 FFN 位置。换句话说,MoE就是更...
 
 
Back to Top