模型结构
-
密集模型
Dense Model: 最传统、最标准的神经网络结构,即标准的FFN网络结构-
一次推理,
FFN层的参数全部参与计算
-
-
混合专家模型
MoE(Mixture of Experts): 密集模型FFN层的改进版本,能在降低计算量同时,维持与密集模型同样的质量-
一次推理,只有部分参数参与计算
-
gemma-26B-A3B中的A3B就是指,在一次推理中,MoE模型只有3B参数参与计算
-
-
MoE推理流程MoE由多个小尺寸的FFN(即专家) 与路由router构成- 针对一个词嵌入向量(非批量处理)
router会从所有专家中选择2个进行计算 - 两个专家的计算结果会由
router给出权重值,进行加权平均,得到MoE层的输出
Note
MoE 并未减少参数内存占用,但降低了 FFN 的计算量
Deepseek MoE

针对传统的 MoE 模型,Deepseek 又进一步改进
Router选择的专家由2个变为4个,使得推理的计算方式增加,例如8个专家选2只有28方式,但是8个专家选4个就有1820种方式4个专家由Routed Expert与Shared Expert构成Routed Expert: 由Router选择,不固定Shared Expert: 常驻专家,用于处理公共特征计算