返回笔记
LLM
混合专家模型详解:DeepSeek-V2 和 MoE 架构
MoE
混合专家
DeepSeek
Mixtral
模型架构
Mixture of Experts 是目前最热门的 LLM 架构创新之一。它让模型"又大又省",DeepSeek-V2、Mixtral 8x7B 都基于此。
MoE 的核心思想
传统 Transformer 每一层所有参数都参与计算。MoE 的做法是:把 FFN(前馈网络)拆成 N 个"专家",每个 token 只激活其中 K 个专家。
比如 Mixtral 8x7B:有 8 个专家,每次只激活 2 个。总参数 47B,但每次推理只用到约 13B 参数。
路由机制
每个 token 经过一个路由器(一个简单的线性层),计算出它应该去哪个专家。Top-2 选专家——最有可能是哪两个专家,就路由到那两个。
路由的损失函数会加一项负载均衡损失,防止所有 token 都挤去同一个专家。
DeepSeek-V2 的创新
DeepSeek 做了两项重要优化:
- 细粒度专家:专家拆得更细更多,每个专家更小,路由更灵活
- 共享专家:保留几个"通用专家"永远激活,处理通用知识;其他"专业专家"负责特定领域
这让 DeepSeek-V2 在仅激活 21B 参数的情况下达到了接近 GPT-4 的性能。
MoE 的优缺点
优点
- 相同推理成本下能做更大模型
- 每个专家可以自发形成专业分工
- 训练效率比同等大小的 Dense 模型高
缺点
- 显存需求大(虽然推理快但总参数多)
- 负载均衡难调
- 推理时在 batch size 小的情况下效率低
- 微调更复杂