返回笔记
LLM

混合专家模型详解:DeepSeek-V2 和 MoE 架构

MoE 混合专家 DeepSeek Mixtral 模型架构

Mixture of Experts 是目前最热门的 LLM 架构创新之一。它让模型"又大又省",DeepSeek-V2、Mixtral 8x7B 都基于此。

MoE 的核心思想

传统 Transformer 每一层所有参数都参与计算。MoE 的做法是:把 FFN(前馈网络)拆成 N 个"专家",每个 token 只激活其中 K 个专家。

比如 Mixtral 8x7B:有 8 个专家,每次只激活 2 个。总参数 47B,但每次推理只用到约 13B 参数。

路由机制

每个 token 经过一个路由器(一个简单的线性层),计算出它应该去哪个专家。Top-2 选专家——最有可能是哪两个专家,就路由到那两个。

路由的损失函数会加一项负载均衡损失,防止所有 token 都挤去同一个专家。

DeepSeek-V2 的创新

DeepSeek 做了两项重要优化:

  1. 细粒度专家:专家拆得更细更多,每个专家更小,路由更灵活
  2. 共享专家:保留几个"通用专家"永远激活,处理通用知识;其他"专业专家"负责特定领域

这让 DeepSeek-V2 在仅激活 21B 参数的情况下达到了接近 GPT-4 的性能。

MoE 的优缺点

优点

  • 相同推理成本下能做更大模型
  • 每个专家可以自发形成专业分工
  • 训练效率比同等大小的 Dense 模型高

缺点

  • 显存需求大(虽然推理快但总参数多)
  • 负载均衡难调
  • 推理时在 batch size 小的情况下效率低
  • 微调更复杂