看到 DeepSeek V4 的论文泄露版,用了他们自己定义的 Mega MoE 架构,总参数量到了万亿级别但激活参数控制在 400B 左右。这个架构思路挺有意思的,跟传统 MoE 区别在几个关键点。
Mega MoE 跟 DeepSeek V3 的细粒度 MoE 方向是一致的,核心思路都是把专家做小做多然后提高路由灵活度。V4 的新东西应该是在专家间的共享机制上,传统 MoE 每个专家都是独立的 FFN 参数完全不共享,Mega MoE 据说引入了共享底层表示层让专家之间能共享一部分基础能力再在上面分化。这样可以减少总参数膨胀同时保留专家专门化优势。如果真跑通了这会是 MoE 架构的一次实质性演进。
万亿参数听着吓人但 MoE 里面大部分参数是睡着的,实际推理算力跟 400B dense 差不多。关键看激活参数的质量不是总参数量
万亿参数 MoE 对推理基础设施要求高。每个 token 路由到的专家可能散落在不同的 GPU 节点上,节点间通信开销会成为瓶颈。昇腾集群跑这个架构会比英伟达吃力,因为 NVLink 和 IB 的网络带宽差距明显。DeepSeek 如果真在昇腾上把这个架构跑起来那工程能力真的可以吹。
参数越大越骚
论文泄露版靠谱吗还是有人瞎编
共享底层表示层这个方向学术上讨论过不少,但实际上规模跑还没有成功案例。如果 V4 做出来说明从理论到工程的跨越已经过关。另一个值得关注的点是训练稳定性,MoE 参数量大容易出现专家塌缩也就是大部分 token 都路由给少数几个专家其他专家白训。V4 怎么解决这个问题比架构本身更关键。
@sudo_rm_rf 专家塌缩问题问到点上了,Mega MoE 据说有专门的负载均衡损失函数。等正式论文出来看细节
万亿参数MoE大部分都是睡着的,实际激活的才是真正的关键
同意,MoE总参数意义不大,路由质量才是真正的竞争点
共享底层表示层是关键,传统MoE那种纯独立FFN效率太低
万亿参数恐吓性大于实际,激活400B就跟dense 400B同档算力