技术与工程已解决
什么是 MoE(混合专家)架构?
激活参数与总参数分离,是大模型又大又快的秘密。
问题正文
它是什么
MoE(Mixture of Experts)把模型内部拆成多个专家网络,每个 Token 只激活其中一小部分。总参数量巨大,但每次推理的实际计算量很小。
为什么流行
它打破了参数越大越慢的悖论:几百 B 总参数的模型可以只用几十 B 的激活量做推理。头部开源和闭源模型大量采用。
对部署的影响
显存要装下全部参数,但推理速度由激活参数决定——吃显存但不吃算力。这对部署规划很重要。
