混合专家模型(MoE)
也叫: MoE · Mixture of Experts · 稀疏专家模型 · 专家混合
混合专家(MoE)模型包含许多专家子网络和一个路由器,路由器把每个 token 只送给其中少数几个专家,所以每个 token 只会用到模型的一部分参数。
在稠密(dense)Transformer 里,每个 token 都要经过全部参数。混合专家模型把部分前馈层换成一组并行的“专家”,再配一个小的路由器,由它决定每个 token 交给哪几个专家处理。模型的总参数量可以非常大,而每个 token 的计算量接近一个小得多的模型。
所以近来许多大型开源权重和闭源模型都采用 MoE,例如 Mixtral、DeepSeek-V3 这些系列。模型介绍里同时列出“总参数”和“激活参数”,说的就是 MoE 结构。
对选 Agent 底层模型的人来说,它主要影响成本和速度:同样总规模下,MoE 每个 token 的推理成本往往比稠密模型低,但所有专家仍需装进显存。
怎么运作
每个 MoE 层有 N 个专家网络和一个学出来的路由器。对每个 token,路由器给专家打分,选出得分最高的几个(常见是一个到几个),该层输出就是这几个专家输出的加权和。训练时会加入均衡约束,让 token 分散到各个专家,而不是都挤向少数几个。尽管叫“专家”,它们通常并不对应“法律”“代码”这样人能读懂的学科;专业分工是学出来的,往往很模糊,更多体现在 token 模式层面。
举个例子
某模型介绍写着“总参数 6000 亿,激活参数 400 亿”。每个 token 经路由器只走几个专家,单 token 计算量相当于一个 400 亿的稠密模型,但部署时 6000 亿参数的权重仍然要全部加载进 GPU 显存。
和相关概念的区别
MoE 与多 Agent 系统:MoE 里的专家是单个模型内部的子网络,在一次前向计算里按 token 路由;multi-agent-system 则是协调多个各自调用模型的独立 Agent。两者只是共用了“专家”这个词。
常见误解
常见问题
混合专家模型是什么?
MoE 里的激活参数是什么意思?
MoE 和多 Agent 系统是一回事吗?
最近核实: 2026-09-20