混合专家(Mixture of Experts,简称 MoE)架构

发布时间:2026/7/23 23:06:50
混合专家(Mixture of Experts,简称 MoE)架构 混合专家Mixture of Experts简称MoE架构的核心原理是“术业有专攻 动态分工”它在模型内部划分出许多个专精的子网络称为“专家”并通过一个路由机制只让其中少数几个相关的专家参与当前输入的计算从而在不增加推理计算量太多的前提下大幅提升模型的总参数量和表达能力。下面从结构、流程和优势三个层面通俗解释一、基本结构组成一个典型的 MoE 层会替代传统 Transformer 中的前馈网络FFN主要由两部分构成专家网络Experts本质就是多个结构相同但参数独立的子网络通常是 FFN。例如有 64 个专家每个专家都“擅长”处理某类特征或语义模式如代码、医学、逻辑推理等虽然是隐式学到的。门控网络 / 路由器Gating Network / Router一个轻量的打分模块负责判断当前输入的这个 token应该交给哪几个专家处理。它会给每个专家打一个权重分然后通常只选分数最高的Top-k 个专家常见 k1 或 k2来处理该 token。二、工作流程以 Transformer 中的 MoE 层为例假设模型有一层 MoE包含 N 个专家处理一个输入序列输入进入 MoE 层某个 token 的隐藏状态向量送入路由器。路由打分路由器输出 N 个专家的得分经过 Softmax 或稀疏化函数。稀疏激活关键只保留分数最高的k 个专家比如 2 个其余专家完全不参与计算。这叫“稀疏激活”保证了计算量只和 k 个专家有关而不是 N 个。专家计算被选中的专家分别对 token 做前向计算得到各自输出。加权融合用路由器给出的权重把 k 个专家的输出加权求和作为这一层的最终输出再传给下一层 Transformer。形象比喻传统模型像“一个全科医生看完所有病人”MoE 像“分诊台路由器根据病情只叫来 2 位专科医生会诊其他医生休息”。三、为什么 MoE 被 GPT-5 等大模型采用结合前文提到的 GPT-5 架构MoE 解决了几个关键问题总参数大激活参数小总参数量可以做到万亿级提升知识容量和上限但每个 token 只激活约 10%15% 的参数如几百亿而非几万亿推理成本可控。知识模块化不同专家隐式学到不同领域/模式的知识有助于减少知识干扰提升专业任务代码、数学、多模态的表现。扩展效率高增加专家数量主要增加存储与训练并行度不一定同比例增加推理算力适合规模化扩展。四、伴随挑战补充说明路由不均衡某些专家可能被过度调用“热门专家”其他的长期闲置需要用辅助损失load balancing loss来约束。训练与通信开销分布式训练中token 要在不同专家间路由对通信带宽敏感。微调和部署复杂度相比稠密模型MoE 在微调策略和服务部署上更复杂一些。