跳到主内容
概念MoE混合专家模型架构推理成本开源模型稀疏激活

MoE(混合专家架构)

MoE 让每个 token 只激活一小部分参数——总参数决定知识容量,激活参数决定推理成本。2026 年 8 月 Qwen3.8-Flash(125B-A6B)与 GLM-5.3-Flash(320B-A18B)同日开源,国产模型正式从「堆参数」转向「效率军备」。

发布 2026-08-30更新 2026-08-30

什么是 MoE

MoE = Mixture of Experts(混合专家)。它把 Transformer 里原本单一的前馈网络(FFN)拆成多个并行的「专家」网络,再配一个路由器(router / gate),每个 token 只挑选少数几个专家参与计算,其余参数全程休眠。

对比稠密(Dense)模型,区别就一句话:

Dense(稠密)MoE(混合专家)
每个 token 的计算全部参数参与只激活一小部分参数
推理成本与总参数成正比与激活参数成正比
显存占用总参数仍然要装下总参数
典型代表Llama 3、GLM-4DeepSeek-V3、Qwen3、Kimi K2.7

理解 MoE 只需要记住两个数字:

  • 总参数:决定知识容量与显存需求——参数越多,「背」的知识越多
  • 激活参数:决定每个 token 的计算量与推理成本——激活越少,越便宜越快

2026 年的效率军备:激活比例越卷越低

2026 年 8 月 26 日晚,阿里与智谱同日开源两款低激活 MoE 模型,是这一架构路线的标志性事件(详见Qwen3.8-Flash 发布资讯、GLM-5.3-Flash 开源资讯)。把近两年的代表模型排一排,能清晰看到「激活比例」的军备竞赛:

模型总参数激活参数激活比例备注
Mixtral 8x7B46.7B~12.9B~28%2023,MoE 出圈之作
DeepSeek-V3671B37B~5.5%2024 末,性价比标杆
Qwen3-235B235B22B~9.4%2025,开源全系列
MiniMax-M2230B10B~4.3%价格约为 Sonnet 的 8%
GLM-5.3-Flash320B18B~5.6%2026-08-26 开源,45 层
Qwen3.8-Flash125B6B~4.8%2026-08-26 开源,训练成本降约 90%
Llama 4 Maverick400B17B~4.3%2025,8×H100 可跑

当 6B 激活就能摸到上一代旗舰的性能水位(阿里官方称 Qwen3.8-Flash 激活 6B 超越 Claude Opus 4.6 的前沿性能),意味着两件事:推理价格还有大幅下探空间(Qwen3.8-Flash 已做到 ¥1/¥3 每百万 token),以及开源模型的自部署门槛进一步降低。

MoE 是怎么工作的

路由器:每个 token 现场点名

路由器是一个很小的线性层,给每个 token 对所有专家打分,选出 top-k 个(常见 k=2 或 k=8),只把 token 送进这几个专家,输出再加权合并。整个过程对上层透明——从外面看,MoE 模型的用法和普通模型完全一样。

专家并不是「领域专家」

这是最常见的误解。专家不是按「前端专家」「法律专家」这样分工的。训练后回头看,专家学到的是统计意义上的 token 模式分化——有的偏向语法结构,有的偏向特定主题分布,但边界模糊、彼此重叠。路由器学到的更接近「哪几个专家组合处理这类 token 效果好」,而非人类可解释的领域分工。

负载均衡:训练的头号难题

如果路由器学会把所有 token 都送给少数几个专家,其余专家就训练不到,模型容量浪费。所以 MoE 训练要加负载均衡损失(load balancing loss),强迫 token 大致均匀地流向各专家。这也是 MoE 训练比 Dense 更难调的根源之一。

共享专家与缓存

  • 共享专家(shared expert):一组永远激活的专家,处理所有 token 都需要的通用知识,DeepSeek 系列把这一设计发扬光大
  • N-gram embedding 缓存:Qwen3.8-Flash 引入了约 51B 的缓存参数加速预填充,属于这一代「效率军备」里的新工程手段

MoE 的优点

  1. 推理成本低:成本看激活参数。GLM-5.3-Flash 320B 总参数、每次推理只动约 18B,成本远低于同容量的稠密模型
  2. 训练效率高:同样的算力预算,MoE 能换来更大的总参数(更多知识容量)。Qwen3.8-Flash 官方称训练成本较 Qwen3.7-Plus 降近 90%
  3. 知识容量大:1.1T 总参数的 Kimi K2.7 Code 能「背」下远超稠密小模型的知识,但每次调用只算激活的那部分
  4. 价格被打穿:BYOK 类编程工具接这类模型,月成本可以压到个位数人民币

MoE 的代价(避坑)

  1. 显存仍要装下全部参数。激活参数决定「算多贵」,不决定「占多少显存」。想自托管 1.1T 的 K2.7 Code,得多卡 A100/H100——个人和小团队基本只能走官方 API。所谓「6B 激活单卡可跑」,指的是推理吞吐成本,不是显存需求
  2. 复杂推理的天花板看激活参数。激活参数太少的模型,超复杂推理的上限不如大激活模型(MiniMax-M2 的官方短板就是 10B 激活在超复杂推理上不及大模型)。日常编程任务够用,硬难题还是要旗舰
  3. 训练更难调:负载均衡、路由坍缩、数值稳定性,工程门槛高于 Dense
  4. 部署工程更复杂:好在 2026 年这已经不是大问题——主流新模型都有 FP8 量化版 + SGLang / vLLM day-0 支持,Qwen3.8-Flash 甚至把开源权重与量化版同步放出

对模型选型的影响

  • 换一套比价逻辑:按「激活参数 × 价格」而非「总参数」评估模型,会成为新的比价习惯
  • 两级路由成标配:日常任务用 Flash 级低激活模型,难题切旗舰——GLM-5.3-Flash 与 GLM-5.3 的价差拉开后,这种用法已是共识(见GLM-5.3-Flash 资讯)
  • BYOK 工具是最大受益者:Cline、OpenCode 这类工具接开源 MoE 模型,几乎零成本拿到旗舰级体验

常见误区

  • 「专家按领域分工」:错。专家学到的是 token 统计模式,不是人类意义上的领域分工(见上文)
  • 「总参数没用,只看激活」:错。总参数决定知识容量,激活参数只决定单次推理成本
  • 「激活参数少 = 显存需求小」:错。显存必须装下全部参数,这是 MoE 自托管的第一道门槛
  • 「MoE 一定优于 Dense」:错。小参数量场景 Dense 更简单稳定;MoE 的优势在大参数、追求性价比时才兑现

相关阅读

相关对比