MoE(混合专家架构)
MoE 让每个 token 只激活一小部分参数——总参数决定知识容量,激活参数决定推理成本。2026 年 8 月 Qwen3.8-Flash(125B-A6B)与 GLM-5.3-Flash(320B-A18B)同日开源,国产模型正式从「堆参数」转向「效率军备」。
发布 2026-08-30更新 2026-08-30什么是 MoE
MoE = Mixture of Experts(混合专家)。它把 Transformer 里原本单一的前馈网络(FFN)拆成多个并行的「专家」网络,再配一个路由器(router / gate),每个 token 只挑选少数几个专家参与计算,其余参数全程休眠。
对比稠密(Dense)模型,区别就一句话:
| Dense(稠密) | MoE(混合专家) | |
|---|---|---|
| 每个 token 的计算 | 全部参数参与 | 只激活一小部分参数 |
| 推理成本 | 与总参数成正比 | 与激活参数成正比 |
| 显存占用 | 总参数 | 仍然要装下总参数 |
| 典型代表 | Llama 3、GLM-4 | DeepSeek-V3、Qwen3、Kimi K2.7 |
理解 MoE 只需要记住两个数字:
- 总参数:决定知识容量与显存需求——参数越多,「背」的知识越多
- 激活参数:决定每个 token 的计算量与推理成本——激活越少,越便宜越快
2026 年的效率军备:激活比例越卷越低
2026 年 8 月 26 日晚,阿里与智谱同日开源两款低激活 MoE 模型,是这一架构路线的标志性事件(详见Qwen3.8-Flash 发布资讯、GLM-5.3-Flash 开源资讯)。把近两年的代表模型排一排,能清晰看到「激活比例」的军备竞赛:
| 模型 | 总参数 | 激活参数 | 激活比例 | 备注 |
|---|---|---|---|---|
| Mixtral 8x7B | 46.7B | ~12.9B | ~28% | 2023,MoE 出圈之作 |
| DeepSeek-V3 | 671B | 37B | ~5.5% | 2024 末,性价比标杆 |
| Qwen3-235B | 235B | 22B | ~9.4% | 2025,开源全系列 |
| MiniMax-M2 | 230B | 10B | ~4.3% | 价格约为 Sonnet 的 8% |
| GLM-5.3-Flash | 320B | 18B | ~5.6% | 2026-08-26 开源,45 层 |
| Qwen3.8-Flash | 125B | 6B | ~4.8% | 2026-08-26 开源,训练成本降约 90% |
| Llama 4 Maverick | 400B | 17B | ~4.3% | 2025,8×H100 可跑 |
当 6B 激活就能摸到上一代旗舰的性能水位(阿里官方称 Qwen3.8-Flash 激活 6B 超越 Claude Opus 4.6 的前沿性能),意味着两件事:推理价格还有大幅下探空间(Qwen3.8-Flash 已做到 ¥1/¥3 每百万 token),以及开源模型的自部署门槛进一步降低。
MoE 是怎么工作的
路由器:每个 token 现场点名
路由器是一个很小的线性层,给每个 token 对所有专家打分,选出 top-k 个(常见 k=2 或 k=8),只把 token 送进这几个专家,输出再加权合并。整个过程对上层透明——从外面看,MoE 模型的用法和普通模型完全一样。
专家并不是「领域专家」
这是最常见的误解。专家不是按「前端专家」「法律专家」这样分工的。训练后回头看,专家学到的是统计意义上的 token 模式分化——有的偏向语法结构,有的偏向特定主题分布,但边界模糊、彼此重叠。路由器学到的更接近「哪几个专家组合处理这类 token 效果好」,而非人类可解释的领域分工。
负载均衡:训练的头号难题
如果路由器学会把所有 token 都送给少数几个专家,其余专家就训练不到,模型容量浪费。所以 MoE 训练要加负载均衡损失(load balancing loss),强迫 token 大致均匀地流向各专家。这也是 MoE 训练比 Dense 更难调的根源之一。
共享专家与缓存
- 共享专家(shared expert):一组永远激活的专家,处理所有 token 都需要的通用知识,DeepSeek 系列把这一设计发扬光大
- N-gram embedding 缓存:Qwen3.8-Flash 引入了约 51B 的缓存参数加速预填充,属于这一代「效率军备」里的新工程手段
MoE 的优点
- 推理成本低:成本看激活参数。GLM-5.3-Flash 320B 总参数、每次推理只动约 18B,成本远低于同容量的稠密模型
- 训练效率高:同样的算力预算,MoE 能换来更大的总参数(更多知识容量)。Qwen3.8-Flash 官方称训练成本较 Qwen3.7-Plus 降近 90%
- 知识容量大:1.1T 总参数的 Kimi K2.7 Code 能「背」下远超稠密小模型的知识,但每次调用只算激活的那部分
- 价格被打穿:BYOK 类编程工具接这类模型,月成本可以压到个位数人民币
MoE 的代价(避坑)
- 显存仍要装下全部参数。激活参数决定「算多贵」,不决定「占多少显存」。想自托管 1.1T 的 K2.7 Code,得多卡 A100/H100——个人和小团队基本只能走官方 API。所谓「6B 激活单卡可跑」,指的是推理吞吐成本,不是显存需求
- 复杂推理的天花板看激活参数。激活参数太少的模型,超复杂推理的上限不如大激活模型(MiniMax-M2 的官方短板就是 10B 激活在超复杂推理上不及大模型)。日常编程任务够用,硬难题还是要旗舰
- 训练更难调:负载均衡、路由坍缩、数值稳定性,工程门槛高于 Dense
- 部署工程更复杂:好在 2026 年这已经不是大问题——主流新模型都有 FP8 量化版 + SGLang / vLLM day-0 支持,Qwen3.8-Flash 甚至把开源权重与量化版同步放出
对模型选型的影响
- 换一套比价逻辑:按「激活参数 × 价格」而非「总参数」评估模型,会成为新的比价习惯
- 两级路由成标配:日常任务用 Flash 级低激活模型,难题切旗舰——GLM-5.3-Flash 与 GLM-5.3 的价差拉开后,这种用法已是共识(见GLM-5.3-Flash 资讯)
- BYOK 工具是最大受益者:Cline、OpenCode 这类工具接开源 MoE 模型,几乎零成本拿到旗舰级体验
常见误区
- 「专家按领域分工」:错。专家学到的是 token 统计模式,不是人类意义上的领域分工(见上文)
- 「总参数没用,只看激活」:错。总参数决定知识容量,激活参数只决定单次推理成本
- 「激活参数少 = 显存需求小」:错。显存必须装下全部参数,这是 MoE 自托管的第一道门槛
- 「MoE 一定优于 Dense」:错。小参数量场景 Dense 更简单稳定;MoE 的优势在大参数、追求性价比时才兑现
相关阅读
相关工具
Aider vs OpenCode:两个开源终端 Agent,选哪个?2026 对比
Aider 与 OpenCode 2026 选型对比:两者都是开源终端 agent、都支持换模型,但 Aider 以 Git-native 工作流与成熟的多语言支持见长,OpenCode 主打模型无关、本地优先与终端交互体验。从 6 个维度给出明确取舍建议。
OpenCode vs Claude Code:终端 AI Coding Agent 怎么选?开源平替 vs 官方 CLI 对比
OpenCode vs Claude Code 2026 选型对比:SST 开源 MIT CLI Agent(75+ 模型 BYOK)vs Anthropic 官方闭源 CLI Agent(Claude 长任务第一梯队),从形态、模型自由、长任务、TUI 体验、多会话、MCP、价格、国内门槛和适合人群 9 个维度判断,帮你选对终端 AI Coding Agent。
Kimi Code vs Qwen Code:国产终端 AI 编程工具怎么选?(2026)
Kimi Code 与 Qwen Code 都是国产终端 AI 编程工具,国内直连、中文语境好。一句话结论 + 决策树 + 价格对比:长上下文与对话体感选 Kimi,开源生态与模型可塑性选 Qwen。