跳到主内容

阶跃星辰发布 Step 5 Preview:600B 稀疏 MoE、1M 上下文,权重 10-15 开放

阶跃星辰(StepFun)发布 Step 5 Preview:600B 稀疏 MoE(激活约 27B)、92 层窄深结构、1M 上下文且输出侧同为 1M。Artificial Analysis 智能指数 44,与 Kimi K3(max)同分但单任务成本低约 65%。API 价 $1/$2.7 每百万 token,BF16 权重计划 2026-10-15 开放。

2026-09-21 · Pandaily / AI-TLDR / DataLearner

发布 2026-09-21核实 2026-09-21

要点

  • Step 5 Preview:约 600B 总参数 / 27B 激活的稀疏 MoE,92 层窄深 Transformer。
  • 1M 上下文,且输入与输出双向 1M——长文档/大批量代码一次调用吐完,不必应用层切片。
  • Artificial Analysis 智能指数 44(200 模型中第 24,中位数 24),与 Kimi K3(max)同分,但单任务成本约低 65%。
  • API 价 $1.00 输入 / $2.70 输出(每百万 token),输出约 99.8 tok/s,TTFT 约 2.96 秒。
  • BF16 权重计划 2026-10-15 开放;Preview 期仅 API 可用。
  • 输入支持文本 / 图像 / 视频(单次至多 60 张图),输出为文本。

时效说明:各来源对发布日口径不一(AI/TLDR 记 09-18,Pandaily / DataLearner 记 09-19–09-20),确切日期待核实。阶跃星辰尚未发布统一官方模型卡,以下规格来自第三方汇总与媒体报道。

为什么「窄深」是个信号

过去两年大模型扩规模的默认动作是加宽。Step 5 反过来:92 层窄深。阶跃星辰给的理由与 Agent 场景直接相关——在长 prefill 阶段(Agent 正在搜索、跑代码、吞工具返回值),更深的stack 提供更长的信息通路,支撑隐式多跳推理。

配合 Sparse GQA + 分块 token 合并,官方称 indexer 与 top-k 选择开销压到更密基线的约 1/8。训练侧强调在策略长程 RL、MoE 路由的比特级训练-推理对齐、MTP-3 投机解码与 KV cache offload,官方称长程 RL 端到端加速三倍以上。

跑分:注意基准版本

基准分数
Terminal-Bench 2.185.0
Terminal-Bench 4.033.3(对比 DeepSeek V4.1 Flash 的 27%)
GPQA Diamond93.5
SWE-Marathon72.7(榜首)
MCP-Atlas85.6
BrowseComp88.7
MMMU-Pro76.0

两个 Terminal-Bench 分数差 50 分以上,原因是它们是两个不同版本的基准,难度不同,不构成模型退化。引用时务必带版本号。

一个容易被忽略的成本陷阱

人工分析记录 Step 5 Preview 在评测集上共生成 1.6 亿 token,而 200 个模型的中位数是 9200 万——它属于偏冗长的一档。

这意味着:输入单价 $1/M 很好看,但真正决定账单的是输出。$2.70/M 的输出价,乘以一个 1.7 倍于中位数的输出量,实际单任务成本需要用真实业务样本测,不能只看价目表。

怎么上手

from openai import OpenAI

client = OpenAI(api_key="sk-...", base_url="https://api.stepfun.com/v1")  # 以官方文档为准
resp = client.chat.completions.create(
    model="step-5-preview",
    messages=[{"role": "user", "content": "通读这个仓库并列出三处并发隐患"}],
    extra_body={"reasoning_effort": "high"},   # low / medium / high 同一 id 可切
)

选型建议:

  • 现在是长程 Agent + 成本敏感场景的高性价比选项;
  • 需要立刻私有化部署的团队,等到 10-15 权重放出再评估;
  • Zhihu 早期实测反馈其在事实性知识与复杂文档处理上仍有短板,建议先在自身样本集上验证。

AI 之家 观点

这一轮竞争的分水岭已经从「谁的参数大」转到「谁的长程任务单成本更低」。Step 5 用 600B/27B 的激活比去对位 Kimi K3 的 2.8T,本质是在打成本-智能帕累托前沿——同一条路线上,Cognition 的 SWE-2 用的是完全不同的姿势(不训基座、只做后训练),但卖点一模一样:差 1 分、便宜六成。

对跑 Agent 舰队的团队,这比刷榜更有意义。但请务必把「1.6 亿 token 输出量」这个数字记牢:价目表上的输入价是诱饵,输出量与输出价才是账单。这也再次说明为什么选型要看「每成功任务成本」而不是「每百万 token 单价」——见 Terminal-Bench 里关于「分数要除以成本看」的纪律。

还有一条必须说得直白:Preview 阶段的所有跑分都是未定稿的。权重开放时间、许可条款、最终定价都还没有官方定论,现在把它写进生产架构的预算模型是冒险。

AI 之家 推荐结论:技术验证与内部 PoC 可以现在开始,尤其适合长 prefill 的 Agent 场景(搜索、代码执行、工具返回值密集);生产采购请等到权重正式开放、许可条款落地之后,并且用你自己的任务集实测输出量,不要按价目表推算。

相关阅读

来源

核对日期:2026-09-21。发布确切日期、权重开放后的许可条款待核实。

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Cursor vs Aider:GUI IDE 还是 CLI?2026 对比

Cursor vs Aider 2026 选型对比:GUI IDE vs Git 原生 CLI,从 Composer vs Architect 双模型、Tab 补全、多模型 BYOK、价格计费、开源与否和适合人群判断,帮开发者选对。Cursor 是闭源 VS Code fork 月费 $20,Aider 是开源 Apache-2.0 CLI 自带 API key。

Augment Code vs Cursor:企业 AI 编程怎么选?Context Engine vs AI IDE 对比

Augment Code vs Cursor 2026 选型对比:Context Engine 全仓索引的企业 AI 平台 vs SpaceX 收购的 AI IDE 天花板,从形态、Context 覆盖、长任务、价格、合规、中文支持和适合人群 8 个维度判断,帮你选对企业 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

相关评测