Terminal-Bench
Terminal-Bench 考的是 Agent 在真实终端里把一件事做完的能力——装依赖、改配置、跑命令、排查报错直到验收通过。它补上了 SWE-bench 不考的「用机器」能力,但 2.1 与 4.0 分数不可直接比较。
发布 2026-09-22更新 2026-09-23核实 2026-09-23什么是 Terminal-Bench
Terminal-Bench 是一类面向终端环境的 Agent 基准:给 Agent 一个真实的命令行环境(通常是一个容器),提出一个需要多步操作才能完成的目标,然后用脚本自动验收结果。
它考的不是「能不能写出正确的代码」,而是能不能把这台机器用好:
- 装依赖、配环境、改配置文件;
- 读懂报错并据此调整下一步;
- 在几十步的操作序列里不跑偏、不中途放弃;
- 最终产出一个可被机器验收的状态(文件、服务、命令输出)。
这也是它和 SWE-bench 最本质的分工:SWE-bench 考「解题」——给一个真实 issue,定位并修复,用单元测试验收;Terminal-Bench 考「用机器」——环境本身就是考题的一部分。两者都强的模型,才适合做终端 Agent 的底座,原因见智能体编程。
为什么 2026 年它变得这么重要
2026 年编程 Agent 的主战场从「补全和改代码」转向「长时间自主干活」。一旦 Agent 的运行时长从几秒拉到几小时,决定成败的能力就变了:
| 能力 | 短任务时代 | 长程 Agent 时代 |
|---|---|---|
| 代码生成质量 | 决定性 | 必要但不充分 |
| 多步规划 | 次要 | 决定性 |
| 读报错自我修正 | 次要 | 决定性 |
| 上下文管理 | 次要 | 决定成本与稳定性 |
Terminal-Bench 恰好集中考后三项,所以它成为各家发布模型时最常引用的硬指标之一——本站多张模型卡都把它和 SWE-bench 并列,例如 Claude Fable 5.1、GPT-6 Astra、DeepSeek V4.1 Flash。
版本:2.0 / 2.1 / 4.0 的难度不是一条线
站内引用到的版本主要有三代,它们的任务集、难度与验收方式都发生过变化:
| 版本 | 站内常见引用场景 | 读分注意 |
|---|---|---|
| 2.0 / 2.1 | 早期旗舰对比,如 Claude Sonnet 5 2.1 达 80.4%、DeepSeek V4.1 Flash 2.1 达 90.6 | 分数普遍偏高,属于难度较早期的一档 |
| 4.0 | 2026 下半年主流,如 GPT-6 Astra 57.9%、Claude Fable 5.1 55.8% | 任务更难、更贴近真实长程,分数显著低于 2.x |
最重要的一条纪律:跨版本分数不可比较。 看到「某模型 Terminal-Bench 90.6」时,第一反应应该是问「哪个版本、什么 harness」。90.6(2.1)与 57.9(4.0)之间不是差距,而是两把不同的尺子。
4.0 到底改了什么(官方公告要点)
Terminal-Bench 团队在 4.0 发布说明里解释了为什么这次是 4.0 而不是 3.1,以及这次改动为什么必须重跑基线。要点如下(依据 Terminal-Bench 4.0 官方公告):
| 改动 | 具体内容 | 对读分的影响 |
|---|---|---|
| 资源标定 | 按「先用充裕资源跑一遍,再选不影响指标的合理档位」的方法标定 time / CPU / memory;所有任务统一 8 小时 agent 超时 | 3.0 里的超时与报错显著减少,测量噪声下降;Anthropic 的工程研究显示光资源配置就能带来约 6 个百分点的分数差异 |
| 移除任务 | 移除 8 个:饱和 2、拒答 2、已有公开解 2、质量/平台兼容问题未解决 2 | 「最新一代模型的所有档位都 5/5 通过」即判饱和——不再有区分度的题会被清掉 |
| 修复任务 | 修复 19 个,更新指令、环境与 verifier | 老分数里含 flaky 成分,不能直接延续 |
| 版本策略 | 转为持续维护 + 语义化版本:资源变更与任务集变更都算 breaking change,必须重跑 | 3.0 与 4.0 分数不可比,引用时务必带版本号 |
| 剩余错误 | 主要是「模型拒答」与「输出 token 超限」两类 | 分数低不一定是不会,可能是被拒答或写超了 |
运行入口也已统一到 Harbor 框架:harbor run -d terminal-bench/terminal-bench@4.0.0。官方同时预告:4.1 聚焦 verifier 改进(抗篡改 verifier),5.0 将加入新任务。
一个提醒:官方榜单与厂商自报分常常对不上
访问官方榜首页(2026-09-23 快照)看到的前列与厂商发布稿里的数字并不一致,例如官方榜记为 Opus 5(max,Claude Code)51.8% ± 3.4%、Fable 5(max)44.5% ± 3.8%、GLM-5.3(max)41.8% ± 3.2%、GPT-5.6 Sol(max,Codex)37.3% ± 3.8%;而厂商发布稿里同代模型常出现 55%–59% 的自报值。
这不是谁在造假,而是effort 档位、harness、版本、快照时点四个变量叠加的结果。正确做法是:引用时把这四个变量一起写出来,否则数字没有可比性。
三个最常见的读分坑
坑一:厂商自己的 harness 不等于官方榜单
同一个模型,跑在自家 CLI 里和跑在基准官方 harness 里,分数可以差很远。部分厂商公布的是「自家 harness 自测分」,并明确说明尚未进入官方榜单——这类数字只能当作参考区间,不能与官方榜单并列排名。
判断方法很简单:看有没有说清 harness。只给分数不给运行环境的,按「信息不全」处理。
坑二:单题短程 ≠ 实战长程
基准里的任务通常边界清晰、验收确定。真实仓库里的脏上下文、隐式依赖、历史包袱会被成倍放大,所以榜单领先不等于你的仓库里也领先。选型时最可靠的仍然是用自己的仓库抽样 20 题——这一点与 SWE-bench 读榜的纪律完全一致。
坑三:只看分数不看成本
两个模型分数接近时,成本往往差几倍。长程 Agent 场景应该同时看单次任务成本:把「分数 / 每任务花费」一起放在表里比较,才是有决策价值的对比。这也是本站模型卡普遍同时标注基准与定价的原因。
与相邻基准怎么搭配看
| 基准 | 主要考察 | 与 Terminal-Bench 的关系 |
|---|---|---|
| SWE-bench | 真实 issue 修复,单元测试验收 | 互补:解题 vs 用机器 |
| AutomationBench | 真实 SaaS 工具链多步业务流 | 相近:都考「跑完一件事」,但更偏云端业务 |
| FrontierCode | 前沿代码能力 | 互补:更接近纯编码难度 |
| OSWorld | 桌面 GUI 操作 | 同类延伸:从终端扩展到图形界面 |
一个模型如果在 Terminal-Bench 很强但 SWE-bench 一般,通常说明工具调用与自我修正强、代码理解偏弱——反过来则相反。两张榜单一起看,才能判断它适合当「执行层」还是「规划层」,这也正是多 Agent 编排里分工的依据。
哪些工具吃这个分数
终端形态的 Agent 是 Terminal-Bench 分数的直接受益方,也是主要引用方:
- Claude Code —— 终端 Agent 的标杆参照系
- Codex CLI —— 与 Claude Code 长期并列对比
- MiMo Code —— 国产阵营中主打终端基准的一档
- Gemini CLI —— Google 的终端入口
FAQ
Terminal-Bench 和 SWE-bench 该看哪个? 看你要它干什么。选代码修复与仓库理解能力看 SWE-bench;选长程自主执行能力看 Terminal-Bench。做终端 Agent 底座的话,两个都要看,且都要确认版本。
为什么同一篇发布稿里 Terminal-Bench 2.1 很高但 4.0 很低? 正常现象。4.0 难度显著提高、任务更贴近真实长程,多数模型在 4.0 上都会大幅回落。如果一个模型只公布 2.1 而回避 4.0,应视为信息不完整。
分数接近时怎么选模型? 比每任务成本,再比稳定性(长会话是否跑偏)。具体方法见长上下文中关于成本与上下文管理的取舍。
延伸阅读
- SWE-bench:基准怎么读才不被忽悠
- Agentic Coding:什么是智能体编程
- 多 Agent 编排:coordinator / worker 模式
- Claude Fable 5.1 模型卡
- GPT-6 Astra 模型卡
- DeepSeek V4.1 Flash 模型卡
- Kimi K3 模型卡
- Claude Code 工具卡
- Codex CLI 工具卡
- 长上下文:成本与上下文管理
来源
- Terminal-Bench 4.0 官方发布说明(资源标定 / 任务增减 / 版本策略)
- Terminal-Bench 官方榜单首页(2026-09-23 访问快照)
- Artificial Analysis — Terminal-Bench v4.0 独立复现与方法论
本文同时参考了本站已核实的模型卡(各卡均标注基准版本与一手来源,见上方延伸阅读)。Terminal-Bench 的任务集、版本难度与官方榜单以官方发布为准;厂商自选 harness 自报的分数在本文中一律按「参考区间」处理,未与官方榜单并列排名。
相关工具
Aider vs Claude Code:终端 AI 编程双雄怎么选
Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。
Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比
Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。
Claude Code vs Codex CLI:终端 AI Agent 双雄对比
Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。
Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)
Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。
Cursor vs Claude Code:什么时候用哪个?(2026 实测选型)
Cursor 和 Claude Code 到底怎么选?一句话结论 + 决策树 + 价格实测 + 国内可用性对比。GUI 派选 Cursor,终端长任务派选 Claude Code,最优解其实是共存。
Devin vs Claude Code:AI 编程 Agent 怎么选?异步自主 vs 终端同步对比
Devin vs Claude Code 2026 选型对比:Cognition 异步自主 Cloud Agent vs Anthropic 终端同步 CLI Agent,从形态、工作模式、长任务能力、并发、价格、中文支持和适合人群 8 个维度判断,帮你选对 AI 编程 Agent。