跳到主内容
概念Terminal-Bench基准测试AI 编程Agent终端模型评测SWE-bench

Terminal-Bench

Terminal-Bench 考的是 Agent 在真实终端里把一件事做完的能力——装依赖、改配置、跑命令、排查报错直到验收通过。它补上了 SWE-bench 不考的「用机器」能力,但 2.1 与 4.0 分数不可直接比较。

发布 2026-09-22更新 2026-09-23核实 2026-09-23

什么是 Terminal-Bench

Terminal-Bench 是一类面向终端环境的 Agent 基准:给 Agent 一个真实的命令行环境(通常是一个容器),提出一个需要多步操作才能完成的目标,然后用脚本自动验收结果。

它考的不是「能不能写出正确的代码」,而是能不能把这台机器用好:

  • 装依赖、配环境、改配置文件;
  • 读懂报错并据此调整下一步;
  • 在几十步的操作序列里不跑偏、不中途放弃;
  • 最终产出一个可被机器验收的状态(文件、服务、命令输出)。

这也是它和 SWE-bench 最本质的分工:SWE-bench 考「解题」——给一个真实 issue,定位并修复,用单元测试验收;Terminal-Bench 考「用机器」——环境本身就是考题的一部分。两者都强的模型,才适合做终端 Agent 的底座,原因见智能体编程。

为什么 2026 年它变得这么重要

2026 年编程 Agent 的主战场从「补全和改代码」转向「长时间自主干活」。一旦 Agent 的运行时长从几秒拉到几小时,决定成败的能力就变了:

能力短任务时代长程 Agent 时代
代码生成质量决定性必要但不充分
多步规划次要决定性
读报错自我修正次要决定性
上下文管理次要决定成本与稳定性

Terminal-Bench 恰好集中考后三项,所以它成为各家发布模型时最常引用的硬指标之一——本站多张模型卡都把它和 SWE-bench 并列,例如 Claude Fable 5.1、GPT-6 Astra、DeepSeek V4.1 Flash。

版本:2.0 / 2.1 / 4.0 的难度不是一条线

站内引用到的版本主要有三代,它们的任务集、难度与验收方式都发生过变化:

版本站内常见引用场景读分注意
2.0 / 2.1早期旗舰对比,如 Claude Sonnet 5 2.1 达 80.4%、DeepSeek V4.1 Flash 2.1 达 90.6分数普遍偏高,属于难度较早期的一档
4.02026 下半年主流,如 GPT-6 Astra 57.9%、Claude Fable 5.1 55.8%任务更难、更贴近真实长程,分数显著低于 2.x

最重要的一条纪律:跨版本分数不可比较。 看到「某模型 Terminal-Bench 90.6」时,第一反应应该是问「哪个版本、什么 harness」。90.6(2.1)与 57.9(4.0)之间不是差距,而是两把不同的尺子。

4.0 到底改了什么(官方公告要点)

Terminal-Bench 团队在 4.0 发布说明里解释了为什么这次是 4.0 而不是 3.1,以及这次改动为什么必须重跑基线。要点如下(依据 Terminal-Bench 4.0 官方公告):

改动具体内容对读分的影响
资源标定按「先用充裕资源跑一遍,再选不影响指标的合理档位」的方法标定 time / CPU / memory;所有任务统一 8 小时 agent 超时3.0 里的超时与报错显著减少,测量噪声下降;Anthropic 的工程研究显示光资源配置就能带来约 6 个百分点的分数差异
移除任务移除 8 个:饱和 2、拒答 2、已有公开解 2、质量/平台兼容问题未解决 2「最新一代模型的所有档位都 5/5 通过」即判饱和——不再有区分度的题会被清掉
修复任务修复 19 个,更新指令、环境与 verifier老分数里含 flaky 成分,不能直接延续
版本策略转为持续维护 + 语义化版本:资源变更与任务集变更都算 breaking change,必须重跑3.0 与 4.0 分数不可比,引用时务必带版本号
剩余错误主要是「模型拒答」与「输出 token 超限」两类分数低不一定是不会,可能是被拒答或写超了

运行入口也已统一到 Harbor 框架:harbor run -d terminal-bench/terminal-bench@4.0.0。官方同时预告:4.1 聚焦 verifier 改进(抗篡改 verifier),5.0 将加入新任务。

一个提醒:官方榜单与厂商自报分常常对不上

访问官方榜首页(2026-09-23 快照)看到的前列与厂商发布稿里的数字并不一致,例如官方榜记为 Opus 5(max,Claude Code)51.8% ± 3.4%、Fable 5(max)44.5% ± 3.8%、GLM-5.3(max)41.8% ± 3.2%、GPT-5.6 Sol(max,Codex)37.3% ± 3.8%;而厂商发布稿里同代模型常出现 55%–59% 的自报值。

这不是谁在造假,而是effort 档位、harness、版本、快照时点四个变量叠加的结果。正确做法是:引用时把这四个变量一起写出来,否则数字没有可比性。

三个最常见的读分坑

坑一:厂商自己的 harness 不等于官方榜单

同一个模型,跑在自家 CLI 里和跑在基准官方 harness 里,分数可以差很远。部分厂商公布的是「自家 harness 自测分」,并明确说明尚未进入官方榜单——这类数字只能当作参考区间,不能与官方榜单并列排名。

判断方法很简单:看有没有说清 harness。只给分数不给运行环境的,按「信息不全」处理。

坑二:单题短程 ≠ 实战长程

基准里的任务通常边界清晰、验收确定。真实仓库里的脏上下文、隐式依赖、历史包袱会被成倍放大,所以榜单领先不等于你的仓库里也领先。选型时最可靠的仍然是用自己的仓库抽样 20 题——这一点与 SWE-bench 读榜的纪律完全一致。

坑三:只看分数不看成本

两个模型分数接近时,成本往往差几倍。长程 Agent 场景应该同时看单次任务成本:把「分数 / 每任务花费」一起放在表里比较,才是有决策价值的对比。这也是本站模型卡普遍同时标注基准与定价的原因。

与相邻基准怎么搭配看

基准主要考察与 Terminal-Bench 的关系
SWE-bench真实 issue 修复,单元测试验收互补:解题 vs 用机器
AutomationBench真实 SaaS 工具链多步业务流相近:都考「跑完一件事」,但更偏云端业务
FrontierCode前沿代码能力互补:更接近纯编码难度
OSWorld桌面 GUI 操作同类延伸:从终端扩展到图形界面

一个模型如果在 Terminal-Bench 很强但 SWE-bench 一般,通常说明工具调用与自我修正强、代码理解偏弱——反过来则相反。两张榜单一起看,才能判断它适合当「执行层」还是「规划层」,这也正是多 Agent 编排里分工的依据。

哪些工具吃这个分数

终端形态的 Agent 是 Terminal-Bench 分数的直接受益方,也是主要引用方:

  • Claude Code —— 终端 Agent 的标杆参照系
  • Codex CLI —— 与 Claude Code 长期并列对比
  • MiMo Code —— 国产阵营中主打终端基准的一档
  • Gemini CLI —— Google 的终端入口

FAQ

Terminal-Bench 和 SWE-bench 该看哪个? 看你要它干什么。选代码修复与仓库理解能力看 SWE-bench;选长程自主执行能力看 Terminal-Bench。做终端 Agent 底座的话,两个都要看,且都要确认版本。

为什么同一篇发布稿里 Terminal-Bench 2.1 很高但 4.0 很低? 正常现象。4.0 难度显著提高、任务更贴近真实长程,多数模型在 4.0 上都会大幅回落。如果一个模型只公布 2.1 而回避 4.0,应视为信息不完整。

分数接近时怎么选模型? 比每任务成本,再比稳定性(长会话是否跑偏)。具体方法见长上下文中关于成本与上下文管理的取舍。

延伸阅读

来源

本文同时参考了本站已核实的模型卡(各卡均标注基准版本与一手来源,见上方延伸阅读)。Terminal-Bench 的任务集、版本难度与官方榜单以官方发布为准;厂商自选 harness 自报的分数在本文中一律按「参考区间」处理,未与官方榜单并列排名。

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Cursor vs Claude Code:什么时候用哪个?(2026 实测选型)

Cursor 和 Claude Code 到底怎么选?一句话结论 + 决策树 + 价格实测 + 国内可用性对比。GUI 派选 Cursor,终端长任务派选 Claude Code,最优解其实是共存。

Devin vs Claude Code:AI 编程 Agent 怎么选?异步自主 vs 终端同步对比

Devin vs Claude Code 2026 选型对比:Cognition 异步自主 Cloud Agent vs Anthropic 终端同步 CLI Agent,从形态、工作模式、长任务能力、并发、价格、中文支持和适合人群 8 个维度判断,帮你选对 AI 编程 Agent。