跳到主内容
概念SWE-bench基准测试AI 编程Agent模型评测Terminal Bench

SWE-bench

SWE-bench 用真实 GitHub issue + 单元测试验收考 AI 编程 Agent:自主定位、改代码、跑通测试。它是 AI 编程能力最硬的基准,也是 2026 年国产 Agent 硬刚 Claude Code 的主战场。

发布 2026-08-30更新 2026-08-30

什么是 SWE-bench

SWE-bench 是目前衡量「AI 解决真实软件工程问题能力」最被引用的基准。它的考题不是刷题网站式的算法题,而是真实开源项目的真实 issue:

  1. 给 Agent 一个仓库快照 + 一段 GitHub issue 描述(比如「这个函数在空输入时崩溃」)
  2. Agent 自主完成:定位相关文件 → 理解上下文 → 修改代码
  3. 用仓库自带的单元测试验收,补丁让失败测试变绿、且不弄坏其他测试,才算通过

一句话:考的是「给一个陌生代码库和一个 bug 报告,你能不能像人类工程师一样把它修好」。这比 HumanEval 这类「从零写函数」的题目难一个数量级——它考检索、考工程直觉、考对既有代码的敬畏,而不只是生成能力。

主要变体

变体特点
SWE-bench(原版)12 个 Python 开源项目(Django、sympy、scikit-learn 等),约 2294 题
SWE-bench Verified500 题人工复核版——剔除了「issue 描述不清 / 测试本身有问题」的噪声题,公认最可信
SWE-bench Lite精选子集,跑分快,常用于快速迭代
SWE-bench Pro / Multimodal 等更难、更大规模或带界面截图的新一代扩展,2026 年前排 Agent 的主战场

看榜时务必分清变体:「SWE-bench Verified 60%」和「SWE-bench Lite 60%」完全不可比。Lite 和原版的题目更容易混进「测试本身就宽松」的样本,分数天然虚高。

2026 年的牌桌:国产 Agent 上桌了

SWE-bench 排行榜是 2026 年国产 AI 编程工具硬刚 Anthropic 的主战场:

  • 小米 MiMo Code:SWE-bench Pro 62%、Terminal Bench 2 73%,双双超过 Claude Code 同期成绩——国产 Agent 第一次在权威基准上正面超越
  • 月之暗面 K2.7 Code:官方称在 HumanEval、SWE-bench、LiveCodeBench 等编程基准上对标 Claude Sonnet 4
  • 阿里 Qwen3-Coder:开源模型 SWE-bench SOTA 的常客
  • 智谱 GLM-5.3-Flash:独立成绩官方暂未完整披露,是开源社区接下来的看点之一

配套的 Terminal Bench 2 考的是终端环境里的长程工具调用(装环境、跑命令、多步骤排障),与 SWE-bench 互为补充:一个考「会改代码」,一个考「会用机器」。

基准 ≠ 实战:读榜的正确姿势

SWE-bench 分数高不代表实战体验好,四个已知缺口:

  1. 题目分布窄。原版集中在 Python 后端库的 bug 修复,前端、移动端、嵌入式、巨型单体架构覆盖薄弱。你的真实项目未必长这样
  2. issue 描述偏干净。真实需求常常是「老板说要支持 SSO,具体怎样你看着办」——需求本身模糊、要人去问。SWE-bench 的 issue 多数有明确验收路径
  3. 测试即真理的漏洞。过测 = 答对,但「为过测而过测」(比如把断言改了、特判了输入)在长榜历史上出现过争议。Verified 子集就是为了压制这类噪声
  4. 单题短程 vs 真实长程。真实任务是数小时的连续工作流,会累积 Context Rot;基准是独立短题,考不出上下文管理能力

所以本站的读法一直是:基准是入场券,不是体验本身。SWE-bench Pro 62% 证明 MiMo 有第一梯队的「解题硬件」,但装上之后的日常手感、稳定性、中文场景表现,要看工具卡实测。

怎么用它选工具

  • 先看变体:只认 Verified / Pro 这类去噪版本;Lite 分数打七折再信
  • 看同榜横向,别看跨榜纵向:和同一变体下的 Claude Code、Codex 比,别拿 A 榜的 60% 碰 B 榜的 70%
  • 关注趋势而非单点:某工具一个月涨 5 个点,说明迭代凶猛,比绝对值更有信息量
  • 最后一定要实测:拿自己仓库跑一周,比任何榜单都准——这也是本站评测坚持实机测试的原因

常见误区

  • 「SWE-bench 高 = Claude Code 平替」:不成立。基准考解题,工具的生态、稳定性、上下文管理、MCP 集成都不在考纲里
  • 「所有 SWE-bench 分数可比」:错。变体不同、评分口径不同,先问「哪个榜」
  • 「开源模型不可能打过闭源」:2026 年已被证伪——MoE + 低激活架构让开源模型在编程基准上与闭源旗舰同台(见 MoE)
  • 「刷榜没意义」:矫枉过正。作为「解题硬件」的入场券,SWE-bench 仍是目前信息密度最高的单一指标

相关阅读

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Cursor vs Claude Code:什么时候用哪个?(2026 实测选型)

Cursor 和 Claude Code 到底怎么选?一句话结论 + 决策树 + 价格实测 + 国内可用性对比。GUI 派选 Cursor,终端长任务派选 Claude Code,最优解其实是共存。

Devin vs Claude Code:AI 编程 Agent 怎么选?异步自主 vs 终端同步对比

Devin vs Claude Code 2026 选型对比:Cognition 异步自主 Cloud Agent vs Anthropic 终端同步 CLI Agent,从形态、工作模式、长任务能力、并发、价格、中文支持和适合人群 8 个维度判断,帮你选对 AI 编程 Agent。