SWE-bench
SWE-bench 用真实 GitHub issue + 单元测试验收考 AI 编程 Agent:自主定位、改代码、跑通测试。它是 AI 编程能力最硬的基准,也是 2026 年国产 Agent 硬刚 Claude Code 的主战场。
发布 2026-08-30更新 2026-08-30什么是 SWE-bench
SWE-bench 是目前衡量「AI 解决真实软件工程问题能力」最被引用的基准。它的考题不是刷题网站式的算法题,而是真实开源项目的真实 issue:
- 给 Agent 一个仓库快照 + 一段 GitHub issue 描述(比如「这个函数在空输入时崩溃」)
- Agent 自主完成:定位相关文件 → 理解上下文 → 修改代码
- 用仓库自带的单元测试验收,补丁让失败测试变绿、且不弄坏其他测试,才算通过
一句话:考的是「给一个陌生代码库和一个 bug 报告,你能不能像人类工程师一样把它修好」。这比 HumanEval 这类「从零写函数」的题目难一个数量级——它考检索、考工程直觉、考对既有代码的敬畏,而不只是生成能力。
主要变体
| 变体 | 特点 |
|---|---|
| SWE-bench(原版) | 12 个 Python 开源项目(Django、sympy、scikit-learn 等),约 2294 题 |
| SWE-bench Verified | 500 题人工复核版——剔除了「issue 描述不清 / 测试本身有问题」的噪声题,公认最可信 |
| SWE-bench Lite | 精选子集,跑分快,常用于快速迭代 |
| SWE-bench Pro / Multimodal 等 | 更难、更大规模或带界面截图的新一代扩展,2026 年前排 Agent 的主战场 |
看榜时务必分清变体:「SWE-bench Verified 60%」和「SWE-bench Lite 60%」完全不可比。Lite 和原版的题目更容易混进「测试本身就宽松」的样本,分数天然虚高。
2026 年的牌桌:国产 Agent 上桌了
SWE-bench 排行榜是 2026 年国产 AI 编程工具硬刚 Anthropic 的主战场:
- 小米 MiMo Code:SWE-bench Pro 62%、Terminal Bench 2 73%,双双超过 Claude Code 同期成绩——国产 Agent 第一次在权威基准上正面超越
- 月之暗面 K2.7 Code:官方称在 HumanEval、SWE-bench、LiveCodeBench 等编程基准上对标 Claude Sonnet 4
- 阿里 Qwen3-Coder:开源模型 SWE-bench SOTA 的常客
- 智谱 GLM-5.3-Flash:独立成绩官方暂未完整披露,是开源社区接下来的看点之一
配套的 Terminal Bench 2 考的是终端环境里的长程工具调用(装环境、跑命令、多步骤排障),与 SWE-bench 互为补充:一个考「会改代码」,一个考「会用机器」。
基准 ≠ 实战:读榜的正确姿势
SWE-bench 分数高不代表实战体验好,四个已知缺口:
- 题目分布窄。原版集中在 Python 后端库的 bug 修复,前端、移动端、嵌入式、巨型单体架构覆盖薄弱。你的真实项目未必长这样
- issue 描述偏干净。真实需求常常是「老板说要支持 SSO,具体怎样你看着办」——需求本身模糊、要人去问。SWE-bench 的 issue 多数有明确验收路径
- 测试即真理的漏洞。过测 = 答对,但「为过测而过测」(比如把断言改了、特判了输入)在长榜历史上出现过争议。Verified 子集就是为了压制这类噪声
- 单题短程 vs 真实长程。真实任务是数小时的连续工作流,会累积 Context Rot;基准是独立短题,考不出上下文管理能力
所以本站的读法一直是:基准是入场券,不是体验本身。SWE-bench Pro 62% 证明 MiMo 有第一梯队的「解题硬件」,但装上之后的日常手感、稳定性、中文场景表现,要看工具卡实测。
怎么用它选工具
- 先看变体:只认 Verified / Pro 这类去噪版本;Lite 分数打七折再信
- 看同榜横向,别看跨榜纵向:和同一变体下的 Claude Code、Codex 比,别拿 A 榜的 60% 碰 B 榜的 70%
- 关注趋势而非单点:某工具一个月涨 5 个点,说明迭代凶猛,比绝对值更有信息量
- 最后一定要实测:拿自己仓库跑一周,比任何榜单都准——这也是本站评测坚持实机测试的原因
常见误区
- 「SWE-bench 高 = Claude Code 平替」:不成立。基准考解题,工具的生态、稳定性、上下文管理、MCP 集成都不在考纲里
- 「所有 SWE-bench 分数可比」:错。变体不同、评分口径不同,先问「哪个榜」
- 「开源模型不可能打过闭源」:2026 年已被证伪——MoE + 低激活架构让开源模型在编程基准上与闭源旗舰同台(见 MoE)
- 「刷榜没意义」:矫枉过正。作为「解题硬件」的入场券,SWE-bench 仍是目前信息密度最高的单一指标
相关阅读
相关工具
Aider vs Claude Code:终端 AI 编程双雄怎么选
Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。
Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比
Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。
Claude Code vs Codex CLI:终端 AI Agent 双雄对比
Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。
Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)
Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。
Cursor vs Claude Code:什么时候用哪个?(2026 实测选型)
Cursor 和 Claude Code 到底怎么选?一句话结论 + 决策树 + 价格实测 + 国内可用性对比。GUI 派选 Cursor,终端长任务派选 Claude Code,最优解其实是共存。
Devin vs Claude Code:AI 编程 Agent 怎么选?异步自主 vs 终端同步对比
Devin vs Claude Code 2026 选型对比:Cognition 异步自主 Cloud Agent vs Anthropic 终端同步 CLI Agent,从形态、工作模式、长任务能力、并发、价格、中文支持和适合人群 8 个维度判断,帮你选对 AI 编程 Agent。