小米 MiMo(编程模型)
小米 2026 年 6 月 11 日随 MiMo Code Agent 开源的自研编程模型:SWE-bench Pro 62%、Terminal Bench 2 73% 双超 Claude Code,内置多模态与记忆系统,是国产 Agent 第一次在权威基准上正面超越 Anthropic 的核心武器。
发布 2026-08-30更新 2026-08-30核实 2026-08-30规格
- 厂商
- 小米
- 发布日期
- 2026/6/11
- 类型
- coding
- 定价
- 开源(随 MiMo Code Agent 免费提供,权重许可以 GitHub 仓库为准)
- API 兼容
- openai, mimo
基准测试
优势
- •SWE-bench Pro 62%、Terminal Bench 2 73%,双超 Claude Code 同期成绩
- •内置多模态能力,截图/UI 也能进工作流
- •配套记忆系统,跨会话记住项目上下文
- •国产厂商出品,国内访问与协作顺畅
不足
- •基准 ≠ 实战:真实项目复杂度未必复现榜单领先
- •模型与 Agent 均 V0.1.0,稳定性与生态待验证
- •独立于 Agent 之外的模型 API 生态尚在早期
适用场景
概述
MiMo 是小米自研的编程模型,2026 年 6 月 11 日随 MiMo Code 终端 Agent 一同开源(MIT 协议,基于 OpenCode 架构改造)。它让国产阵营第一次拿到一个硬指标:
SWE-bench Pro 62% + Terminal Bench 2 73%,两项双双超过 Claude Code 同期成绩。
前者考「给真实 GitHub issue,自主定位 + 修复 + 通过测试」(详见 SWE-bench 解读),后者考终端环境里的长程工具调用。两项都超,说明模型侧「解题」与「用机器」两个能力同时到位——这正是终端 Agent 最需要的组合。
核心能力
双基准超 Claude Code
62% / 73% 的意义不在绝对值,而在参照系:这是国产模型第一次在 Anthropic 定义的主场项目上正面超越。怎么理性看待这个成绩(题目分布、issue 干净度、单题短程 vs 实战长程),见基准解读。
内置多模态
不只是文本编程模型——截图、UI 素材可以进入工作流(「照着这张设计图改样式」)。这在小模型阵营里是稀缺配置。
记忆系统
Agent 内置跨会话记忆:记住项目上下文与用户习惯。工程意义与风险(记忆存哪、可否编辑)详见 Agent 记忆。
获取方式
| 通道 | 说明 |
|---|---|
| MiMo Code 内置 | 装上 Agent 即用,模型免费 |
| 开源仓库 | XiaomiMiMo/MiMo-Code,权重许可以仓库为准 |
| BYOK 接入 | OpenAI 兼容接口,可接进 Cline 等工具 |
本卡事实核对时点为 2026-08-30;模型与配套 Agent 当时均为 V0.1.0 早期版本。版本号、权重许可与基准成绩请以上方 GitHub 仓库为准,本文不作推测性更新。
API 调用示例
接口 OpenAI 兼容,本地起服务后按 BYOK 方式把 base_url 指过去即可:
from openai import OpenAI
client = OpenAI(
api_key="EMPTY", # 本地部署通常不校验 key
base_url="http://localhost:8000/v1",
)
resp = client.chat.completions.create(
model="mimo-code",
messages=[{"role": "user", "content": "为这个函数补上边界测试"}],
)
print(resp.choices[0].message.content)
自部署的成本结构与官方 API 完全不同——它从「按 token 付费」变成「按显卡付费」,选型方法见长上下文里的显存与并发取舍。
与同档国产编程模型怎么选
| 维度 | MiMo | Kimi K2.7 Code | Qwen3-Coder |
|---|---|---|---|
| 开放方式 | MIT 开源 + 内置 Agent | 开源权重 + 商用 API | 开源权重 + 百炼 API |
| 主打基准 | SWE-bench Pro 62% | 长程编程任务 | 代码生成与补全 |
| 多模态 | 内置 | ||
| 成熟度 | V0.1.0 早期 | 正式版 | 正式版 |
| 适合 | 研究 / 零预算尝鲜 | 生产环境主力 | 国内直连生产 |
三者并不是简单替代关系:要生产稳定选正式版,要研究改造选 MiMo。更完整的国产阵营对比见国产编程模型盘点。
常见误区
- 把 SWE-bench 成绩当成实战胜率:榜单是干净 issue + 单题短程,真实仓库的脏上下文与长依赖会被放大,选型请以自己的仓库做 20 题抽样。
- 忽略 V0.1.0 的语义:早期版本号意味着 breaking change 与文档缺口是常态,别把它放进需要 SLA 的流水线。
- 以为开源等于零成本:本地推理的显卡、运维与上下文管理成本都是真金白银,小团队先算成本账。
适合 / 不适合
适合:
- 想体验「SWE-bench 超 Claude Code」的国产 Agent 用户
- 基准向研究与二次开发(MIT + OpenCode 架构,改造成本低)
- 预算为零的个人开发者
不适合:
- 要企业级 SLA 与稳定承诺的团队(V0.1.0,早期)
- 深度依赖成熟插件生态的重度用户(生态在追 Claude Code)
- 闭源旗舰级复杂推理需求(见国产模型选型)
相关阅读
- MiMo Code CLI 评测 —— 搭载本模型的国产 Agent
- SWE-bench:基准怎么读才不被忽悠
- Agent 记忆:记忆系统的工程实践
- 国产编程模型盘点
- Kimi K2.7 Code 模型卡 —— 同期国产对手