跳到主内容
coding小米

小米 MiMo(编程模型)

小米 2026 年 6 月 11 日随 MiMo Code Agent 开源的自研编程模型:SWE-bench Pro 62%、Terminal Bench 2 73% 双超 Claude Code,内置多模态与记忆系统,是国产 Agent 第一次在权威基准上正面超越 Anthropic 的核心武器。

发布 2026-08-30更新 2026-08-30核实 2026-08-30

规格

厂商
小米
发布日期
2026/6/11
类型
coding
定价
开源(随 MiMo Code Agent 免费提供,权重许可以 GitHub 仓库为准)
API 兼容
openai, mimo

基准测试

62%
SWE-bench Pro
73%
Terminal Bench 2

优势

  • •SWE-bench Pro 62%、Terminal Bench 2 73%,双超 Claude Code 同期成绩
  • •内置多模态能力,截图/UI 也能进工作流
  • •配套记忆系统,跨会话记住项目上下文
  • •国产厂商出品,国内访问与协作顺畅

不足

  • •基准 ≠ 实战:真实项目复杂度未必复现榜单领先
  • •模型与 Agent 均 V0.1.0,稳定性与生态待验证
  • •独立于 Agent 之外的模型 API 生态尚在早期

适用场景

终端 Agent 的默认模型(MiMo Code 内置)看重 SWE-bench 成绩的基准向研究开源国产 Agent 的学习与二次开发

概述

MiMo 是小米自研的编程模型,2026 年 6 月 11 日随 MiMo Code 终端 Agent 一同开源(MIT 协议,基于 OpenCode 架构改造)。它让国产阵营第一次拿到一个硬指标:

SWE-bench Pro 62% + Terminal Bench 2 73%,两项双双超过 Claude Code 同期成绩。

前者考「给真实 GitHub issue,自主定位 + 修复 + 通过测试」(详见 SWE-bench 解读),后者考终端环境里的长程工具调用。两项都超,说明模型侧「解题」与「用机器」两个能力同时到位——这正是终端 Agent 最需要的组合。

核心能力

双基准超 Claude Code

62% / 73% 的意义不在绝对值,而在参照系:这是国产模型第一次在 Anthropic 定义的主场项目上正面超越。怎么理性看待这个成绩(题目分布、issue 干净度、单题短程 vs 实战长程),见基准解读。

内置多模态

不只是文本编程模型——截图、UI 素材可以进入工作流(「照着这张设计图改样式」)。这在小模型阵营里是稀缺配置。

记忆系统

Agent 内置跨会话记忆:记住项目上下文与用户习惯。工程意义与风险(记忆存哪、可否编辑)详见 Agent 记忆。

获取方式

通道说明
MiMo Code 内置装上 Agent 即用,模型免费
开源仓库XiaomiMiMo/MiMo-Code,权重许可以仓库为准
BYOK 接入OpenAI 兼容接口,可接进 Cline 等工具

本卡事实核对时点为 2026-08-30;模型与配套 Agent 当时均为 V0.1.0 早期版本。版本号、权重许可与基准成绩请以上方 GitHub 仓库为准,本文不作推测性更新。

API 调用示例

接口 OpenAI 兼容,本地起服务后按 BYOK 方式把 base_url 指过去即可:

from openai import OpenAI

client = OpenAI(
    api_key="EMPTY",                    # 本地部署通常不校验 key
    base_url="http://localhost:8000/v1",
)

resp = client.chat.completions.create(
    model="mimo-code",
    messages=[{"role": "user", "content": "为这个函数补上边界测试"}],
)
print(resp.choices[0].message.content)

自部署的成本结构与官方 API 完全不同——它从「按 token 付费」变成「按显卡付费」,选型方法见长上下文里的显存与并发取舍。

与同档国产编程模型怎么选

维度MiMoKimi K2.7 CodeQwen3-Coder
开放方式MIT 开源 + 内置 Agent开源权重 + 商用 API开源权重 + 百炼 API
主打基准SWE-bench Pro 62%长程编程任务代码生成与补全
多模态内置
成熟度V0.1.0 早期正式版正式版
适合研究 / 零预算尝鲜生产环境主力国内直连生产

三者并不是简单替代关系:要生产稳定选正式版,要研究改造选 MiMo。更完整的国产阵营对比见国产编程模型盘点。

常见误区

  • 把 SWE-bench 成绩当成实战胜率:榜单是干净 issue + 单题短程,真实仓库的脏上下文与长依赖会被放大,选型请以自己的仓库做 20 题抽样。
  • 忽略 V0.1.0 的语义:早期版本号意味着 breaking change 与文档缺口是常态,别把它放进需要 SLA 的流水线。
  • 以为开源等于零成本:本地推理的显卡、运维与上下文管理成本都是真金白银,小团队先算成本账。

适合 / 不适合

适合:

  • 想体验「SWE-bench 超 Claude Code」的国产 Agent 用户
  • 基准向研究与二次开发(MIT + OpenCode 架构,改造成本低)
  • 预算为零的个人开发者

不适合:

  • 要企业级 SLA 与稳定承诺的团队(V0.1.0,早期)
  • 深度依赖成熟插件生态的重度用户(生态在追 Claude Code)
  • 闭源旗舰级复杂推理需求(见国产模型选型)

相关阅读

来源