Reasoning Model(推理模型)
Reasoning Model(推理模型)在给出答案前会先做一段「显式思考 / 内部推理链」,把难题拆步骤、自我校验,再输出结论。它用更高的延迟与算力换数学、代码、逻辑、规划类难题的正确率。代表有 OpenAI o 系列、DeepSeek-R1、Claude 扩展思考形态。选型关键是「难任务上推理模型,简单任务上普通模型」。
发布 2026-09-06更新 2026-09-25核实 2026-09-25AI 之家 推荐结论:2026 年真正要做的选择题已经不是「要不要开推理」,而是**「给多少 effort」。主流旗舰把思考改成了常开的 adaptive thinking**,用
effort参数调深浅;能不能关反而成了版本相关的坑。旧心智模型「推理模型 = 一个可开关的特殊模型」已经过时,按它写的代码会报错。
什么是 Reasoning Model
Reasoning Model(推理模型)是一类在输出最终答案前,先做显式推理的模型。它不像传统模型「读完 prompt 直接吐答案」,而是先生成一段内部思考过程(chain-of-thought / 扩展思考),把问题拆步骤、尝试、校验,再给出结论。
你可以把它理解成:普通模型是「凭直觉秒答」,推理模型是「先在草稿纸上推一遍再答」。
解决什么问题
很多任务不是「知道就能答」,而是「想清楚才能对」:
- 多步数学 / 竞赛题
- 复杂代码生成与调试
- 逻辑谜题、约束满足
- 长链条规划、多跳推理
这些任务里,直接生成答案的错误率很高;让模型「多想一会儿」,正确率显著提升。推理模型用更高的延迟与算力换这类难题的准确率。
工作原理
用户问题 → [思考阶段:拆步骤 / 试错 / 自校验] → 最终答案
关键特征:
- 思考预算(thinking tokens / effort):很多推理模型允许你控制「想多久」——低 effort 快但浅,高 effort 慢但更准。
- 思考过程通常不计入最终输出:用户看到的是结论,模型内部先跑完推理链。
- 可与工具调用结合:推理模型也能边想边调 Function Calling / MCP 工具取数据。
代表形态:OpenAI 的 o 系列(o1 起)、DeepSeek-R1(开源、可自部署)、Claude 的扩展思考(extended thinking)能力。
2026-09 更新:从「开关」变成了「档位」
这是本条目最需要更新的一处认知。早期推理模型把「思考」做成一个你来决定开不开的开关;到 2026 年,主流旗舰的做法已经变成默认常开 + 用 effort 调深度,两者的工程含义完全不同。
| 模型 | thinking 形态 | 能否关闭 | 调深浅的方式 |
|---|---|---|---|
| Claude Haiku 4.5 | Extended | 可按需开启 | 按需开启 extended thinking |
| Claude Opus 5 | Adaptive(默认开) | 仅当 effort ≤ high | effort 参数(默认 high) |
| Claude Opus 5.5 | Adaptive(常开) | 完全不可关 | effort 参数(另有 2.5x Fast 模式) |
三处会直接导致报错的破坏性变更(均在 Claude Opus 5 及之后生效):
- Opus 5:
effort为xhigh或max时,发thinking: {"type": "disabled"}返回 400(Opus 4.8 允许); - Opus 5.5:任何 effort 下发
disabled都返回 400; - Opus 5.5:
tool_choice的any与tool类型返回 400,只支持auto+ 严格工具调用。
实践含义:不要再把「低延迟路径统一关掉 thinking」当作省钱套路——它可能直接让请求失败。正确的做法是把 effort 当成成本控制旋钮:低 effort 快而浅,高 effort 慢而准,需要更快则用 Fast 模式(代价是两倍价)。
和普通模型怎么选
| 场景 | 用谁 |
|---|---|
| 闲聊 / 摘要 / 简单改写 | 普通模型(快、便宜) |
| 数学 / 代码 / 逻辑 / 规划 | 推理模型(慢但准) |
| 高并发低延迟 API | 普通模型 |
| 一次性硬核难题 | 推理模型(高 effort) |
经验法则:简单任务上普通模型,难任务上推理模型。把推理模型当「重型火力」,别拿它做所有事——否则又慢又贵。
2026 年更实用的版本是按 effort 分层:
| 任务类型 | 建议档位 | 说明 |
|---|---|---|
| 分类、抽取、格式规整 | 低 / 中等 effort,或直接上 Haiku 4.5 档 | 想得久没有收益 |
| 日常编码、单文件改动 | 中等 effort(多数模型的默认档) | 性价比最高的区间 |
| 多文件重构、架构决策 | 高 effort | 这才有必要付推理成本 |
| 一次性硬核难题 | 最高 effort + 允许长耗时 | 见下方「max effort 陷阱」 |
max effort 不是免费的精度。Simon Willison 用「画一只骑自行车的鹈鹕 SVG」的固定测试跑 Opus 5.5,max thinking 档两次都没返回任何结果——耗尽 128K 输出上限仍在推理,每次花掉 $2.56、耗时近 20 分钟。默认 effort 起步,别一上来就拉满。
常见误区
- 以为「思考越久越对」无上限——过长的思考会引入冗余甚至自我绕晕,任务匹配比堆预算更重要。
- 以为推理模型不用写清需求——它依然依赖你把约束讲清楚,模糊 prompt 下思考也会跑偏。
- 忽视成本——推理模型的思考 token 也计费,长思考 = 高账单,生产要设思考上限。
和 Coding Agent 的关系
Claude Code / Codex 这类编码 Agent 在难任务上会借助推理模型的扩展思考来拆解需求、规划文件改动、自我 review。复杂重构 / 多文件改动尤其吃推理能力。
怎么用:三步上手
- 先判断任务难度——确定性、模板化任务别上推理模型。
- 设思考预算——从中等 effort 起,难任务再调高,并监控延迟/成本。
- 把约束写进 prompt——推理模型照样需要清晰指令,模糊需求下思考会发散。
哪些模型支持
- DeepSeek-R1(DeepSeek-R1)——开源推理模型,可自部署,是「推理能力可以自己跑」这一路线的代表。
- Claude 系列(Opus 5.5 / Opus 5 / Haiku 4.5)——adaptive thinking,用
effort调档,编码场景常用。 - OpenAI o 系列及后续 GPT 系列——通用推理标杆,同样提供 effort 类档位。
- 多数 2026 旗舰模型已把「推理档位」作为标准能力,是否可关闭则因模型而异(见上文表格)。
FAQ
推理模型一定比普通模型准吗? 不一定。在简单任务上,多想不会更准,只会更慢更贵。收益出现在「需要多步推导、且单步错误会累积」的任务上——数学、复杂调试、长链条规划。分类、摘要、格式转换这类任务上,把预算花在推理上纯属浪费。
思考 token 计费吗? 计费。这是最容易失控的一项:长思考 = 高账单,且用户往往看不到思考过程。生产环境务必设思考上限与成本告警。
为什么我发 thinking: disabled 会报错?
因为 Opus 5.5 起 thinking 完全不可关闭,Opus 5 也只允许在 effort ≤ high 时关闭。改用 effort 参数控制推理深度即可,详见上文表格。
effort 是不是调越高越好? 不是。过高 effort 可能耗尽输出上限却什么也不返回(见上文 max effort 陷阱),而且成本是线性甚至超线性上升。默认档起步,遇到明确失败再上调。
开源推理模型能追上闭源吗?DeepSeek-R1 证明了「可自部署的强推理」这条路走得通,但代差依然存在。选型标准应是你的数据能不能出网——能出网就看绝对能力,不能出网则开源自部署是唯一解。
延伸阅读
- 模型如何调工具:Function Calling
- 协议层:MCP · Agent 沙箱
- 编码 Agent:Agentic Coding · 智能体编排
- 上下文管理:Context Engineering · 上下文压缩
- 模型:Claude Opus 5.5 · Claude Opus 5 · Claude Haiku 4.5 · DeepSeek-R1
来源
相关工具
Aider vs Claude Code:终端 AI 编程双雄怎么选
Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。
Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比
Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。
Claude Code vs Codex CLI:终端 AI Agent 双雄对比
Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。
Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)
Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。
Cursor vs Claude Code:什么时候用哪个?(2026 实测选型)
Cursor 和 Claude Code 到底怎么选?一句话结论 + 决策树 + 价格实测 + 国内可用性对比。GUI 派选 Cursor,终端长任务派选 Claude Code,最优解其实是共存。
Devin vs Claude Code:AI 编程 Agent 怎么选?异步自主 vs 终端同步对比
Devin vs Claude Code 2026 选型对比:Cognition 异步自主 Cloud Agent vs Anthropic 终端同步 CLI Agent,从形态、工作模式、长任务能力、并发、价格、中文支持和适合人群 8 个维度判断,帮你选对 AI 编程 Agent。