跳到主内容
概念reasoning-model推理模型chain-of-thoughto1deepseek-r1扩展思考

Reasoning Model(推理模型)

Reasoning Model(推理模型)在给出答案前会先做一段「显式思考 / 内部推理链」,把难题拆步骤、自我校验,再输出结论。它用更高的延迟与算力换数学、代码、逻辑、规划类难题的正确率。代表有 OpenAI o 系列、DeepSeek-R1、Claude 扩展思考形态。选型关键是「难任务上推理模型,简单任务上普通模型」。

发布 2026-09-06更新 2026-09-25核实 2026-09-25

AI 之家 推荐结论:2026 年真正要做的选择题已经不是「要不要开推理」,而是**「给多少 effort」。主流旗舰把思考改成了常开的 adaptive thinking**,用 effort 参数调深浅;能不能关反而成了版本相关的坑。旧心智模型「推理模型 = 一个可开关的特殊模型」已经过时,按它写的代码会报错。

什么是 Reasoning Model

Reasoning Model(推理模型)是一类在输出最终答案前,先做显式推理的模型。它不像传统模型「读完 prompt 直接吐答案」,而是先生成一段内部思考过程(chain-of-thought / 扩展思考),把问题拆步骤、尝试、校验,再给出结论。

你可以把它理解成:普通模型是「凭直觉秒答」,推理模型是「先在草稿纸上推一遍再答」。

解决什么问题

很多任务不是「知道就能答」,而是「想清楚才能对」:

  • 多步数学 / 竞赛题
  • 复杂代码生成与调试
  • 逻辑谜题、约束满足
  • 长链条规划、多跳推理

这些任务里,直接生成答案的错误率很高;让模型「多想一会儿」,正确率显著提升。推理模型用更高的延迟与算力换这类难题的准确率。

工作原理

用户问题 → [思考阶段:拆步骤 / 试错 / 自校验] → 最终答案

关键特征:

  • 思考预算(thinking tokens / effort):很多推理模型允许你控制「想多久」——低 effort 快但浅,高 effort 慢但更准。
  • 思考过程通常不计入最终输出:用户看到的是结论,模型内部先跑完推理链。
  • 可与工具调用结合:推理模型也能边想边调 Function Calling / MCP 工具取数据。

代表形态:OpenAI 的 o 系列(o1 起)、DeepSeek-R1(开源、可自部署)、Claude 的扩展思考(extended thinking)能力。

2026-09 更新:从「开关」变成了「档位」

这是本条目最需要更新的一处认知。早期推理模型把「思考」做成一个你来决定开不开的开关;到 2026 年,主流旗舰的做法已经变成默认常开 + 用 effort 调深度,两者的工程含义完全不同。

模型thinking 形态能否关闭调深浅的方式
Claude Haiku 4.5Extended可按需开启按需开启 extended thinking
Claude Opus 5Adaptive(默认开)仅当 effort ≤ higheffort 参数(默认 high)
Claude Opus 5.5Adaptive(常开)完全不可关effort 参数(另有 2.5x Fast 模式)

三处会直接导致报错的破坏性变更(均在 Claude Opus 5 及之后生效):

  1. Opus 5:effort 为 xhigh 或 max 时,发 thinking: {"type": "disabled"} 返回 400(Opus 4.8 允许);
  2. Opus 5.5:任何 effort 下发 disabled 都返回 400;
  3. Opus 5.5:tool_choice 的 any 与 tool 类型返回 400,只支持 auto + 严格工具调用。

实践含义:不要再把「低延迟路径统一关掉 thinking」当作省钱套路——它可能直接让请求失败。正确的做法是把 effort 当成成本控制旋钮:低 effort 快而浅,高 effort 慢而准,需要更快则用 Fast 模式(代价是两倍价)。

和普通模型怎么选

场景用谁
闲聊 / 摘要 / 简单改写普通模型(快、便宜)
数学 / 代码 / 逻辑 / 规划推理模型(慢但准)
高并发低延迟 API普通模型
一次性硬核难题推理模型(高 effort)

经验法则:简单任务上普通模型,难任务上推理模型。把推理模型当「重型火力」,别拿它做所有事——否则又慢又贵。

2026 年更实用的版本是按 effort 分层:

任务类型建议档位说明
分类、抽取、格式规整低 / 中等 effort,或直接上 Haiku 4.5 档想得久没有收益
日常编码、单文件改动中等 effort(多数模型的默认档)性价比最高的区间
多文件重构、架构决策高 effort这才有必要付推理成本
一次性硬核难题最高 effort + 允许长耗时见下方「max effort 陷阱」

max effort 不是免费的精度。Simon Willison 用「画一只骑自行车的鹈鹕 SVG」的固定测试跑 Opus 5.5,max thinking 档两次都没返回任何结果——耗尽 128K 输出上限仍在推理,每次花掉 $2.56、耗时近 20 分钟。默认 effort 起步,别一上来就拉满。

常见误区

  • 以为「思考越久越对」无上限——过长的思考会引入冗余甚至自我绕晕,任务匹配比堆预算更重要。
  • 以为推理模型不用写清需求——它依然依赖你把约束讲清楚,模糊 prompt 下思考也会跑偏。
  • 忽视成本——推理模型的思考 token 也计费,长思考 = 高账单,生产要设思考上限。

和 Coding Agent 的关系

Claude Code / Codex 这类编码 Agent 在难任务上会借助推理模型的扩展思考来拆解需求、规划文件改动、自我 review。复杂重构 / 多文件改动尤其吃推理能力。

怎么用:三步上手

  1. 先判断任务难度——确定性、模板化任务别上推理模型。
  2. 设思考预算——从中等 effort 起,难任务再调高,并监控延迟/成本。
  3. 把约束写进 prompt——推理模型照样需要清晰指令,模糊需求下思考会发散。

哪些模型支持

  • DeepSeek-R1(DeepSeek-R1)——开源推理模型,可自部署,是「推理能力可以自己跑」这一路线的代表。
  • Claude 系列(Opus 5.5 / Opus 5 / Haiku 4.5)——adaptive thinking,用 effort 调档,编码场景常用。
  • OpenAI o 系列及后续 GPT 系列——通用推理标杆,同样提供 effort 类档位。
  • 多数 2026 旗舰模型已把「推理档位」作为标准能力,是否可关闭则因模型而异(见上文表格)。

FAQ

推理模型一定比普通模型准吗? 不一定。在简单任务上,多想不会更准,只会更慢更贵。收益出现在「需要多步推导、且单步错误会累积」的任务上——数学、复杂调试、长链条规划。分类、摘要、格式转换这类任务上,把预算花在推理上纯属浪费。

思考 token 计费吗? 计费。这是最容易失控的一项:长思考 = 高账单,且用户往往看不到思考过程。生产环境务必设思考上限与成本告警。

为什么我发 thinking: disabled 会报错? 因为 Opus 5.5 起 thinking 完全不可关闭,Opus 5 也只允许在 effort ≤ high 时关闭。改用 effort 参数控制推理深度即可,详见上文表格。

effort 是不是调越高越好? 不是。过高 effort 可能耗尽输出上限却什么也不返回(见上文 max effort 陷阱),而且成本是线性甚至超线性上升。默认档起步,遇到明确失败再上调。

开源推理模型能追上闭源吗?DeepSeek-R1 证明了「可自部署的强推理」这条路走得通,但代差依然存在。选型标准应是你的数据能不能出网——能出网就看绝对能力,不能出网则开源自部署是唯一解。

延伸阅读

来源

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Cursor vs Claude Code:什么时候用哪个?(2026 实测选型)

Cursor 和 Claude Code 到底怎么选?一句话结论 + 决策树 + 价格实测 + 国内可用性对比。GUI 派选 Cursor,终端长任务派选 Claude Code,最优解其实是共存。

Devin vs Claude Code:AI 编程 Agent 怎么选?异步自主 vs 终端同步对比

Devin vs Claude Code 2026 选型对比:Cognition 异步自主 Cloud Agent vs Anthropic 终端同步 CLI Agent,从形态、工作模式、长任务能力、并发、价格、中文支持和适合人群 8 个维度判断,帮你选对 AI 编程 Agent。