跳到主内容
codingAnthropic

Claude Opus 5.5

Anthropic 于 2026-09-22 发布的 Claude 5.5 家族首款模型 claude-opus-5-5:输入 $4 / 输出 $20 每百万 token,缓存读降至 $0.20,官方称多数任务达到 Fable 5.1 水平而典型负载成本比 Opus 5 低约 40%,Terminal-Bench 4.0 达 66.4%。

发布 2026-09-24更新 2026-09-30核实 2026-09-30

规格

厂商
Anthropic
发布日期
2026/9/22
类型
coding
上下文窗口
1000K tokens
最大输出
128K tokens
定价
输入 $4 / 输出 $20 每百万 token(缓存读 $0.20、缓存写 $5);Fast 模式 $8/$40
API 兼容
anthropic, bedrock, vertex-ai, azure-ai-foundry

基准测试

66.4%(xhigh effort,±2.6;Fable 5.1 55.8%、Opus 5 52.3%、GPT-6 Astra 57.9%)
Terminal-Bench 4.0
54.4%(Fable 5.1 50.3%、Opus 5 48.0%、GPT-6 Astra 53.3%)
FrontierCode v1.1 (Main)
57.8%(max effort;medium effort 为 52.5%)
CursorBench 4.0
81.8%(Fable 5.1 80.7%、Opus 5 74.0%)
OSWorld 2.0 (partial)
67.7%(Fable 5.1 65.6%、Opus 5 63.6%、GPT-6 Astra 57.2%)
Humanity's Last Exam(带工具)
1846(Fable 5.1 1735、Opus 5 1708)
GDPval-AA v2.1(Elo)
40.0%(Fable 5.1 31.4%、Opus 5 26.9%、GPT-6 Astra 41.4%)
AutomationBench
58 分(212 款同类中第一,max effort)
Artificial Analysis 智能指数

优势

  • •官方口径「多数任务达到 Fable 5.1 水平」,典型负载成本比 Opus 5 低约 40%
  • •三项编程基准全部登顶:Terminal-Bench 4.0 66.4%、FrontierCode v1.1 54.4%、CursorBench 4.0 57.8%
  • •缓存读降价 60% 至 $0.20/M,长会话 agentic 场景成本结构改善最明显
  • •1M 上下文 + 128K 最大输出(Claude Code v2.1.280 与 Claude API 2026-09-22 release notes 口径)
  • •首个带 Fable 5.1 级 safeguards 的 Opus:网络安全/生物/蒸馏三类回退,越界尝试比 Opus 5 少约 85%
  • •零数据保留(ZDR)继续可用,AWS / Google Cloud / Azure 同日上线

不足

  • •上下文窗口与最大输出未写在消费者向发布页正文,需从 Claude Code CHANGELOG 与 API release notes 取证(口径见正文)
  • •max thinking 档可能跑空 128K 输出上限:Simon Willison 实测两次无输出,各耗 $2.56 / 近 20 分钟
  • •Artificial Analysis 指出其输出冗长——智能指数跑完共生成 2.6 亿 token,中位数仅 8800 万
  • •网络安全任务大多被回退到 Claude Opus 4.8,生物类受限用途需申请 Life Sciences 计划
  • •thinking 模式不可关闭;官方也承认基准差距未必等于真实体验差距

适用场景

代码库级迁移、审计与重构等数小时级长程 agentic 任务Claude Code / Codex 类 CLI 的默认主力模型(成本与效果平衡点)知识工作与文档产出:GDPval-AA v2.1 1846 Elocomputer use 与图表识别:OSWorld 2.0 81.8%(partial)、Chartography 89.0%

概述

Claude Opus 5.5(模型 ID claude-opus-5-5)是 Anthropic 于 2026 年 9 月 22 日发布的旗舰模型,Claude 5.5 家族的第一款。官方给它的定位是一句话:「在多数任务上达到 Claude Fable 5.1 的水平,而运行成本比 Opus 5 低 40%」——不是单纯堆能力,而是把上一代旗舰的能力向下压到一个能日常跑的价格。

发布当天即上线全部平台:Claude 官方订阅体系、Claude Code、Claude Platform(API),以及 AWS、Google Cloud、Microsoft Azure 三家云。零数据保留(ZDR) 选项继续可用。官方同时预告 Claude Sonnet 5.5 与 Claude Haiku 5.5 将在未来数周跟进,带来大部分相同的性能、效率与安全改进。

2026-09-30 更新(家族进度):Claude Sonnet 5.5 已于 2026-09-28 发布(模型 ID claude-sonnet-5-5,$2/$10、缓存读 $0.20、1M 上下文,官方称输出提速 30%+ 且同任务更省 token),并即日成为 Anthropic API 上的默认 Sonnet。至此 「Opus 5.5 → Sonnet 5.5」两档已完成换代,家族第三款 Haiku 5.5 仍未发布——路透社 2026-09-28 报道称其「即将推出(due soon)」,官方未给日期。选型提示:Sonnet 5.5 与 Opus 5.5 差价为 2 倍($2/$10 vs $4/$20),但两者缓存读同为 $0.20,长会话场景下「Opus 做判断 + Sonnet 做执行」的混合编排比单独换 Opus 更划算。详见 Sonnet 5.5 发布资讯。

关于发布时间的口径:Anthropic 官方发布页标注 September 22, 2026(太平洋时间),国内媒体多在 9 月 23 日报道。引用时建议写明时区或「美西时间 9-22 / 国内 9-23」,避免读者对不上同一天(GPT-6 Sol 与 Luna 亦同)。

这一代还有个不能忽略的背景:Opus 5.5 是 Anthropic CEO Dario Amodei 公开承诺「pacing the frontier」(主动校准能力提升节奏,让对齐与安全实践跟得上)之后发布的第一款模型,发布前接受了 METR 与 Frontier Design 等外部机构评测。它也是首个在网络安全、生物、蒸馏三类上套用 Fable 5.1 级 safeguards 的 Opus 模型。

核心能力

长程任务:这一代真正的主战场

官方给出的案例全部指向「几小时到一天」级别的活:

  • 早期测试者用它审计并修复一个 20 万行代码库,耗时不到 3 小时;同样的活 Opus 5 需要 20 小时以上、多消耗 2.5 倍 token;
  • 另有测试者完成了 68 万行代码的迁移,不到一天完成;
  • 内部对照测试:把负载均衡软件 HAProxy 从 C 翻译成 Rust,Opus 5.5 用 9.5 小时、Fable 5.1 用 12 小时,两者都几乎通过了 HAProxy 自身的回归测试,而 Opus 5.5 成本低 51%。

结论很直接:长任务不再是「能不能做」,而是「做一次多少钱」——这也是缓存读降价 60% 的意义所在(长会话里 90% 以上的输入 token 按缓存价计费)。

编程基准:三项全登顶,但口径必须写清

基准Opus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
Terminal-Bench 4.066.4%55.8%52.3%57.9%37.3%
FrontierCode v1.1 (Main)54.4%50.3%48.0%53.3%47.5%
CursorBench 4.057.8%51.8%46.6%—41.7%
AutomationBench40.0%31.4%26.9%41.4%28.8%
Terminal-Bench-Science 0.158.7%52.6%29.0%64.6%22.4%

口径提醒(引用前必读):官方表中 Opus 5.5 除特别说明外均为 adaptive thinking @ max effort,而 Terminal-Bench 4.0 为 xhigh effort,标准误 ±2.6。正文里的成本对比图又给了一组 default effort(medium) 数字:FrontierCode 54.6%、CursorBench 52.5%。因此「Opus 5.5 跑了多少分」必须带上 effort 档位,否则与官方表对不上。GPT-6 Astra 与 GPT-5.6 Sol 的数字来自 OpenAI 自报。

值得注意的是 AutomationBench 与 Terminal-Bench-Science 两项上 GPT-6 Astra 更高(41.4% / 64.6%)。Anthropic 自己在脚注里说明:AutomationBench 由 Zapier 运行、无 fallback 模型且把 safeguards 干预计为失败,因此得分低于实际表现。别只挑自己赢的那三项看。

知识工作与 computer use

  • GDPval-AA v2.1:1846 Elo,高于 Fable 5.1 的 1735、Opus 5 的 1708;
  • HLE(带工具):67.7%,高于 Fable 5.1 的 65.6%、Opus 5 的 63.6%、GPT-6 Astra 的 57.2%;
  • OSWorld 2.0(partial):81.8%;Chartography(图表识别,带工具)89.0%;
  • 写作风格被专门调过:官方称针对长期被吐槽的「Claudish」腔调做了优化,先给结论、少术语、更严格遵循格式与长度指令。

安全:能力越强,回退越多

这是本代与既往 Opus 最大的结构性差异:

  • 网络安全:多数网络安全任务会被透明回退到 Claude Opus 4.8;常规软件开发流程里识别与修复 bug 不受影响。认证从业人员可走即将扩容的 Cyber Verification Program;
  • 生物:采用与 Fable 5.1 同级的生物安全护栏;受限研发用途需申请 Life Sciences Verification Program(现已开放申请);
  • 蒸馏防护:带 preserved thinking 反蒸馏保护,阻止 API 用户编辑先前上下文以套取推理链,适用于 2026-08-31 及之后创建的 API 账户;
  • 行为审计:近 2000 个场景的自动化审计中,Opus 5.5 在几乎所有 misaligned behavior 指标上优于近期所有 Claude 模型;围堵边界评测里尝试越界的次数比 Opus 5 或 Claude Mythos 5.1 少约 85%,且每次都为低严重性并自我报告;
  • 提示注入:Gray Swan 基准中与 Fable 5.1 并列受测模型里注入成功率最低。

官方也留了一句实话:它常表现出「怀疑自己正在被评估」,这会让部署前评测对真实行为的预测力下降——safeguards 不等于免检。

API 调用示例

from anthropic import Anthropic

client = Anthropic(api_key="sk-ant-...")

resp = client.messages.create(
    model="claude-opus-5-5",
    max_tokens=16000,
    thinking={"type": "adaptive"},   # 5.5 起 thinking 不可关闭
    messages=[
        {"role": "user", "content": "审查这个仓库的鉴权模块,给出风险清单与补丁"},
    ],
)
print(resp.content[-1].text)

模型 ID 为 claude-opus-5-5,在 AWS Bedrock、Google Cloud Vertex AI 与 Microsoft Foundry 上使用同一标识符(各家可能有自己的部署名前缀,接入前以云厂商控制台为准)。

定价(2026-09-24 核对)

项目Claude Opus 5.5Claude Opus 5变化
输入(每百万 token)$4$5−20%
输出(每百万 token)$20$25−20%
缓存读$0.20$0.50−60%
缓存写$5$6.25−20%
Fast 模式(Claude Code / Platform)$8 / $40(最高 2.5x 速度)—新增档位

「降 40%」是怎么算出来的:官方口径是 典型负载在默认设置下比 Opus 5 便宜约 40%——它不只来自 20% 的标价下调,还包括每任务消耗 token 更少与输出生成快 30% 以上。此外 Anthropic 同步上调了 Pro、Max、Team 与按席位 Enterprise 的 5 小时用量上限约 20%,并让订阅者自选一次配额重置时间。

2026-09-25 补记:SDK 与 API 侧的同日跟进

发布当天,Anthropic 的四个官方 SDK 也做了同日对齐,升级时值得一起处理:

包版本与 Opus 5.5 相关的要点
anthropic-sdk-pythonv1.8.0支持 claude-opus-5-5、inline tool 定义、MCP tool-list pinning(beta)、共享 evaluated_permission 枚举;修复 Python 3.13 开流崩溃
anthropic-sdk-typescriptv0.128.0同上,并同步发布 Vertex / Bedrock / Google Cloud / Foundry / AWS 伴侣版本
claude-agent-sdk-pythonv0.2.158新增 ClaudeAgentOptions.verbatim_prompts:把用户消息原样送给 CLI,禁用 @path 文件展开与 slash 命令派发,使不可信文本无法触发意外的文件读取或命令执行;内置 CLI 2.1.280
claude-agent-sdk-typescriptv0.3.280新增 fireReason(定时任务通知来源)、verbatimPrompts、alpha 的 readMcpResource()

对安全敏感的两点:

  • verbatim_prompts 值得默认打开——只要你的 Agent 会把外部文本(issue 正文、PR 描述、网页抓取结果)拼进提示词,就存在「文本里写着 @/etc/passwd 或 /delete-everything 就被当指令执行」的风险;该选项从入口把这条路径堵死。
  • inline tools beta:通过 inline-tools-2026-09-15 请求头,可以把工具定义写进会话中途的 system message,不必改顶层 tools 数组、也不会让 prompt cache 失效;配套的 mcp-client-2026-09-15 头支持 MCP 工具集定义与新的 mcp_tool_listing 响应块。对「工具很多且经常变」的 Agent 架构,这直接省掉一批缓存重建成本。

适合 / 不适合

适合

  • 代码库级迁移、审计、重构等数小时级长程 agentic 任务(本代主打);
  • 把 Claude Code、Cline 等 CLI 的默认模型换到 5.5(成本与效果的新平衡点);
  • 需要 Fable 级质量但预算只到 Opus 档的团队;
  • 知识工作与专业文档产出(GDPval 1846 Elo);
  • 对合规有要求的场景:ZDR + 三家云 + 分级 safeguards。

不适合

  • 成本敏感的高频跑量:Gemini 3.8 Flash 等价位仍是量级差异;
  • 网络安全与生物类受限任务:会被回退或拦下,别指望绕过;
  • 需要关闭 thinking 的低延迟场景:本代已不提供关闭选项;
  • 只看单项基准就拍板:Astra 在 AutomationBench 与 Terminal-Bench-Science 上更高,按自家 eval 定。

避坑清单

  1. max effort 慎用:Simon Willison 用「画一只骑自行车的鹈鹕 SVG」的固定测试跑 Opus 5.5,max thinking 档两次都没返回任何结果——耗尽 128K 输出上限仍在推理,每次花掉 $2.56、耗时近 20 分钟。他据此判断 max effort 在该场景「基本不可用」,但仍把 Opus 5.5 设为 Claude Code 默认模型。默认 effort 起步,别一上来就拉满。
  2. 冗长会吃掉降价红利:Artificial Analysis 测出它跑完智能指数共生成 2.6 亿 token,同类中位数仅 8800 万。token 单价降了,不代表账单一定降。
  3. 上下文与输出上限的取证路径不常规:消费者向发布页正文没有直接写这两个数,本站此前因此留空。2026-09-25 补记:Claude Code v2.1.280 官方 CHANGELOG 条目明确写「Added Claude Opus 5.5 (claude-opus-5-5), now the default Opus model — 1M context, $4/$20 per Mtok with $0.20/Mtok cache reads」,同日 Claude API release notes 给出 128K max output,故本站按 1M 上下文 / 128K 输出填写并保留此取证说明。若你的平台控制台显示的数值不同,以平台为准。
  4. 5.5 的 API 有三处破坏性变更:thinking: {"type":"disabled"} 直接返回 400(thinking 不可关闭,要调行为请用 effort 参数);tool_choice 的 any 与 tool 类型返回 400,只支持 auto 且严格工具调用;computer use 必须使用 computer_toolset_20260801 工具集(旧 computer_20251124 在 Claude API 与 Google Cloud 上返回 400,仅 Bedrock 仍可用)。从 Opus 5 / 4.x 升级的代码必须逐条过一遍。
  5. 基准数字必须带 effort 档:表里的 66.4% 是 xhigh,正文里的 54.6% / 52.5% 是 medium,混用会被读者抓到不一致。
  6. 旧账户没有反蒸馏保护:preserved thinking 仅适用于 2026-08-31 之后创建的 API 账户。
  7. 不要把它当「最安全」代名词:官方明说它常怀疑自己在被评估,部署前评测的外推能力有限。

相关阅读

来源

本卡片由 AI 之家 编辑部根据公开资料整理,非厂商付费内容。上下文窗口与最大输出以 Claude Code v2.1.280 CHANGELOG 与 Claude API 2026-09-22 release notes 为准(发布页正文未直接列出);定价与基准以 Anthropic 官方页面为准,欢迎在 反馈邮箱 反馈更新。

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Cursor vs Claude Code:什么时候用哪个?(2026 实测选型)

Cursor 和 Claude Code 到底怎么选?一句话结论 + 决策树 + 价格实测 + 国内可用性对比。GUI 派选 Cursor,终端长任务派选 Claude Code,最优解其实是共存。

Devin vs Claude Code:AI 编程 Agent 怎么选?异步自主 vs 终端同步对比

Devin vs Claude Code 2026 选型对比:Cognition 异步自主 Cloud Agent vs Anthropic 终端同步 CLI Agent,从形态、工作模式、长任务能力、并发、价格、中文支持和适合人群 8 个维度判断,帮你选对 AI 编程 Agent。