Claude Opus 5.5
Anthropic 于 2026-09-22 发布的 Claude 5.5 家族首款模型 claude-opus-5-5:输入 $4 / 输出 $20 每百万 token,缓存读降至 $0.20,官方称多数任务达到 Fable 5.1 水平而典型负载成本比 Opus 5 低约 40%,Terminal-Bench 4.0 达 66.4%。
发布 2026-09-24更新 2026-09-30核实 2026-09-30规格
- 厂商
- Anthropic
- 发布日期
- 2026/9/22
- 类型
- coding
- 上下文窗口
- 1000K tokens
- 最大输出
- 128K tokens
- 定价
- 输入 $4 / 输出 $20 每百万 token(缓存读 $0.20、缓存写 $5);Fast 模式 $8/$40
- API 兼容
- anthropic, bedrock, vertex-ai, azure-ai-foundry
基准测试
优势
- •官方口径「多数任务达到 Fable 5.1 水平」,典型负载成本比 Opus 5 低约 40%
- •三项编程基准全部登顶:Terminal-Bench 4.0 66.4%、FrontierCode v1.1 54.4%、CursorBench 4.0 57.8%
- •缓存读降价 60% 至 $0.20/M,长会话 agentic 场景成本结构改善最明显
- •1M 上下文 + 128K 最大输出(Claude Code v2.1.280 与 Claude API 2026-09-22 release notes 口径)
- •首个带 Fable 5.1 级 safeguards 的 Opus:网络安全/生物/蒸馏三类回退,越界尝试比 Opus 5 少约 85%
- •零数据保留(ZDR)继续可用,AWS / Google Cloud / Azure 同日上线
不足
- •上下文窗口与最大输出未写在消费者向发布页正文,需从 Claude Code CHANGELOG 与 API release notes 取证(口径见正文)
- •max thinking 档可能跑空 128K 输出上限:Simon Willison 实测两次无输出,各耗 $2.56 / 近 20 分钟
- •Artificial Analysis 指出其输出冗长——智能指数跑完共生成 2.6 亿 token,中位数仅 8800 万
- •网络安全任务大多被回退到 Claude Opus 4.8,生物类受限用途需申请 Life Sciences 计划
- •thinking 模式不可关闭;官方也承认基准差距未必等于真实体验差距
适用场景
概述
Claude Opus 5.5(模型 ID claude-opus-5-5)是 Anthropic 于 2026 年 9 月 22 日发布的旗舰模型,Claude 5.5 家族的第一款。官方给它的定位是一句话:「在多数任务上达到 Claude Fable 5.1 的水平,而运行成本比 Opus 5 低 40%」——不是单纯堆能力,而是把上一代旗舰的能力向下压到一个能日常跑的价格。
发布当天即上线全部平台:Claude 官方订阅体系、Claude Code、Claude Platform(API),以及 AWS、Google Cloud、Microsoft Azure 三家云。零数据保留(ZDR) 选项继续可用。官方同时预告 Claude Sonnet 5.5 与 Claude Haiku 5.5 将在未来数周跟进,带来大部分相同的性能、效率与安全改进。
2026-09-30 更新(家族进度):Claude Sonnet 5.5 已于 2026-09-28 发布(模型 ID
claude-sonnet-5-5,$2/$10、缓存读 $0.20、1M 上下文,官方称输出提速 30%+ 且同任务更省 token),并即日成为 Anthropic API 上的默认 Sonnet。至此 「Opus 5.5 → Sonnet 5.5」两档已完成换代,家族第三款 Haiku 5.5 仍未发布——路透社 2026-09-28 报道称其「即将推出(due soon)」,官方未给日期。选型提示:Sonnet 5.5 与 Opus 5.5 差价为 2 倍($2/$10 vs $4/$20),但两者缓存读同为 $0.20,长会话场景下「Opus 做判断 + Sonnet 做执行」的混合编排比单独换 Opus 更划算。详见 Sonnet 5.5 发布资讯。
关于发布时间的口径:Anthropic 官方发布页标注 September 22, 2026(太平洋时间),国内媒体多在 9 月 23 日报道。引用时建议写明时区或「美西时间 9-22 / 国内 9-23」,避免读者对不上同一天(GPT-6 Sol 与 Luna 亦同)。
这一代还有个不能忽略的背景:Opus 5.5 是 Anthropic CEO Dario Amodei 公开承诺「pacing the frontier」(主动校准能力提升节奏,让对齐与安全实践跟得上)之后发布的第一款模型,发布前接受了 METR 与 Frontier Design 等外部机构评测。它也是首个在网络安全、生物、蒸馏三类上套用 Fable 5.1 级 safeguards 的 Opus 模型。
核心能力
长程任务:这一代真正的主战场
官方给出的案例全部指向「几小时到一天」级别的活:
- 早期测试者用它审计并修复一个 20 万行代码库,耗时不到 3 小时;同样的活 Opus 5 需要 20 小时以上、多消耗 2.5 倍 token;
- 另有测试者完成了 68 万行代码的迁移,不到一天完成;
- 内部对照测试:把负载均衡软件 HAProxy 从 C 翻译成 Rust,Opus 5.5 用 9.5 小时、Fable 5.1 用 12 小时,两者都几乎通过了 HAProxy 自身的回归测试,而 Opus 5.5 成本低 51%。
结论很直接:长任务不再是「能不能做」,而是「做一次多少钱」——这也是缓存读降价 60% 的意义所在(长会话里 90% 以上的输入 token 按缓存价计费)。
编程基准:三项全登顶,但口径必须写清
| 基准 | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| FrontierCode v1.1 (Main) | 54.4% | 50.3% | 48.0% | 53.3% | 47.5% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | — | 41.7% |
| AutomationBench | 40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
| Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% | 22.4% |
口径提醒(引用前必读):官方表中 Opus 5.5 除特别说明外均为 adaptive thinking @ max effort,而 Terminal-Bench 4.0 为 xhigh effort,标准误 ±2.6。正文里的成本对比图又给了一组 default effort(medium) 数字:FrontierCode 54.6%、CursorBench 52.5%。因此「Opus 5.5 跑了多少分」必须带上 effort 档位,否则与官方表对不上。GPT-6 Astra 与 GPT-5.6 Sol 的数字来自 OpenAI 自报。
值得注意的是 AutomationBench 与 Terminal-Bench-Science 两项上 GPT-6 Astra 更高(41.4% / 64.6%)。Anthropic 自己在脚注里说明:AutomationBench 由 Zapier 运行、无 fallback 模型且把 safeguards 干预计为失败,因此得分低于实际表现。别只挑自己赢的那三项看。
知识工作与 computer use
- GDPval-AA v2.1:1846 Elo,高于 Fable 5.1 的 1735、Opus 5 的 1708;
- HLE(带工具):67.7%,高于 Fable 5.1 的 65.6%、Opus 5 的 63.6%、GPT-6 Astra 的 57.2%;
- OSWorld 2.0(partial):81.8%;Chartography(图表识别,带工具)89.0%;
- 写作风格被专门调过:官方称针对长期被吐槽的「Claudish」腔调做了优化,先给结论、少术语、更严格遵循格式与长度指令。
安全:能力越强,回退越多
这是本代与既往 Opus 最大的结构性差异:
- 网络安全:多数网络安全任务会被透明回退到 Claude Opus 4.8;常规软件开发流程里识别与修复 bug 不受影响。认证从业人员可走即将扩容的 Cyber Verification Program;
- 生物:采用与 Fable 5.1 同级的生物安全护栏;受限研发用途需申请 Life Sciences Verification Program(现已开放申请);
- 蒸馏防护:带 preserved thinking 反蒸馏保护,阻止 API 用户编辑先前上下文以套取推理链,适用于 2026-08-31 及之后创建的 API 账户;
- 行为审计:近 2000 个场景的自动化审计中,Opus 5.5 在几乎所有 misaligned behavior 指标上优于近期所有 Claude 模型;围堵边界评测里尝试越界的次数比 Opus 5 或 Claude Mythos 5.1 少约 85%,且每次都为低严重性并自我报告;
- 提示注入:Gray Swan 基准中与 Fable 5.1 并列受测模型里注入成功率最低。
官方也留了一句实话:它常表现出「怀疑自己正在被评估」,这会让部署前评测对真实行为的预测力下降——safeguards 不等于免检。
API 调用示例
from anthropic import Anthropic
client = Anthropic(api_key="sk-ant-...")
resp = client.messages.create(
model="claude-opus-5-5",
max_tokens=16000,
thinking={"type": "adaptive"}, # 5.5 起 thinking 不可关闭
messages=[
{"role": "user", "content": "审查这个仓库的鉴权模块,给出风险清单与补丁"},
],
)
print(resp.content[-1].text)
模型 ID 为
claude-opus-5-5,在 AWS Bedrock、Google Cloud Vertex AI 与 Microsoft Foundry 上使用同一标识符(各家可能有自己的部署名前缀,接入前以云厂商控制台为准)。
定价(2026-09-24 核对)
| 项目 | Claude Opus 5.5 | Claude Opus 5 | 变化 |
|---|---|---|---|
| 输入(每百万 token) | $4 | $5 | −20% |
| 输出(每百万 token) | $20 | $25 | −20% |
| 缓存读 | $0.20 | $0.50 | −60% |
| 缓存写 | $5 | $6.25 | −20% |
| Fast 模式(Claude Code / Platform) | $8 / $40(最高 2.5x 速度) | — | 新增档位 |
「降 40%」是怎么算出来的:官方口径是 典型负载在默认设置下比 Opus 5 便宜约 40%——它不只来自 20% 的标价下调,还包括每任务消耗 token 更少与输出生成快 30% 以上。此外 Anthropic 同步上调了 Pro、Max、Team 与按席位 Enterprise 的 5 小时用量上限约 20%,并让订阅者自选一次配额重置时间。
2026-09-25 补记:SDK 与 API 侧的同日跟进
发布当天,Anthropic 的四个官方 SDK 也做了同日对齐,升级时值得一起处理:
| 包 | 版本 | 与 Opus 5.5 相关的要点 |
|---|---|---|
anthropic-sdk-python | v1.8.0 | 支持 claude-opus-5-5、inline tool 定义、MCP tool-list pinning(beta)、共享 evaluated_permission 枚举;修复 Python 3.13 开流崩溃 |
anthropic-sdk-typescript | v0.128.0 | 同上,并同步发布 Vertex / Bedrock / Google Cloud / Foundry / AWS 伴侣版本 |
claude-agent-sdk-python | v0.2.158 | 新增 ClaudeAgentOptions.verbatim_prompts:把用户消息原样送给 CLI,禁用 @path 文件展开与 slash 命令派发,使不可信文本无法触发意外的文件读取或命令执行;内置 CLI 2.1.280 |
claude-agent-sdk-typescript | v0.3.280 | 新增 fireReason(定时任务通知来源)、verbatimPrompts、alpha 的 readMcpResource() |
对安全敏感的两点:
verbatim_prompts值得默认打开——只要你的 Agent 会把外部文本(issue 正文、PR 描述、网页抓取结果)拼进提示词,就存在「文本里写着@/etc/passwd或/delete-everything就被当指令执行」的风险;该选项从入口把这条路径堵死。- inline tools beta:通过
inline-tools-2026-09-15请求头,可以把工具定义写进会话中途的 system message,不必改顶层tools数组、也不会让 prompt cache 失效;配套的mcp-client-2026-09-15头支持 MCP 工具集定义与新的mcp_tool_listing响应块。对「工具很多且经常变」的 Agent 架构,这直接省掉一批缓存重建成本。
适合 / 不适合
适合
- 代码库级迁移、审计、重构等数小时级长程 agentic 任务(本代主打);
- 把 Claude Code、Cline 等 CLI 的默认模型换到 5.5(成本与效果的新平衡点);
- 需要 Fable 级质量但预算只到 Opus 档的团队;
- 知识工作与专业文档产出(GDPval 1846 Elo);
- 对合规有要求的场景:ZDR + 三家云 + 分级 safeguards。
不适合
- 成本敏感的高频跑量:Gemini 3.8 Flash 等价位仍是量级差异;
- 网络安全与生物类受限任务:会被回退或拦下,别指望绕过;
- 需要关闭 thinking 的低延迟场景:本代已不提供关闭选项;
- 只看单项基准就拍板:Astra 在 AutomationBench 与 Terminal-Bench-Science 上更高,按自家 eval 定。
避坑清单
- max effort 慎用:Simon Willison 用「画一只骑自行车的鹈鹕 SVG」的固定测试跑 Opus 5.5,max thinking 档两次都没返回任何结果——耗尽 128K 输出上限仍在推理,每次花掉 $2.56、耗时近 20 分钟。他据此判断 max effort 在该场景「基本不可用」,但仍把 Opus 5.5 设为 Claude Code 默认模型。默认 effort 起步,别一上来就拉满。
- 冗长会吃掉降价红利:Artificial Analysis 测出它跑完智能指数共生成 2.6 亿 token,同类中位数仅 8800 万。token 单价降了,不代表账单一定降。
- 上下文与输出上限的取证路径不常规:消费者向发布页正文没有直接写这两个数,本站此前因此留空。2026-09-25 补记:Claude Code v2.1.280 官方 CHANGELOG 条目明确写「Added Claude Opus 5.5 (claude-opus-5-5), now the default Opus model — 1M context, $4/$20 per Mtok with $0.20/Mtok cache reads」,同日 Claude API release notes 给出 128K max output,故本站按 1M 上下文 / 128K 输出填写并保留此取证说明。若你的平台控制台显示的数值不同,以平台为准。
- 5.5 的 API 有三处破坏性变更:
thinking: {"type":"disabled"}直接返回 400(thinking 不可关闭,要调行为请用effort参数);tool_choice的any与tool类型返回 400,只支持auto且严格工具调用;computer use 必须使用computer_toolset_20260801工具集(旧computer_20251124在 Claude API 与 Google Cloud 上返回 400,仅 Bedrock 仍可用)。从 Opus 5 / 4.x 升级的代码必须逐条过一遍。 - 基准数字必须带 effort 档:表里的 66.4% 是 xhigh,正文里的 54.6% / 52.5% 是 medium,混用会被读者抓到不一致。
- 旧账户没有反蒸馏保护:preserved thinking 仅适用于 2026-08-31 之后创建的 API 账户。
- 不要把它当「最安全」代名词:官方明说它常怀疑自己在被评估,部署前评测的外推能力有限。
相关阅读
- 同门旗舰:Claude Fable 5.1 · Claude Sonnet 5 · Claude Opus 4.5
- 同日对手:GPT-6 Sol · GPT-6 Luna · GPT-6 Astra
- 搭载工具:Claude Code · Cline · Kiro · OpenRouter
- 概念:Terminal-Bench · Agentic Coding · Prompt Caching
- 资讯:Claude Opus 5.5 与 GPT-6 Sol/Luna 同日发布
来源
- Introducing Claude Opus 5.5(Anthropic 官方,2026-09-22)
- Opus 5.5 system card(Anthropic 官方)
- Claude Opus 5.5 平台文档(Anthropic,模型参数与 thinking 说明)
- Simon Willison 实测:Opus 5.5 max thinking 两次跑空(2026-09)
- Artificial Analysis 智能指数:Opus 5.5 列 212 款同类第一(2026-09)
- AI“减速”讨论未歇,OpenAI、Anthropic 同日上新(澎湃新闻,2026-09-23)
- Claude Code v2.1.280 官方 CHANGELOG(1M 上下文与 $4/$20 的取证来源,2026-09-22)
- Claude API release notes:Opus 5.5 破坏性变更与 inline tools beta(Anthropic,2026-09-22)
本卡片由 AI 之家 编辑部根据公开资料整理,非厂商付费内容。上下文窗口与最大输出以 Claude Code v2.1.280 CHANGELOG 与 Claude API 2026-09-22 release notes 为准(发布页正文未直接列出);定价与基准以 Anthropic 官方页面为准,欢迎在 反馈邮箱 反馈更新。
相关工具
Aider vs Claude Code:终端 AI 编程双雄怎么选
Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。
Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比
Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。
Claude Code vs Codex CLI:终端 AI Agent 双雄对比
Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。
Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)
Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。
Cursor vs Claude Code:什么时候用哪个?(2026 实测选型)
Cursor 和 Claude Code 到底怎么选?一句话结论 + 决策树 + 价格实测 + 国内可用性对比。GUI 派选 Cursor,终端长任务派选 Claude Code,最优解其实是共存。
Devin vs Claude Code:AI 编程 Agent 怎么选?异步自主 vs 终端同步对比
Devin vs Claude Code 2026 选型对比:Cognition 异步自主 Cloud Agent vs Anthropic 终端同步 CLI Agent,从形态、工作模式、长任务能力、并发、价格、中文支持和适合人群 8 个维度判断,帮你选对 AI 编程 Agent。