跳到主内容

Claude Sonnet 5.5 发布:同价 $2/$10 取代 Sonnet 5,输出提速 30%+,Claude Code 同步换默认 Sonnet

Anthropic 于 2026-09-28 发布 Claude 5.5 家族第二款模型 Claude Sonnet 5.5(claude-sonnet-5-5):定价维持 $2/$10、缓存读 $0.20,官方称输出快 30%+ 且同任务更省 token,即日成为 Anthropic API 默认 Sonnet。

2026-09-30 · Anthropic 官方发布页 / Claude Code 官方 CHANGELOG(GitHub)

发布 2026-09-30核实 2026-09-30

要点

  • Anthropic 于 2026-09-28 发布 Claude Sonnet 5.5,模型 ID claude-sonnet-5-5。这是 Claude 5.5 家族的第二款——首款 Claude Opus 5.5 于 2026-09-22 发布,两款相隔仅六天。
  • 定价一分没涨:输入 $2 / 输出 $10 每百万 token,缓存读 $0.20,缓存写 $2.50。与 Sonnet 5 完全同价。
  • 官方给的两个改进方向:输出生成快 30% 以上,以及完成同样的工作用更少的 token。也就是说同价位下,每任务成本下降。
  • 即日成为 Anthropic API 上默认的 Sonnet 模型:据 Claude Code v2.1.284 的官方 CHANGELOG 条目,claude-sonnet-5-5 已是 Anthropic API 的默认 Sonnet,1M 上下文、$2/$10、缓存读 $0.20。
  • 上下文口径简化:据官方模型配置文档(本站经 Claude Code v2.1.284 发布说明转引),在 Anthropic API 上 Sonnet 5.5 与 Sonnet 5 一律以 1M 上下文运行——没有 200K 变体、没有 [1m] 后缀可选、任何套餐都不需要额外用量额度。该段为转引,待与官方文档原文核对。
  • effort 默认值分场景:Claude Code 与 Claude 各端应用中默认为 Medium,Claude Platform(API)默认为 High。
  • 同日 Claude Code 发布 v2.1.284(官方 CHANGELOG 一手),随后又发 v2.1.285:前者带来 Sonnet 5.5 默认化、auto mode「仅此一次」选项、/mcp reconnect all;后者新增 allowedProviders 托管设置与 claude --desktop 等。
  • 家族第三款 Haiku 5.5 仍未发布:路透社 2026-09-28 报道称其「即将推出」(due soon),官方未给具体日期。

背景与分析

一个反常的信号:换代不涨价

过去两年里,模型换代几乎等于「能力涨、价格也涨」。Sonnet 5.5 这次打破了惯例:同一价位、同一上下文、同一缓存价,只改效率。

官方发布页给出的定价表:

项Claude Sonnet 5.5Claude Opus 5.5
输入$2$4
输出$10$20
缓存读$0.20$0.20
缓存写$2.50$5

真正的关键句是官方那句「Sonnet 5.5 完成任务所需 token 少于 Sonnet 5,因此运行更便宜」。这意味着竞争指标从「每百万 token 单价」转到了「每任务成本」——和六天前 GPT-6 Sol 发布时 OpenAI 的叙事完全一致。选型时请按每任务成本估,不要只比标价。

客户实测数字:省 token 才是重点

官方发布页引用了五家早期客户的对比数据(厂商发布的客户引述,非第三方独立评测,读的时候要打个折):

客户场景引述要点
Zendesk客服工单工单处理快 20%
Balyasny Asset Management2441 项金融任务准确率优于 Sonnet 5;每答案约 12.1 万 token vs Sonnet 5 的 49.7 万
Box文档校对准确率高、快 2.4 倍、总 token 少 12%;会回查源文件里 Sonnet 5 漏掉的错误
Lovable编码 eval工具调用少约三分之一、shell 执行约少一半
AtlassianRovo Agents运行速度最多快 30%

其中 Balyasny 那条最值得开发团队注意:token 用量降到约四分之一。这是「同价更省」最硬的证据,也解释了为什么官方敢不降价。

effort 默认值:一个容易踩的账单坑

官方明确写了默认值分场景:Claude Code 与各端应用 = Medium,Claude Platform(API)= High。

对开发者的实际含义:

  • 从 API 切到 Claude Code 跑同一套任务,推理深度会下降——不是模型变了,是默认 effort 变了。
  • 反之,把在 Claude Code 里调好的 prompt 直接搬到 API,成本会上升。
  • 官方建议:低档适合例行工作(更快、更省 token),高档会推理更久并更多自查。

AI 之家 观点:这条比基准分数更影响日常账单。很多团队抱怨「同一个模型,在 CLI 里和在自己代码里表现不一样」,一半原因就在这种默认值分场景。建议把 effort 显式写进配置,别依赖默认值——尤其是跨 CLI / API 两种调用方式的项目。

基准数字(转引,标注待核实)

以下数字来自第三方对 Anthropic 官方公告的整理,本站未逐条核对官方原表,仅作方向性参考,做选型请以官方公告为准:

基准Sonnet 5.5(厂商自报)
Terminal-Bench 4.0(agentic coding)70.6%
FrontierCode 1.1 主集(xhigh)52.1%
CursorBench 4.055.5%
GDPval-AA v2.1(Elo)1844
AA-Briefcase v1.1(Elo)1811
Humanity's Last Exam(带工具)64.5%
OSWorld 2.1(部分)80.1%

同时转引来源提到两条官方自己的限定:max effort 下 FrontierCode 反而低于 xhigh(46.2% vs 52.1%),原因是更容易触发一个会超出任务范围的多子代理代码审查 skill;以及知识工作类分数由 Artificial Analysis 在预发布部署上跑,官方称该部署存在结构化输出 bug,结果被低估。

另有一条跨源的明显分歧:同一转引来源称 Sonnet 5 在 Terminal-Bench 4.0 上仅 10.3%,与本站 Terminal-Bench 条目此前收录的口径差距过大,本站不采信该对比值,待官方原表核实。

安全:不推能力前沿,所以评估重点不同

官方的说法很直接:Sonnet 5.5 没有推进模型能力的前沿,因此对齐评估聚焦在一组「任何能力水平都适用」的风险上——违背用户利益、误导用户、配合高风险滥用。

  • 自动行为审计覆盖约 1850 个场景,Sonnet 5.5 在对齐、抗滥用与诚实度多数指标上优于或持平 Sonnet 5;
  • 在 containment(容器逃逸)评估上接近 Opus 5.5,且是所有模型中最不可能试探容器边界的;
  • 官方仍承认:Opus 5.5 整体表现略好,且没有任何评估能可靠捕获全部失效。

Claude Code:v2.1.284 与 v2.1.285(官方 CHANGELOG 一手)

v2.1.284(本站 2026-09-30 核对所见):

  • 新增 Claude Sonnet 5.5,成为 Anthropic API 上的默认 Sonnet 模型(1M 上下文、$2/$10、缓存读 $0.20);
  • auto mode 在「读取工作目录外文件」的提示里新增 「Yes, but ask again next time」——此前只有「永久允许」与「每次拒绝」两个极端;
  • 网关场景的花费上限改为显示美元金额(如 $271.40 / $500.00 spent this month),状态栏 rate_limits.spend_limit 增加 used_usd / limit_usd / period;
  • /mcp reconnect all:一次重连所有连接失败或需要认证的 MCP 服务;
  • effort 滑块新增 effortSlider:decreaseEffort / increaseEffort / toggleUltracode 快捷键动作,可在 keybindings.json 里重绑;
  • 修复「Prompt is too long」在压缩后仍然报错——现在会再压缩一次,保留更少的近期对话。

v2.1.285(同日稍后,本站核对所见):

  • 新增 allowedProviders 托管设置,可限制这台机器能用哪些 API provider(Anthropic API、自定义端点、Bedrock、Mantle、Vertex AI、Foundry、Claude Platform on AWS、Cloud 网关);
  • 新增 CLAUDE_CODE_DISABLE_WEB_FETCH 环境变量,可彻底关闭 WebFetch 工具;
  • 新增 claude --desktop(在当前目录打开 Claude 桌面应用)、claude plugin configure <plugin>;
  • claude plugin install --config 支持 <server>.<key>=<value>,安装时即可写好打包 MCP 服务自己的配置;
  • 修复:托管设置文件被系统拒绝读取时直接拒绝启动 → 现在告警并跳过该文件策略;Remote Control 附件单次下载失败后会重试最多两次;切模型后仍沿用旧输出上限的问题等。

日期口径说明:Claude Code 官方 CHANGELOG 的版本标题下不标注发布日期,本节日期为**本站核对当日(2026-09-30)**所见的最新版本,非厂商公布的发布日。

对开发者的影响

  1. 不用改代码,但可能要改成本模型。 走 Anthropic API 默认 Sonnet 别名的调用会自动切到 5.5——每任务 token 下降意味着账单下降,但单请求延迟结构也变了,有 SLA 的场景先实测。
  2. 显式写 effort。 CLI 默认 Medium、API 默认 High,跨场景调用请显式指定。
  3. 升级 Claude Code 后回归两项:① 依赖 auto mode 的无人值守流程,确认新的「仅此一次」选项不会改变既有行为;② 企业网关场景确认 allowedProviders 与 availableModels 的组合是否仍符合策略。
  4. 别急着把 Haiku 4.5 换掉。 Haiku 5.5 尚未发布,官方只说「即将推出」。
  5. 基准数字等官方原表。 本文基准为转引,落地到选型文档前请回官方公告核对。

待核实

  • Sonnet 5.5 的官方基准原表:本站为转引,未逐条核对。
  • 「Anthropic API 上恒为 1M 上下文、无 [1m] 后缀」:转引自官方模型配置文档,待与 docs 原文核对。
  • Haiku 5.5 发布日期:官方仅称「即将推出」,无日期。
  • GitHub Copilot 与 Vercel AI Gateway 同日上线 Sonnet 5.5:来自第三方转引官方 changelog,本站未直接核对。
  • 批量 API 价(转引称 $1/$5,即 5 折):未在官方发布页出现,本站不采信。

来源

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Cursor vs Aider:GUI IDE 还是 CLI?2026 对比

Cursor vs Aider 2026 选型对比:GUI IDE vs Git 原生 CLI,从 Composer vs Architect 双模型、Tab 补全、多模型 BYOK、价格计费、开源与否和适合人群判断,帮开发者选对。Cursor 是闭源 VS Code fork 月费 $20,Aider 是开源 Apache-2.0 CLI 自带 API key。

Augment Code vs Cursor:企业 AI 编程怎么选?Context Engine vs AI IDE 对比

Augment Code vs Cursor 2026 选型对比:Context Engine 全仓索引的企业 AI 平台 vs SpaceX 收购的 AI IDE 天花板,从形态、Context 覆盖、长任务、价格、合规、中文支持和适合人群 8 个维度判断,帮你选对企业 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

相关评测