跳到主内容
codingOpenAI

GPT-6 Sol

OpenAI 于 2026-09-22 发布的 GPT-6 中阶主力 gpt-6-sol:API 价 $2 输入 / $10 输出每百万 token,较 GPT-5.6 Sol 促销价腰斩,1.05M 上下文 / 128K 输出,官方定位复杂编程与 agentic 工作流,已在 Codex、ChatGPT Work 与 API 上线。

发布 2026-09-24更新 2026-09-30核实 2026-09-30

规格

厂商
OpenAI
发布日期
2026/9/22
类型
coding
上下文窗口
1050K tokens
最大输出
128K tokens
定价
$2 输入 / $10 输出 每百万 token(缓存读最高 90% 折扣)
API 兼容
openai, azure-openai, bedrock

基准测试

33.2%(xhigh,单任务约 $0.27)
AutomationBench(OpenAI 自报)
1,050,000 / 128,000 token
上下文 / 最大输出
2026-04-20
知识截止
错误量约为上一代一半(OpenAI 口径)
内部事实准确性评估

优势

  • •API 价格较 GPT-5.6 Sol 促销价腰斩:$2/$10 每百万 token
  • •1.05M 上下文 + 128K 最大输出,与上代同规格
  • •OpenAI 内部事实准确性评估:错误量约为上一代的一半
  • •reasoning effort 六档可调(none~max),成本与效果可按任务分档
  • •改 reasoning effort 或工具集不再让 prompt 缓存失效,agent 会话成本更稳

不足

  • •官方明确定位低于 GPT-6 Astra,不是最强档
  • •仅文本输出:图片可输入但不支持音视频
  • •Chat Completions 仅在 reasoning_effort=none 时支持 function calling,用内置工具需走 Responses API
  • •AutomationBench 自报 33.2%(xhigh),仍低于 Astra 的 41.4%(Anthropic 表口径)
  • •国内无官方 API,需走 Azure 或中转

适用场景

复杂编程与 agentic 工作流(官方点名的主战场)代码审查、调试、数据分析等重复性专业任务Codex / ChatGPT Work 的日常主力模型高性价比长上下文:大仓库分析、多文档综合

概述

GPT-6 Sol(API 模型 ID gpt-6-sol)是 OpenAI 于 2026 年 9 月 22 日(美西时间;国内报道多在 9 月 23 日)发布的 GPT-6 家族中阶模型,与同日发布的轻量款 GPT-6 Luna 一起补齐了产品矩阵。至此 GPT-6 形成旗舰 Astra → 中阶 Sol → 轻量 Luna 的三档结构。

一句话概括它的意义:把 Astra 那代的能力,压到一个能日常跑的价格。 官方原话是「Sol 和 Luna 建立在 Astra 背后的进展之上,把它的大部分优势带进更快、更负担得起的模型,以支撑规模化工作」,并把降价直接归因于缓存与推理效率的提升。

2026-09-24 更新(本站前情修订):此前 GPT-6 Astra 模型卡 中「GPT-6 Sol 尚未获官方确认」的判断已作废——OpenAI 已于 2026-09-22 在官方开发者社区正式公告 Sol 与 Luna 上线,本卡为取代该待核实条的正式条目。

2026-09-30 更新(继任者发布:GPT-6.1 Sol):OpenAI 在 2026-09-29 的 DevDay 2026 上发布了 GPT-6.1 Sol(API 模型 ID gpt-6.1-sol),官方定位为「在智能体编程、计算机使用与专业工作上接近 Astra,价格是 Astra 标准输入输出的五分之一」。API 定价:输入 $2 / 缓存输入 $0.10 / 输出 $10 每百万 token。

对本卡(GPT-6 Sol)的三点影响:

  1. 标价没变($2/$10),但缓存输入大幅下探——官方称缓存输入比标准输入便宜 95%、比 GPT-6 Sol 的缓存价便宜 50%。长会话 agent 的实际成本会明显下降,因为这类负载里绝大部分输入 token 按缓存价计费。
  2. 本卡转为上一代。新项目请以 GPT-6.1 Sol 为基线做对照 eval;写了死模型 ID gpt-6-sol 的代码不受影响,依赖「默认 Sol」的调用会随平台切换而变化。
  3. 可用性限定:官方公告写明 GPT-6.1 Sol 走 API、ChatGPT Work 与 Codex(Plus / Pro / Business / Enterprise / Edu),不在普通 Chat 中提供;且公告只写「coming soon」,未给出确切上线日期。

详见 OpenAI DevDay 2026 全量盘点。本卡正文保留 GPT-6 Sol 的原始事实,不再按 6.1 口径改写。

三档定价对照(官方定价页 / 公告):

模型输入 / 输出(每百万 token)定位
GPT-6 Astra$10 / $50旗舰,能力最强
GPT-6 Sol$2 / $10中阶,复杂编程与 agent 工作流
GPT-6 Luna$0.10 / $0.50轻量,高频批量任务

核心能力

定位:Sol 写代码,Luna 跑批量

官方模型页给了非常直接的分工:

  • Sol —— 面向复杂编程与 agentic 工作流:实现功能、代码审查、调试、数据分析这类需要多步推理的活;
  • Luna —— 「我们最高效的模型」,面向定义清晰、量大的常规任务:文档摘要、信息抽取、快速问答。

两者规格一致:1,050,000 token 上下文窗口、128,000 最大输出;知识截止 Sol 为 2026-04-20、Luna 为 2026-05-18。输入支持图片,输出仅文本,不支持音频与视频。

reasoning effort 六档

none / low / medium(默认)/ high / xhigh / max。默认 medium 是个重要信号:OpenAI 认为多数任务不需要拉满推理档就能拿到可用结果,成本因此可以下探。

一个容易踩的接口约束:要用内置工具与 function calling,官方推荐走 Responses API;Chat Completions 仅在 reasoning_effort=none 时支持 function calling。老代码直接换 model id 可能静默失效。

可靠性:官方口径的「错误减半」

OpenAI 称在内部事实准确性评估(基于用户实际报错的真实对话)中,GPT-6 Sol 的错误量约为上一代的一半,并强调两款模型在安全对齐评估上也有改善,包括减少对自己编程工作作出误导性陈述。

同时官方给了一句必要的降温:这些评估刻意设置了具有挑战性的情境,结果不能直接视为日常使用中的错误率。把它当「相对改善」而非「绝对错误率」来读。

成本:AutomationBench 的性价比账

腾讯新闻援引 OpenAI 公布的结果(AutomationBench,覆盖 47 种工具的销售/营销/运营/客服/财务/HR 工作流):

模型档位得分单任务成本(相对 Sol)
GPT-6 Solxhigh33.2%约 $0.27(基准 1x)
GPT-6 Astralow30.3%约 3.9x
Claude Fable 5.1—31.4%超过 8.9x
Claude Opus 5max26.9%约 11.1x

口径提示:该组数字为 OpenAI 自报,与 Anthropic 官方发布表中 AutomationBench 的口径不同(Anthropic 表列 Claude Opus 5.5 40.0%、GPT-6 Astra 41.4%,由 Zapier 运行且把 safeguard 干预计为失败)。跨厂商对比时必须写明「谁跑的、什么档位、什么规则」,裸比分没有意义。

API 调用示例

from openai import OpenAI

client = OpenAI(api_key="sk-...")

# 推荐 Responses API:内置工具与 function calling 的完整支持
resp = client.responses.create(
    model="gpt-6-sol",
    reasoning={"effort": "medium"},   # none/low/medium(默认)/high/xhigh/max
    input="审查这段鉴权代码,列出问题并给出补丁",
)
print(resp.output_text)
# Chat Completions 下若要 function calling,必须显式把 effort 设为 none
resp = client.chat.completions.create(
    model="gpt-6-sol",
    reasoning_effort="none",
    messages=[{"role": "user", "content": "提取这段文本里的所有订单号"}],
    tools=[...],
)

定价(2026-09-24 核对)

项目GPT-6 SolGPT-5.6 Sol(促销价)变化
输入(每百万 token)$2$4−50%
输出(每百万 token)$10$20−50%
缓存输入最高 90% 折扣—同日优化

OpenAI 把这轮降价称为永久性下调(区别于限时促销)。配套的缓存改动对 agent 场景影响更大:调整 reasoning effort 或工具可用性不再使缓存失效,并新增了 Prompt Caching Dashboard 与 miss Diagnostics 用于定位缓存未命中的原因——长会话 agent 的成本大头本就在缓存读,这条比标价下调更值钱。

待核实:有汇总报道称 OpenAI 产品线中最便宜的 Terra 档已下线。该说法未见 OpenAI 官方公告确认,本站不据此给出迁移建议,请以官方定价页为准。

适合 / 不适合

适合

  • 需要 Astra 级别可靠性但预算只到中阶档的编程 / agent 流水线;
  • Codex CLI、ChatGPT Work 的日常主力;
  • 长上下文批处理:大仓库分析、多文档综合(1.05M 窗口);
  • 想通过 effort 档位做成本分层的团队(简单任务 low、难关 xhigh)。

不适合

  • 追求绝对能力上限——那仍是 GPT-6 Astra;
  • 需要图像 / 音频 / 视频输出(仅文本输出);
  • 已经在 Chat Completions 上重度依赖 function calling 且不愿改 Responses API 的存量代码;
  • 高频跑量——GPT-6 Luna 便宜 20 倍。

避坑清单

  1. 别只换 model id 就上线:Chat Completions 下的 function calling 受 reasoning_effort=none 限制,工具调用场景改走 Responses API。
  2. 默认 effort 是 medium:追求质量要显式上调,追求成本要显式下调——不写就是 medium。
  3. 缓存失效规则变了但别盲信:新规则是「改 effort / 工具不失效」,实际命中率用 miss Diagnostics 自己验一遍再下成本结论。
  4. 知识截止 2026-04-20:涉及 4 月之后事件的问答必须配检索工具。
  5. 国内无官方 API:走 Azure OpenAI 或 OpenRouter 等中转,注意数据出境合规。
  6. 跨厂商基准别裸比:AutomationBench 有三套口径(OpenAI 自报 / Anthropic 转引 Zapier / 第三方复现),引用时写明来源。

相关阅读

来源

本卡片由 AI 之家 编辑部根据公开资料整理,非厂商付费内容。定价以 OpenAI 官方定价页为准,基准数据已标注自报 / 第三方口径;欢迎在 反馈邮箱 反馈更新。

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Cursor vs Claude Code:什么时候用哪个?(2026 实测选型)

Cursor 和 Claude Code 到底怎么选?一句话结论 + 决策树 + 价格实测 + 国内可用性对比。GUI 派选 Cursor,终端长任务派选 Claude Code,最优解其实是共存。

Devin vs Claude Code:AI 编程 Agent 怎么选?异步自主 vs 终端同步对比

Devin vs Claude Code 2026 选型对比:Cognition 异步自主 Cloud Agent vs Anthropic 终端同步 CLI Agent,从形态、工作模式、长任务能力、并发、价格、中文支持和适合人群 8 个维度判断,帮你选对 AI 编程 Agent。