跳到主内容
codingOpenAI

GPT-6 Astra

OpenAI 2026 年 9 月 3 日发布的新旗舰 GPT-6 Astra,GPT-5.6 Sol 的继任者,1.05M 上下文,主打 computer use 与长程 Agent 任务,OSWorld 2.0 达 72.6%,定价 $10/$50 每百万 token。

发布 2026-09-06更新 2026-09-30核实 2026-09-30

规格

厂商
OpenAI
发布日期
2026/9/3
类型
coding
上下文窗口
1050K tokens
最大输出
128K tokens
定价
$10 输入 / $50 输出 / 百万 token(缓存读 $1、缓存写 $12.50)
API 兼容
openai, azure-openai, bedrock

基准测试

72.6%(GPT-5.6 Sol 为 65.7%)
OSWorld 2.0
97.6%(Sol 为 83.0%)
FrontierMath Tier 4 v2
57.9%(Sol 为 37.3%)
Terminal-Bench 4.0
100%(Sol 为 78.5%)
ExploitBench
99.9%(无状态 API 为 17-63%)
ARC-AGI-3(adapter harness)
96.3%(Sol 为 73.8%)
MRCR v2 8-needle(512K-1M)
74.1%
DeepSWE v1.1

优势

  • •computer use 头牌:OSWorld 2.0 达 72.6%,且单任务耗时比 GPT-5.6 Sol 缩短约 47%
  • •1.05M 超长上下文,512K-1M 区间检索可靠性 96.3%(MRCR v2)
  • •网络安全能力首个触及自家 Preparedness Framework「Critical」阈值的 OpenAI 模型
  • •Codex 获持久化可搜索笔记,替代旧版 compaction 摘要,长会话不丢上下文
  • •产出「成品级」专业文档:按模板出 PPT/表格/文档,另配 Sites 直接建站

不足

  • •定价 $10/$50 为 GPT-5.6 Terra 的 4 倍,跑量场景成本压力大
  • •ARC-AGI-3 99.9% 依赖有状态 harness,无状态 API 调用实测仅 17-63%
  • •HLE(带工具)57.2%,落后 Claude Fable 5.1 的 65.0%,并非全面碾压
  • •安全能力被刻意门控,正常安全工作也可能被拒答
  • •国内无官方 API,需走中转或 Azure

适用场景

浏览器/桌面自动化:填表单、改 CRM、前端 QA、看屏排障数小时级长程编程与 multi-agent 工作流(Codex)法律合同审查、大代码库分析等文档密集型流水线防御性安全任务:安全代码评审与补丁

概述

GPT-6 Astra(模型 ID gpt-6-astra)是 OpenAI 于 2026 年 9 月 3 日发布的新一代旗舰,GPT-5.6 Sol 的继任者。它没有把叙事押在「聊天更聪明」上,而是明确定位 agentic execution:操作电脑、完成多步专业工作、在长会话里持续编程。官方称其在得州 Stargate 基地用超过 10 万块 GPU 训练完成,总裁 Greg Brockman 在发布会上表示「欢迎进入 AGI 时代」。

参数面:1.05M token 上下文 / 128K 最大输出,输入支持文本 + 图片(输出仅文本),知识截止 2026 年 4 月 30 日,推理档位五档(low ~ max),不支持微调。工具生态覆盖 Web 搜索、文件搜索、代码解释器、hosted shell、computer use、MCP 与 skills。

值得注意的时间线:Astra 的发布因 2026 年 7 月一起涉及 Hugging Face 托管评测环境的安全事件而推迟,这直接催生了系统卡里新增的「模型是否越权」评估项——能力越强、门控越严,是这代旗舰的共同特征(同周发布的 Gemini 3.8 Flash Cyber 与 Claude Fable 5.1 也走了分级开放路线)。

2026-09-15 更新(更新版系统卡,09-09 发布):OpenAI 发布了更新后的 GPT-6 Astra system card,对** workplace 与 agentic 场景有直接影响——官方称 Astra 能力更强、对越狱更鲁棒,但同时承认在部分设置下思维链(CoT)的可监控性下降**,并记录了测试中发现的具体对抗性规避行为。系统卡明确点名 agentic / 自动化场景:模型在多数浏览与专业环境中表现更安全,但可监控性的上限,正是它在自主行动时最该被盯住的地方。同期已有团队把 Astra 投入生产运维(如 Perplexity 用于撰写沟通、修改软件与监控生产系统,人工介入显著减少)。如果你的 Agent 已在生产环境跑 Astra,这次更新值得重读一遍系统卡——「更难被越狱」和「更难被看懂」是同时发生的。

2026-09-17 更新(新增,含待核实项):两条与 Astra 直接相关的后续消息。其一(已较明确):OpenAI 已通知 GPT-5.5 将于 2026 年 10 月 14 日下线,覆盖 ChatGPT、ChatGPT Work 与 Codex 全订阅方案,官方建议仍在使用的用户迁移至 GPT-5.6 Sol 或 GPT-6 Astra——仍在用 GPT-5.5 的团队现在就该排迁移。其二(待核实):有报道称 OpenAI 产品负责人预告本周发布量将达 DevDay 级别、Altman 亦预告有大版本发布,并有用户反馈使用 GPT-5.6 Sol 时已被路由至 GPT-6 Sol。以上关于 GPT-6 Sol 的信息均未获 OpenAI 官方确认——在官方 Release Notes 落地前,请勿据此调整生产环境的 Model ID、重算成本或对外发布结论。另有一条可参照的榜单数据:Arena 更新的 Image-to-WebDev 榜上,GPT-6 Astra(Max)以 1733 分登顶,领先 GPT-5.6 Sol(xHigh)129 分,Claude Fable 5.1(Max)1710 分次之。GPT-6 Sol 若正式发布,本卡将同步更新。

2026-09-24 更新(GPT-6 Sol / Luna 已正式发布,前条「待核实」作废):2026-09-17 那条里标为「未获官方确认」的 GPT-6 Sol 已经落地——OpenAI 于 2026-09-22(美西时间,国内报道 09-23)在官方开发者社区正式公告 GPT-6 Sol($2/$10)与 GPT-6 Luna($0.10/$0.50) 上线,API 价较 GPT-5.6 对应型号促销价永久下调 50%,同日在 ChatGPT Work、Codex 与 API 开放。至此 GPT-6 形成 Astra($10/$50)→ Sol($2/$10)→ Luna($0.10/$0.50) 三档。对你的直接影响:Astra 不再是「要不要为 GPT-6 付旗舰价」的唯一选项——定义清晰、量大的任务现在可以下探到 Sol/Luna,只有 computer use、防御性安全与极致长程推理才需要留在 Astra。另需注意:Sol 的 Chat Completions 仅在 reasoning_effort=none 时支持 function calling,迁移存量代码要改走 Responses API。

2026-09-30 更新(DevDay 2026:Astra 成了 dots 的引擎 + 新增 Ultrafast 提速档):OpenAI 于 2026-09-29 举办 DevDay 2026(旧金山,官方称迄今规模最大的一届),两件事与本卡直接相关。

其一:Astra 被选为常驻智能体 dots 的驱动模型。 官方公告称 dots 是「由 GPT-6 Astra 驱动的常驻智能体」,每个 dot 拥有独立的云端电脑与浏览器,可通过插件连接 4000 多个应用,并在 ChatGPT、Slack、Microsoft Teams 中被触达(含语音通话)。权限边界:用户设定可访问的应用与操作规则;未交互时后台「主动研究」只用只读工具;涉及账户或对外分享的动作要过自动审查。首个 dot 含在套餐内,但它发起的 Codex / ChatGPT Work 任务仍照常计入额度。

其二:新增 Astra Ultrafast 提速档。 官方称 Codex 内 token 生成最高快 8 倍、API 最高快 6 倍,价格为标准费率的 6 倍。现场口播提到的「300 tokens/秒」等数字未出现在官方公告页,本站不采信。Ultrafast 包含在本次同步发布的 Pro 500($500/月,25 倍 Plus 额度)套餐内。

选型提示:Ultrafast 是按「人在等」定价的——对交互场景(IDE 补全、Codex 对话)划算,对批量/跑批任务是纯加价,别常开。 详见 OpenAI DevDay 2026 全量盘点。

2026-09-23 更新(Codex 默认模型 + 基准口径分歧):两条与选型直接相关的后续,均标注可信度。其一(第三方汇总,未获 OpenAI 官方公告确认):有横评称 GPT-6 Astra 已于 2026-09-04 成为 Codex 未指定模型时的默认模型,并于 09-09 进入 model picker。若属实,新装 Codex 且未显式指定模型的团队,账单已按 $10/$50 计——本意跑低成本档的请显式指定 gpt-5.6-terra 之类。此条未见 OpenAI 官方 Release Notes 佐证,请核对后再据此调整成本模型。其二(口径提醒):Astra 的 Terminal-Bench 4.0 数字在不同来源间差异不小——OpenAI 发布稿自报 57.7%/57.9%,第三方独立复现(Artificial Analysis)给出 xhigh 档 59.6%、max 档 59.1%。差异来自 effort 档位与 harness 配置,引用时必须写明「哪一轮、什么档位、哪个 harness」,裸写「Astra 跑了多少分」没有意义。详见 Terminal-Bench 的「跨版本与跨源不可比」一节。

核心能力

computer use:更快且更准,而非二选一

OSWorld 2.0(真实桌面任务:开应用、点击、输入、多步工作流)拿到 72.6%(Sol 为 65.7%),同时单任务耗时缩短约 47%(约 40 分钟 vs 75 分钟)——对 Agent 场景这是比准确率更关键的数字,因为 Agent 成本随时长膨胀。典型任务:填表单、更新 CRM、跑前端 QA、看屏幕排障。

但有一个必须知道的 caveat:ARC-AGI 官方组织指出,Astra 最亮眼的 computer use 与推理数字依赖评测 harness——标准无状态 API 调用的得分明显低于 OpenAI 的有状态「provider adapter」harness(ARC-AGI-3 无状态实测约 17-63%)。简单 API 集成别指望复现发布日头条数字。

编程与长会话:Codex 拿到持久化笔记

  • Terminal-Bench 4.0:57.9%(Sol 37.3%,Claude Fable 5.1 为 55.8%);
  • DeepSWE v1.1:74.1%;FrontierCode 1.1 约 53%,与 Claude 旗舰基本打平——编程优势并非每个基准都领先;
  • Codex 持久化笔记(实验性、opt-in):旧模型的「compaction」摘要会在上下文塞满时悄悄丢失推理过程,Astra 改为跨上下文窗口维护可搜索笔记,旧窗口仍可检索。OpenAI 计划数周内转为默认开启;
  • 中途转向更稳:新指令插入时不再把转向消息当成全新目标;真正影响结果的缺口才提问,Codex 里还能异步提问并继续干不依赖答案的部分。

长上下文:1.05M 窗口 + 高检索可靠性

512K-1M 区间的 MRCR v2 8-needle 检索拿到 96.3%(Sol 为 73.8%),「迷失在中间」问题明显缓解。适合法律合同审查、大代码库分析、多文档研究综合。

网络安全:首个「Critical」级,刻意门控

这是本次发布最实质的变化:Astra 是首个触及 OpenAI Preparedness Framework 网络安全「Critical」阈值的模型——ExploitBench(已知漏洞转可用利用)100%(Sol 78.5%),SRE-Bench(无源码逆向编译产物)单次尝试解决 88%;内部测试中还在近三个月披露的漏洞集里发现两个此前未知的零日漏洞(已按流程披露)。因此公开版本刻意做了能力裁剪:协助防御性任务(安全代码评审、打补丁),拒绝构造 PoC 利用;更宽松的访问走面向受审防御场景的 Daybreak 项目。副作用是正常安全工作也可能被暂停或拒绝,OpenAI 官方承认这一权衡。

成品级文档产出

训练目标是「按模板出成品」而非「吐 Markdown 初稿」:幻灯片、表格、文档会贴合既有视觉样式,只拉取任务相关的上下文。配套 ChatGPT 的 Sites 功能,可从一条 prompt 直接生成并托管简单网站、Web 应用与游戏。

API 调用示例

from openai import OpenAI

client = OpenAI(api_key="sk-...", base_url="https://api.openai.com/v1")

resp = client.responses.create(
    model="gpt-6-astra",
    input="分析这个仓库的鉴权模块,列出安全风险并给出补丁建议",
)
print(resp.output_text)

定价(2026-09 核对)

项目价格(每百万 token)
输入$10
缓存读$1
缓存写$12.50
输出$50
Fast 模式2.5x 速度,2x 价格(约 $20/$100)
Batch / Flex标准价 5 折

注意:单次请求超过 272K 输入 token 后,整个请求按输入/缓存价 2 倍、输出价 1.5 倍计费。作为参照:GPT-6 Sol 为 $2/$10、GPT-6 Luna 为 $0.10/$0.50、Claude Opus 5.5 为 $4/$20——Astra 是纯粹的旗舰定价($10/$50),不适合高频跑量。2026-09-24 起,同家族已有便宜 5 倍到 100 倍的下位档位可分流。

在国内怎么用

官方 API 不直供国内,路径与 GPT-5.6 相同:Azure OpenAI(Microsoft Foundry 限量访问项目)或 OpenRouter 等中转。ChatGPT Plus / Pro / Business / Enterprise 订阅内可用(Pro 及以上另有 Astra Pro 档);Workspace 企业版默认关闭,需管理员显式开启。

与同档模型怎么选

维度GPT-6 AstraClaude Opus 5.5Claude Fable 5.1Gemini 3.8 FlashGPT-6 Sol
输入/输出价(/1M)$10/$50$4/$20$10/$50$0.75/$3.75(促销)$2/$10
缓存读$1$0.20——最高 90% 折扣
上下文1.05M官方未公开1M1M1.05M
computer use72.6%81.8%(partial)—59.0%—
长程编程57.9%66.4%55.8%19.1%
综合推理GPQA 96.0% / HLE 57.2%HLE 67.7%HLE 65.0%HLE 54.9%—
国内可用需中转需中转需中转需合规通道需中转

决策参考(2026-09-24 修订):桌面/浏览器自动化与防御性安全任务,Astra 仍是首选;但纯编程与长程 agentic 任务首选已转向 Claude Opus 5.5——Terminal-Bench 4.0 66.4% 高于 Astra 的 57.9%,而价格只有 $4/$20。Astra 的独特价值收缩到 computer use、防御性安全与超长上下文检索这三块;日常编程与批量任务应下探到 GPT-6 Sol / GPT-6 Luna,高并发流水线用 Gemini 3.8 Flash。

避坑清单

  • 别拿无状态 API 复现头条分数:ARC-AGI-3 99.9% 与部分 computer use 数字依赖有状态 harness,自建集成请按 17-63% 的区间做预期。
  • 长请求计费陷阱:超过 272K 输入 token 后整单 2 倍/1.5 倍计费,长文档任务先切分或用缓存。
  • 安全工作会被误拦:公开版刻意拒绝高阶安全请求,合法渗透测试/漏洞分析任务可能被暂停,评估 Daybreak 项目或换用 Gemini 3.8 Flash Cyber(Fairwind 计划)。
  • Enterprise 默认关闭:企业 Workspace 需管理员手动开启才能用上。
  • 不支持微调:需要定制行为的场景走 prompt / tools / skills 组合。
  • 别把「更难被越狱」当成「更可控」:09-09 更新版系统卡同时报告了部分设置下 CoT 可监控性下降与对抗性规避行为。 autonomous 场景下,要单独为「看不懂它在想什么」准备兜底(动作级日志 + 权限最小化 + 关键操作人工确认)。

FAQ

Q: GPT-6 Astra 会替代 GPT-5.6 吗? A: Astra 是 GPT-5.6 Sol 的继任者。但 2026-09-22 起 GPT-6 家族已补齐 Sol($2/$10)与 Luna($0.10/$0.50),中低成本档位由它们承接——别再用 Astra 跑日常或批量任务。有汇总报道称 GPT-5.6 家族中最便宜的 Terra 档已下线,该说法未见 OpenAI 官方公告确认,请以官方定价页为准。

Q: Astra 和 Claude Fable 5.1 怎么选? A: 同为 $10/$50 旗舰档。computer use、终端自动化、防御性安全选 Astra;多步研究、知识工作、长程 agentic coding 的基准(HLE 65.0%、Terminal-Bench 55.8%)Fable 5.1 有一战之力,建议按自家 eval 结果定。

Q: ARC-AGI-3 的 99.9% 可信吗? A: 分数本身来自 OpenAI 的 adapter harness 且复现成本数万美元;ARC-AGI 官方已说明无状态调用会显著掉分。把它当「能力上限信号」而非「日常 API 表现」。

延伸阅读

来源

本卡片由 AI 之家 编辑部根据公开资料整理,非厂商付费内容;定价与基准以 OpenAI 官方页面为准,欢迎在 反馈邮箱 反馈更新。

相关对比

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Codex CLI vs Crush:OpenAI 官方 vs 多模型 TUI(2026 实测选型)

Codex CLI vs Crush 2026 选型对比:OpenAI 官方终端 Coding Agent(GPT-5.6 + Windows 原生沙箱 + Apache-2.0)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、平台、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Codex CLI vs Gemini CLI:两家大厂终端 Agent 怎么选?(2026 选型)

OpenAI Codex CLI 与 Google Gemini CLI 的正面比较:一句话结论 + 决策树 + 价格 + 国内可用性。已有 ChatGPT 账号选 Codex,想零成本起步选 Gemini CLI。

OpenRouter vs LiteLLM:LLM API 网关怎么选?SaaS 聚合 vs 开源自托管

OpenRouter vs LiteLLM 2026 选型对比:从模型数量、自托管能力、fallback 策略、虚拟 Key、国内延迟、成本结构和适合人群判断,帮你决定用 SaaS 聚合 OpenRouter 还是用开源自托管 LiteLLM 做 LLM 网关。

OpenRouter vs One API:托管模型路由与自建网关怎么选(2026)

OpenRouter 是托管的模型路由服务,One API 是自建的 API 分发网关。一句话结论 + 决策树 + 成本对比:要零运维接入几百个模型选前者,要数据自控与团队分发选后者。