跳到主内容

OpenAI 发布 Agents API 公测:把 Codex 的 agent harness 托管出来,一次 API 调用起一个云 agent

OpenAI 于 2026 年 9 月把驱动 Codex 的 agent harness 以 Agents API 形式开放公测:单个 API 调用即可创建长时运行的云 agent,支持 OpenAI 托管沙箱或自托管 / 第三方沙箱(E2B、Modal、Cloudflare、Vercel 等)、原生 subagent 并行、自动上下文压缩与 tool search;API 本身不额外收费,按 token 与容器计费。

2026-09-13 · OpenAI 官方 / OpenAI Developer Community / GenAI Daily

发布 2026-09-13核实 2026-09-13

要点

  • Agents API 进入 public beta:把驱动 Codex 与 ChatGPT for Work 的 harness 与基础设施,通过一个简单的 API 开放给所有开发者。
  • 核心对象是四个:agent(模型 + 指令 + 工具)、environment(代码在哪台机器上跑)、session(跨任务的持久会话)、event stream(执行过程回传的事件流)。
  • 环境三选一:OpenAI 托管沙箱、自托管(自有基础设施 / VPC)、或八家沙箱合作方——Blaxel、Cloudflare Dev、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop、Vercel。
  • harness 内置三项能力:自动上下文压缩(接近上限时保留关键信息,让 agent 跑几小时乃至几天)、tool search(按需加载工具定义,省 token)、原生 subagent(multi_agent.enabled、max_concurrent_subagents)。
  • 收费与限制:API 本身不额外收费,只付 token、工具与容器费用;公测阶段数据处理留在美国,且不支持零数据保留(ZDR),即使自托管沙箱也一样。

背景与分析

过去两年,写 agent 的门槛从「能不能调模型」变成了「怎么让一个 agent 在生产的第 40 个小时还活着」。LangGraph、CrewAI 这类框架解决了编排的组装问题,但会话持久化、上下文压缩、崩溃恢复、子 agent 协调这套运行时负担,仍然压在每个团队自己身上。

OpenAI 这次的做法是把自己在 Codex 上跑通的那套 harness 直接托管出来,只留三样东西给开发者自己定义:指令、工具(含 MCP server)、执行环境。

一个最小示例(官方 quickstart 形态):

const session = await client.beta.agents.sessions.create({
  agent: {
    model: "gpt-6-astra",
    tools: [{ type: "mcp", server_label: "observability", transport: { type: "http", server_url: "https://observability.example.com/mcp" } }],
    multi_agent: { enabled: true, max_concurrent_subagents: 3 },
  },
  vault_ids: ["vault_YOUR_VAULT_ID"],
  environment: { type: "openai_hosted", capability_directories: ["/workspace/capabilities/skills"] },
  input: "Investigate service-api's elevated 5xx rate over the last 30 minutes...",
});

值得注意的是 harness 来自开源 Codex 代码库——开发者可以直接读它怎么管理工具、记忆与上下文,而不是面对一个黑盒。这给了一条很实际的退路:不想锁定托管服务,就自己部署开源 harness。

OpenAI 公布的早期客户数据(均为客户自述,非第三方复现):Ciridae 称评测分数从 0.71 升到 0.85、subagent 工作流延迟降到 1/4;SafetyKit 称案件审查流程单案成本下降 60%;Hypha 称把 harness 与沙箱分离后,失败的 agent 响应减少 86%。

对开发者的影响

  • 正面:长时运行 agent 的运维成本被大幅外包。自动上下文压缩、崩溃恢复、subagent 并行这三块,是多数团队自研时最容易做砸的部分。
  • 代价:编排层锁定在 OpenAI 的实现上,并且要跟着它的模型与 harness 版本迭代。对「跨模型 provider」的产品来说,更现实的选择是直接用 GitHub 上的开源 Codex harness,而不是托管 API。
  • 合规红线:公测期不支持 ZDR、数据处理在美国。金融、医疗、政务这类有数据驻留要求的团队,短期内只能走自托管沙箱路径,但要接受数据仍可能出境这一点——这是选型前必须问清的一条。
  • 成本模型变化:容器按时计费是新增科目。有开发者在社区提醒,第一次用托管沙箱要先算清容器成本再批量起容器。

AI 之家 观点

这件事的行业含义大于产品含义:agent 竞争的战场正式从「模型」挪到了「harness + 执行环境」。

  1. harness 正在被商品化。OpenAI 把自己的核心 harness 开源并托管,等于告诉市场:编排层不再是差异化来源,差异在工具、数据与工作流。这会直接压到 Dify、Coze、CrewAI 这类「组装型」平台的定价逻辑。
  2. 执行环境成了新的护城河。OpenAI 拉了八家沙箱合作方,Cursor 同期也上线 Self-Hosted Machines(AWS Lambda / Cloudflare / Modal / Vercel / E2B 等)。两边指向同一个结论:代码在哪跑、密钥留在谁的机房,是企业采购的第一问题。
  3. 短期最大风险不是能力,是数据驻留。不支持 ZDR 这一条,会让相当一部分国内与欧洲合规场景暂时无法上托管版;自托管 + 开源 harness 会是这一段时间的现实解法。

给团队的判断建议:如果你的差异化在业务工具与数据,用托管 Agents API 换速度是划算的;如果你要做的是跨模型、可迁移的 agent 平台,就别把编排层交给任何一家模型厂商。

相关阅读

来源

相关对比

Cursor vs Aider:GUI IDE 还是 CLI?2026 对比

Cursor vs Aider 2026 选型对比:GUI IDE vs Git 原生 CLI,从 Composer vs Architect 双模型、Tab 补全、多模型 BYOK、价格计费、开源与否和适合人群判断,帮开发者选对。Cursor 是闭源 VS Code fork 月费 $20,Aider 是开源 Apache-2.0 CLI 自带 API key。

Augment Code vs Cursor:企业 AI 编程怎么选?Context Engine vs AI IDE 对比

Augment Code vs Cursor 2026 选型对比:Context Engine 全仓索引的企业 AI 平台 vs SpaceX 收购的 AI IDE 天花板,从形态、Context 覆盖、长任务、价格、合规、中文支持和适合人群 8 个维度判断,帮你选对企业 AI 编程工具。

CrewAI vs AutoGen:多 Agent 框架怎么选?业务自动化 vs 研究实验

CrewAI vs AutoGen 2026 选型对比:从上手难度、API 设计、多 Agent 协作模式、代码执行、记忆系统、GUI、API 稳定性和适合人群判断,帮你决定用 CrewAI 做业务自动化还是用 AutoGen 做研究实验。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Cursor vs Claude Code:什么时候用哪个?(2026 实测选型)

Cursor 和 Claude Code 到底怎么选?一句话结论 + 决策树 + 价格实测 + 国内可用性对比。GUI 派选 Cursor,终端长任务派选 Claude Code,最优解其实是共存。

Codex CLI vs Crush:OpenAI 官方 vs 多模型 TUI(2026 实测选型)

Codex CLI vs Crush 2026 选型对比:OpenAI 官方终端 Coding Agent(GPT-5.6 + Windows 原生沙箱 + Apache-2.0)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、平台、生态、价格、国内可用性帮你选对终端 AI 编程工具。

相关评测