打开 OpenAI 九月十日的公告页,第一段就把主语说死了:他们把跑 Codex 的那套 harness 和基础设施做成接口,名字叫 Agents API,状态是 public beta。同一天的 API 更新日志 也落了一条 Sep 10:公测发布,OpenAI 负责会话编排、上下文压缩和恢复。
如果你这周在群里看到的是「又一个 Agent SDK」,先别急着装包。公告写的是 OpenAI 托管并维护这套 harness。你选计算环境:它代管的沙箱、你自己的机器,或者它列出的沙箱伙伴。开发者文档把同一句话拆成四个名词:Agent(模型、指令、工具、MCP)、Environment(可选的沙箱或电脑)、Session(一次能接着干的会话)、Events and items(你送进去的输入和它吐出来的记录)。
一次会话实际上在干什么
概览页把官方托管的路径写成四步。先建会话,OpenAI 配环境。再给任务,环境就绪后用户输入才算开一轮。然后跟进度,可以流式看,也可以等 webhook。最后是接着干,或在这一轮还在跑的时候插手。会话会留下状态,下一句不用把整段对话重新拼一遍。不要了,会话和发布出去的产物可以删。
示例请求里的模型字段写的是 gpt-6-astra。概览里多代理打开时,max_concurrent_subagents 写成 4;公告里另一段示例写成 3。这是文档里的配置值,不是限额公告。子代理各自持有上下文,主代理收拢结果。上下文快顶到窗口时,接口会自动压缩较早的内容,不用你自己写一套摘要逻辑。工具这边,文档列了工具搜索、可编程的工具调用、MCP,以及内置的网页搜索。
快速入门用一个很小的任务示范这条路径:在 OpenAI 托管的沙箱里写一个 tree.py,跑起来,把当前目录的树打出来。密钥权限它写了三项:api.agents.read、api.agents.write,外加推理用的 api.responses.write。用 cURL 时要自己带 OpenAI-Beta: agents=v1;官方 SDK 会替你加。密钥要放在沙箱外面。
入门页有一句比「写个树」更有用:看到 agent.session.turn.completed 之后,还得看它报告的执行结果。一轮结束,不保证每个工具都成功。以 turn.failed、turn.cancelled 或 session.failed 结尾的事件才是失败或取消。只看到 agent.session.idle,不能当成做成了。流中途断了,先把会话和已保存的条目取回来,再决定要不要重试。要接着改,把 session_id 留下,追问之前先把事件流打开,免得漏掉开头几条。
沙箱交给谁,账单怎么拆
公告把环境分成三类。OpenAI 托管的沙箱,用的是跑 Codex 和 ChatGPT 的那套隔离设施,官方负责开通和管理,你可以往里放文件、包、skills 和插件。自己的基础设施,文档里的字段是 environment.type: "self_hosted",命令由你这边的执行器跑,连接和生命周期归你的程序。第三类是它点名的伙伴:Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop、Vercel。公告说这些集成覆盖全托管或放进你的 VPC、不同的文件和密钥存放方式,以及不同的 CPU、GPU 和内存配置。具体哪一家适合哪类负载,公告没有给对照表,只能按它写的「冷启动、性能、成本各不相同」去问那一家的文档。
费用这一句最容易读拧。公告原文是:用 Agents API 没有额外费用,只按你的代理用掉的 token 和工具付费,价目在定价页。概览页补了一刀:模型按所选模型的接口价计,OpenAI 的工具用标准价,OpenAI 托管沙箱用标准容器价。所以「不另收费」指的是接口这一层不再加一笔座席费或调用费,不是沙箱机时和网页搜索自动变成零。容器单价不在这两页正文里展开,下单前仍要打开定价页看当天的数字。截至写这篇时,我没有把第三方博客里的每小时美元价抄进来。
数据放在哪
概览页末尾有一段合规相关的限制,比功能列表更值得先看。Agents API 目前只支持美国的数据驻留,不支持零数据保留(Zero Data Retention)。自己托管沙箱,也不会让这个接口变得符合零保留。人在欧洲、合同要求数据不出区、或者安全评审里写了 ZDR 的团队,按这页的字面,公测阶段对不上。这不是推断,是文档自己写的。
公告页还贴了几段客户引言。Ciridae 的技术负责人说评测分从 0.71 到 0.85,子代理带来 4 倍延迟下降;SafetyKit 说迁到这个接口后单案成本降了 60%;Hypha 说把 harness 和沙箱拆开之后,失败响应降了 86%。这些数字都出自被引用人,页面没有附评测方法,不能当成 OpenAI 的基准,更不能当成你这边复现的保证。
公告开头还写了他们为什么觉得这层值得单独拿出来。把 Codex 和 ChatGPT for Work 铺到「数百万」人之后,他们的体会是:能用的代理需要一套 harness 管上下文、省着用工具、协调子代理,还需要能连续跑上几天的基础设施,中间结果要能存下来。这套话是产品理由,人数没有附口径。公测页末尾写他们会按反馈快改,目标是以后的正式版。字段、事件名、沙箱限额都还可能动。
接到生产之前,密钥权限要按入门页给齐,流结束时不要把 idle 误当成成功,账单里除了 token 还要看托管沙箱的容器和工具有没有另计。数据驻留那一行对不上,就先不要把生产流量接上去。伙伴名单上的九家只说明有一等集成,不说明你的 VPC 或冷启动要求他们都接得住。那一截要问伙伴自己的文档,不在 OpenAI 公告的对照表里。
