
这两年做智能体的人,手上多半都有一段不太想给别人看的代码。它干的事很枯燥:调一次模型,把返回里的工具请求抠出来,跑一下工具,把结果再塞回上下文,然后重复,直到任务结束,或者窗口塞满。写得好的和写得差的,差距不在谁更聪明,在谁的循环更能扛。

9 月 10 日,OpenAI 说这段循环它来跑。Agents API 进了公开测试,托管的正是支撑 Codex 的那套东西。给四样东西——任务、模型、可用工具、执行环境——一次调用就能拉起一个可以上生产的智能体。编排、上下文管理、执行基础设施,全部挪到对面去。
被接管的那几块,恰好是团队最不想维护的部分。上下文会自动压缩,长任务不会再在窗口填满的那一刻直接死掉;工具改成检索和程序化调用,不再每轮把所有工具定义一股脑塞进提示词;子智能体可以并行,调度交给 OpenAI 的基础设施,不占你自己的调度器;连模型调用、工具执行、状态本身,都跑在他们那边。
开发者手里剩下两样是硬的:智能体能碰哪些工具,代码在哪执行。执行环境给了三条路——OpenAI 自己的沙盒、你自己的基础设施,或者第三方沙盒供应商,Cloudflare、Vercel、Modal、E2B、Daytona、DigitalOcean、Oracle、Blaxel、Runloop 都在名单上。协调模型调用和工具的 harness 逻辑开源放在 GitHub 上,托管版由他们运营维护。
定价这块下手最狠。公测对所有开发者开放,没有额外的平台费,只付 token 和工具的钱。
早期用户报出来的数字挺漂亮:延迟降到大约四分之一,单任务成本降六成,失败响应少八成六,有个客户迁移之后评估分从 0.71 涨到 0.85。这些数是 OpenAI 和它的设计伙伴自己报的,不是独立基准,读的时候要打个折。方向倒是可信:一个调优过的框架,配上像样的压缩和并行子智能体,确实打得过那种每一轮都把整份对话重新发一遍的手搓循环,而手搓循环烧钱恰好就烧在这儿。
战略上的意思很直白。编排这门生意是一批公司的立身之本,LangChain、CrewAI 和后面一长串小框架,卖的就是这一层。现在 OpenAI 把它做成不抽成的托管服务,架在这些框架本来就要调的模型之上。框架不至于就此没用,但"我们替你管循环"这份溢价没了。
有家 IT 咨询公司的开发主管讲得实在:一个能连着跑很久的手搓智能体,底下压着任务队列、一套状态库、一堆沙盒机器、上下文压缩和失败重试,每一样都得有人守着、有人半夜爬起来看告警。这些零件没有消失,是有人替你接过去了。
开源这一手也值得留意。harness 的逻辑公开放在 GitHub 上,等于把循环怎么跑的摊给你看。托管版出状况的时候,至少能对着源码判断是自己用法不对还是对面出了问题,不用全靠猜。
那接下来干什么,也得跟着变。
注意力要从循环挪到工具上。工具的定义写得清不清楚、检索能不能命中、执行结果返回成什么形状,现在直接决定智能体跑成什么样。以前这些是被循环拖累的次要问题,现在是唯一的问题。
沙盒选型升成了一等设计。跑在 OpenAI 托管的沙盒里省事,包依赖、网络能通到哪、密钥怎么放,都由对方说了算;跑在自己的虚拟私有云里,可控,但维护自己扛;中间那批第三方供应商,各有各的包兼容和网络策略。这个选择过去是运维细节,现在是架构决策,定下来之后就很难改。
测量口径要趁早定。单任务成本、延迟、失败率,这三个数在托管之前几乎没人认真记过,因为大家都在救火。托管之后它们直接变成账单上的行,等到那时候再补记就晚了。

还有一层容易被跳过:验收。托管解决的是任务跑得完,不解决跑出来的对不对。评估集、回归用例、人工抽查抽多少,这些还得自己搭,搭的时间还得往前挪——并行之后一次产出好几个结果,没有验收标准就分不出哪个能要。
两条限制写在文档里,得单独说一句。Agents API 目前只支持美国境内的数据驻留,也不接受零留存这类约定,调用时要带上 OpenAI-Beta: agents=v1 这个头。内部数据往里喂之前,这两句得先看明白——它不是技术细节,是能不能用的前提。
真要把执行环境留在自己这边,还有个绕不开的现实:长任务和并行子智能体是要真机器去跑的。自己的开发机顶多撑一两个线程,跑起来风扇狂转,一批任务排到天亮,频率还往下掉。随时能开、用完就关的云上机器在这种时候更合适,卡型可以挑,按小时算,任务结束就释放。算力这东西现在租比买划算,尤其你只是想验证一个想法、跑完就收工的时候。













