OpenAI开放Agents API公测,托管式长任务智能体免服务费

首页 / AI资讯 / AI智能体

0:00
0:00
1x
定时

9月10日,OpenAI把驱动Codex的托管式智能体运行框架通过一个接口对外开放,Agents API进入公开测试阶段。开发者只需要提供工具并选择执行环境,剩下的会话管理、任务编排、上下文压缩与故障恢复全部由平台承担。按照官方说明,除模型词元消耗与付费工具调用之外,不再收取额外服务费。平台内置的能力包括沙箱代码执行、文件编辑、MCP服务器连接、产物生成与多智能体委派。对过去需要自己搭一套调度与状态管理系统的团队来说,这条公告把智能体开发的门槛往下压了一大截。

Codex背后的托管框架,现在所有开发者都能用

这套框架此前只在Codex内部使用,服务于需要长时间运行的编程任务。它的核心不是某个更强的模型,而是一层负责让智能体稳定跑下去的基础设施。一个真实的长任务往往要跨越数小时甚至数天,中间包含文件解析、代码运行、结果存储与多轮试错,任何一次网络抖动或进程重启都可能让前功尽弃。把这些工程问题交给平台,开发者才能把注意力放回业务逻辑本身。

从接口设计的角度看,OpenAI选择的是最小暴露原则。开发者交出工具清单与执行环境,平台接管会话生命周期。这种分工与云计算早期的路径相似:用户不再自己维护服务器,而是购买一份抽象过的运行能力。区别在于智能体的状态比无状态服务复杂得多,会话上下文、工具调用记录、中间产物都需要被持久化并能在故障后恢复。框架能不能把这些细节处理得足够可靠,直接决定了它是否值得被生产系统依赖。

会话、编排与上下文压缩,平台替你管了什么

会话管理是第一个被接管的环节。长任务会积累大量对话历史与工具返回结果,直接塞进上下文很快会超出窗口,平台需要按策略做压缩与摘要,同时保留关键决策与未完成事项。压缩做得好,智能体在跑了几个小时之后依然清楚目标与进度;做得差,它会在中途忘记最初的约束条件,反复做已经完成的事。上下文压缩因此不是优化项,而是长任务能否成立的前提。

编排与恢复是另外两块。任务被拆成子步骤后,需要按依赖关系调度,失败时决定重试还是改道,还要在多智能体并行时协调彼此的产出。恢复能力则要求在进程中断后,从最近一个一致状态继续,而不是从头再来。这些机制在自建方案里通常要写几百上千行代码,还容易出现边界缺陷。平台把这类能力标准化,客观上会让更多团队敢于尝试原本觉得太复杂的场景。

沙箱执行、文件编辑与多智能体委派怎么落地

沙箱代码执行是这套框架里最实用的内置能力。智能体可以在隔离环境中运行代码、读写文件、安装依赖,而不会影响宿主系统。对数据清洗、报表生成、批量文件处理这类任务,能跑代码意味着不必把每一步都交给模型逐字推理,效率与可靠性都更高。文件编辑能力则让智能体可以直接产出可交付的文档与代码,产物生成把中间结果沉淀为可下载的文件。

多智能体委派是更容易被高估的一项能力。把一个任务拆给多个智能体并行推进,听起来可以压缩时间,实际效果取决于任务能否被清晰切分,以及子任务之间是否需要频繁交换中间结果。在耦合度高的任务里,委派带来的协调成本可能超过并行收益。MCP服务器连接则让智能体可以接入外部数据源与工具,把能力边界从模型内部扩展到企业既有的系统之上,这也是这套框架面向企业场景的关键接口。

与Cursor Projects正面相撞,长任务平台之争开打

同一天,Cursor发布了Projects功能,把编辑器延伸成云端项目执行环境:一个项目对应一项明确的工作,例如一个功能、一次迁移或一个完整应用,由协调智能体规划任务并委派给云端机器上并行运行的子智能体,关掉笔记本也不会中断。两家产品瞄准的是同一类需求,也就是能够跨越数天甚至数月、不需要人一直盯着的长任务。OpenAI走的是通用接口路线,Cursor走的是把编辑器与项目上下文绑定的垂直路线。

这两条路线的差别会体现在用户选择上。需要把智能体嵌进自己产品、自己掌控界面的团队,更适合用托管接口;以代码与仓库为核心工作对象、希望开箱即用的团队,更适合用绑定编辑器的方案。无论哪条路线胜出,这一轮竞争都在抬高行业的默认预期:智能体不再被当作一次问答的延伸,而是被当作一种需要可观测、可恢复、可计费的基础设施。谁把这层基础设施做得更稳,谁就掌握下一阶段开发者的默认选择。

公测之后,托管框架进生产环境还差什么

可观测性与成本治理是第一道门槛。长任务智能体会产生大量工具调用,一旦出现循环调用,或者多个子智能体互相等待彼此的产出,费用会在无人察觉的情况下快速累积。生产环境需要的是完整的会话追踪,能回放每一次提示、工具调用与外部接口请求,并设置成本上限与自动熔断。这些能力在公测阶段通常还不完整,却决定了智能体能不能被放心地接入真实的业务流程。

权限与合规是第二道门槛。智能体要在企业系统里读写数据,就需要细粒度的权限控制、完整的操作留痕,以及在高风险动作前插入人工审批节点。金融、医疗与政务类场景对这几项的要求尤其严格,缺少任何一环都无法通过内部合规审查。公测版本先把能力做出来,把治理能力留给后续补齐,是常见的产品节奏,但企业采购决策通常只认已经具备的部分,这也决定了托管方案短期内会先在中低风险场景落地。

素材来源:OpenAI官方博客、Pondero、AI Native Foundation、AI Weekly 发布时间:2026-09-12