OpenAI 亲述:受 Jev 启发,一周内做出 Decisions API,把模型输出变成代码能直接用的「选择」
「计算机操作的结果明明很容易验证,为什么进展如此缓慢?」今年 6 月,播客主持人 Dwarkes…
文章目录
「计算机操作的结果明明很容易验证,为什么进展如此缓慢?」今年 6 月,播客主持人 Dwarkesh Patel 提出的这个质疑,在行业里引发了不小争议。三个月后,OpenAI 在 9 月 29 日的开发者日交出了答案:Dot、计算机操作能力,以及一系列新的开发者接口。而其中一项 Decisions API 的诞生故事,尤其值得玩味。
一分钟速览
- OpenAI API 产品负责人 Nikunj Handa 承认,Decisions API 是受 Jev 启发启动的,起初并不在研发计划中;
- 项目启动约一周即完成可运行原型,未重新训练模型,沿用 Luna 权重、把输出约束成结构化结果;
- 专为决策优化推理系统,首次决策返回时间尽可能短,多问题可并行批量处理;
- 可用于客服工单分类、评估打分、计算机操作,也能与 GPT Live 配合。
计算机操作为什么终于变快了
Sky 联合创始人、现 OpenAI 计算机操作产品与工程负责人 Ari Weinstein 认为,过去一年最关键的进步是智能体遇到障碍后更会排错和重试。它不再只能看着截图逐步点击:页面结构、无障碍信息和智能体自己编写的代码,都成了它操作软件的方式。每个 Dot 都有一台独立的云端 Linux 电脑,既能开浏览器也能运行桌面应用。但 Ari 也强调,当智能体能访问网站、处理付款,人该在哪些环节把关,仍是产品必须回答的问题——可靠性和恰当的安全检查,是建立用户信任的基础。
Decisions API 的一周诞生记
最有趣的细节来自 OpenAI API 产品负责人 Nikunj Handa 的访谈:Jev 推出后引起了用户和内部团队的关注,Decisions API 此前并不在开发计划里。团队先验证原型是否可行,再着手优化决策返回速度,结果约一周就做出了可运行的原型。他们没有重新训练模型,而是沿用 Luna 的权重,把输出约束成结构化结果,并专门优化推理系统,让首次决策返回时间尽可能短,多问题还能并行批量处理。Nikunj 把它形容为「一个极快的分类和决策层」,能用于客服工单分类、评估打分和计算机操作,也能和 GPT Live 配合,让智能体在需要快速判断时更灵敏。
趋势洞察
从「AI 为什么不擅长操作电脑」的质疑出发,OpenAI 的产品思路清晰起来:智能体要真正落地,需要的不只是更强的模型,还有多模态感知(截图、无障碍 API、代码)、自主排错重试机制,以及一个能把「判断」快速结构化的决策层。而 Decisions API 的诞生也说明,行业竞争正在从「模型参数」转向「让智能可编程、可调用」的工程接口——谁能先把判断能力变成开发者手里的 API,谁就更接近下一个智能体时代。
两个值得注意的 API 细节
除了 Decisions API,这次访谈还透露了两个对开发者很实用的能力:异步函数调用允许模型在工具运行期间继续推理、之后再去获取结果;中途引导则允许开发者在模型运行过程中插入新消息。这两项能力对工具调用频繁、执行时间长的智能体任务尤其关键。结合计算机操作能力,OpenAI 试图回答的是一个更根本的问题:当智能体能访问网站、处理付款时,人该在哪些环节把关——Ari 的建议是限制智能体可访问的网站和应用,并在付款等可能产生重要后果的操作前征求用户同意。
本文地址:https://www.163264.com/16600