2026年9月,OpenAI在DevDay发布了一批面向Agent开发者的新工具,Computer Use从一个"能跑但慢"的实验性功能,变成了一个在多数任务上比普通人操作更快的系统。Ari Weinstein负责OpenAI Computer Use的产品与工程工作,此前曾在Apple做自动化工具,后创立Sky并随之加入OpenAI。在DevDay结束后的第一时间,他与主持人swyx和Vibhu坐下来,把这次发布的技术逻辑说透了。第二个嘉宾Nikunj来自OpenAI的API团队,专门讲开发者侧的新能力。这期节目来自Latent Space播客,录于2026年9月底。

1. "180度不同":Computer Use在过去几个月里究竟变了什么

几个月前,有知名AI播客说Computer Use两年没有进展。Ari听到这个评价后,给出了自己的回应:"我希望他们现在已经有了不同的看法,因为Computer Use现在是180度不同的产品了。"

真正的转折发生在模型能力的一个具体维度上:调试能力。早期的Computer Use可以可靠地启动任务,但碰到问题就卡死了;现在的模型会反省、会重试、会判断哪里出了问题。这不是一个渐进的改善,而是让整个系统从"可以演示"变成"可以用"的质变。

与此同时,Computer Use的执行方式也发生了根本变化。展开Codex里的工具调用记录,你会发现它不再是一步一步截图点击,而是在写JavaScript代码,让计算机批量执行一组动作。接口层也变成了多模态的混合:截图、Accessibility树、DOM、Playwright——模型会根据任务类型选择最合适的交互方式。

2. GPT-6.1 Soul:成本和速度的双重突破

这次DevDay的核心模型是GPT-6.1 Soul。Ari提到了两个数字:相比上一代Astra,它的成本是五分之一;如果专门看Computer Use场景,成本是七分之一。这个降幅超出了基础推理成本的改善幅度,说明新模型在Computer Use任务上做了有针对性的优化。

速度的提升让整个用户体验发生了变化。Ari分享了一个自己的例子:他订阅了一个高度可定制的备餐服务,可以精确到每克鸡肉、每克米饭的配比,但操作太繁琐,他自己做一次订单要两个小时。他让Computer Use在GPT-6.1 Soul上跑了一次,15分钟搞定——不只是节省了时间,而是速度快了8倍。

当一个工具比你快8倍并且还帮你省了两小时,它就从"可选"变成了"必用"。

3. Dots:每个Agent拥有自己的Linux电脑

Dots是这次发布里产品形态变化最大的东西。它和之前的Computer Use产品有一个根本区别:每个Dot在云端拥有一整台Linux虚拟机。

此前的形态是:要么访问云端的一个浏览器,要么操控你自己的本地电脑。现在是完整的Linux桌面环境——可以跑完整的桌面应用,也可以开浏览器。这意味着Agent的能力上限不再受限于浏览器沙箱,而是和一个真正的云端工作站相当。

Ari的解释很直接:所有软件都是为人设计的,Computer Use让Agent能用同一套软件。Dots把这个能力变成了一个持久的、有状态的个人助理——你不需要每次都重新配置环境,Dot记住了你,也记住了上次的状态。开发者和用户可以从"我能做什么"变成"它能替我做什么"。

4. 测量进步:Benchmark之外的真实改善

Computer Use的测量比一般模型评测复杂。生产环境里的安全检查、不同任务的配置差异,让单一数字很难说明问题。Ari的态度是:无论用哪种测量方式,改善是一致的——有时候改善来自Harness,有时候来自模型,通常是两者合力。

Keynote上提到了7倍的速度提升,这个数字体现在多个基准测试上。但Ari更在意的是帕累托前沿:速度和准确率同时往好的方向移动,而不是牺牲其中一个换另一个。这是系统级的改善,不是单点的数字游戏。

他也坦承,"今天"和"昨天"的差别可能不如"过去两个月"的差别大。Computer Use是一个快速迭代的系统,每一天的改善都在累积,但真正的质变是发生在更长的时间跨度上的。

5. App Shots与多模态输入:给模型更丰富的上下文

App Shots是一个在Keynote里演示过但细节不多的功能。它的核心逻辑是:普通截图只给了模型一张像素图,App Shots会把你当前正在操作的应用上下文以更结构化的方式带入Codex或ChatGPT,让模型理解你在做什么,而不只是"看到"一张图。

Roman在演示里展示了一个场景:Computer Use自动给应用截图,同时他可以继续用自己的电脑做别的事情,两者互不干扰。这是Computer Use从"占用你的屏幕"变成"在后台帮你跑"的关键一步。

这也呼应了Ari对多模态接口的判断:截图、Accessibility树、DOM、Playwright这些不是竞争关系,而是工具箱。模型知道什么时候用哪个,这本身就是能力的体现。

6. Decisions API:低延迟推理的另一套逻辑

Nikunj带来了Developer侧的另一条线:Decisions API。它的定位和Computer Use里用的模型不同——没有推理步骤,是一个更小的模型,支持并行推理,速度极快。

Ari解释了两者的关系:Decisions API非常适合快速、高频的判断任务,但在长周期、复杂任务上不如Computer Use用的大模型。如何把两种能力结合起来,目前还是开放的研究问题。

这个API的诞生故事本身就值得一提。Nikunj描述了一个典型的OpenAI内部节奏:推理基础设施团队的工程师看到一个原型觉得很兴奋,直接开始黑客式地实现,原型跑通了,然后就开始"爬山"——一轮轮压延迟,达到目标就发布。从灵感到准备发布,周期极短。Ari补充说,OpenAI内部已经在用Decisions API做客服分类和其他工作流,这是把自己当第一个用户的做法。

7. 下一步:从"比人快"到"比专家快"

Ari在开篇和结尾都回到了同一个判断:Computer Use现在在大多数任务上已经比普通人快了。下一个目标是"literally superhuman"——不只是快过普通用户,而是快过真正的专家级电脑用户。

这个目标一旦实现,产品形态会发生根本变化。Ari认为,到那时才能真正构建出实时体验的产品——Agent的速度不再是用户体验的瓶颈,交互方式会从"委托任务然后等待"变成"实时协同"。

这也是这次DevDay整个叙事的核心:从研究成果到产品工具,Computer Use走完了第一段路。接下来的问题不是"能不能用",而是"快到什么程度才算够"。

Computer Use最初被质疑的那个问题——"两年没有进展"——现在有了一个具体的回答:从"可靠地开始任务"到"比专家更快地完成任务",这段路走了不到一年。

Latent Space 作者:智顶顶