你可能听说过那台由AI控制的自动售货机,里面卖的是内衣和活鱼。或者是旧金山那家商店里,AI经理解雇了一名人类员工的事情。又或者是那个AI电台主播,每天要说229次口头禅"保持在清单上"。

这些离奇事件都出自Andon Labs的实验项目。这是一家位于旧金山的AI安全公司,专门让AI智能体负责真实世界的运营工作,并观察结果如何。这些运营业务同时也是该公司为顶尖前沿AI实验室开发评估体系和进行研究的测试平台。

这些实验令人瞠目又荒诞的失败案例,为公司带来了大量关注。但很多人没意识到,这些实验其实是为了回答一个严肃的问题:当今的AI智能体究竟能承担多少真实世界的责任?"我们想要衡量自主性,"Andon联合创始人卢卡斯·彼得森说,"我们想为社会提供准确的数据,来说明当你这样做时会发生什么。"

从模拟环境到AI运营的真实企业

Andon Labs在2025年最初是从虚拟世界起步的,他们做了一个名为Vending-Bench的测试,让AI智能体运营一个模拟的自动售货机业务。这些基于Anthropic、谷歌和OpenAI大语言模型的智能体,负责管理订货、定价等任务。研究人员发现,许多智能体的表现会随时间推移而退化,出现忘记订单、误解送货时间表,或者陷入他们所称的"崩溃循环"等问题。一些智能体还会以"这是在模拟环境中,所以可以接受"为理由,为自己的欺骗性或非法行为进行辩解。

Andon团队认为,进入真实物理世界能让智能体面对工程师根本无法提前设计到程序中的各种后果和情境。"人类不可能把现实世界中会发生的所有情况都列举出来并写进模拟程序里,"彼得森说。此外还有一个原因:"我们觉得在真实世界里做这件事会挺有趣的。"Andon为这份玩笑投入了真金白银,包括为Andon Market签下了三年租约——这是一家位于旧金山繁忙街道上的实体店,由AI智能体管理,销售服装、家居用品和艺术品。

不过,这家店并非完全自主运营。"感觉就像是我在经营这家店,然后有个AI给我列了个清单,"员工费利克斯·卡森说。名为Luna的AI经理负责追踪送货情况并与供应商沟通,而卡森和同事们则处理实体工作。当Luna让卡森去后面检查东西时,他有时会忽略这个指令,因为他不想让销售区无人照看。Luna还多次在楼层照片中把内置的电气盖板误认为是松动的杯垫,要求卡森把它移除。尽管如此,卡森仍称Luna是个"还不错的经理",并称赞它在员工请假时表现得很灵活。

真实世界的AI实验能揭示什么,又不能揭示什么

Andon进军真实世界带来了一个基本的权衡取舍。进入物理世界让实验更加真实,但不可预测的环境条件和人类行为的不可预测性,使得这些测试无法重复验证。这种设置也使得难以判断某次成功或失败究竟应归因于模型本身、围绕模型搭建的软件,还是协助模型的人员。

彼得森坦然承认了这些局限性。他表示,只有一家店在不受控条件下运营,这些实验充其量只能算是"弱科学"。目前,他主要将这些实验视为发现意外行为的方式,之后Andon可以尝试在模拟环境中系统性地重现这些行为。

普林斯顿大学AI研究员萨亚什·卡波尔专门研究像Andon这类实验的"开放世界评估",他认为,尽管这些实验的科学严谨性有限,但仍具有真实价值。"我认为他们在推广这种评估方式方面做得不错,"他说,"哪怕只是证明了你可以从少量开放式实验中获得大量洞见。"他指出,学术研究和论文发表的速度跟不上AI飞速发展的步伐,并表示Andon的测试之所以有用,部分原因在于该公司的工作"确确实实处于模型能力的前沿"。

在卡波尔看来,真实世界的实验最适合用来发现可能的失败模式。一家真实的商店不仅能揭示智能体是否能管理库存或与供应商沟通,还能揭示员工是否会接受AI经理的指令,以及顾客是否愿意光顾由AI运营的商店(就最后这一点而言,早期结果明显是负面的)。这些社会和组织层面的障碍,或许有助于解释为何令人印象深刻的AI能力尚未转化为经济领域的广泛应用。"我认为Andon这项工作最有价值的地方,"卡波尔说,"是让我们更全面地理解这些智能体目前仍存在哪些局限。"

测试AI智能体的可靠性

位于斯德哥尔摩的Andon Café,就是AI展现出多种失败模式的一个典型例子。最初,当AI经理基于谷歌Gemini模型运行时,它花钱大手大脚地购买新鲜食材,结果很多食材在用完之前就变质了。当Andon把AI经理换成OpenAI的GPT模型后,它对于花费问题"惊慌失措",彼得森说。这个智能体反应过度,干脆停止购买任何可能过期的东西。它把菜单简化到只剩芝士吐司,用冷冻面包和保质期长的芝士来最大限度地减少浪费。但彼得森指出,这家咖啡馆位于斯德哥尔摩一个时尚地段,"任何人都知道芝士吐司在那里根本卖不出去"。

这个案例说明了为何成功完成单个任务并不等同于能够可靠地经营一家企业。卡波尔认为,AI评估过于关注智能体是否能完成任务本身。借鉴航空和核工程领域的经验,他和同事们提出还应衡量可靠性和稳健性等品质,这些品质决定了一个有能力的系统是否能在无需持续监督的情况下被信任运行。"可靠性的提升速度,远远慢于能力的提升速度,"卡波尔说。Andon的咖啡馆案例让这种差距变得具体可见:一个智能体或许完全有能力下单购买面包,但仍可能是个不可靠的经理。

为了确定这类失败发生的频率,以及是否可以预防,Andon计划将其实体业务中获得的数据反馈回模拟环境中。这些"数字孪生体"将重现最初在真实世界中遇到的复杂情况,让研究人员能够在受控条件下重演这些情境,并测试各种改动是否能让智能体变得更加可靠。原则上,实体业务用来发现失败模式,数字孪生体用来量化这些失败模式。不过卡波尔警告说,现有的数字孪生研究表明,"我们距离用模拟环境替代真实世界实验来研究人与组织的行为方式,还差得很远"。

尽管存在这些局限性,将真实世界测试平台与可重复的模拟实验结合起来,正是Andon商业模式的核心:为AI开发者提供基于实验室外真实情境的评估体系。该公司表示,其在研究和评估方面与Anthropic、谷歌DeepMind、OpenAI和xAI都有合作。而Andon自身经营的实体业务,成功程度依然明显有限。当Andon Market的卡森接受《IEEE Spectrum》采访时,他刚上班大约一个小时。期间有两位顾客进店,但都没有购买任何东西,不过两人都拿了免费的徽章和贴纸离开。

Q&A

Q1:Andon Labs是一家什么样的公司?

A:Andon Labs是一家位于旧金山的AI安全公司,专门让AI智能体负责真实世界的商业运营,并观察其表现,同时为顶尖AI实验室提供评估和研究服务。

Q2:AI经理在真实商店运营中表现如何?

A:表现参差不齐。比如Andon Market的AI经理Luna能追踪送货、联系供应商,但也会犯误判错误,比如把电气盖板误认成杯垫;Andon Café的AI经理曾因担心食材浪费,把菜单简化到只剩芝士吐司。

Q3:为什么要在真实世界而非模拟环境中测试AI智能体?

A:因为人类无法提前把现实世界中所有可能发生的情况都写进模拟程序里。真实世界能让AI智能体遇到工程师从未设计过的意外后果和情境,从而更真实地揭示AI的能力边界和失败模式。

Spectrum