人工智能带来的影响,已经导致人们的关注点从搜索引擎优化(SEO)转向了答案引擎优化(AEO),即内容被优化以便作为智能体式答案呈现出来。此外还存在更进一步的生成式引擎优化(GEO),品牌试图借此影响大语言模型。

软件工具本身是否也即将迎来重新洗牌,使得像 Claude Code、Codex 和 Cursor 这样的编程助手,更倾向于选择某个特定的调试套件、渗透测试工具、迁移工具、包管理器或数据库(或者你所设想的任何软件技术栈核心功能工具集)?

开发者工具增长服务公司 Armature 认为答案是肯定的。

利益攸关,深度绑定

带着显而易见的巨大利益,Armature 上周公布了一项研究,作为其"关于如何影响编程智能体选择"这一更广泛工作的一部分,目的是让产品被选中。该公司开展了一项实验性分析,旨在了解编程智能体如何看待工具、如何发现和挑选工具,以及在每个类别中最终胜出的是哪一个。

Armature 联合创始人西奥多·奥岑伯格(Theodore Otzenberger)向 The New Stack 表示,软件开发者对 AI 的采用比其他任何职业都更迅猛、更彻底,随着模型变得更智能、执行框架工程化程度更高,整个任务正被端到端地交给智能体处理。

"通过观察本次分析中的一万七千次工具选择会话,我们发现工具供应商二十年的品牌建设,就这样被瞬间冻结了,"奥岑伯格说。"智能体一提到容器就立刻想到 Docker,但对它现在提供的沙盒功能却一片空白,结果反而没有选择这个工具。你的声誉会伴随你进入模型权重,与那个让你成名的产品绑定在一起……但如今这种'权重'运作的引力规则已经变了。"

"通过观察本次分析中的一万七千次工具选择会话,我们发现工具供应商二十年的品牌建设,就这样被瞬间冻结了。"

奥岑伯格提醒我们,如今真正决定哪个工具会被接入代码库的,是智能体本身,他表示这对当今的开发者工具供应商来说"关乎生死存亡"。这些供应商现在必须确保自己的工具被提及、被选中,并被提升到"必备"的地位,以便被编程智能体视为极为可用的选项。他确信,否则的话,明天它们就会"直接从技术栈中消失"。

决策者正在改变……

"我们公开了整个研究,每一条痕迹和每一个提示词都发布出来,这样任何人都可以核实我们没有偏袒任何一方,看看目前各方的真实处境。这幅图景会随着每一个新智能体和新模型的出现而变化,所以我们即将在 Astra 和 Fable 5.1 上重新进行完整的研究。决策者正在发生变化,理解他们如今已经成为一个工程学问题,"奥岑伯格补充道。

奥岑伯格与联合创始人路易·斯克雷明(Louis Scremin)描述了他们如何观察了数千次工具搜索会话,覆盖了不同类型的人类开发者画像(从"氛围编程者"到初创公司的初级工程师,再到大型企业的高级开发者),共计使用了 1163 种提示词变体。需要说明的是,该公司公布的核心数据来自其经过验证的较小规模子集(5292 次会话),而非完整的一万七千次会话。

实验分析是如何进行的

搜索覆盖了 75 个代码仓库(即各自独立的代码库),并研究了三个编程智能体(Claude Code、Codex、Cursor),以考察这些智能体在实际实现工具时的表现,而不仅仅是提出建议。

该分析在公开的 GitHub 代码仓库上进行,团队提取了与编程语言及框架、第三方服务、部署平台、团队规模和代码库年龄相关的统计数据。由于所使用的开源代码库更可能是由初创公司而非企业级软件巨头构建的,团队随后根据公开可得的数据对统计结果进行了去偏处理,以实现其理想的样本分布。

接下来,他们让三个编程智能体分别创建真实世界的代码仓库,以匹配代码库的确切需求。最后,他们生成了移除部分代码库内容的变体版本。为了进一步防止智能体产生偏见,团队还使用了虚构的公司名称、人为编造的 Git 历史记录以及伪造的 API 密钥。团队通过一个协调器模拟了"人类参与决策"的环节,此次由 Gemini 3.7 Flash 扮演这一角色。

"模拟人类始终会选择排名最靠前的方案,或者要求编程智能体自行选出最佳方案并实施。但我们注意到,如果一开始就要求智能体直接实施而不提出任何疑问,会使智能体偏向于自行构建一切,因为它无法申请授权来选择某个特定的第三方方案。加入这个'人类'参与决策的环节后,最初观察到的领先工具及云平台原生方案的主导地位有所减弱,画面变得更为真实,"Armature 澄清道。

团队从中了解到了智能体工具选择的哪些规律?

或许并不令人意外的是,Armature 指出代码库的上下文环境是关键因素。当智能体被要求挑选一个胜出的电子邮件/通信服务提供商时,四个用四种不同语言编写的代码库,分别返回了四个不同的胜出工具。

Resend 在 TypeScript 代码中胜出(55/89 次运行)。

SendGrid 在 Python 中胜出(22/24)。

Postmark 在 Go 中胜出(20/24)。

Azure ACS 在 Java 中胜出(22/23)。

Armature 还发现,不同的编程智能体依赖不同的信息来源,因此彼此之间的选择结果并不一致。

Cursor 在三分之二的会话中依赖网络搜索做决策。

Codex 几乎总是使用网络搜索(94% 的会话),但十次查询中有九次会使用 site 等搜索指令符。

Claude Code 主要依赖其自身的先验知识,仅在约 30% 的情况下才会进行网络搜索。但一旦进行搜索,它浏览的页面数量是 Codex 的三倍。

三个智能体在仅有 42% 的情形下会选择同一款工具,而 Claude Code 选择自行构建的比例几乎是 Codex 和 Cursor 的两倍(19% 对 10%)。

这是从后门进来的采购决策

Glokal AI OU 的创始人兼首席技术官吉特·帕塔纳克(Jeet Pattanaik)向 The New Stack 表示,Armature 所提供的开发者工具增长服务,属于"因激励存在而存在"的一类业务,实际上"这是从后门溜进来的采购决策"。

"我最看重的发现是:被提及并不等于被选中,"帕塔纳克说。"PayPal 被提及了 139 次,却从未被选中过。LangChain 是被提及次数最多的框架,达到 194 次,但仅被选中了四次。这个差距正是整个商业模式的核心所在,因为这意味着影响决策的杠杆已经不再是品牌知名度了,而是智能体在做决策的那一刻恰好读到了什么内容。"

帕塔纳克强调了一个事实:真正左右智能体决策的因素,往往微小到令人不安的程度。

"因此,供应商接下来要优化的(除了研究中已经提到的代码库上下文环境之外)将是工具的配套文档和定价页面——而这些内容将面向一种非人类的读者呈现,它不会走马观花地浏览,不会被一个logo所打动,而是会把某个关于数据留存的脚注完全按字面意思理解。这是一种奇特的新型 SEO,而且它终将像旧式 SEO 一样被人钻空子,"帕塔纳克补充说。

"供应商接下来要优化的将是工具的配套文档和定价页面——而这些内容将面向一种非人类的读者呈现,它不会走马观花地浏览,不会被一个logo所打动,而是会把某个关于数据留存的脚注完全按字面意思理解。"

这类分析对现实世界开发者产生的影响,或许会在未来几个月里成为人们茶余饭后热议的话题。

这种对齐正成为一种日益增长的趋势

MailChannels 的创始人肯·辛普森(Ken Simpson,网名 ttul)在 Hacker News 上撰文表示,他也为自己的公司开展过类似的分析。

"Armature 确实抓住了一些关键点。你首先分析智能体在各种使用场景下会做出怎样的选择,然后从中提炼出你能做些什么——如果有的话——来让智能体的选择开始向你自己的产品倾斜,而远离竞争对手,"辛普森写道。

值得指出的是,Armature 是一家非常年轻的公司(成立于 2026 年),因此该机构对此类分析的呈现还处于早期阶段。无论如何,在一个智能体依据公开代码库、开放数据仓库以及整个互联网所提炼出的分析结果来做决策的世界里,我们或许真的需要把旧的营销手册扔出窗外,从头再来一遍。

Q&A

Q1:编程智能体选择工具主要依据什么因素?

A:研究发现代码库的上下文环境是关键因素,同一类需求在不同编程语言的代码库中,最终胜出的工具会完全不同,比如电子邮件服务在TypeScript、Python、Go、Java代码库中分别有不同的胜出者。

Q2:不同编程智能体在选择工具时是否一致?

A:并不一致。Claude Code、Codex、Cursor三个智能体在仅有42%的情形下会选择同一款工具,而且它们依赖的信息来源也不同,比如Codex几乎总是用网络搜索,Claude Code则主要依赖自身先验知识。

Q3:工具被智能体频繁提及是否意味着会被选中?

A:不一定。研究显示,PayPal被提及139次却从未被选中,LangChain被提及194次但只被选中4次,说明被提及和被实际选用之间存在很大差距。

The New Stack