Sequoia Capital的播客节目"Training Data"近期邀请到Parag Agrawal,他曾担任Twitter CEO,在将Twitter出售给马斯克之前离职,此后回归创业,创立了Parallel Web Systems。本期节目由Sequoia合伙人Sonya Huang和Andrew Reed主持,话题聚焦于Agrawal正在构建的"智能体搜索"基础设施,以及他对互联网商业模式即将发生的根本性变革的判断。

Agrawal的核心押注简单而激进:AI智能体使用搜索的频次,将是人类的一千倍。这不是一个渐进式的量变,而是需要从零重建整套技术栈和商业逻辑的量级跳跃。他用三年时间,带着这个判断,正在悄悄重造搜索引擎的底层。

1. "人类点击数据是个bug"

在Google统治搜索二十年的逻辑里,有一个核心假设:人类的点击行为是最好的相关性信号。哪个结果被点击最多,哪个结果就最好。整个搜索排名的优化,都围绕着这个反馈循环运转。

Agrawal把这个假设翻过来了。"我们在Parallel的观点是,人类点击数据是个bug。" 当搜索的使用者是AI智能体而不是人类时,人类点击产生的反馈信号不仅没用,还会让模型学坏。智能体做搜索,应该依赖智能体的反馈,而不是人类的反馈。

这个判断在三年前他创业时就确立了,但当时面临的最大障碍之一恰恰是:如何大规模获取高质量的评分数据来训练排名模型?传统做法是雇人工打标,成本高昂且难以规模化。大型语言模型的出现改变了这道题——专家级别的评分数据现在可以由模型生成,成本大幅下降。更重要的是,智能体作为一个独立的"客户群体"真正出现了,这让Parallel的整个商业逻辑变得可验证。

2. 先做智能体,后建索引

从零开始造搜索引擎,最让外界质疑的问题是:谷歌和必应花了二十年、几百亿美元才建起全量网络索引,你一家早期公司凭什么从头干起?

Agrawal的回答是,他从一开始就没打算"先建索引再找客户"。

Parallel第一个上线的产品不是搜索引擎,而是搜索智能体(search agent)。 这个区别很关键。当用户提交一个需要深度研究的查询,他们愿意等一分钟甚至十分钟。在这段等待时间里,智能体可以实时爬取网页,用推理时的计算量来弥补索引不完整的缺口。

这其实是一种资源置换:用推理时的算力换取对离线爬取索引的依赖。牺牲了延迟,换来了在索引尚不完整时就能开始服务真实客户。在客户使用过程中,Parallel不断积累真实的查询数据,逐步扩充索引范围——用业务增长来驱动基础设施建设,而不是反过来。

早期客户来自几个明显有"批量研究需求"的垂直领域:保险核保和理赔处理、销售数据增富、量化金融的数据采集。这些场景的共同特点是,之前都在花钱雇人在搜索引擎上做大量重复性信息采集工作。Parallel用智能体替代了这批人工,同时收集到了大量真实的"智能体搜索"评估数据——这才是他们最需要的东西。

3. 这家公司到底是什么

"你们是AI公司还是基础设施公司?按某些定义,这简直就是个新型实验室(neolab)。"Andrew Reed在访谈中直接发问。

Agrawal的回答明确而坚定:Parallel不是新型实验室。

他对"新型实验室"的定义是:输出物是一个模型。Parallel的输出物不是模型,而是模型的放大器。"别人发布了更好的模型,对我们来说是好事,因为这打开了更多我们能发挥价值的场景。" 而对于其他试图做通用基础模型的公司,更强的竞争模型意味着要爬更高的山。

Parallel的核心技术问题,Agrawal用一个极其简洁的框架描述:每一次搜索查询,本质上是"从一万亿个网页里,给我找对的一千个token"。为了在极短时间内完成这件事,他们需要把信息跨存储层级高效组织,训练专门的小型排名模型,并在极有限的计算/延迟预算内最大化输出质量。

这里涉及大量研究性工作——如何拿一个预训练基础模型,改造它的架构来适配这个新问题,如何在固定的延迟窗口内分配算力。但这与训练超大规模基础模型是完全不同的方向:Parallel的目标是把信息压缩进极小的排名模型,而不是把模型做大。

4. 200毫秒:把搜索速度压进智能体的节奏

访谈中有一个数字值得单独拿出来说。Agrawal提到,就在录制前一周,Parallel刚刚发布了新产品Turbo——将智能体搜索的响应时间从此前的3秒压缩到了200毫秒。

3秒和200毫秒的差距,对人类用户来说可能感受不大。但对智能体来说,这个差距决定了整个系统的架构能否成立。当一个AI智能体在完成任务的过程中需要反复调用搜索,每次查询耗时3秒意味着整个任务流程的速度瓶颈卡死在搜索这一环;200毫秒意味着搜索可以被当作一个接近实时的工具来调用,智能体的工作节奏不会被打断。

在技术上,这意味着必须放弃"读时堆算力"的策略,转而在离线阶段把更多的信息压缩进内存层级,训练出能在极短时间内做出高质量排序决策的专用模型。这是一个系统层面的重新设计,而不是单纯的工程优化。

Agrawal的表述里有一个细节:"到上周为止,我们还给自己3秒钟来投入算力做实时处理。这周开始,只有200毫秒了。" 这意味着整个技术取舍框架需要重新校准,在同样的延迟预算里,离线的信息组织工作必须做到更高的完整性,才能让实时的排序模型不需要太多实时算力就能找到正确答案。

这次对话止步于搜索的技术层面,商业模式和内容出版生态的部分尚未在字幕中展开。但从Agrawal的技术判断来看,他在押注的,是搜索基础设施的一次完整换代:不只是把旧引擎接上AI接口,而是从反馈数据、索引策略到延迟预算,每一层都重新设计,以匹配智能体而非人类的使用方式。在他看来,人类搜索时代积累的那套基础设施,对智能体来说是历史包袱,不是财富。

playlist7 作者:智顶顶