这是Y Combinator于2026年8月举办的一场以数据为主题的专题演讲活动,主持人Francois Chaubard邀请了三位领域专家——Snorkel联合创始人Vincent Chen、Inception Labs创始人Volo Kuleshov,以及MIT博士、Anthropic研究员Shayne Longpre——围绕训练数据、基准测试与多语言预训练展开深度分享。

Francois Chaubard本人有着九年深度学习团队的一线经验,他在Focal Systems期间亲历了数据从"被忽视的配角"到"核心瓶颈"的全过程转变。他在开场时提到,2016年他离开博士项目创业时,业界普遍认为数据是商品,Scale AI的早期投资者几乎找不到,大多数VC认为数据业务的终值是零。而今天,这个赛道已经创造了超过千亿美元的市值。

这场演讲的核心命题是:在Transformer架构已经成熟、算力不再是主要瓶颈的今天,数据才是制约AI能力上限的真正变量。

1. "你有85%的F1分数,下一步做什么?"

Chaubard在Focal Systems面试深度学习工程师时,有一道必考题:模型在"热狗/非热狗"分类任务上达到了85%的F1分数,你接下来怎么做?

大多数候选人的回答是:读论文、换激活函数、加层数。他的回答是:直接淘汰。

正确答案只有一个:看数据。把所有假阳性和假阴性分类整理出来,放进帕累托桶(Pareto buckets),找出最大的问题所在。在Focal的货架识别场景里,模型失效的原因往往是冰箱玻璃起雾、有人挡住了货架——这些问题加多少层神经网络都解决不了,只有通过数据才能发现并修复。

他引用了Andrej Karpathy的经历:Karpathy曾亲自标注ImageNet,测量人类在这个数据集上的真实水平,结果发现自己也分不清爱斯基摩雪橇犬和西伯利亚哈士奇——而ImageNet里有30%到40%的图片都是各种狗。数据本身的质量问题,比架构选择更根本。

Karpathy在读博期间,花了大约5%的时间思考数据,95%的时间在研究架构。进入生产环境后,这个比例翻转了。Chaubard认为,现在这个比例已经接近3%对97%——架构问题基本解决了,数据才是战场。

2. 分布偏移:训练集再大也不够

"你有1000亿小时的数据,然后Salesforce改了UI。"

这是Chaubard描述数据问题时最直接的一个例子。假设你在自动化Salesforce操作,收集了海量用户操作录屏,训练出了一个表现优秀的模型。然后产品界面更新了。所有数据作废,重新来过。

这就是训练分布与测试分布之间的偏移(distribution shift)。模型在漂亮的训练集上表现完美,一旦进入真实生产环境,遇到训练时没见过的情况,就会彻底失效。数据不是一次性资产,它需要持续维护和更新。

他还提到了一个更具体的例子:目前没有任何AI模型能在预测标普500指数未来七天收益上超过随机猜测。掷硬币比所有在产模型都强。原因很简单——没有高质量的专家数据。如果能拿到高盛交易员的操作记录,结果可能会不同,但这类数据根本不存在于公开训练集里。

3. 数据集是产品,不是ZIP文件

"很多人以为数据集就是个压缩包,其实完全不是。"

Chaubard用ARC-AGI的游戏设计举例:Prime Intellect刚刚在某个游戏上取得了突破,但那个游戏本身的设计工作量是巨大的。每一个高质量的评估环境,背后都是极其精细的工程投入。

他在Focal的经历同样印证了这一点:仅仅是"在库/缺货"这个看似简单的分类任务,就需要处理大量边界情况——比如"产品推手"(product pusher):货架上的商品被推到了前面,看起来像有货,但实际上后面是空的。这算缺货吗?如果算,模型会把它和真正的缺货混淆;如果不算,又会漏掉一类真实问题。这类本体论决策(ontology decision)需要大量领域专家的判断,没有捷径。

他提出了一个类比:数据集之于LLM,就像App之于iPhone。你想让LLM成为一个好医生、好律师、好会计,就需要对应领域的高质量数据和强化学习环境。这类数据有多少种,就像手机里能装多少个App——数量是开放的。而且,就像Instacart不应该由苹果公司来做一样,OpenAI、Anthropic、谷歌也不应该自己去建医疗数据集——应该有专门的公司来做这件事。

4. 专家监督的规模化:从标注到知识提取

Vincent Chen是Snorkel的联合创始人,Snorkel起源于斯坦福AI实验室,专注于数据问题已超过十年。他的核心论点是:真正的瓶颈不是数据量,而是专家判断的规模化。

医生、律师、记者——这些人脑子里装着"什么是好答案"的完整规格,但把这些知识提取出来、转化成有效的训练数据,是一个极其困难的工程问题。Snorkel的所有研究都围绕这个问题展开:如何给领域专家提供杠杆,让他们的判断能够高效地转化为数据集。

他将数据标注的演进分为几个阶段。早期的Data 1.0是基础标注:问答对、偏好标签、简单的提示-回复对,每条数据大约需要30秒的人工判断。这个阶段的瓶颈是吞吐量。

这场演讲最终指向一个共同结论:AI能力的天花板,不是由模型架构决定的,而是由训练数据的质量和覆盖范围决定的。Transformer已经足够好了,GPU也足够多了,但医疗、法律、金融这些领域的专家级数据,依然稀缺。谁能解决专家知识的规模化提取问题,谁就掌握了下一阶段AI竞争的关键变量。Chaubard在开场时说,十年前VC们认为数据业务终值为零,而今天这个赛道已经创造了超过千亿美元的市值。这个数字,还会继续增长。

Y Combinator 作者:智顶顶