在AI行业,基准测试已成为各家公司验证自身模型能力的行业惯例,当测试结果对自己有利时,便借此在竞争对手中脱颖而出并大肆宣传自身优势。换句话说,好的基准测试成绩几乎总是意味着良好的公关效果。
不过,不少公司也已经摸清了如何"戏耍"传统基准测试体系的门道——这些体系大多历史悠久,并非为衡量现代模型的能力而设计。
成立于2024年的初创公司Vals表示,他们的使命正是修复这一并不完善的评测体系。在不到两年的时间里,该公司已经在科技行业中树立起了自己的地位。去年,Vals由8VC和彭博Beta领投完成种子轮融资。上月,在经历了一段快速增长期后,该公司又完成了由安德森·霍洛维茨领投的4000万美元A轮融资。
公司联合创始人雷扬·克里希南现年25岁,此前曾在Palantir实习,并在斯坦福大学读本科期间为微软以及该校颇受赞誉的人工智能实验室工作过。克里希南表示,Vals的诞生源于他自己的一个观察——基准测试正在落后于其本应衡量的行业的发展速度。
克里希南分享道:"当时我们看到大量非常强大的新模型迅速涌入市场,而学术界的基准测试却跟不上这种前沿的进步速度。"随着AI融入社会的方方面面,基准测试真正应该存在的意义,是验证模型是否真的具备公司所宣传的能力。
上周,这位年轻的创始人带我参观了公司位于旧金山福尔松街的两层办公室——这栋古老的砖楼在一个世纪前曾是一家大型啤酒厂的所在地。如今,这座历史建筑不再产出啤酒,而是入驻了多家致力于打造科技行业未来的初创公司。
克里希南告诉我:"从历史上看,我认为评测工作一直是在以一种非常抽象的方式来衡量智能水平,比如模型是否掌握了足够的信息去通过律师资格考试之类的测试。"
在这一点上,Vals力求做出差异化。许多基准测试体系提供的测试题目是公开可查的(这可能导致公司针对这些测试题目专门训练自家模型,从而在考试中"作弊"),而Vals不会公开披露其具体的测试材料。除了衡量AI模型的通用知识外,Vals还会评估模型完成法律、金融、编程等特定行业相关复杂任务的能力。
克里希南表示:"我们真正在做的,是审视这些模型带来的实际影响。它们能否在每一个领域都产出与人类同等质量的工作成果?"
他说,这样做的目的不仅是检验模型带来的正面结果,也要检验负面结果。团队希望借此分析,"如果这些模型在现实世界中不受约束地运行,会带来哪些负面影响"。
Vals所测评的能力范围也在不断扩大。除了更传统的行业外,这家初创公司还在持续拓展一些更为独特的领域。克里希南分享道:"我们有一项关于递归自我改进能力的基准测试。我们还在心理健康、网络安全、生物安全等领域开展工作,甚至有专门测试模型理解并应用日内瓦公约、判断武装冲突法的基准。"
企业会付费请Vals来测试自家模型,这个商业模式乍一听可能让人有点难以理解——一家公司为什么要花钱去得知自己的模型表现不佳?但拥有一套行之有效的评测体系,能够帮助企业排查问题并持续改进。克里希南将他们的营收模式类比为学生付费参加College Board组织的SAT考试。
反过来,这些评测结果也正在成为企业在采购新AI模型时的关键决策依据。
这家初创公司近期披露,其目前的营收已达到去年同期的八倍。团队规模也在不断扩张。Vals今年年初仅有8名员工,如今团队规模已扩大三倍,达到25人。克里希南表示,随着公司不断发展,他们计划搬迁至一个规模显著更大的新办公室,并再招募10到15名员工。该公司近期还推出了一项面向联邦机构提供模型评测服务的项目。
克里希南认为,自家公司这套基准测试体系,代表着AI公司未来思考业务增长与建立公众信任的方向。
他说:"AI公司正开始走向上市。SpaceX已经上市,Anthropic计划今年晚些时候上市,我猜测OpenAI也会很快上市。我认为,随着AI模型日益成为经济的核心组成部分并被更广泛地应用,我们所做的这类基准测试与评测,将会推动这些模型的实际使用,并成为这些公司提交上市文件、或谈论未来AI投资计划时的核心内容。"
Q&A
Q1:Vals是一家什么样的公司?它的主要业务是什么?
A:Vals是一家成立于2024年的AI基准测试初创公司,致力于评测AI模型在法律、金融、编程等具体行业中完成复杂任务的真实能力,而非仅仅衡量模型的通用知识水平。
Q2:Vals最近完成了多少融资?由哪家机构领投?
A:Vals上月完成了由安德森·霍洛维茨领投的4000万美元A轮融资,此前该公司还曾获得8VC和彭博Beta领投的种子轮融资。
Q3:Vals的基准测试与传统基准测试相比有什么不同?
A:许多传统基准测试题目是公开的,模型可能针对性训练从而"作弊";而Vals不公开具体测试材料,并且注重评估模型在真实行业任务中的表现及潜在负面影响。
