AI推理速度的竞争愈演愈烈。今年5月,专为AI推理设计定制芯片的Cerebras在IPO首日便收获市场热烈反响。然而,法国初创公司Kog却另辟蹊径,坚信传统GPU还有大量潜力尚待挖掘。
今年5月,Kog凭借一篇技术预览文章登上Hacker News首页。该预览旨在证明"在企业已有的标准数据中心GPU上,实现极速单请求解码完全可行"——演示中使用的正是AMD MI300X和英伟达H200 GPU。
部分人对此感到失望,因为这一方案并不适用于个人笔记本电脑中的GPU。但也有不少人看到了其中的潜力。在推理速度和成本已成为关键瓶颈的当下,Kog承诺通过软件优化释放现有硬件的新能力,吸引了远不止旁观者的关注。"我们获得了200个实质性的商业线索,"CEO盖尔·德拉洛在接受TechCrunch采访时表示。
根据早期反馈,这位独立创始人预计软件工程将成为首要应用场景。资深的Claude Code用户深知,有时需要等待数小时才能获得结果。Anthropic自身也深知速度的价值,为Claude的快速模式单独定了更高价格。
Kog希望吸引那些因等待时间过长而望而却步的用户——他们通常将AI工作流用于专业任务。此外,该公司也有一些设计合作伙伴,这些合作伙伴允许用户通过提示词生成游戏和应用程序。德拉洛表示,借助Kog推理引擎(KIE)实现更快的输出,将直接为这些合作伙伴带来更多收入。
Kog也清醒地认识到,这一市场尚未完全成熟。在观察需求的过程中,Kog发现潜在客户并没有准备好对小模型进行微调。"正因如此,自发布以来,我们全力专注于加速大模型的开发,以满足我们所观察到的市场需求。"
这意味着Kog要实现"推理速度提升30倍"的承诺,仍需迈过一道高门槛。其演示展示了令人印象深刻的每请求3000 Token/秒(TPS)——但这是基于一个专门构建的小型模型实现的,该模型仅有约20亿参数,即现已开源的Laneformer 2B。
面对质疑,德拉洛对相同方案同样适用于大语言模型充满信心,尽管大语言模型的规模对推理芯片而言是一大挑战。"GPU拥有光明的未来,"他说。在这位CEO看来,"GPU不适合解码"已成为一种误解;新一代GPU拥有越来越大的内存带宽,只等被充分释放。
Kog并非唯一一家认为软件优化能让GPU发挥超出标称性能的公司。同样来自法国的ZML发布了与硬件无关的软件,绕过英伟达的CUDA框架,支持在多种竞争芯片上实现快速推理。但德拉洛表示,Kog更接近斯坦福大学的Hazy Research实验室,在GPU加速领域的专注程度更为深入底层。
德拉洛本人并非研究员,他的第一家创业公司——曾入选TechCrunch50 2009的Stribe——与Kog毫无关联,唯一的交集是他的前联合创始人、后来转型为风险投资人的卡梅尔·泽鲁阿尔,其旗下的Varsity VC联合领投了Kog的种子轮融资。
Kog在底层技术上的深度专注,源自德拉洛独特的个人背景。他在法国综合理工学院攻读固体物理学,毕业后从事进攻性网络安全工作,也就是白帽黑客。德拉洛表示,这段经历塑造了他如今在团队中大力倡导的思维方式。在科学层面,"要理解物理定律,理解GPU的运行规律,才能将其发挥到极致。"在黑客精神层面,这位DEF CON CTF锦标赛四次决赛入围者说,它教会他"在极低的层面逆向工程——深入到汇编语言和二进制代码——去理解事物的运作原理,并尝试利用它来实现一个它原本未必被设计用来完成的目标。"
这种方式的代价是极度耗费时间与精力。"每遇到一款新GPU,我们都会投入数周乃至数月时间,深入研究细节,在该硬件上开展GPU工程研究。"以目前11人的团队规模,这在相当长一段时间内限制了Kog所能支持的芯片数量。
从长远来看,Kog希望将其方法论融入基于智能体的流水线,从而支持更多芯片和模型。随着欧洲积极构建自身在这两个方向上的能力,这或许将为Kog带来主权层面的政策红利。目前,该公司已获得Scaleway的支持,并得到法国公共投资银行Bpifrance及法国科技2030计划的背书。
但当务之急,Kog需要向市场证明其方法论在大语言模型上同样行之有效。这也是获取下一轮融资的关键。"一旦我们将第一个主要模型的速度提升10倍——我预计这将在9月实现——我们就能开始展示客户牵引力,并以此为基础启动A轮融资,"德拉洛说。
Q&A
Q1:Kog推理引擎(KIE)的推理速度能达到多少?
A:Kog的演示显示,其推理速度可达每请求3000 Token/秒(TPS),并声称最终目标是实现比现有方案快30倍的大语言模型推理速度。不过,目前这一成绩是基于约20亿参数的小型模型Laneformer 2B实现的,在大语言模型上的验证仍在进行中,CEO预计9月可展示首个大模型10倍速度提升的成果。
Q2:Kog的技术方案和其他GPU推理优化方案有什么区别?
A:同样来自法国的ZML也在做硬件无关的推理优化软件,绕过英伟达CUDA以支持多种芯片。而Kog更专注于底层GPU加速研究,风格更接近斯坦福的Hazy Research实验室。Kog会针对每款新GPU投入数周乃至数月进行深度工程研究,专注程度和底层深度是其主要差异所在。
Q3:Kog主要面向哪些客户或应用场景?
A:Kog主要瞄准因推理延迟而受阻的专业用户,例如依赖AI工作流完成专业任务的团队,以及通过提示词生成游戏和应用程序的平台型客户。CEO表示,软件工程将是首个重点应用场景,更快的推理速度可直接为这些客户带来效率提升和收入增长。
