Positron AI Inc.是一家生产不含HBM内存的推理设备的公司,该公司今日宣布已完成8.75亿美元融资。
本轮融资由NEA、Atreides Management、Valor Equity Partners、Andra Capital、SemiAnalysis Capital以及Netscape Inc.联合创始人吉姆·克拉克领投,另有十余家机构投资者参与。融资完成后,Positron估值达到50亿美元,较今年2月增长了五倍。
大语言模型在运行过程中,需要频繁在底层图形芯片的计算电路与内存电路之间传输数据,这一传输速度由内存带宽这一指标来衡量。芯片的内存带宽越高,其执行推理任务的速度就越快。
服务器级图形芯片通常配备HBM内存,这是目前市场上内存带宽最高的RAM类型。然而当前HBM的供应远低于需求,此外,用于将HBM内存与图形芯片计算电路集成的互连器件也存在短缺。
总部位于内华达州里诺的Positron表示,其已找到规避供应链紧张问题的方法。该公司生产的推理设备用LPDDR5X内存替代了HBM,这种内存主要用于智能手机。
LPDDR5X的供应比HBM更充足,价格也更低。但存在一个关键问题:其内存带宽明显低于HBM,通常这意味着推理速度会更慢。Positron表示,公司已找到弥补这一性能差距的方法。
据该公司介绍,大多数人工智能加速器对HBM模块内存带宽的利用率不足30%。相比之下,Positron的推理设备能释放LPDDR5X超过90%的吞吐能力。公司表示,硬件利用率的提升弥补了理论峰值性能上的差距。
该公司的旗舰系统名为Titan,配备高达18.4TB的LPDDR5X内存,可提供23.68Tbps的内存带宽。据Positron介绍,如此大的内存池使单台Titan设备能够运行一个拥有32万亿参数、上下文窗口达100亿Token的大语言模型。
Titan通过一款名为Asimov的定制芯片来执行推理计算。该处理器基于脉动阵列架构构建,即一组包含协同定位内存的相同计算模块。Asimov利用其协同定位内存来存储大语言模型的权重,这些数值在大语言模型输出生成过程中起着重要作用。
该芯片的脉动阵列由专门优化用于运行激活函数的模块支持。这些代码片段用于确定大语言模型的哪些神经网络应参与某项推理任务。此外,Asimov还包含中央处理器核心,可作为"可编程应急通道",承接芯片其他模块未优化处理的任务。
每台Titan设备最多可搭载8颗Asimov芯片。客户可将多台设备连接组成集群,最多支持16384个加速器。
Titan和Asimov目前尚未量产。据Positron介绍,模拟数据显示,由其芯片驱动的服务器机架每美元可处理的Token数量,最高可达英伟达公司Blackwell GB300 NVL72设备的26倍。
"我们现在的重点是完成Asimov的芯片流片、推动Titan投入生产,并扩大制造规模以满足眼下的市场需求,"Positron首席执行官米特什·阿格拉瓦尔表示,"这笔融资为我们实现这一目标提供了充足的资金保障。"
Positron预计将于今年年底采用台湾积体电路制造公司的3纳米工艺完成Asimov芯片的流片,并于2027年下半年开始量产。与此同时,Positron也将加快Titan设备的制造进程,重点是与合作伙伴确立LPDDR5X的供应承诺。
Q&A
Q1:Positron融资获得多少钱?公司估值是多少?
A:Positron本轮融资获得8.75亿美元,公司估值达到50亿美元,较今年2月增长了五倍。
Q2:Positron的Titan设备用什么内存替代HBM?
A:Titan设备使用LPDDR5X内存替代HBM,这种内存主要用于智能手机,供应更充足、成本更低。
Q3:Positron的推理设备性能相比英伟达产品如何?
A:据Positron模拟数据显示,其芯片驱动的服务器机架每美元可处理的Token数量,最高可达英伟达Blackwell GB300 NVL72设备的26倍。
