AI硬件初创公司Olix Computing近日宣布完成3.12亿美元融资。本轮C轮融资的参与方包括Arm Holdings、Netflix联合创始人里德·黑斯廷斯等多位投资者。融资完成后,Olix估值达33亿美元,约为今年2月上轮融资后估值的三倍。
大语言模型接收提示词后,会将文本转化为一组数学值,即KV缓存,再利用KV缓存生成响应。推理流程的这一阶段被称为解码阶段。
总部位于伦敦的Olix正在研发一款名为DX-1的芯片,专为解码工作负载优化,并计划将其集成到名为X-1的数据中心设备中。据Olix介绍,系统内部的芯片将通过光学互连相连,以光的形式传输数据。
大语言模型在推理解码阶段所使用的KV缓存,其体积往往超过模型本身,因此无法存入芯片内部的SRAM。显卡通常的解决方案是将KV缓存卸载至片外HBM内存——HBM速度虽不及SRAM,但容量更大。
现有的解码优化处理器,如英伟达的Groq 3 LPX,则采用了不同的思路:配备远超普通显卡的片上SRAM,容量足以将KV缓存完整保存在芯片内部,从而无需依赖片外HBM。
Olix在今日发布的博客文章中暗示,DX-1芯片采用了类似方案。据该公司介绍,DX-1不含任何HBM内存,也不使用将HBM模块与显卡集成所需的先进封装技术。Olix表示,DX-1"将模型保存在高速片上内存SRAM中,以实现更高的能效和更低的延迟"。
在互连方案上,X-1设备中的处理器将通过"慢速宽带"光学互连相连。传统数据中心通常使用铜线连接机架内的芯片,而光学互连因光在玻璃中的传播速度快于电子在金属中的传播速度,性能更优。常规光学互连由少量高速数据通道组成,而"慢速宽带"方案则反其道而行之,采用大量低速通道。
两种方案的速度差异源于数据编码方式的不同。传统高速光学互连采用PAM4技术,速度快但可靠性较低,通常需要数字信号处理器来纠正传输错误。"慢速宽带"互连则采用可靠性更高的NRZ编码,误码率更低,无需数字信号处理器,从而降低了成本。此外,由于通道数量众多,单个通道出现故障对整体系统的影响也相对有限。
在性能方面,Olix表示DX-1芯片可支持1000亿参数的大语言模型以每秒超过10,000个Token的速度运行。用户还可将多个X-1机架组成集群,以运行参数规模达10万亿的超大模型。
Olix计划于2027年上半年开始出货。本轮融资将用于完善DX-1背后的"更广泛定制芯片平台",并加速推进量产工作。
Q&A
Q1:Olix的DX-1芯片与普通GPU在处理大语言模型推理时有什么区别?
A:普通GPU通过片外HBM内存存储KV缓存,而DX-1专为解码阶段优化,将KV缓存完整保存在速度更快的片上SRAM中,无需HBM,从而实现更低延迟和更高能效。
Q2:Olix X-1设备采用的"慢速宽带"光学互连有什么优势?
A:"慢速宽带"互连使用大量低速通道和NRZ编码,相比传统PAM4高速互连,误码率更低,无需额外的数字信号处理器,成本更低,且单通道故障对系统整体影响有限,可靠性更高。
Q3:Olix DX-1芯片能支持多大规模的模型?
A:单台X-1设备可支持1000亿参数的大语言模型以每秒超过10,000个Token的速度运行;多个X-1机架组成集群后,可运行参数规模高达10万亿的超大模型。
