现代AI的运行大量依赖乘法运算。从生成式AI到图片整理、音乐推荐,神经网络背后需要执行数十亿次将输入值与权重相乘的操作。德克萨斯大学奥斯汀分校电气与计算机工程学教授Lizy K. John认为,这些运算远比实际需要的复杂。

过去五年,John一直致力于研究一类名为"无权重神经网络"的模型。这类网络不依赖反复的乘法运算,而是将二进制输入通过相互连接的查找表进行处理——更像是查阅一组预存答案,而非反复求解同一道算术题。她表示,根据任务不同,这类网络在保持相近精度的前提下,体积或速度可达传统方案的1000倍。

她的团队目前专注于小型、特定场景的应用:医疗传感器、运动追踪、关键词识别。但她认为,这一方法最终有望扩展到更大的目标,包括当今聊天机器人背后的Transformer模型。

为什么选择放弃权重,转向查找表?

John表示,几年前,一位朋友随口邀请她参加一个每周例会,讨论用查找表替代权重的技术——这并非新概念。早在80年代,英国就有人围绕这一技术构建了用于模式识别的商业产品,但后来销声匿迹。里约联邦大学的几位教授多年来默默坚持研究,但只有一个研究小组,成果有限。

朋友知道她有硬件实现经验,认为她能帮助将这一想法落地。她当时有一名学生,此前一直研究脉冲神经网络——另一种传统神经网络的替代方案,非常适合接手这个课题。对她而言,贯穿始终的核心关切是能效。AI的高能耗令她忧虑,她一直在寻找用更少资源、更低功耗实现同等效果的方法。

不到六个月,团队就在FPGA(一种现成芯片)上实现了运行。他们构建出一批采用查找表方法的小型神经网络,可以运行在微型芯片上,无需GPU。体积比同类方案缩小了1000倍,这一结果令人振奋。

为什么现在是研究无权重神经网络的好时机?

John说,当前AI模型的能力令人叹为观止。她每次使用ChatGPT都印象深刻,尽管它有时也会出错。但当模型预测句子中的下一个词时,背后需要进行数十亿次乘法运算。如果有人问她一个问题,她不会靠做乘法来回答,而是在脑中判断:该说什么,不该说什么。而人脑完成这些思考,只消耗约20瓦的能量。

当今主流网络模型所依赖的神经元模型,源自1943年的一篇论文——McCulloch-Pitts模型。业界在此基础上不断扩展,堆叠数十亿个神经元,才得到今天能用的系统。但这并不意味着这是唯一的路。她的基本判断是:也许存在更简单的方式,同样能得出正确答案。

在查找表方案中,本质上是查询一个0或1,判断"走这个方向还是不走"。没有30位或16位的权重,也就没有乘法——而乘法正是耗能的根源,无论是在硬件中还是对人类大脑而言,都是一种代价高昂的运算。小时候我们都为背乘法表头疼,这本就是一种复杂操作。

目前已取得哪些成果?

在人体活动识别、医疗监测(心电图、脑电图、血压)等数据集上,无权重神经网络可将能耗降低1000倍。目前许多智能传感器上的处理只能采集原始数据并上传至服务器或手机,因为电池供电的贴片设备无法在本地完成处理。

他们的网络足够小,可以直接部署在传感器上。针对某一具体问题,业界最优的小型AI模型体积为17MB,而他们的方案仅需14KB,缩小了1000倍以上。这意味着无需每毫秒传输原始数据,既节省能耗,也保护隐私——数据无需离开设备。

在关键词识别方面同样取得进展。这类技术用于设备在识别"Alexa"等唤醒词之前的持续监听。目前业界最优模型每次推理需消耗5000纳焦以上,而他们的方案仅需42至79纳焦,具体取决于变体版本。

如果无权重架构明天就得到推广,哪个领域会最先受益?

John表示,首要目标是医疗监测,比如一种可以贴在身上持续使用一周的创可贴式设备,让医生无需昂贵的联网设备就能掌握患者状况。化学领域也是研究方向之一——学生做完实验后,数据需要缓慢传出进行离线处理,过程中会引入误差。他们希望将AI直接部署在实验现场,让结果即时呈现,就像把石蕊试纸浸入溶液,立刻看到颜色变化。

至于能否应用于聊天机器人,团队正在探索中。Transformer网络由注意力层和多层感知机交替叠加构成。目前他们已经替换了多层感知机部分,约占网络的一半;注意力层尚未替换。但从长远来看,大语言模型确实是目标之一。

此外,新型芯片制造工艺也带来了有趣的可能性。他们在柔性可弯曲基底上构建了一个心律失常检测器。这种基底只能容纳约1万个逻辑门,而现代2纳米或5纳米芯片可容纳数十亿个。传统神经网络根本无法在如此有限的空间内运行,而他们的网络可以,因为它本身就足够小。这种基底的制造过程也更具可持续性,耗水量远低于标准芯片制造工艺。

整个技术生态系统需要为此做出改变吗?

不需要。数据可以沿用当前模型所使用的数据,甚至可能需要更少的数据,这本身就是一个优势。训练目前仍在GPU上进行,因为GPU是现有最强大的计算平台。她希望未来能转向基于FPGA的硬件进行训练,因为FPGA本身内置了小型查找表,天然适合训练和推理两个阶段。在此之前,技术栈的其他部分无需改变。

FPGA使用查找表已有30多年历史,但在市场上并非主流,人们更多听到的是其他类型的处理器。近年来也有一些AI研究尝试用查找表替代部分乘法运算,但这些方案通常使用一张大型查找表,而非像他们这样将多张小型查找表相互连接。这种方法并不常见——了解它的人都知道它很出色,只是还没有流行起来。以前没有迫切需求,而现在有了。

为什么研究这一方向的人远少于研究Transformer的人?

John认为,原因在于:当一种方法已经奏效,且人们还负担得起继续沿用它的成本时,就缺乏足够的动力去转变。目前他们只能证明这一方法在小规模问题上有效,例如传感器输出等场景。对于更大规模的问题,人们对其能否扩展缺乏信心,因为它看起来太简单了,简单到难以置信。

每次她在会议或其他高校做报告,认真听讲的人都会深受触动,表示希望参与研究。但这只是零星吸引了少数人。她的希望是,能够证明这一方法在更大规模的大语言模型上同样有效,届时或许能吸引更多人加入。关键在于证明它可行。她对此充满期待。

Q&A

Q1:无权重神经网络和传统神经网络有什么区别?

A:传统神经网络依赖大量乘法运算,将输入值与权重相乘来完成计算,能耗极高。无权重神经网络则用查找表替代乘法,将二进制输入通过相互连接的查找表进行处理,本质上是查询预存答案。这使得网络体积和能耗大幅降低,在特定任务上可比传统方案小或快1000倍,且无需GPU即可运行。

Q2:无权重神经网络目前能用在哪些场景?

A:目前主要应用于小型、特定场景,包括医疗传感器(心电图、脑电图、血压监测)、人体活动识别和关键词识别。在这些场景中,能耗可降低1000倍,模型体积也极小,例如某问题上仅需14KB,而同类最优方案需要17MB。此外,团队还在探索化学实验现场的实时数据处理,以及柔性可弯曲芯片上的心律失常检测。

Q3:无权重神经网络未来能用于大语言模型吗?

A:有可能,但目前尚未完全实现。研究团队已成功替换Transformer网络中的多层感知机部分(约占网络的一半),但注意力层尚未替换。研究者认为大语言模型是长期目标,并希望通过在更大规模模型上的成功验证来吸引更多研究者加入这一方向。

Spectrum