在一张实验台上,康奈尔科技大学博士后研究员何一凡将一台光学接收器的镜头对准约一米外发出红色光束的LED灯。与接收器相连的电脑显示器稍作刷新后,呈现出一排形似二维码的方格阵列。
当我们用手机镜头扫描二维码时,光线照射到图像传感器只是解读黑白矩阵背后数据的第一步。而这里的接收器则截然不同:它直接利用光束照射产生的光电流来改写自身的存储内容。与二维码所藏的数据(通常只是一个简单的网址)不同,这种光学编码可以传输AI模型的参数。
上个月,在IEEE/JSAP超大规模集成电路技术与电路研讨会上,研究团队正式发布了这一新型接收器设计,旨在缓解AI系统对存储器日益增长的需求压力。研究人员指出,通过向处理器直接投射数据,可以降低数据中心、自动驾驶汽车乃至AI机器人等边缘应用场景所消耗的能量。
"各种各样的AI芯片层出不穷,"纽约康奈尔科技大学电气与计算机工程系副教授徐在善(Jae-sun Seo)说道。这些处理器的内部空间通常不足以存放AI模型的全部参数,因此额外的数据需要存储在动态随机存取存储器(DRAM)中。随着系统规模扩大,用于在DRAM和处理器之间传输数据的电气连接会带来成本和效率问题,"这是主要瓶颈之一。"
光学链路以高带宽传输数据,能耗损失比金属导线低,但现有光学接收器依赖耗电量大的模拟电路来完成光信号到电信号的转换,这一缺陷削弱了其本身的优势。该团队的新技术则采用接收快速闪烁的数字二维码式矩阵的方式,无需模拟电路即可让芯片调整模型参数,实现全数字光学通信,从而降低能耗。
"这是一个非常重要的问题,"IEEE院士、密歇根大学电气与计算机工程系主任丹尼斯·西尔维斯特(Dennis Sylvester)表示,他并未参与该项目。"这项研究具有巨大的商业价值,而这个解决方案的思路十分巧妙。"
系统架构
处理器内置有少量静态随机存取存储器(SRAM),但容量不足以支撑AI模型独立运行。相比之下,DRAM虽然读写速度较慢,但在相同面积内可存储更多数据。
在新系统中,DRAM与发射端放置在一起,接收端则作为处理器SRAM的一部分。发射端将数据以光束形式照射到SRAM单元阵列上,这些存储单元经过改造,内置了光电二极管。光线照射每个光电二极管后产生电流,进而翻转SRAM中的二进制数值。
在建立光信号与接收器之间的连接时,必须进行校准,因为二者难以保证完全对准或相互垂直。为此,芯片会参考一个数据帧,其中包含每个数据像素预期位置的信息,并以此为基准确保正确接收真实数据。何一凡解释说,"最理想的情况是发射端和接收端之间保持点对点的直线空间",徐在善补充道,"但即便存在轻微倾斜,我们的校准电路也能应对。"
研究人员表示,若要在实际场景中落地应用,还需要开发一种能够每秒数百万次切换光学矩阵、传输速率达到每秒吉比特级别的光学发射器。目前,在何一凡和徐在善的实验室中可以看到的发射器仅是概念验证原型,只能通过金属掩模发出静态的14×14比特矩阵。研究团队表示,正在与光学研究团队合作,开发能够快速切换矩阵的发射器。
商业化挑战
西尔维斯特认为,该技术目前距离商业化仍有较大距离,原因在于单个光敏存储位单元比常规芯片中的SRAM位单元面积更大。这意味着芯片可容纳的存储容量更小,这一取舍可能会抵消基于光学方案带来的效率提升。
徐在善表示,缩小存储位单元是团队持续攻关的方向,可以通过优化晶体管和电路尺寸、利用CMOS工艺缩放来实现。
徐在善和何一凡正在探索该技术在机器人及其他边缘应用领域的潜力。例如,在AI机器人驱动的仓储和工厂场景中,可借助光学数据传输技术,在为每台机器人更新AI模型时节省时间和能耗。此外,由于体积限制导致存储资源极为有限的微型机器人,未来也有望从中受益,但这需要更加注重尺寸优化的设计方案。
"边缘AI是一个高速增长的领域,三四五年后,它受到的关注度很可能与数据中心不相上下,因为智能将越来越多地迁移到我们身边的这些设备中,"西尔维斯特表示。
Q&A
Q1:这种光学接收器技术与普通二维码扫描有什么区别?
A:普通手机扫描二维码时,光线照射图像传感器只是数据读取的第一步,后续还需要软件解析。而新型光学接收器不同,它利用光束产生的光电流直接改写芯片自身的存储内容,无需模拟转换电路,还能传输AI模型参数等复杂数据,实现全数字光学通信,大幅降低能耗。
Q2:光学数据传输技术在AI机器人上有哪些具体应用场景?
A:研究人员认为该技术在边缘AI领域潜力巨大。在仓储和工厂中,AI机器人可通过光学数据传输快速更新AI模型,节省时间和能耗。对于体积极小、存储资源严重受限的微型机器人,该技术也有望提供帮助,但需要针对尺寸进行专项优化设计。
Q3:光学接收器技术目前距离商业化还有多远?
A:目前距商业化仍有较大差距。主要障碍在于光敏存储位单元面积比常规SRAM位单元更大,导致芯片可容纳的存储容量减少,可能抵消光学方案的效率优势。此外,现有发射器仅为概念验证原型,尚不具备每秒切换数百万次矩阵的能力。团队正通过优化晶体管尺寸和CMOS工艺缩放来缩小存储单元。
