人工智能分类:人工智能
想象一支交响乐团正在演奏一首复杂的乐曲。如果小提琴每隔几小节就跑偏音调,整个乐团就不得不频繁停下来重新调音。幸运的是,这种情况在真实演出中不会发生,因为乐器能够保持稳定。然而,这恰恰是当前量子计算机运行的真实困境。
量子计算机本质上是对漂移极为敏感的模拟机器,为了维持可靠运行,必须持续重新校准控制参数,包括驱动量子比特的模拟信号的频率、振幅和相位。目前,这一过程需要完全中断整个量子计算任务。计算与校准的彻底分离,成为量子计算未来发展的根本瓶颈——因为实用的量子算法需要连续运行数天乃至数月。
为此,谷歌研究团队在《自然》期刊上发表了题为《量子纠错的强化学习控制》的论文,展示了一种强化学习(RL)框架。在该框架中,自主智能体通过从量子错误检测事件中持续学习,实时调整数千个控制参数,在计算过程中稳定量子系统、抵抗漂移。简而言之:这项研究找到了一种"演奏中随时调音"的方法。
在音乐厅里,一件走音的乐器会被立刻听出来。但在量子世界中,情况截然不同。对量子比特的测量会使其量子叠加态坍缩,就如同"聆听本身毁掉了演出"。为了保护量子信息,研究团队采用了量子纠错(QEC)技术——通过冗余编码将多个物理量子比特组合成"逻辑量子比特",并利用专门的奇偶校验方式,将模拟噪声转化为二值化的错误检测事件。
然而,这些事件只能告诉我们某处发生了错误,却无法精确定位。这好比听到了一个刺耳的音符,却不知道是哪位演奏者出了问题。为了定位可能的错误位置并计算相应的纠正方案,研究团队依赖量子纠错解码器,例如基于真实数据训练的神经网络解码器AlphaQubit,以及算法解码器Tesseract。当错误足够稀少时,这些解码器能通过分析检测数据成功恢复逻辑量子信息。但解码器留下了一个关键问题未解答:这些错误最初为什么会发生?
部分错误源于量子系统与外部环境之间不可避免的相互作用,导致退相干现象。这一过程会摧毁宏观量子叠加态,使量子计算机退化为经典计算机。还有许多错误则是控制校准不精确和硬件漂移的表现——这些问题理论上是可以通过技术手段加以改善的。
传统的量子校准依赖物理模型,经过数十年量子控制研究不断完善。然而,依赖人工建模的方法在各技术领域都面临性能天花板。早期计算机视觉依赖严格几何规则时遭遇瓶颈;传统机器人学至今仍难以用运动学方程描述接触动力学和摩擦力的复杂现实;蛋白质折叠预测这一数十年悬而未决的难题,直到AlphaFold等深度学习系统出现才取得突破性进展。共同规律是:当方法从人工建模转向直接从数据中学习,新的突破才得以实现。
谷歌研究院在利用强化学习解决复杂问题方面积累了丰富经验。强化学习不依赖预设指令,而是通过经验驱动:智能体测试不同行为,并从产生的错误中直接学习,持续优化策略。由于量子纠错本身已经持续产生检测事件,研究团队赋予这些数据一个额外角色:除了解码纠错,还将检测事件作为主动学习信号。随着计算推进,强化学习智能体实时监控这些数据,动态调整控制参数,对抗漂移、防止新错误产生。
研究团队在谷歌旗舰超导处理器Willow上对该强化学习量子控制框架进行了验证。通过人为注入控制参数漂移,结果表明强化学习调控将纠错码的逻辑稳定性提升了3.5倍,显著延长了处理器作为可靠"量子存储"设备的时长。
通常,将处理器调至最佳状态需要"人在回路"的方式,科学家需要凭借物理直觉处理难以自动化的边界情况。然而,即便经过这样全面的专家校准,后续的强化学习微调仍系统性地将逻辑错误率额外降低了20%。
综合所有技术后,本次实验将量子存储中的逻辑错误降至历史新低:在表面码中,每千次纠错周期不足一次错误;在色码中,每百次不足一次。
在可扩展性方面,研究团队通过数百个量子比特和数万个控制参数的数值模拟进行了验证。结果证实:所需的强化学习训练迭代次数与系统规模无关,这为将该方法扩展至更大规模系统提供了重要依据。通过加速智能体与量子处理器之间的通信循环,并引入更先进的机器学习方法,研究团队期待进一步释放该框架的潜力。
这项工作开启了一种全新范式:量子计算机能够从自身错误中学习,并在计算过程中持续保持稳定运行。
本项工作由谷歌研究院Google Quantum AI团队与Google DeepMind团队联合完成。
Q&A
Q1:量子纠错中的强化学习框架是如何工作的?
A:在该框架中,强化学习智能体持续监控量子纠错产生的错误检测事件,将这些事件作为学习信号,实时动态调整数千个控制参数(如频率、振幅、相位),从而在计算过程中对抗硬件漂移,稳定量子系统。整个过程无需中断量子计算任务,实现了"边演奏边调音"的目标。
Q2:Willow处理器上的实验取得了哪些具体成果?
A:在谷歌Willow超导处理器上的验证实验显示,强化学习调控将纠错码的逻辑稳定性提升了3.5倍;在专家完成人工校准后,强化学习微调还额外将逻辑错误率降低了20%。综合所有技术后,量子存储的逻辑错误率达到历史新低:表面码每千次纠错周期不足一次,色码每百次不足一次。
Q3:这种强化学习方法能否扩展到更大规模的量子计算机?
A:可以。研究团队通过数百个量子比特和数万个控制参数的数值模拟验证了可扩展性。结果表明,强化学习所需的训练迭代次数与系统规模无关,意味着该方法在原理上可以扩展到未来更大型的量子计算机,而不会因系统增大而导致训练成本指数级上升。
