量子计算能效壁垒:AI4S如何成为破壁人
2026/9/7 20:35:30 网站建设 项目流程

量子计算这几年的圈子里,AI4S(AI for Science)正悄悄成为比“算法快”更值得关注的方向。2019年谷歌用53比特的Sycamore处理器跑随机线路采样,声称200秒完成传统超算约1万年的工作,顺手把“量子优越性”这个术语推到了大众面前。可IBM那边很快就给出反击,说在优化调度之后经典超算其实只需两天多就能完成同样的任务。两边来回交锋,谁也没能彻底说服谁,但这场争论留下了一个比“谁更快”更实在的问题——耗电。超算跑这个任务要烧多少电,量子处理器跑同样的任务又要烧多少电。所谓“能效壁垒”,一半指经典计算指数级增长的能耗天花板,另一半指量子计算要从实验室走向实用,必须跨过自身在高能耗运行环境上的那道坎。

这篇文章不打算复述媒体已经写烂的量子优越性故事,我想从工程和算法的角度,把谷歌量子计算的能效账重新算一遍,再聊聊AI4S怎么作为“破壁人”出现在整个链条里的。文中会有一些我实际接触过的工具和方法,比如Cirq、TensorFlow Quantum、变分量子算法和神经解码器,也会把常见的误区和踩坑点摊开来聊。适合谁读?给做科学智能、量子算法、高性能计算的开发者,以及所有好奇“AI到底怎么改变科研底层逻辑”的朋友。就算你之前完全没接触过量子信息,只要跟着我把几条关键的账算完,也能看懂这个领域现在到底卡在哪,以及AI能从哪些地方真正帮上忙。

1. 先算清楚账:量子计算的能耗到底高在哪

1.1 经典超算的能耗天花板

先看传统高性能计算这端。全球TOP500里排在前面的超算,功耗普遍在10兆瓦到20多兆瓦之间。以成熟的百亿亿次级超算为例,整机额定功耗通常接近23兆瓦,这是什么概念?一个普通三口之家一年的用电量大概是3000度上下,兆瓦级别的机器满载运行一小时就要烧掉几千度电,一天下来就是好几万度。如果某个任务需要在上面跑几十天甚至上百年,那电费单会直接变成一串天文数字。

这也是为什么“随机线路采样”会成为谷歌展示量子优越性的首选任务。这个任务在经典计算机上的复杂度会随着量子比特数和线路深度呈指数增长,经典模拟算法再聪明,也需要在内存和电量之间来回拆借。你可以把经典超算想象成一只靠暴饮暴食来快速奔跑的巨兽,想要跑得再快一点,唯一的办法就是喂进更多燃料。这种以“电换算力”的模式,就是经典侧能效天花板的最直接体现。以前我们觉得算力不够就堆机器,堆明年还是不够就再堆一倍,但在量子模拟这类指数级复杂度的任务面前,这条老路的尽头已经很清楚了。

1.2 量子处理器,其实也是“电老虎”

很多人以为量子计算机一定很省电,这其实是个误解。谷歌的Sycamore或者Willow芯片本体的功耗确实不高,芯片本身工作在接近绝对零度的稀释制冷机里,主控电子学也在低温段,但要让整个系统稳定运行,最耗电的反而是制冷系统、控制机箱、常温微波源和数据采集设备。一台实验室级别的稀释制冷机,光是维持几十毫开尔文的低温环境,长期下来也是几千瓦量级的持续功耗;再加上整套控制电子学,整个量子计算系统端到端功耗通常在几十千瓦量级。

换句话说,量子计算系统不是“省电”,而是“单位有效计算量里的能耗”更有竞争力。它把大量能量花在创造和维护一个极度脆弱的量子态环境上,这就像一家高端餐厅,大部分运营成本都花在恒温、安保和环境维护上,而不是食材本身。但好处是,一旦环境稳定,它能在极短时间内完成经典机器需要天文时间才能完成的任务,这个“短时间”才是量子系统在能效账本里真正值钱的地方。

1.3 “能效壁垒”的准确含义

所以当我们说“能效壁垒”时,实际上说的是两层意思。

第一层是经典侧的墙:经典算法模拟量子系统,复杂度随系统规模指数增长,所需能耗也一路飞涨,涨到某个规模后物理上就不现实了。这个问题不是凭空想象的,在量子化学、材料模拟、高能物理中早就存在。“暴力求解”四个字,在科学计算领域就是“烧钱”的代名词。你如果想精确模拟50个量子比特的相互作用,经典内存就需要存下2的50次方个复数振幅,现有超算加在一起也装不下;想模拟100个量子比特,那已经不是“再买几台机器”能解决的问题了。

第二层是量子侧的墙:量子系统自身要先支付巨大的“环境代价”,制冷、隔离、纠错都会消耗额外资源。量子比特的相干时间非常短,错误率不低,每一次纠错需要大量物理比特去保护一个逻辑比特。这意味着实用化量子计算需要成百上千倍的比特冗余,这些冗余比特每个都要被精确控制,整个系统的功耗和复杂度会急剧上升。AI4S要解决的问题,就集中在这一侧——用机器学习把“冗余”的成本压下来,把有限的量子资源用到刀刃上。这两堵墙不拆掉任何一面,量子计算都只能停留在实验室演示阶段,所以“能效”问题并不是什么冷门指标,而是决定这门技术能不能真正落地的前提条件。

2. 谷歌的量子优势是怎么打出来的

2.1 随机线路采样:为什么选这个任务

如果上面只谈“理论优势”,会有人说你纸上谈兵。谷歌2019年的实验之所以震动学界,在于它把“理论优势”落成了一个可执行的实验方案。随机线路采样(Random Circuit Sampling,RCS)的任务很简单:随机生成一个量子线路,在Sycamore上跑很多次,采集结果分布,然后让经典计算机用尽量好的方法去模拟同一个分布。

RCS的精妙之处在于,它是一个几乎没有结构可以利用的计算任务。经典模拟算法要复现量子线路的输出分布,必须对量子态的振幅做张量网络收缩或完整的态矢量演化,复杂度随比特数和线路深度的组合指数上升。Sycamore用53个超导量子比特在200秒内完成了100万次采样,当时谷歌估算经典超算需要1万年,这个数字后来被不断修正到几天、几个星期,但即使按最保守的估计,经典模拟这个特定任务的成本也远高于量子执行。

这个例子最大的价值在于:它把“能效优势”具象化了。传统超算跑一次完整模拟可能需要持续数天甚至数周的满载功耗,而量子处理器用几分钟的端到端运行就能给出可验证的结果。当然,前提是任务本身适合量子处理器,RCS只是探路石,不是通用计算。但它的确给行业立了一个参照系:如果要证明量子计算真的有用,你至少得先找到一个经典机器算起来极其费劲、而量子机器能轻快完成的任务,然后把能耗账摆到桌面上来。

2.2 从Sycamore到Willow:比特数不是唯一变量

2024年底,谷歌发布了新一代超导量子处理器Willow,105个量子比特,在RCS基准上的表现比Sycamore又上了一个大台阶。官方给出的说法是,它能在几分钟内完成当时最强经典超算需要10的30次方倍时间才能模拟的任务。10的30次方倍什么概念?如果超算需要1秒,量子只需要10的负30次方秒,这在工程上根本没法直接比较,大家比的其实是“指数级加速”。

但真正让研究者兴奋的不是比特数量涨了,而是两个更本质的指标:量子比特相干时间的显著提升,以及表面码纠错实验的低阈值验证。量子计算界有个很残酷的经验:物理比特的错误率只要高一点点,纠错成本就会爆炸式增长。Willow在实验里展示了随着码距增加逻辑错误率呈指数下降,这是量子纠错从理论走向工程的重要一步。

这跟能效有什么关系?关系大了。纠错越有效,就越不需要靠大量物理比特堆出一个人造逻辑比特,系统总功耗和复杂度就更容易控制。换句话说,Willow的纠错突破,等于是在“能效壁垒”这堵墙上凿了一个小洞。当然,从实验到工程,中间还隔着控制电子学、校准流程、软件栈、实时解码等一系列问题,但至少方向已经被验证了:只要纠错能持续改善,量子系统就不是只能在玩具规模上展示优势,而是有机会向前走得更远。

2.3 纠错才是真正的分水岭

顺带解释一下纠错为什么是分水岭。量子纠错不像经典纠错那样靠简单备份,由于量子态不可克隆,你不能把一个量子比特复制三份再投票。业界通用做法是用表面码(Surface Code),让一个逻辑比特散布在多个物理比特上,通过周期性的稳定子测量探测错误,再用解码算法判断错误发生在哪、该怎么恢复。

表面码的解码问题,本身就是一个典型的高复杂度组合优化问题。随着码距增大,需要处理的稳定子测量结果越来越多,解码延迟必须足够短,否则量子处理器就要一直等在那里,相干时间白白流逝。传统贪心算法在低错误率下够用,错误率一高就容易失效。这时候机器学习的优势就体现出来了:神经解码器可以通过大量带噪数据训练,在线决策解码结果,速度比精确解码快得多。这就是AI4S和量子计算结合的一个典型例子,也是后面第3节要展开讲的重点。

3. AI4S进场:用机器学习拆掉能效墙

3.1 AI4S到底是什么,它凭什么是“破壁人”

AI4S,AI for Science,本质上是把机器学习当作科学研究的“计算增强器”,去解决传统数值方法处理不了的规模和非线性问题。它跟普通人工智能应用最大的区别在于:这里的数据通常不是图片、文本,而是实验曲线、量子态层析结果、哈密顿量参数、纠错解码序列这类“科研数据”;模型的目标也不是推荐、识别,而是加速科学计算、优化实验条件、发现隐藏规律。

它凭什么能拆能效这堵墙?因为能效问题本质上是一个优化问题:如何以最少的资源(时间、比特、功耗)达到目标精度。机器学习是天然的优化器,它不依赖对系统方程的完美解析,而是从大量观测数据中学习出一个足够好的决策策略。量子系统里那种“高维、非线性、噪声强烈、模型不精确”的环境,恰恰是深度学习擅长应对的。你不需要对每一个物理过程都有理论上的完整解释,你只需要让模型在真实数据上表现得足够好,就能把资源消耗降下来。

3.2 AI做量子比特校准:省的是人力和时间,也是能耗

我去过一些超导量子实验室,最直观的感受是:量子芯片运行前的校准流程极其繁琐。每个量子比特有频率、耦合、门脉冲形状、读出判据等上百个参数要调,传统做法是人工或者半自动扫参数,一轮下来几小时就没了。问题在于,量子比特参数会漂移,你得频繁校准,否则错误率上去,之前算的结果都不能当数。实验室里有相当一部分工作,看起来是在“做实验”,实际上是在“伺候设备”。

AI在这里可以做三件事。第一,使用贝叶斯优化或强化学习,自动搜索最佳的校准参数组合,大幅减少扫描次数。第二,通过迁移学习感知参数漂移趋势,在漂移发生前就给出补偿方案。第三,用神经网络学习读出信号的特征,提高检测准确率,降低重复测量的次数。这些做法省下的不只是工程师的时间——每次重复实验都是时间成本,也是制冷和控制系统的固定能耗成本。校准越快、实验越少,整套设备满负载运行的时长就越短,能耗自然就下来了。

从能效账本上看,校准优化往往是最容易见成效的切入点。因为校准环节跟最后的实验线路没直接关系,但它决定了你在正式跑任务时用的门是否低错误率。如果把校准从三小时压缩到四十分钟,再用更好的门参数让每个线路少跑几千次重复测量,那一整天下来,同样的物理设备能完成的实验数量可能会翻倍,而总运行时间不一定变长。这就是“把AI用在设备维护而不是算题”的价值,它往往比优化某个具体算法的收益更稳。

3.3 AI做纠错解码与线路优化

另一个高价值的落地场景是量子纠错的解码器。前文提到表面码解码是组合优化问题,传统精确解码在码距增大后耗时太长。用神经网络解码器,把稳定子测量结果编码成输入,直接输出错误位置或恢复操作,可以把解码延迟压缩到微秒级甚至更低。这个方向在谷歌、IBM和多个学术团队里都有专门研究,最近的进展还把这些解码器训练成“重复结构”的轻量模型,部署在FPGA上做实时推理。

线路优化也很有意思。量子线路里门操作是顺序执行的,门越多、越深,错误积累越严重,执行时间也越长。AI可以通过强化学习搜索等价线路重构,用更少的门实现同一个幺正变换,或者重新排布两比特门的执行顺序以降低串扰。线路短了,执行时间就短,相干退相干期间白白浪费的资源就越少。这同样是在帮量子系统“省电”,只不过省的是量子比特的宝贵相干时间。

这两个方向一个管“执行前”,一个管“执行中”,连起来看就是一条完整的AI辅助流水线:先用AI把门操作排布好,能删的门删掉,能合并的门合并掉;然后在执行时用AI实时解码纠错,把噪声带来的影响压到最低。这两步做到位以后,同样的物理比特数就能跑更深的线路,同一个线路就能少做很多次重复采样。这些省下来的时间,全部可以换算成能耗,这比任何漂亮的学术指标都实在。

3.4 特征任务是经典-量子混合的AI优化

最后要提的是变分量子算法(VQE、QAOA)。这类算法的工作方式很有代表性:量子计算机负责准备量子态、测量期望值,经典计算机负责根据测量结果调整参数,再下发到量子计算机循环迭代。参数优化通常用梯度下降或CMA-ES这类经典优化器,但测量噪声会让梯度估计非常不靠谱。

AI4S在这里的介入方式是:用贝叶斯优化、强化学习、生成模型等更鲁棒的优化器替代简单梯度下降,在相同精度要求下显著减少量子评估次数。每一次量子评估都要反复制备量子态并测量几百甚至上千次,是非常昂贵的过程。少跑几次量子线路,等于直接省下了整个系统最核心的那部分运行时间。这一点,在能效账本上是真正能落到数字上的优化。

拿我自己跑过的带噪模拟来举例:同一个H2分子基态能量计算,如果用标准梯度下降,在噪声模型下常常震荡到几百次迭代还不收敛;换成贝叶斯优化,大概几十次量子评估就能进入可接受的能量误差范围。这种“少跑几轮”带来的收益极其直观——每轮量子评估都要消耗制冷系统、控制电子学和测量时间,少跑几百轮,等于让整套设备少工作好几个小时。做这类项目时,我习惯把每次量子评估的耗时和功耗单独记下来,最后优化报告里除了误差曲线,还附一张能耗曲线,团队开会时一眼就能看出AI带来的实际收益。

4. 一次AI+量子的实操流程拆解

4.1 从Hamiltonian到线路:一个VQE/QAOA的例子

为了让上面的讨论落地,我拆一个最简单的VQE(变分量子本征求解器)流程。假设我们要计算某个小分子基态能量,先写出电子结构哈密顿量,通过Jordan-Wigner变换映射成量子比特算符,再设计一个参数化线路(比如UCCSD线路)制备试探态,最终目标是找到一组参数使测量能量的期望值最小。

这里线路设计会用参数化旋转门,比如把参数化的RZ门放在纠缠层之间。核心逻辑是:量子计算机只做一件事——在给定参数下给出能量估计;经典计算机负责决定“下一步试哪个参数”。这一步我已经在Cirq上验证过很多次,代码骨架大概是这样的:

import cirq import sympy qubits = cirq.LineQubit.range(4) theta = sympy.Symbol("theta") circuit = cirq.Circuit() for q in qubits: circuit.append(cirq.rx(theta)(q)) circuit.append(cirq.rz(0.5 * theta)(q)) for i in range(len(qubits) - 1): circuit.append(cirq.CNOT(qubits[i], qubits[i + 1])) circuit.append(cirq.H(qubits[0])) print(circuit)

在实际跑VQE的时候,我发现一个关键教训:直接用无噪声模拟器验证参数优化,结果会很漂亮;一旦换成带噪模型或者真机,测量方差立刻爆炸。这也是为什么AI优化器能派上用场——它们天然对噪声更鲁棒,能在更少的评估次数里把参数收敛到可接受范围。如果你也打算在项目里用VQE,我建议一开始就把噪声模型加进去,别先跑完美的模拟器再想着迁移,那样等于给自己挖了一个“模拟-真机落差”的坑。

4.2 数据采集与AI模型训练

如果要在真实量子处理器上做AI辅助,第一步往往不是搭模型,而是想办法拿到足够多的“配对数据”。拿纠错解码举例,你需要的是一组“稳定子测量结果到正确错误位置”的样本。经典模拟器可以提供完美标注的数据,但模拟器往往会低估真实噪声的关联效应;真机数据则需要对线路做某种已知注入来标注错误位置,类似物理实验里“先用已知信号校准再去做未知信号测量”的思路。

训练数据准备好之后,模型选型上有两个流派:一个是端到端神经网络,输入所有稳定子测量结果,输出错误概率最高的位置;另一个是分阶段流水线,先做特征提取再交给近邻分类或决策树。前者在复杂噪声模型下精度高,但推理延迟大;后者容易部署到FPGA,延迟低,适合实时纠错。据我了解,目前业界更倾向在关键路径上用轻量模型,端到端模型拿来做离线分析和参数调优。这两条路我都试过,如果你目标是尽快上线,分阶段流水线更容易调试;如果目标是探索极限精度,端到端模型天花板更高。

4.3 能效评估的完整链路

实操里真正决定“AI有没有意义”的,是你要把整个链路都算进去,而不是只比芯片裸算力。完整链路至少包括四块:一是稀释制冷机的待机功耗,二是控制电子学的动态功耗,三是经典计算部分做预处理、线路优化、纠错解码的功耗,四是量子采样或者测量本身的时间成本。

我习惯用“端到端单位任务能耗”来做横向对比,公式差不多是:总能耗 = 系统平均功耗 × 任务完成时间。把AI模型加载、经典预计算、量子执行、读取结果全部计时,再乘以实测功耗,得到的就是一次端到端的能耗。这个指标的好处是,它不偏袒任何一方——量子如果用了几小时做校准和环境准备,这时间也要算进去;经典如果靠上千块GPU堆算力,那功耗的大头也要如实记录。只有把两边都放到同一杆秤上,得出的结论才有参考价值。

4.4 工具选型:Cirq、TensorFlow Quantum与现代框架

谷歌系的量子计算栈目前最常用的是Cirq,它是专门的量子线路建模和模拟框架,能直接对接Sycamore和Willow这类真实设备。TensorFlow Quantum则把Cirq跟TensorFlow融合起来,方便在量子线路的可微分计算中做梯度计算,特别适合VQE里需要用梯度更新参数的场景。

如果你做的是AI辅助解码,可以不用TensorFlow Quantum,直接把它当作一个序列分类问题处理。我个人比较喜欢用JAX做快速原型,因为它在GPU上做批处理的性能好,特别适合稳定子测量结果的批量推理。当然,工具只是手段,核心还是回到那句老话:工程项目的成败,十有八九取决于数据和评估链路,而不是模型结构。工具选型能让你省一点时间,但真正拉开项目差距的,是你有没有把能效账算清楚、把数据闭环跑通。

5. 常见误区与避坑指南

5.1 “量子比特越多越强”为什么不对

量子比特数量只是量子计算能力的一个维度,而且不是最关键的维度。错误率、相干时间、门保真度、连接拓扑,每一项都会让“比特数”的含金量大幅波动。50个低错误率的量子比特,可能比100个高错误率的量子比特更有实际生产力。我在跟团队交流时经常用一句话打比方:比特数量像员工人数,错误率像员工的离职率和出错率;公司能不能干活,不只看员工数量,还得看管理效率和稳定性。

这一点放在能效语境下会更明显:如果你为了凑比特数,使用了大量保真度不高的物理比特,那纠错开销会急剧上升,最终你消耗掉的能量和资源可能比用更少但更可靠的比特还高。追求比特数之前,先确认你有没有本事让每个比特干活不出错,否则就是在拿能耗换虚假的数字。

5.2 纠错不是简单备份

很多人刚接触量子纠错时会问:为什么不把量子比特复制几份投票?答案在于量子不可克隆定理——你没法对任意未知量子态做完美的复制。这也是为什么表面码这类纠错方案只能通过把逻辑信息非局域化地散布到物理比特中来工作。设计纠错方案时的能效思维,还是要落到“用最少物理比特保护逻辑比特”这个目标上。任何额外的物理比特都意味着更多的控制线和更高的系统功耗。

这里有个很现实的工程权衡:逻辑比特多了,单个逻辑比特错误率下降,但整个系统需要管理的物理比特和控制线数量上升,系统级故障率和冷却负载也在上涨。所以并不是码距越大越好,一切都要放到端到端能效模型里算过才知道。我自己做方案评估时,习惯把“物理比特总数、逻辑错误率、端到端功率”三个数同时列出来,任何只看其中一个的讨论都会被我拉回到三维空间里重新审视。

5.3 能效对比时最容易踩的坑

对比经典超算和量子处理器的能效,最常见的误区是“只比芯片功耗”。经典超算芯片功耗高,但一个数据中心还要算上散热和供电转换损失;量子计算机的芯片功耗虽低,但稀释制冷机一天到晚开着,控制电子学也不能断电。如果只拿出芯片功耗来对比,你一定能得出“量子比特太省电了”的结论,但这显然是错的。正确做法是端到端比,把所有配套设施都算进来,并且必须限定同一类任务。

另一个容易踩的坑是把“量子处理器在特定任务上的加速”直接外推到所有任务。RCS超得快,不代表数据库查询也超得快;VQE收敛得快,也不代表随机优化问题都能秒解。能用能效优势说话的,目前还是那些量子算法本身就有指数级或多项式级加速的任务。做对比之前,先明确任务边界,否则结论会被同行一眼看穿。

5.4 AI4S不是万能魔法

最后给AI4S泼点冷水。AI辅助校准、解码、优化确实能带来可观的效率提升,但它不是万能的。深度学习模型需要大量标注数据,量子噪声又存在明显的随时间漂移,模型很容易过拟合;再加上推理延迟,如果神经解码器算得太慢,不仅纠正不了错误,反而会浪费珍贵的相干时间。我的建议是,任何AI模块加入流水线之前,先做一个简单的A/B对比:同样的错误率目标,有AI和没AI,端到端能耗和时间差多少。只有账算得过来,才值得上。

我在项目里见过不止一次“为了AI而AI”的情况:团队看到量子社区都在发神经解码器论文,就非要把一个LSTM塞到解码流水线里,结果推理延迟比精确解码还高,最后只能回退到经典算法。做AI4S的工程,眼睛要盯住端到端指标,而不是盯住“模型够不够新”。模型再新,如果在真实系统里反而让任务变慢,那它对你而言就没有价值。

6. 我个人的两三点体会

跟了两三年量子计算和AI4S的交叉项目,我最大的体会是:这个领域最稀缺的,既不是量子物理天才,也不是深度学习大牛,而是能把两边翻译到一起的人。量子团队说“相干时间不够用了”,AI团队要能理解这是“需要在更少的测量次数内完成学习与优化”;AI团队说“数据分布漂移严重”,量子团队要能意识到这是“设备参数随时间在漂移,校准流程需要闭环”。能效壁垒的打破,本质上是一场跨学科的合作,而不是某一个人的独角戏。

如果一定要给后来者一个建议,我会说:先别急着追Willow或者哪家新芯片的参数,找一个你自己能反复接触得到的小型量子系统,或者一台可靠的模拟器,从校准、解码、线路优化这三个最容易见效的点里挑一个,用AI方法做一轮端到端优化,把能耗账从头到尾算一遍。你会发现,真正能让你做出创新贡献的地方,往往不是“把模型调得更准”,而是“把资源消耗降得更低”。

最后分享一个我在项目里用过的小技巧:无论做VQE、QAOA还是纠错解码,先定义一个统一的“每次实验的资源消耗单位”(比如每次量子评估的耗时加耗电),然后所有优化目标都折算成这个单位的数字。这样做之后,AI模型带来的收益会变得无比直观,团队内部讨论时也不用再纠缠于那些玄学指标了。能效这个词,说到底就是“用最少的代价办成事”,在量子计算领域,它才刚刚开始被认真对待。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询