这两年AI发展得有多快,算力的缺口就有多大。
不知道大家有没有这种感觉,大模型参数越做越大,训练一次要的算力越来越夸张,动不动就是几千上万张GPU,电费都得几百万。而且不光训练,推理也费算力,用户多问几句话,服务器就扛不住了。
但问题是,传统芯片的性能提升越来越慢了。摩尔定律早就走到了尽头,先进制程从7nm到5nm再到3nm,每往前走一步都难如登天,成本还越来越高。一边是AI对算力的需求指数级增长,一边是传统芯片的性能提升越来越乏力,这个矛盾怎么解?
最近这两年,光子芯片和存算一体这两个技术方向特别火,很多人说它们能打破摩尔定律的瓶颈,成为AI算力的新希望。今天就跟大家聊聊这个话题,说说我自己的看法。
一、先搞懂:AI的算力瓶颈到底卡在哪
很多人对算力瓶颈的理解,就是芯片不够快,性能不够强。其实不完全是这样。现在的AI算力瓶颈,很大程度上不是算不动,而是数据搬不动。
传统的计算机架构,计算和存储是分开的。CPU/GPU负责计算,内存/硬盘负责存储。计算的时候,要把数据从存储搬到计算单元,算完了再搬回去。这个数据搬运的过程,其实比计算本身还要费时间、费能量。
尤其是AI大模型,参数动辄几十亿上百亿,甚至上千亿。每次计算,都要把大量的参数从内存搬到计算单元,搬来搬去,大部分时间和功耗都花在数据搬运上了,真正用于计算的反而不多。这就是业内常说的"内存墙"和"功耗墙"。
打个比方,就像一个工厂,生产线速度很快,但原材料运不进来,成品运不出去,那生产线再快也没用,大部分时间都在等货。现在的AI芯片,大概就是这么个情况。
而且传统的电子芯片,还有个发热问题。晶体管越做越小,密度越来越高,发热越来越严重,散热都成了大问题。你看现在的高端GPU,功耗动不动就三四百瓦,一个数据中心的电费和散热成本,都是天文数字。
所以说,AI的算力瓶颈,不是单一的问题,是制程、功耗、内存墙、散热,好几个问题叠在一起,传统架构越来越难以为继了。
二、光子芯片:用光来计算,听起来很美
第一个热门方向,就是光子芯片。简单说,就是不用电子,用光来做计算。
光有什么好处?首先是速度快,光速嘛,肯定比电子快。其次是功耗低,光传输和计算的功耗比电子低很多,发热也小。还有就是带宽大,光可以用不同波长并行传输数据,带宽比电子高得多。
听起来是不是很美好?如果真的能实现光子计算,那算力直接就能上一个大台阶,功耗还能降下来,简直是完美的解决方案。
但问题来了,光子芯片说了这么多年,为什么一直没大规模商用?因为难度实在太大了。
光子不像电子那么好控制。电子可以用晶体管很方便地开关、放大,但光子不一样,光的开关、调制、探测,每一步都很难。而且光子器件的体积很难做小,不像晶体管可以做到几纳米。还有就是,光子计算适合做特定的运算,比如矩阵乘法,刚好是AI里用得最多的,但通用计算就不太行了。
现在的光子芯片,更多还是在特定场景下的应用,比如AI推理、通信这些领域,离通用计算还差得远。而且很多技术还停留在实验室阶段,真正量产商用的还不多。
不过这两年进展确实挺快的,国内外都有不少公司在做,也有一些产品出来了,主要用在数据中心的AI推理加速上。虽然还谈不上替代GPU,但在某些特定场景下,确实能做到性能更高、功耗更低。
我的判断是,光子芯片未来肯定是个重要方向,但短期内还成不了主流,更多是作为补充,在特定场景下发挥作用。想要全面替代电子芯片,至少还得二三十年。
三、存算一体:把计算和存储放一起,更接地气
第二个方向,存算一体,我觉得比光子芯片更接地气,也更容易落地。
什么是存算一体?顾名思义,就是把存储和计算放在一起,不用再把数据搬来搬去了。刚才说了,传统架构最大的问题就是数据搬运太费时间费功耗,那存算一体直接从根上解决这个问题,在存储单元里直接做计算,数据不用搬,就地就算了。
这就好比把仓库和生产线合在一起,原材料不用运来运去,直接在仓库里加工,效率肯定高多了。
存算一体的技术路线也有好几种,比如基于Flash的、基于RRAM的、基于MRAM的,各有各的优缺点。但不管哪种路线,核心思路都是一样的,就是打破计算和存储的边界,消除数据搬运的开销。
这个方向为什么我觉得更靠谱?因为它不需要颠覆现有的半导体产业,更多是架构上的创新,技术难度相对低一些,落地也更快。
事实上,现在存算一体已经有不少商用产品了,主要用在端侧AI推理上,比如智能摄像头、可穿戴设备、物联网设备这些。这些场景对功耗要求高,算力需求又不是特别大,存算一体的优势特别明显。
当然,存算一体也有它的问题。比如精度问题,存储单元做计算,精度往往不如传统的数字电路,对于高精度的训练场景,还不太够用。还有就是软件生态的问题,传统软件都是基于冯诺依曼架构写的,要适配存算一体,还得重新优化,生态建立需要时间。
但总的来说,存算一体是目前来看,解决AI算力瓶颈最现实、最有可能率先大规模落地的技术路线。尤其是在端侧和边缘侧,未来几年应该会有很大的发展。
四、这两个技术,真的能打破摩尔定律吗
说了这么多,最后回到最开始的问题:光子芯片和存算一体,真的能打破摩尔定律的AI瓶颈吗?
我的看法是:能缓解,但谈不上打破。而且更重要的是,它们不是替代关系,而是互补关系,未来大概率是多种技术并存的局面。
为什么说能缓解?因为这两个技术,都是从不同角度解决传统架构的痛点。存算一体解决数据搬运的问题,光子芯片解决速度和功耗的问题,都能在现有基础上,把算力再往上提一大截,同时降低功耗。
但为什么说谈不上打破?因为摩尔定律的本质,是每18个月性能翻一倍、价格降一半。不管是光子芯片还是存算一体,都很难维持这样的指数级增长。它们更像是打开了一个新的空间,让算力再上一个台阶,但上去之后,还是会遇到新的瓶颈,增长还是会放缓。
而且还有个很重要的点,就是AI的算力需求增长太快了,比芯片性能提升的速度快多了。就算芯片性能再翻十倍,可能过两年又不够用了。技术进步永远追不上需求的增长,这可能是个永恒的矛盾。
所以我觉得,未来的AI算力,不会是某一种技术一统天下,而是多种技术混合。传统的GPU/CPU负责通用计算,存算一体负责端侧和边缘侧的推理,光子芯片负责特定场景的加速,大家各司其职,一起满足AI对算力的巨大需求。
五、最后说几句
总的来说,AI的算力瓶颈确实是个大问题,而且会越来越突出。传统的摩尔定律路线已经走不动了,必须找新的出路。
光子芯片和存算一体,都是很有希望的方向。存算一体更近一些,未来几年应该会看到更多落地;光子芯片更远一些,但潜力更大。
不过大家也不用太焦虑,技术的发展总是波浪式前进的。一个方向遇到瓶颈了,总会有新的方向冒出来。当年摩尔定律快不行的时候,大家也担心过,后来多核、GPU并行计算又把算力拉上去了。这次也一样。
对于我们普通人来说,关注技术趋势就好,不用太纠结技术细节。可以确定的是,算力会越来越便宜,AI会越来越普及,这是大趋势。
本文为个人行业观察分享,仅代表个人观点,具体技术进展请以行业官方信息为准。