最近智算中心开工的消息多得看不过来,但苏州市智能算力产业创新中心正式启动这个事,我还是想拿出来单独聊聊。干这行的人都清楚,智能算力早就不是“要不要建”的问题,而是“谁来建、怎么建、建完怎么用”的问题。这个项目的特殊之处在于三个点:其一,它挂的是“产业创新中心”的牌子,而不是单纯叫“数据中心”或“智算中心”,这意味着它不是只堆一排机柜,而是要做算力、技术、产业三者咬合的联合体;其二,标题里的“央地协同”四个字值得玩味,它代表的是上层产业资源与地方要素禀赋的结合方式,这种模式正在成为很多城市布局智算的主流范式;其三,它落在苏州,一个制造业和生物医药都很强的城市,算力在这里落地,不是PPT式的概念,而是有真实产业场景去承接的。
这篇文章不吹不黑,我想从项目定位、技术架构、建设运营实操、常见误区和影响范围几个角度,把这个事件背后能复用的经验拆出来。对正在做智算规划的城市、园区,对想参与算力项目的集成商和运维团队,甚至对想用便宜算力跑模型的开发者,应该都有参考价值。
1. 这一轮智能算力热,跟以前的机房建设有什么本质区别
1.1 智能算力不是“更大号的算力”,而是另一种算力形态
很多人一听“智能算力”,下意识觉得就是服务器多一点、显卡贵一点、机房大一点的“升级版”。实际上这个理解会带来一系列决策偏差。传统通用算力解决的是逻辑计算,跑数据库、跑网站、跑企业ERP,CPU是主角,讲究的是稳定和通用性。而智能算力解决的是并行计算和海量矩阵运算,GPU、NPU这类加速芯片是主角,它执行的不是一条指令处理一条数据,而是成千上万个计算单元同时处理海量数据。形象点说,通用算力是“一个博士在解一道难题”,智能算力是“一万个小学生在同时做一万道加减法”,后者不一定更“聪明”,但一定更擅长处理批量并行任务,而这恰好是深度学习训练、推理、大模型应用最需要的。
这个区别落到基础设施上,直接影响建筑、供电、制冷、网络的设计。我们做过的智算项目中,单机柜功率密度做到30千瓦、40千瓦甚至更高都很常见,而传统机柜一般也就6到10千瓦。这意味着一栋楼如果按老标准设计,光是把电力送进机柜、把热量排出去就会出大问题。所以苏州市智能算力产业创新中心这种定位清晰的智算项目,从启动阶段就必须把功率密度、液冷系统、高压直流供电这些“硬骨头”考虑进去,而不是先把楼盖起来再想办法塞设备。
另一个容易忽略的差异是“服务对象”。传统数据中心服务的可能是几千家企业里的普通IT系统,而智算中心服务的是一批特定用户:大模型团队、高校科研组、自动驾驶企业、生物医药研发机构。这些用户对算力的要求不是“能用就行”,而是“卡不能闲着、任务不能被抢跑、模型训练不能动不动断点”。智算中心的运维复杂度,比传统IDC高一个量级。
1.2 为什么叫“产业创新中心”,而不是叫“数据中心”
名字这个东西,在项目里往往决定了预算结构和运营方向。传统数据中心强调“托管”和“出租”,它的核心指标是上架率、机柜数量、带宽吞吐。而“产业创新中心”强调的则是“聚合”和“转化”,它的核心指标变成算力利用率、模型训练效率、孵化企业数量、行业解决方案落地数。
我理解苏州这个项目的逻辑是:算力本身是“原材料”,光把原材料堆在仓库里没有意义,必须把它加工成能被制造企业、医疗企业、AI公司直接使用的“产品”。所以“产业创新中心”意味着这个项目大概率会包含几层东西:最底下是智算中心机房,中间是算力调度平台和模型服务平台,上面是面向具体行业的技术创新实验室、孵化空间和产业联盟。建设一个智算中心,只是完成了“硬件底座”,真正难的是让底座上长出应用,而“创新中心”这个定位,恰恰是在为“长出应用”提前留出制度接口和运营空间。
这也是我判断这类项目能不能做成的一个重要观察点:如果启动文件里只有机柜数量、GPU采购量,没有提到行业实验室、生态企业、人才培训、场景开放,那它大概率还是个“放大了的数据中心”,离“智算产业创新中心”还有不少距离。
1.3 “央地协同”拆开看,到底是在协同什么东西
项目标题里最显眼的四个字是“央地协同”。不带立场地说,这四个字翻译成产业语言,其实是两类资源的精准互补。一类是拥有技术、设备、资金、生态圈的上层产业资源,另一类是拥有土地、电力、区位、制造业场景、政策配套的地方资源。前者需要找到能规模化落地算力设施的区域,后者需要引入带动区域产业升级的算力引擎,两边的诉求在这个项目里正好重合。
这种协同模式的实际意义在于它解决了智算项目最头疼的“三重门槛”。第一是资金门槛,智算中心动辄数十亿投入,单靠地方财政很难扛;第二是运营门槛,建起来之后要有懂芯片、懂集群、懂大模型的专业团队去运营维护,这部分能力往往沉淀在大型科技企业和专业算力服务商手里;第三是场景门槛,算力要发挥价值,必须贴近具体产业,而苏州在电子制造、装备制造、生物医药、新能源这些领域的企业密度非常高,天然是智算应用的“试验场”。
可以说,“央地协同”不是在玩概念,而是在做一种“资本和资产分离、资源和场景互补”的算力布局实验。能不能成功,最终要看算力负载率,以及有多少本地企业真正把业务跑在了这个中心上面。
2. 智算产业创新中心的技术底盘,到底由哪几层构成
2.1 基础设施层:高密度算力的物理前提
智算项目启动后,最先落地的是基础设施层。这里面有三个关键指标,外行看热闹,内行看门道。
第一是单机柜功率密度。传统数据中心按8千瓦到12千瓦设计,而智算项目通常按20千瓦到40千瓦起步。功率密度决定了同样面积的机房能塞进多少算力,也决定了供电和散热方案。从经验看,如果按32千瓦以上设计,风冷基本到极限,必须上液冷。液冷分冷板式和浸没式,冷板式改造难度小、维护方便,浸没式散热效率更高但运维门槛和成本都上来了。很多项目在启动阶段不愿意提液冷,觉得“再扩一扩风冷也能凑合”,实际运行后会吃大亏。我在一些项目里见过GPU服务器因为散热不足降频运行,名义上买了高配卡,实际算力打了七折,这种隐性损失比多花几千万做液冷贵得多。
第二是供电架构。智算中心的用电量是体量惊人的,一个1000卡级别的智算集群,满载功耗能到1.5兆瓦以上,这还没算制冷。供电系统要考虑的不只是“够不够用”,还包括“多路冗余”和“高压直流”。高压直流比传统UPS效率高几个百分点,别小看这几个点,一年电费算下来差百万量级。另外,如果项目选址所在区域电网容量不足,扩容周期会非常难受,所以启动前一定要和电力部门确认两路市电的可用容量和扩容工期,这类问题拖到运营阶段再处理基本是无解的。
第三是网络架构。智算集群对网络的要求和传统数据中心完全不同。GPU服务器之间的数据交互极其频繁,大模型训练时,一张卡训练出来的梯度要同步给其他几千张卡,数据量非常大,内网带宽上不去,整个集群的任务就会一直“卡”在通信上,GPU只能干等着。业内做训练集群,内部网络基本都在用InfiniBand或者RoCE这种高带宽低延迟方案,并以无阻塞网络为目标来设计。很多项目舍得买几亿元的GPU,却在内网交换机上省钱,这是非常典型的预算倒挂。
2.2 技术平台层:算力调度的核心枢纽
基础设施层之上,是决定智算中心“好不好用”的关键一层——技术平台层。这一层主要包括算力调度平台、容器编排系统、监控运维体系三类核心组件。
算力调度平台要解决的核心问题是“怎么把合适的卡分给合适的人”。一个智算中心里面会同时跑着很多任务,有的是大模型训练,需要几百张卡连续跑一周;有的是小规模的推理请求,需要秒级响应;还有的是科研机构短租算力,只需要几块卡跑几个小时。如果没有调度平台,这些任务就会互相抢资源、互相拖累。调度的本质是把GPU算力池化,让算力变成像CPU那样的弹性资源,按需分配、按量计费。模型训练中,常见的手段包括k8s结合GPU调度插件、作业排队系统以及断点续训机制,这些说起来简单,但在几千张卡规模的集群上稳定跑,对工程团队的要求相当高。
容器编排系统则负责让训练任务在集群上“跑得起来、跑得完”。大模型的训练作业通常是以容器为单位调度到GPU节点上,作业可能要跑几天甚至几周,中间如果出现单卡故障、节点宕机,编排系统要能自动把任务迁移,保证整体训练不中断。我见过很多团队在单个服务器上跑模型没问题,一旦放到几十台服务器并行训练就频繁失败,问题就出在缺乏一套可靠的编排调度机制。
监控运维体系在智算中心的重要程度,怎么强调都不过分。GPU的显存温度、算力利用率、显存带宽、网络吞吐这些指标,必须实时可视化。传统IDC运维只看CPU负载和网络流量,到了智算场景,需要拉起一套针对GPU的精细化监控体系,把故障定位时间从“小时级”压缩到“分钟级”。
2.3 模型与应用层:把算力转成生产力
再往上是模型与应用层,这一层才真正决定智算中心能否对当地产业产生价值。简单说,企业用户并不关心你中心里有多少张H系列显卡,他只关心“我能不能在不自建机房的情况下,把我的AI想法跑出来”。
为了满足这个需求,创新中心通常会把基础模型能力封装成服务。比如内置主流开源大模型的部署镜像,提供数据处理、模型微调、模型评测、推理服务API等能力。中小企业不需要懂并行训练、不需要懂集群调度,直接在平台上上传数据集,调用预置模型做微调,就能获得一个行业定制化模型。这个过程有点类似云计算从“提供虚拟机”进化到“提供数据库和中间件”,算力中心也应该从“提供显卡”进化为“提供AI能力”。
在具体的行业场景里,这种模式的价值非常直接。制造企业要做一个质检模型,光靠自己买卡、部署环境、调框架,光工程前置就得折腾一两个月。而如果创新中心已经备好了端到端的视觉模型微调链路,企业的算法工程师只需要关注标注数据和评估结果,周期能从两个月压缩到两周。这个效率差异,才是“创新中心”而不是“机房”的核心竞争力。
2.4 数据与安全层:容易被低估的“地基中的地基”
还有一个层经常被讨论,但在实际操作中容易被忽略——数据与安全。智算中心的用户会把自己的业务数据、模型权重放在平台上,制造企业的工艺参数、医院的患者数据、金融机构的交易数据,都是高敏感信息。如果一个智算创新中心的数据隔离、权限管理、审计追溯做不好,几乎不可能获得行业头部客户的信任。
数据隔离有两条路径:一条是物理隔离,重要行业用户独享专属分区;一条是逻辑隔离,通过虚拟化和容器技术划分资源。物理隔离安全性高但资源利用率低,逻辑隔离可以细粒度调度但依赖平台安全能力。实际运营中往往是混合使用:头部重点客户走物理隔离,中小客户走逻辑隔离。安全审计上,则要做到“用户操作全留痕、数据流动可追溯、模型发布必审批”,这些工作虽然不产生直接收益,却是产业用户敢不敢把核心业务放进来的信任基础。
3. 一个智算中心从启动到运营,关键环节实战拆解
3.1 建设阶段的“三大件”:电力、液冷、网络
我把建设阶段遇到的真实问题集中归结为“三大件”。
电力方面,很多项目方一开始以为只要找供电局报个“大容量增容”就完事了。实际上智算中心的用电负荷曲线和传统数据中心完全不一样:训练任务一旦跑起来,功率就迅速拉满,而且可能连续几天不降;传统数据中心则是平均负载缓慢爬坡。这种“瞬时拉满”的用电模式对电网冲击很大,需要提前和电力部门沟通负荷特性。另外后备电池、柴发配置也要跟上,GPU训练中途断电造成的损失,远远不只是“重启一下”那么简单,模型训练到第三天的进度可能会直接归零。
液冷方面,我的建议是别把它当作“可选项”。哪怕当前项目用的是风冷型号的GPU服务器,也要在机房的管路、承重、空间上预留液冷改造条件。智算项目的硬件更新周期很短,两年后的新一代加速卡功耗大概率会更高,那时候再改造机房,代价比现在一次性规划到位要高得多。
网络方面,前面已经提到InfiniBand或RoCE的选型问题。这里补充一点:智能算力集群的网络调优,设备买对只是第一步,实际组网时还要考虑拓扑结构、冗余链路、拥塞控制参数的调节。我们遇到过同类配置的两个项目,一个训练效率比另一个高出将近20%,差别就全在网络链路的细微调优上。这块非常依赖有实操经验的网络工程师,而不是单纯看交换机参数表。
3.2 集群搭建阶段:卡堆起来只是“能用”,离“好用”还有距离
很多人以为智算中心的建设就是“买卡、上架、装驱动、跑通一个demo”,这个流程走通确实只需要几天,但离好的算力集群还差得很远。我梳理一下从裸机集群到稳定服务需要经历的六个关键步骤:
基础环境标准化:制定统一的GPU服务器固件版本、驱动版本、容器镜像模板,避免每台机器环境不一致带来的维护灾难。这一步听起来基础,但很多团队不做,导致后续故障定位时驱动版本排查就能耗掉半天。
集群网络配置与验证:对IB或RoCE网络做带宽测试、拥塞延迟测试,重点验证多节点通信是否存在丢包。大规模模型训练对网络丢包极度敏感,千分之一级的丢包就可能导致训练速度明显下降。
调度系统部署:搭建算力调度和容器编排平台,配置多租户配额。这个阶段要考虑清楚“一个用户最多能占多少卡”“训练任务和推理任务怎么分时混跑”等运营规则。
数据存储打通:建立高性能并行文件系统,让几千张卡能同时高速读取训练数据。一个容易踩的坑是:GPU集群准备好了,数据存储却成为瓶颈,导致每轮训练都在等数据加载,GPU空转。
任务测试与基准验证:用小规模模型跑通端到端任务,再逐渐扩展到大规模模型。先跑通一个千卡规模的基准测试,记录不同并行策略下的吞吐和效率,为后续用户提供调优参考。
运维体系上线:建立监控告警、日志收集、故障自动切换机制。这一步不做好,等业务上线之后再补运维体系,就像房子都入住了才发现没有消防通道。
3.3 运营阶段:算力怎么“卖”,决定了中心能不能活下去
智算中心的建设是一次性投入,运营却是长期战役。运营模式上,目前行业里比较成熟的有三类:算力租赁(按卡时计价)、算力券补助(政府向企业发放算力代金券,由中心接收后统一结算)、以及能力订阅(企业购买的不只是算力,还包括平台工具和模型服务)。
算力租赁是基础盘,计价单位通常是“卡时/卡月”,价格会依据GPU型号、租期长短、是否含存储和带宽不同而波动。算力券是这个阶段地方产业政策里很常见的做法,相当于政府帮本地中小企业“买第一杯咖啡”,让没接触过AI的企业以零成本门槛尝试算力平台,体验过后才会形成付费习惯。能力订阅则是未来毛利最高的方向,因为它卖的不再是“硬件消耗”,而是“结果”,比如卖一个训练好的质检模型、卖一个推理API的调用次数,这种模式对用户价值更直接,抗价格波动的能力也更强。
运营中还有一个重要指标叫算力利用率。很多智算中心对外称“已上线”,实际负载率只有两三成,大量昂贵GPU处于闲置状态。这个问题在行业里非常普遍,建中心时的热情和运营时面对空机柜的落差,会直接影响后续投入决策。要提升利用率,除了靠算力券拉动,还要主动找一批有真实训练需求的企业和高校来做“种子用户”,先把平台跑起来,再逐步扩大。
3.4 生态阶段:从“一栋楼”到“一张网”
智算中心如果只做“算力买卖”,天花板很低。真正让苏州市智能算力产业创新中心这类项目有长期价值的,是它能不能长出“生态”。
生态是什么?是一批围绕在中心周边的AI开发企业、数据标注团队、模型服务商、行业咨询机构、人才培训机构。中心给他们提供算力底座,他们给中心提供应用场景和增值服务。对地方政府来说,这些企业不需要都搬进一栋楼里,但它们会因为智算中心的存在而愿意落户本地;而企业一旦落户,就会带来就业、税收和产业升级,形成正循环。这也是“产业创新中心”和“数据中心”在定位上最大的分野——一个是在做资产,一个是在做网络。
实际运作中,创新中心通常还会承担“产业联盟”的角色,定期办技术沙龙、行业大赛、开发者培训,帮本地企业的技术负责人建立起对AI的认知和信任。这些活动看着务虚,但对于让一个制造业企业老板掏钱买算力服务,比销售打一百通电话都管用。
4. 我见过的智算建设翻车现场:几个高频误区和避坑建议
4.1 误区一:有卡就有算力,算力就等于竞争力
这个误区在行业里实在太常见了。有些项目启动仪式风风光光,采购清单上全是顶级加速卡,但建成后一测训练效率,跟同等配置的头部云厂商差出一大截。原因是什么?卡只是算力的“素材”,要让它高效工作,需要网络、存储、调度、框架深度协同。就像给一个团队每人配了顶级电脑,但没有协同办公软件、没有项目管理制度,产出未必比得上前者。
我的建议是:验收智算中心时不要只看“有多少卡”,要看“跑一个标准大模型训练任务的吞吐量是多少”“多卡扩展效率曲线是否接近线性”。这些才是衡量算力服务水平的硬指标。与其在发布会上讲“总算力多少P”,不如实际跑一个第三方可以复现的基准测试。
4.2 误区二:只重建设预算,不重运营预算
智算中心的建设费用是一次性的,看得见摸得着,决策比较容易。而运营费用是持续的:电费、网络费、运维人力、软件授权、机房维修,一年加起来可能占到建设成本的百分之十几。很多项目在可研阶段把运维成本压得很低,真正运营后才发现入不敷出。
更关键的是运营团队的搭建。既懂GPU调度又懂行业应用的工程师,在当前人才市场上薪资很高、非常难招。创新中心如果不能在启动时就把运营团队编制和薪酬体系定下来,建完之后大概率会陷入“有人建、没人管”的尴尬境地。这事得在规划阶段就同步设计,不能等项目建成再临时招人。
4.3 误区三:轻视能耗指标,PUE数字难看不说,还会限电
智算中心的耗电量非常惊人,而许多地区对高耗能项目的审批和监管越来越严格,能耗指标(PUE)已经不只是环保问题,而是直接影响项目能不能合法运营的问题。国内很多地方对新建数据中心PUE有明确限值要求,比如要求低于1.3甚至1.25。传统风冷机房要做到1.3以下非常吃力,而液冷机房则相对轻松。选技术方案时如果只图便宜,用了能效差的设计,后面不光电费高,还可能被列为重点能耗监管对象,限电、整改、停工风险都不小。
在这个问题上,我建议项目方在启动阶段就把PUE目标钉死,比如“全年平均PUE不高于1.25”,然后把实现路径通过技术方案评审确认下来,而不是让PUE成为一个事后统计的“结果指标”。
4.4 一些真正实用的建议
如果让我给准备启动智算类项目的人提几条可执行建议,我会重点强调以下几条:
先找用户再建中心。在做设计之前,至少接触二十家本地潜在客户,弄清楚他们要用算力做什么、愿付多少钱、对平台功能有哪些要求。很多智算中心建成后利用率低,根子在启动阶段没有做需求侧的功课。
预留弹性扩展空间。智算硬件更新快,机房在电力、承重、管路方面尽量预留未来1.5倍到2倍的扩容条件,免得下一代设备上马时土建推倒重来。
把“平台服务”当成核心产品来做。如果只把自己定位成“卖卡的”,随时会被上游硬件涨价和下一代产品迭代冲击;只有把模型服务、行业解决方案做厚,才有真正的定价权和用户黏性。
重视产学研协作。高校和科研院所的用量虽然单价低,但他们的科研课题能带来技术影响力、人才流动和长期合作机会,是创新中心生态里性价比最高的“种子用户”。
5. 智算中心向周边辐射的影响范围,比想象中更大
5.1 对区域产业:算力区位优势直接影响招商
过去招商看的是土地、交通、劳动力,现在还要加一条“算力可得性”。一个城市的智算供给能力强,对人工智能企业、数据服务企业、智能制造改造服务商的吸引力都会明显提升。反过来,一个城市连本地算力平台都没有,企业和人才就更容易流失到算力资源富集的地方。这就是算力正在变成“区位要素”的现实。
苏州市智能算力产业创新中心启动后,最直接的影响是会吸引一批原先在一线城市租云GPU跑模型的企业来本地落户。原因很简单:同样的算力,本地用可以享受政策补贴、网络延迟低、便于和本地制造业客户当面沟通。这种“算力跟着产业走、产业跟着算力走”的双向吸引,会给区域带来一轮结构性的产业集聚机会。
尤其对制造企业来说,智能算力中心落地意味着“AI+制造”的尝试成本大幅下降。以前一个工厂想上视觉检测、想跑设备预测性维护,需要自己组建AI团队,成本高、门槛也高。现在本地有了算力中心,企业可以先小规模尝试,验证有效后再扩大投入,这是一种风险可控的技术升级路径。
5.2 对中小开发者和创业团队:创作门槛被拉低了
智算中心的算力服务平台一旦运转起来,对中小企业、独立开发者和早期创业团队其实是很重要的一步。过去训练一个像样的行业模型,起步投入就是几十万卡时费用,个人开发者根本玩不起。而创新中心通过算力券、共享资源池、公共模型库的方式,可以显著降低这个门槛。
我今天想强调的一点是,创新中心的公共模型库价值容易被低估。如果中心预置了一批经过验证的行业模型模板,新用户不用从零开始训练,在基座模型基础上做增量微调就行,训练时间可以从以周计算压缩到以天甚至以小时计算。这种“站在基座上做应用”的方式,才是算力普惠的真正含义。年轻团队要做的,是把一个具体的行业痛点搞透,然后利用现成的模型底座快速做出产品,而不是自己从一片空地盖起整个技术栈。
5.3 对芯片与硬件生态:国产化适配迎来真实练兵场
智算中心的规模化落地还会传导到更上游的产业链。过去国产AI芯片面临一个经典困境:没有足够丰富的真实应用场景去打磨性能和兼容性。而智算创新中心这类项目,既有海量算力需求,又有多种行业的真实负载,恰好为国产芯片、国产服务器、国产框架提供了难能可贵的适配验证环境。
创新中心如果能在技术路线上考虑国产方案和主流方案的协同共存,通过统一的调度平台把异构算力管起来,那么国产硬件的成熟速度会明显加快。这里的关键词是“异构算力统一调度”,它要求调度平台不绑定单一芯片品牌,让用户按需选择合适的算力资源。这个技术方向本身就是智算产业里一个很有价值的公共技术组件。当然,国产芯片的生态成熟度与主流方案之间仍有差距,实操中需要循序渐进:先跑通推理场景,再逐步承担训练负载;先接单一框架,再逐步兼容主流生态。
5.4 运营层面:从“建好一个中心”到“用好一个中心”
从运营角度看,这个项目启动之后真正的挑战才刚刚开始。我见过不少同类项目在启动时轰轰烈烈,半年后却卡在用户增长、平台稳定性和商业模式验证上。所以我要再强调一次:创新中心能不能成为名副其实的“智算高地”,看的不是启动仪式上的算力数字,而是六个月后、一年后的真实负载率、用户留存率、行业案例数量。
建议运营团队把目标拆解成阶段性的关键指标:启动后3个月,达成首批种子用户上线;6个月,算力利用率稳定在某个合理水位;12个月,在本地主要行业形成3到5个可对外宣讲的标杆案例。这些里程碑比任何宣传口号都更能说明项目的真实成色。
写在最后的一些个人体会
跟过几个智算中心的建设和运营,我感触最深的一点是:这个行业最缺的其实不是钱,也不是芯片,而是“把算力翻译成产业价值”的人。苏州市智能算力产业创新中心的启动,资金和硬件大概率都不会是瓶颈,真正决定它能走多远的,是能不能组建一支既懂GPU集群又懂制造企业语言的专业团队。
如果你所在的单位也在规划类似项目,我的建议很直接:别把精力都花在启动仪式和领导调研上,多花点时间在需求调研和运营规划上。建一个智算中心是工程问题,让这个中心被产业真正用起来,才是持续的经营问题。前者有标准答案,后者没有公式,只能靠贴着一线需求一点点磨。这个项目后续如果能在机制创新上给出一些“央地协同”的可复制经验,对整个行业都是很有价值的事。