GTC 2026 的 China AI Networking Day 把主题定在“迎接 10 亿瓦级 AI 工厂的时代”,说实话,这个标题放在两年前我会觉得是噱头,但放到现在,我只会觉得它来得太晚了。过去一年我在帮朋友所在的几家单位做大规模 GPU 集群的网络规划和性能调优,最直观的感受就是:算力从来不是瓶颈,能喂饱算力的网络才是。当你面对的不再是一排 8 卡的训练服务器,而是几千张卡同时做 All-to-All 通信时,网络就不再是“综合布线工程”里的那个配角,而是整个 AI 工厂的血液循环系统。
这篇文章我不打算复述 GTC 上那些华丽的 PPT,我只会从实际落地和工程观察的角度,把“10 亿瓦级 AI 工厂”这个概念掰开揉碎,讲清楚它背后到底意味着什么、网络在其中扮演什么角色、我们在真实搭建和运维这些系统时到底在折腾什么,以及未来几年这个方向会怎么演变。
1. 从数据中心到 AI 工厂:一盏灯点亮的时代拐点
1.1 “10 亿瓦”这个数字到底有多硬核
10 亿瓦,换算成标准单位就是 1GW,也就是 1000MW(兆瓦)。为了让你对这个数字有体感,我先给几组对比数据:一个典型的传统互联网数据中心(IDC),机柜功率在 6kW 到 12kW 之间,整栋楼加起来可能只有 20MW 到 40MW;一个大中型云计算可用区,建设规模在 50MW 到 100MW 已经算相当可观了。而一座 1000MW 的 AI 工厂,相当于把 2 万多个标准机柜的电量集中在一个园区里劈头盖脸地灌进去。
我做过一个很粗略的账:以当前主流 GPU 服务器单机功耗 10kW 左右来算,1GW 大约可以支撑 8 万到 10 万台这样的服务器;再按一卡一服务器来折算,就是 8 万到 10 万张加速卡。这个规模如果放在两年前大家会觉得是天文数字,但 2025 年往后,多个头部厂商的集群规划都已经明确在朝着 10 万卡、甚至 30 万卡的方向冲。算力疯长之后,电力的边际效应就开始显现,黄仁勋在多个场合反复强调 AI 工厂(AI Factory)的概念,本质上就是说:算力基础设施建设要进入工厂化、规模化的时代了。
但我要特别指出一点:10 亿瓦不是“目标”,而是“结果”。它背后真正驱动的是模型参数量和数据量的持续膨胀。今天的大模型预训练动辄就是几十万亿 token 的数据集,模型参数量从千亿走向万亿、十万亿,每一次规模跃升,对算力的需求不是线性翻倍,而是成数量级地跳变。当单集群规模从万卡走向十万卡,你不可能再把它们拆成几百个小集群各自为政,因为你需要的是海量 GPU 协同完成一次训练任务,而不是几百个并行的“小任务”。这时候,一个能把这么多加速器高效粘合在一起的巨型系统就不可避免地诞生了,而它消耗的电力,自然就来到了 1GW 量级。
1.2 为什么 AI 终于配得上“工厂”二字
我印象非常深的一次对话,是和一个做传统企业 IT 的老朋友吃饭。他问:“数据中心跟 AI 工厂到底有什么本质区别?不都是房子、机柜、空调、电线吗?”我当时打了个比方:传统数据中心是“库房”,你把服务器放进去、托管在机架上,跑的是各种 Web 服务、数据库、流媒体——资源被拆成几十万个虚拟机或者容器,提供给各种业务使用,每一个请求都是轻量的、瞬时的,整体模式更像一个“超市”,顾客随取随走。
AI 工厂则完全不一样,它更像一条“流水线”。整座工厂的终极目标不是“把数据存下来”或者“把请求转发出去”,而是高效地产出一系列智能模型。GPU 在工厂里就是“机床”,数据是“原材料”,训练框架是“工艺路线”,网络则相当于工厂里的“传送带”。传送带一旦卡住,整条流水线都得等。这样一座工厂追求的是“单位能源产出多少有效计算”,而不是“单位面积放多少台服务器”。
从这个角度看,AI 工厂的三大支柱就非常清晰了:第一是密集的计算资源,也就是大规模 GPU 集群;第二是高速、无损、低时延的互联网络,把算力组织成一个整体;第三是与算力规模精确匹配的能源供给和散热系统。过去几年大部分团队把精力花在第一点上——堆卡;今年开始越来越多的团队意识到第二点才是真正拉开差距的地方。一张卡两年前花 3 万美元,现在花 4 万美元,但你花几千万建好网络之后,如果利用率从 40% 优化到 70%,相当于凭空多出来一大截算力,这笔账怎么算都划算。
2. 网络是 AI 工厂的“血液循环系统”
2.1 训练一次大模型,网络里到底在跑什么
很多非网络背景的读者可能对“AI 训练需要网络”这件事感觉很抽象。我换个角度解释:假设你要把 100 万个词元的文本送给一个 1 万亿参数的模型去训练,这个模型不可能放到一张卡里,它必须被切分成许多份——这就像你让一万人每人负责读一本书的一部分,然后大家要共同更新对这本书的理解。张量并行(Tensor Parallelism)是把模型的一层切开,让多张卡各算一部分再拼起来;数据并行(Data Parallelism)是把数据切开,让不同卡各自算各自的梯度,然后汇总;专家并行(Expert Parallelism)则让不同的 token 路由到不同的“专家”模块上去计算。
这些并行策略如果只是理论,倒是挺简单,但落到工程上就会立刻演变成一个可怕的东西:通信。在训练一个万亿参数模型时,每一轮迭代,网络里跑的数据量动不动就是几十 GB 甚至上百 GB,而且不是一次性均匀发送,是大量的突发式 All-to-All 流量,所有卡同时给所有其他卡发数据。你在机房上线前做带宽测试,可以轻松跑到 90% 的利用率,但真实训练任务一跑起来,网络利用率能稳定到 60% 就已经相当了不起,剩下 40% 全被拥塞、等待、报文重传吃掉了。
为什么等待那么致命?因为分布式训练是典型的“木桶效应”:每一轮迭代要等所有 GPU 都算完、都通信完,才进入下一轮。一张卡掉链子 5 秒,整批一万张卡陪着它一起等 5 秒。所以在千卡、万卡集群里,哪怕网络平均时延只增加 10 微秒,都可能让整体训练效率肉眼可见地下降。这不是玄学,这是同步屏障(Barrier)机制决定的物理现实。我见过最夸张的一个案例,某个集群因为交换机的拥塞管理配置不当,GPU 利用率从预期的 80% 直接掉到 50% 以下,一轮排查过去,发现根源仅仅是某个型号交换机的 ECN 阈值设置得过于激进。
2.2 Scale-up 与 Scale-out:两张网各管一段
接触过大规模 AI 集群的人应该都熟悉一个词:Scale-up(纵向扩展)和 Scale-out(横向扩展)。Scale-up 指的是单个“计算域”内部的 GPU 互联,典型代表就是 NVIDIA 的 NVLink 域,一张 8 卡的 DGX 服务器内部,卡与卡之间通过 NVLink 以每秒 TB 级别带宽直接通信;Scale-out 则是把不同的计算域通过外部网络连接起来,典型代表是 InfiniBand 或高速以太网,带宽以每秒几百 Gbps 到几个 Tbps 为主。
为什么要分两段?因为一张卡和它最亲密的“伙伴”之间,通信量最大、时延要求最苛刻,比如张量并行里的 AllReduce,那一丁点延迟都会直接变成同步等待;而跨域之间的通信,虽然带宽要求极高,但对时延的敏感度相对没有那么极端。所以网络上普遍的做法是:NVLink 域内做“快车道”,以极低时延完成细粒度协同;域间用 Scale-out 网络做“主干道”,保证海量数据快速搬运。
这带来一个很有意思的工程变化:过去我们选网络设备,主要考虑的就是交换容量和端口速率;现在选设备,还要考虑你能不能在物理上离 GPU 足够近、能不能用铜缆直连、能不能忍受光模块的功耗和散热、能不能做 RDMA——每一项都会体现在真实的训练效率上。在万卡集群里,Scale-out 网络动辄几千个端口,任何一个端口如果出现微突发丢包,都可能引发 PFC 风暴,接着是连锁式的性能崩塌。所谓“无损网络”的圣杯,就在这几千个端口的恶劣战场上艰难地维持着。
2.3 AI 网络与传统数据中心网络最本质的区别
做网络的人,如果只是把传统数据中心的“大二层 + 等价多路径”思路照搬到 AI 集群,几乎都会栽跟头。原因在于流量模型完全不同。传统数据中心是典型的南北向流量,用户请求进来,内部服务之间偶有东西向通信,但整体流量是碎片化的、小包居多、长短混合,网络设备可以依靠缓存和缓冲来“消化”突刺。AI 训练网络则是极端的“大象流”:大量节点以近乎线速的方式互相灌数据,队列很快就占满,传统哈希的负载均衡在这种场景下会频繁失效。
另一个本质区别是“流完成时间”的敏感性。传统业务里,一个 Web 请求慢个几十毫秒,用户可能有感知但业务还在跑;AI 训练里,一个梯度同步慢 100 毫秒,可能就导致整个集群进入同步停滞状态。因此 AI 网络必须引入“拥塞感知”机制,比如 RoCEv2 里的 ECN(显式拥塞通知)、数据中心里常见的 PFC(优先级流控)、以及更现代的智能拥塞控制算法。这些机制的原理不复杂,但配合不当就会互相打架,PFC 风暴导致死锁的事故,我过去两年里处理过不下五次。每次我都觉得:网络工程师的活儿完全变了,不再是配置 VLAN、静态路由这么简单,而是要从流量的脾气秉性出发去设计整个系统。
3. 技术选型:专用 InfiniBand 与开放以太网的贴身肉搏
3.1 InfiniBand:为 AI 而生的专用跑道
InfiniBand(IB)之于 AI 训练集群,就像 F1 赛道之于赛车,它是极其优秀的专用方案。IB 从设计之初就考虑了高性能计算场景的三大诉求:极低时延、极高带宽、无损传输。它的链路层流控机制能保证数据包在传输过程中不因拥塞而丢弃,配合自适应路由(Adaptive Routing)和拥塞控制,能把大规模 GPU 集群的通信效率推到非常高的水平。
在 GTC 的语境下观察,NVIDIA 自家的集群集成基本都以 InfiniBand 为主力网络。过去几年各大厂商的万卡集群,绝大多数选择 IB 方案,图的就是稳定、确定性强、效果有保障。IB 的运维难度也相对可控——虽然设备贵,但它的行为非常规矩,可观测性工具也很成熟,出了问题能快速定位。某种程度上,IB 是“虽然贵但是省心”的选择。
但 IB 的代价同样明显:第一是成本,IB 交换机和光模块的价格明显高于同规格以太网;第二是封闭生态,它对第三方设备的兼容性有限,你很难拿不同厂商的设备混合组网;第三是在一些非 AI 业务场景里,IB 网络基本是纯浪费。所以 IB 适合的目标非常清晰:专门的、专注 AI 训练的大型集群,尤其是你要在确定性上追求极致的时候。
3.2 以太网阵营的反击:Spectrum-X 与超以太网联盟
以太网阵营这两年的反攻速度非常快。核心逻辑很简单:以太网的生态太庞大了,全球各大数据中心已有基础设施几乎都是以太网,如果能在此基础上实现高性能无损传输,那企业就能“花小钱办大事”。RoCE(RDMA over Converged Ethernet)正是这一思路的产物,它把 IB 的 RDMA 语义搬到了以太网上,让普通交换机也能跑出接近 IB 的高性能。
但 RoCE 最大的毛病是:以太网本来就不是为无损设计的,丢包、乱序、缓存不足等问题都会让 RDMA 传输效率急剧恶化。早期的 RoCE 部署,性能对网络微突发极其敏感,很多人因此宁可加钱上 IB。为了补上这个短板,业界联合推进了 Ultra Ethernet Consortium(UEC),制定面向 AI 时代的以太网增强标准,从拥塞控制、负载均衡、丢包恢复等多个层面重新定义链路行为。NVIDIA 自己也顺势推出了 Spectrum-X 平台,通过 BlueField DPU 和 Spectrum 交换机的联动来做端到端的拥塞控制,实际效果已经相当接近 IB。
我在实际测试中的体感是:对于 1K 卡级别集群,Spectrum-X 和 IB 的性能差距已经在 5% 以内;在 4K 卡以上规模,IB 仍然有优势,但以太网方案的综合性价比、多厂商竞争带来的灵活性,让越来越多新项目开始认真考虑“超以太网”路线。尤其是一些已经有大量以太网资产和数据中心运维经验的公司,完全没必要上来就砸重金上全套 IB。
3.3 选型不是网络问题,而是工程经济学问题
关于 IB 和以太网之争,我的核心观点是:从来不存在“哪个方案绝对更好”,只存在“哪个方案适合你的现状和目标”。很多团队在选型时容易犯一个错误,就是只盯着带宽和时延的纸面参数,忽略了“运维能力和团队熟悉度”这个隐藏成本。IB 如果没人会调,买了也白买;RoCE 如果调不好,图便宜的下场就是天天处理 PFC 死锁。
我建议做选型时画一张表,把下面几个维度列出来:GPU 集群规模(1K、4K、10K+)、模型通信模式(稠密 vs 稀疏专家并行)、现有网络资产(是否已有大量以太网)、运维团队技术栈(是否熟悉 RDMA),以及最重要的——业务对“确定性”还是“性价比”更敏感。如果全部追求极致且预算充足,IB 是正确答案;如果是多租户混合负载平台,以太网反而更务实,因为它的通用性允许你在闲时跑一些 HPC 或大数据任务,不至于让网络空转。
我个人比较看好的一条路径是“以以太网为主体、以智能网卡为补强”的混合架构。拿走 IB 的一点性能劣势,换来整个体系的开放性和长期演进空间,这在 1GW 级 AI 工厂里,不是技术决定,而是资本和运维的不可承受之重反过来倒逼技术选择。
4. 搭建 AI 工厂网络时,真正要命的工程细节
4.1 拓扑怎么选:不只是胖树,还要看“高铁直达率”
AI 集群的网络拓扑选择,和传统数据中心最大的差异在于:你不能再依赖“三层都是全互联”的胖树结构了。胖树的带宽收敛比容易控制,但它的时延路径较长,而且在大规模 All-to-All 场景下,上游链路的拥塞概率极高。所以做 AI 网络的人,越来越多会关注“Rail-Optimized”(轨道优化)拓扑。
什么是 Rail-Optimized?简单说,就是把物理上相邻的一批 GPU 卡,尽量放在同一个网络交换域内,让它们之间的通信不需要经过多层交换机转发,就像一条专门的“高铁线”直连。这样做的好处是:分布式训练里最常见的“相邻节点通信”可以走最短路径,时延和拥塞都大幅下降;但它要求的交换端口数量和布线复杂度也会上升。4K 卡集群用两层 Rail 拓扑还能应付,到了 2 万卡以上,设计者就得考虑三层或多级结构。
另一个在大规模组网里被反复提到的拓扑是 Dragonfly+,它把网络分成“群(Group)”“组(Pod)”层次,组内是全互联,组间通过少量全局链路相连。它的优势是“用更少的链路达到同等带宽”,对机架间的物理布线压力大减,在 10 万卡量级,这种拓扑的优势不是一点点,而是决定性的。但它的代价是路由复杂度和流控算法大幅上升,开局配置的难度比 Fat-Tree 高一个数量级。我见过不少团队在 POC 阶段用胖树能跑出漂亮数据,真上了 Dragonfly 后因为配置参数没调好,性能反而崩了——拓扑本身没有对错,只有“你的团队能否驾驭”。
4.2 拥塞是无感 AI 工厂里最隐秘的性能杀手
我甚至想说,大规模 AI 集群的性能杀手不在 GPU,而在网络拥塞。它的隐蔽性在于:从交换机 SNMP 的端口利用率看,一切正常——链路没打满、丢包率看着也低;但训练任务的实际吞吐就是上不去。原因往往是:瞬时微突发导致的排队、PFC 反压的扩散、ECN 标记阈值和实际队列深度不匹配,这些层面的问题根本不会体现在“平均利用率”里。
之前处理过一个典型事故:集群从 2048 卡扩展到 4096 卡后,训练的吞吐没有像预期那样线性提升,某些迭代的耗时反而翻倍。排查了很久,最后发现是以太网交换机在默认配置下的 PFC 死锁——某个低优先级队列被高优先级流量堵死,导致反压信号层层上传,最终把多个端口的有效带宽全部拉低。这个问题的“元凶”竟然只是某个交换机的“头阻塞”参数没调对。从此以后,我在所有环境上线前,都会强制加入“全集群压力测试”:让所有 GPU 同时互发数据,持续跑足 30 分钟,观察 ECN 标记报文比例、PFC 帧数量、队列深度和实际吞吐的对应关系,有任何一项偏离基线,就停下来排查,绝不带着隐患上线。
这些“看不见的变数”就是 AI 网络和传统网络最大的不同:传统网络的故障是“通”与“不通”的问题,AI 网络的故障是“快”与“慢”、“稳”与“抖”的问题,后者对运维工具和工程师直觉的要求高得多。
4.3 网络可观测性:AI 时代的新“必修课”
正因为 AI 网络性能衰减如此隐蔽,可观测性建设就成了硬需求。传统网络监控工具,SNMP 轮询设备和端口状态、ping 测连通性、看丢包率告警,这些在我看来已经远远不够了。你要想在 1GW 的 AI 工厂里活得好,至少得具备以下几种能力:基于流级别的实时遥测(能看到某个通信对的流量路径和拥塞点);全局拥塞事件的检测与归因(能快速判断是哪个上游链路导致的反压扩散);以及训练任务与网络指标的关联分析(能把一次迭代耗时拉长,对应到是哪一阶段的通信拖了后腿)。
在 NVIDIA 的生态里,InfiniBand 过去在可观测性上的优势很大,因为它有专门的遥测机制;而以太网方案这两年也在快速追赶,Spectrum 交换机配合 DOCA 遥测能提供相当细粒度的数据。我自己的经验是:无论用哪家方案,一定不要把监控数据只留在网络团队手里,要把它和训练框架里的迭代耗时、GPU 利用率联合起来看。很多“网络好像没问题”的案子,一旦把训练日志里的通信耗时曲线叠加到网络遥测上,立刻就能发现“每次同步阶段网络队列就加深”这种强相关性。
4.4 供电与散热:网络设备也被推着“卷”
说到 1GW 的 AI 工厂,供电和散热是绕不开的话题。很多人以为这是机电专业的事,和网络没关系,但实际做下来你会发现:算力密度的提升直接改变了网络设备的形态。传统的交换机设备,一个框式交换机能胜任接入层任务,功耗低、噪声小;但在 AI 工厂里,接入层基本被 128 端口、单端口 800G 甚至 1.6T 的盒式交换机取代,单台交换机的功耗已经逼近甚至超过 1000W,机柜级的功耗密度非常高。
光模块更是重灾区。一个 800G 的可插拔光模块,功耗普遍在 16W 到 20W 之间,一张 128 端口交换机光模块总功耗轻松突破 2kW。如果是 10 万卡集群,光模块的数量数以十万计,总体耗电量惊人。这也是为什么“共封装光学(CPO)”最近被反复提起——把光引擎直接封装到交换芯片旁边,用板载光学替代可插拔模块,能把光互连功耗降低一半以上。虽然目前 CPO 的产业链成熟度还在早期,但在我接触的几个大型新园区设计中,已经预留了 CPO 交换机的机柜空间和制冷余量,这种前瞻性是必须的。
5. 我看到的 10 亿瓦级 AI 工厂的现实与想象
5.1 算力地图上的新基建逻辑
从商业布局的视角看,1GW 量级的 AI 工厂已经不只是“机房扩建”,它正在重塑整个基础设施的投资逻辑。过去数据中心选址看带宽资源、客户分布、骨干网络节点;AI 工厂选址的核心只有一个:电力资源是否充足、是否便宜、能否持续供电。我见过好几个新规划中的园区,直接建设在大规模水电、风电资源附近,目的就是锁定长周期的低成本清洁能源。这本质上跟当年把电解铝厂建在电厂旁边一样,是“能源密集型工业”对地理位置的硬要求。
同时,电网侧被迫跟着改造。一个 1GW 的园区,其峰值负荷足以顶上一个中型城市的全部用电量,这对接入方案、变电站配置、电网调度都是一次从零开始的设计。听起来特别宏大,但它真的在发生。我在和一些做电力基建的朋友沟通时发现,他们已经在用“数据中心 + 新能源 + 储能”的微网模式来规划 AI 园区,光伏、储能电池组和算力负载统一调度。未来的 AI 工厂,与其叫“数据中心”,不如叫“智能算力发电厂”——只不过它输入的是一次能源,输出的是模型推理能力。
5.2 AI 工厂对产业链的连锁冲击
AI 工厂的大规模建设,正在带动一连串产业链的连锁反应。最直接的是光模块和光缆:800G 光模块还在放量,1.6T 已经进入样机阶段,后面还会有 3.2T 甚至更高速率;这背后是硅光技术、薄膜铌酸锂调制器、高密度封装这些基础研究的快速商业化。铜缆也是一个很有意思的市场——在机柜内部和相邻机柜的短距离连接上,无源铜缆(DAC)凭借极低的功耗和成本,反而在 800G 时代继续“统治”了一席之地,但更长距离的应用还得靠光。
再往上游看,交换芯片和数据中心交换机的竞争格局也在悄悄生变。过去以太网交换芯片市场是几家传统厂商的天下,现在因为 AI 带来的高速率窗口,新的玩家不断涌入。各家都在争夺“AI 网络标准”的定义权,不仅有传统兼容路线,还有专门为 AI 场景优化的新架构。这些竞争对最终用户来说是绝对的利好——价格的快速下降和产品丰富度的提升,让过去“非 IB 不 AI”的格局松动,企业有了更多组合选择。
5.3 工程师、架构师、研究员的新机会
最后聊点实际的——人和团队。1GW 时代对人才的需求,已经完全不是传统网络工程师能覆盖的了。过去懂 VLAN、MSTP、OSPF、BGP 就能胜任网络运维;现在要想跑好 AI 工厂网络,你得懂 RDMA、无损网络、拥塞控制、GPU 拓扑和数据并行语义,还得能读懂训练框架的日志,理解梯度同步算法的时间线。
我认识的几个转型比较成功的传统网络工程师,都有一个共同特征:他们并没有急着去学“深度学习理论”,而是先啃透了 RoCE 的原理、跑通了 PFC/ECN 的配置,再通过一次次故障排查把“网络问题”和“训练问题”之间的因果链条建立起来。这个过程非常痛苦,但一旦建立起来,就像打通了任督二脉:你看到一段紧耦合的通信模式,就能预判它在哪条链路上会产生拥塞,提前把拓扑和阈值调好。这种“跨界”能力,在未来几年会越来越值钱。因为纯网络专家不懂算力调度,纯算法工程师不懂网络细节,能沟通两端的人,才是 AI 工厂最稀缺的角色。
我一直觉得,技术在巨变时最考验的不是“学得快”,而是“忘得快”——忘掉过去那些基于传统流量模型建立的经验直觉,重新建立一套面向 AI 通信模式的思维方式。GTC 2026 这场活动的意义,不在于展示又多了多少 PFlops 的算力,而在于让整个行业意识到:算力的体量已经大到需要专门为它设计基础设施了,网络在其中不再是被动配套,而是决定系统上限的主导者之一。
如果你所在的团队正准备建设自己的 AI 集群,我的建议是别急着下单买卡,先把网络方案拿出来,请懂行的人认认真真做一轮压力测试和拓扑评审。GPU 贵,但闲置的 GPU 更贵,而让 GPU 闲置的最大元凶,往往就是那条看似“啥都能通”的网络。算力是原材料,网络才是生产线,生产线不顺畅,原材料堆再多也做不出合格的产品。这个时代,真正决定 AI 工厂生产力的,不是你有多少电和多少卡,而是你能不能把这些资源精确、无缝、高效地组织成一台轰鸣的机器。