1. AI 供应链最近到底发生了什么,为什么值得你停下来读
AI 供应链最近出现了一次教科书级别的连锁反应:MetaRoCE 开源、ChatGPT Work 采用断层、牛鞭效应在硬件层被反复放大,这三件事本质上是一个故事的三段剧情。我在基础设施圈待了这么多年,第一次觉得"供给"和"需求"之间那根弦被拉到这么紧——上游厂商拼命扩产,中游云厂商一边抢卡一边退单,下游企业用户却在 POC 里打转。这篇文章我就把自己观察到的整条传导路径拆开讲,顺便给同样在震荡期里做技术选型和预算规划的同学一些可落地的参考。
先说我为什么会对这两件"看上去不相干"的事产生警觉。Meta 开源 RoCE 网络相关的成果,这属于基础设施层的技术事件,很多人只把它当成又一个开源项目上架;ChatGPT Work 在企业端采用遇冷,又常被归为"产品落地难"的老话题。但如果你把 AI 行业放回供应链框架里看,会发现它们分别是"供给侧新增了一个替代变量"和"需求侧出现了一段失真信号"。当这两个变量同时叠加,上下游的订单预测和行为决策就会开始互相踩踏,这就是我在标题里点名的牛鞭效应。
这篇文章适合三类人:一类是负责算力采购、集群规划、网络选型的基础设施工程师;一类是在企业里推进 AI 工具落地的技术管理者和产品负责人;还有一类是关注 AI 行业投资与创业节奏的从业者。我尽量不堆术语,但涉及 RoCE、RDMA、InfiniBand 这些网络基础概念时会展开解释,保证没接触过数据中心网络的读者也能跟上。
2. 从用户敲下回车到芯片厂排产,AI 供应链中间隔着多少层
2.1 一条被所有人低估的长链条
大多数人理解 AI 行业,看到的是最上游的模型发布和最下游的对话框打字。但一条完整的 AI 供应链其实长这样:终端用户和应用场景排在最前端,往下是调用这些能力的软件产品,再往下是大模型训练与推理服务,紧接着是承载这些服务的算力集群——服务器、GPU、网络设备,再往深处走是芯片设计、先进封装、存储颗粒,最底层是代工产能和上游材料。
每一层都有自己的下单节奏、库存逻辑和度量方式。终端用户按天产生请求量,云厂商按季度评估扩容,GPU 采购合同的周期往往以年计算,而芯片代工从投片到出货要经历数月甚至更长的周期。层与层之间的时间尺度越拉越大,需求信号在传递过程中的失真程度就越严重。这里有个特别容易被忽视的点:AI 供应链不是一个单线结构,而是一张网。算力可以来自自建集群、云上租用、裸金属托管、甚至二手卡市场,需求可以从多个入口分流。这张网的出口越多,每一层对"真实需求"的判断就越困难。
2.2 为什么网络层才是整条链的"心跳"
我在跟不少做 AI 训练的同学聊的时候发现,大家普遍盯着 GPU 的算力指标,却很少关注 GPU 之间的通信效率。分布式训练的本质是让几千张卡协同完成同一个任务,训练过程中频繁发生集合通信——梯度聚合、参数同步、模型分片交换。网络质量直接决定 GPU 有多少时间在真正计算、有多少时间在空等数据。
业内有个词叫"通信占比":如果一次迭代 10 秒,其中 3 秒花在等网络数据,那通信占比就是 30%,等于三成算力在闲置。高性能网络的价值就在这里——把通信占比压下去,GPU 利用率才能提上来。网络层之所以是整条供应链的心跳,不只是因为它决定性能,还因为它决定了算力集群的采购组合:选 InfiniBand 还是选以太网加 RoCE,交换机品牌和端口速率怎么配,网卡是否支持 RDMA,这些决定直接影响了硬件成本结构、交付周期和运维复杂度。网络层的每个技术路线变化,都会沿着供应链向上游传导——这就是 MetaRoCE 开源这件事值得单独拿出来聊的原因。
3. MetaRoCE 开源:网络层突然多了一个改写采购逻辑的变量
3.1 先补课:RoCE 到底是干什么的
RoCE 全称是 RDMA over Converged Ethernet,翻译过来就是"在融合以太网上跑 RDMA"。RDMA 是一种允许网卡直接把数据从一个服务器的内存搬到另一个服务器内存的技术,绕过操作系统内核和 CPU 参与,实现极低的延迟和极高的吞吐。传统 TCP 协议走内核协议栈,每次收发都有开销,在大规模分布式训练里根本扛不住频繁的集合通信。RDMA 把数据通路从 CPU 手里解放出来,让网络传输变得像本地内存访问一样快。
RoCE 最大的特点在于它跑在以太网上,而 RDMA 最初的载体实际上是 InfiniBand。InfiniBand 是专门为高性能计算设计的网络架构,性能确实强,但设备生态相对封闭,价格也更贵。RoCE 让 RDMA 能力可以在标准以太网基础设施上实现,理论上能用更低的成本获得接近 InfiniBand 的性能。代价是工程复杂度上来了:以太网本身是尽力而为的网络,丢包、拥塞、乱序都是常态,而 RDMA 对丢包极其敏感,一个报文丢失可能拖垮整条链路的重传效率。于是 RoCE 网络里最核心的难题变成了拥塞控制——什么时候降速、该让谁降速、怎么让整个集群的流量像水流一样平稳分布。
Meta 开源的 MetaRoCE,按标题消息的指向看,就是把他们大规模 AI 集群中运行 RoCE 网络积累的相关成果——拥塞控制算法、网络调优配置、运维工具链这一类的东西——以开源形式放出来。对这种项目,我的判断是它不只是代码层面的一次贡献,更是对整个 AI 网络生态的一次姿态调整。
3.2 开源带来的连锁反应,比代码本身更重要
先说采购层面的变化。AI 训练集群选型时,网络方案通常只有两个选项:InfiniBand 或者 RoCE。InfiniBand 生态成熟、性能稳定,但成本高且被单一厂商主导;RoCE 开放、兼容现有以太网设施,但对工程师的调优能力要求极高。过去很多团队不敢选 RoCE,就是因为拥塞控制这类核心技术掌握在少数设备厂商手里,出了问题只能提工单等回复。MetaRoCE 这类开源成果相当于把大型互联网公司千卡、万卡集群上验证过的网络运营经验公开出来,等于告诉所有人:RoCE 这条路不仅走得通,而且已经被跑大规模生产系统的人验证过了。
这会直接影响三个层面的决策。第一,交换机采购不再是"非 InfiniBand 不可",基于标准以太网配合 RoCE 的方案在成本上的优势会被重新评估;第二,网卡和驱动层面的竞争会加剧,开源协议栈降低了新硬件进入生态的门槛;第三,云厂商可以用更低的网络成本提供裸金属训练集群,把省下来的成本投射到租金上,反过来倒逼上一轮囤积 InfiniBand 设备的数据中心重新算账。
我在这一节想强调的关键点是:供应链上的技术选型从来不只是性能对比,而是"替代弹性"的博弈。当某个关键环节只有一种成熟方案时,它的定价权、交付周期、升级节奏都掌握在供应商手里;而一旦开源方案提供了一个可信的替代项,整个采购谈判的天平就会移动。MetaRoCE 开源的真正意义,是让 AI 训练网络的供给曲线从"单一通道"变成了"双通道",替代弹性上来了,上游的议价空间和下游的成本结构都会跟着变。
4. ChatGPT Work 的采用断层:需求信号正在被"虚火"污染
4.1 断层比大多数人想象的更真实
MetaRoCE 开源解决的是"供给端怎么更便宜地造算力"的问题,而 ChatGPT Work 在企业端的采用情况,直接关系到"终端到底有多少真实需求"。我这里的 ChatGPT Work 泛指以 ChatGPT 为代表的一批生成式 AI 工作工具在实际企业环境中的部署应用状态。
断层这个词是我有意选的,因为它比"推进缓慢"更准确。实际情况是:个体热情很高,组织落地停滞。员工自己注册账号用得不亦乐乎,但公司层面的采购流程、权限管控、预算归属全都没跟上;POC 项目做了不少,真正进入生产环境、跑在核心业务流里的极少。典型的症状包括:安全合规评审卡在第一轮,数据权属问题无人拍板,IT 部门不清楚该把 AI 工具的预算划在哪个科目下,业务部门又担心用错工具导致责任事故。
这种断层的本质是"个人生产力提升"和"组织流程再造"之间没有搭桥。AI 工具帮助个体写周报、生成代码片段、整理会议纪要,这类价值是即时且清晰的;但企业级的价值需要系统集成、权限架构、审计追踪、知识库治理这些配套工程才能兑现。后者是重活、慢活,没人愿意为它买单,断层就产生了。
4.2 断层如何污染上游的需求信号
关键是这个断层对供应链意味着什么。供应链每一层做决策时,依赖的都是层与层之间的订单信号,而订单信号的起点是终端用量。当企业端采用处于断层时,终端用量呈现出的形态非常具有迷惑性:总注册数和总调用量可能很高,但付费深度很浅,稳定留存很少。
这会造成两类相反的误判。一类误判是"高估"——看到用户增长曲线陡峭,认定需求还会继续爆发,于是云厂商下单购买 GPU 训练容量的节奏明显快于实际推理负载的增长;另一类是"低估"——当业界开始普遍讨论采用断层的新闻后,投资人收紧预算,云厂商缩减扩容计划,终端需求其实还在缓慢爬坡,但采购决策已经踩了刹车。
这两类误判的交替出现,正是牛鞭效应最典型的触发条件。终端信号的失真不会停留在终端,它会顺着订单一层一层往上传递,每一层都在用自己的偏差放大前一层的信息。ChatGPT Work 采用断层看起来是个应用层的话题,但它实际上就是整个 AI 供应链需求侧的第一个失真节点。
5. 牛鞭效应:为什么 GPU 从抢不到货到传言过剩,中间只隔了几个月
5.1 先讲清楚牛鞭效应的四个诱因,AI 供应链上全都齐了
牛鞭效应是供应链管理里一个经典现象:终端需求只出现很小的波动,越往上游走,订单波动越大,图像上画出来就像甩动的牛鞭——鞭梢小幅挥动,鞭把大幅摆动。它的产生机制在学术界早有定论,我在 AI 供应链上逐条对照过,发现四个标准诱因全部命中。
第一个诱因是需求预测放大。每一层都基于下游订单加一个安全系数来下单,安全系数层层叠加,订单量就层层放大。第二个诱因是批量订购。GPU 这类设备有最小起订量,云厂商一次下单可能就是一个集群规模的整数倍,不会跟着周级别需求精细化调整。第三个诱因是价格波动和配额分配。供应紧张时,供应商按订单比例配货,客户为了多拿货会虚报需求,这个虚报在后续周期里变成泡沫。第四个诱因是信息不透明和长交付周期。芯片和网络设备交付周期长,客户等货期间会重复下单、多处下单,等到货时才发现远超真实所需,于是大面积取消订单。
下面这张表是我把经典诱因映射到 AI 供应链的一个速查,方便你对照理解:
| 牛鞭效应诱因 | 在经典供应链中的表现 | 在 AI 供应链中的对照 |
|---|---|---|
| 需求预测放大 | 零售商按销量加安全库存订货 | 云厂商按用户增长曲线加安全系数采购 GPU |
| 批量订购 | 批发商按整车整柜下单 | 算力集群按千卡万卡整数规模下单 |
| 配额分配与虚报 | 短缺时按比例配货,客户多报需求 | GPU 产能紧张时客户超订再转售 |
| 信息不透明与长交付期 | 经销商一单多投试探 | 同一批算力需求向多个云厂商重复询价 |
5.2 从"现象级增长"到"库存过剩",完整传导路径复盘
把这四个诱因串起来,就能还原出 AI 供应链过去一段时间经历的完整路径。
第一阶段是需求爆发。生成式 AI 产品上线,用户量在极短时间内冲到现象级,所有人都觉得这是历史级的机会。第二阶段是恐慌性下单。云厂商和 AI 创业公司大规模锁定 GPU 订单,合同一签就是数年,订单规模远超当下真实负载,因为没人敢赌自己能抢到下一批产能。第三阶段是产能瓶颈暴露。以 GPU 为代表的算力芯片供给受限,交付周期拉得很长,这时候客户能做的只有两件事:加价、加量下单。供应商面对过量订单,只能按比例分配产能,又倒逼客户进一步虚报需求。
第四阶段就是现在正在经历的:终端采用断层被媒体和行业报告大面积讨论,投资人开始追问 GPU 利用率和回报率,云厂商发现当初锁定的订单有一部分根本消化不掉,于是推迟交付、协商取消、甚至把囤积的卡转向转售租赁市场。第五阶段是反向踩刹车。上游芯片厂看到取消订单和降价消息,开始收缩产能规划,原定的扩产计划延后或搁置。
整个过程里最讽刺的一点是:终端需求从"现象级暴涨"到"增速回落",波动幅度其实没有那么大,真正被放大的,是产业链每一层基于悲观预期做出的收缩动作。牛鞭效应最伤人的地方从来不是需求本身的变化,而是需求变化被层层放大的过程。
5.3 MetaRoCE 和采用断层如何联手改变了传导路径
现在把第三和第四节的线索合并看,这场连锁反应的全貌就清晰了。MetaRoCE 开源解决的是供给端的结构性问题——它降低了 RoCE 网络的采用门槛,让算力供给多了一条更便宜的通道,硬件采购的选择权更多,供应瓶颈被部分打破。这相当于给整条链条加了一个"泄压阀":当 InfiniBand 生态产能紧张时,RoCE 方案可以承接溢出的需求。
而 ChatGPT Work 采用断层则处在需求端,它让终端信号失真,成为整条链条上最不稳定的输入源。一旦市场情绪从"风口论"切换到"断层论",上游订单修正的力度会被放大,形成剧烈的库存调整周期。泄压阀能缓解供给紧张,却不能纠正需求信号的失真;开源项目能降低建设成本,却不能代替企业把 AI 工具真正嵌进业务流程。两个变量一叠加,就会看到一种奇特局面:网络层技术在进步、算力成本在下降,但上游设备商的排产计划依然在周期底部徘徊,因为下游的采购意愿被采用断层和需求修正死死压制着。
6. 震荡周期里的生存策略:我在实际操作中总结的几条做法
6.1 基础设施侧:按弹性规划,而不是按峰值规划
如果你现在负责公司的算力集群规划,我的第一条建议是:把预算报告的叙事从"满足峰值需求"改成"满足弹性扩展"。按峰值规划基建,本质上是把自己的决策权交给最乐观的预测者;按弹性规划,则是把风险分散到云上按需扩容、短期租用、混合调度这些路径上。我见过太多团队在 GPU 紧缺时咬牙囤货,结果等货到了,模型推理负载已经被更轻量的部署方案消化掉了,几百张卡在机房里吃灰。
具体执行层面的做法是:先把训练和推理的负载拆开,训练负载优先跑在自建集群上,推理负载用云上按需实例兜底;扩容时按周粒度观察真实利用率,连续两周超过既定阈值才触发下一批采购。网络侧同样值得上心,如果你在新建 AI 集群,别默认选 InfiniBand,把 RoCE 方案纳入评估,用实际业务负载做几分钟的基准压测,而不是看厂商的宣传材料。MetaRoCE 这类开源项目落地后,RoCE 方案的技术风险正在快速下降,值得认真测试。运维团队可以提前准备网络层面的可观测性工具,比如用ethtool -S查看网卡丢包和重传计数,用ibstat查看 InfiniBand 链路状态,或者重点监控 RoCE 网络里的 PFC 暂停帧计数,这些数字比任何仪表盘上的"健康度"都诚实。
6.2 应用侧:把 AI 能力做成可插拔模块,别做全家桶改造
在采用断层期里,企业应用侧最容易犯的错是把 AI 工具当成一个整体项目去推动,动辄就要重构业务流程和系统架构。以我的经验,这种做法大概率会在断层期里卡死:组织没有做好配套准备,重构带来的风险又让决策者迟迟不敢签字,项目就从"推进中"慢慢变成"悬停中"。
更务实的路线是把 AI 能力抽象成可插拔的模块。比如把大模型调用包一层中间层,模型 API 的切换不影响上层业务代码;对单个场景做价值验证,而不是等全套基础设施就绪后才开始试点;成本核算跟真实调用量挂钩,按每千次请求的实际成本做展示,而不是按并发峰值去买授权和算力。断层的本质是"组织消化新工具的能力"跟不上"工具本身的能力",而可插拔架构能让你以最小的组织改动先吃下最容易产生价值的部分。
6.3 个人与团队的信号识别训练
最后说点偏认知层面的建议,我觉得这也是震荡期里最值钱的东西。第一,看数据别看头条。行业头条在短缺期一定会渲染紧缺,在过剩期一定会渲染饱和,而真实信号藏在云厂商的价格调整、二手市场的报价变动、开源社区的技术讨论密度这些容易被忽略的地方。第二,区分"用户增长"和"付费深度"。用户增长是前置信号,付费深度才是可持续需求,判断供应链走势时多盯后者。第三,把开源生态投入当作长期对冲。MetaRoCE 这类开源项目带来的不只是技术选项,更是一种供应链上的冗余能力——当某个环节收紧时,开源生态的存在本身就是谈判筹码和逃生通道。
回过头看,这轮 AI 供应链的连锁反应并不神秘,它只是把供应链管理教科书里的经典剧本用新行业重新演了一遍。Meta 在网络上开源是给供给侧松松绑,ChatGPT Work 在需求侧的断层则是给产业链打了一针清醒剂。两股力量较劲的时候,最不该做的就是跟着情绪追涨杀跌。基础设施往弹性方向走,应用架构往模块化方向走,认知判断往真实数据方向走,这三点全做到,哪怕后面再来一轮牛鞭效应的反向甩动,你也能站稳。