GTC巅峰对话:预训练范式终结与AI推理新瓶颈
2026/9/10 7:07:33 网站建设 项目流程

1. GTC 2026开场:这场对话为什么值得熬夜看

每年GTC(GPU Technology Conference)最吸引人的,除了各种核弹级硬件发布,就是那些站在AI技术最前沿的大佬之间的思想碰撞。而这一次,黄仁勋把Jeff Dean和Bill Dally两个人一起请上台,搞了一场"巅峰对话",单从阵容来看,就已经算是近年GTC含金量最高的一场了。

Jeff Dean是谁不用多说了,Google Research的掌门人,TensorFlow的创始人之一,MapReduce、BigTable这些改变一个时代的技术背后都有他的影子。在深度学习还没有像今天这么风靡的时候,他就已经在用大规模分布式系统解决机器学习问题了。而Bill Dally则是NVIDIA的首席科学家,图形学、计算机体系结构领域的老泰斗,现在整个NVIDIA的GPU架构路线图、CUDA生态的底层逻辑,都跟他有直接关系。这两个人坐在一起聊AI的未来,基本上可以说是"软件派"和"硬件派"两个视角的一次正面碰撞。

这场对话最抓人的其实是几个非常大胆的判断:第一,"预训练范式已死";第二,"延迟瓶颈不在计算"。这两个观点抛出之后,现场的开发者圈子里基本瞬间炸开了锅。很多人第一反应是:Jeff Dean是不是在唱衰大模型?其实仔细听完两个人的完整阐述会发现,他们不是在否定大模型本身,而是在说——过去五年我们习以为常的那种"堆数据、堆算力、搞一个超大Transformer、然后微调"的老套路,正在走向终结。

这篇文章我就把这场对话的核心观点拆开揉碎,结合我自己在AI工程实践里的理解,聊聊这几个判断背后的逻辑,以及未来五年AI技术栈会往哪个方向走。不管你是做大模型应用开发的、搞AI基建的,还是刚入行的算法工程师,这篇文章都值得你花十分钟认真看完。

2. "预训练范式已死":解剖这个劲爆判断

2.1 预训练范式的黄金十年

过去十年,AI领域的最大叙事就是"预训练 + 微调"。2017年Transformer架构被提出来之后,紧接着BERT、GPT系列模型一路把这条路走通了。它的核心逻辑其实特别简单:先用海量的无标注文本把模型"喂饱",让它学会语言的统计规律和世界知识,然后再用少量有标注的数据做微调,适配到具体的任务上。

这套范式之所以能横扫一切,是因为它极度高效。不需要为每个任务从零开始设计特征工程、不需要为每个领域单独标注海量数据,一个预训练好的底座模型,可以在十几个下游任务上都取得不错的效果。从NLP到CV再到多模态,基本是"一个Transformer打天下"的状态。

但是这套范式走到今天,其实已经出现了非常明显的结构性瓶颈。第一个问题就是数据。预训练模型对数据的需求是近乎贪婪的,GPT-4级别模型的训练数据动辄几万亿token,而互联网上真正高质量的文本数据是有限的。不少团队已经开始用合成数据来凑数,但合成数据的质量、多样性、偏差问题又成了新的挑战。换句话说,预训练时代的"燃料"正在枯竭。

第二个问题是算力成本。训练一个前沿级别的模型,电费账单都是千万美元起步的,这种成本注定了只有极少数巨头能玩得动。整个行业的创新活力被死死压住,学术界和中小团队基本失去了训练基础模型的能力。这不是技术上的问题,而是经济模型上的问题。

第三个问题,也是我认为最根本的问题:预训练范式做的是"知识的存储和检索",而不是"问题的解决"。一个模型在预训练阶段学到的是"世界是什么样的",但到了实际应用阶段,我们需要的是"我应该怎么行动"。这两者之间存在着一条巨大的鸿沟。这也是为什么很多大模型在聊天、写文章这些开放式任务上表现惊人,但到了复杂推理、工具调用、多步骤规划这些场景里,就开始露怯了。

2.2 Jeff Dean说的"死",到底是什么意思

Jeff Dean在对话里提到预训练范式已死,其实强调的不是"预训练模型没用了",而是"仅仅靠预训练已经不够了"。他的完整逻辑链条是这样的:下一代AI系统不会是单个巨型模型,而是一整套由多个模型、多个工具、多个子系统组成的复杂体系。预训练模型只是这个体系里的一个组件,而不是全部。

这就像盖房子。预训练模型相当于砖头和水泥,它们是基础材料,但房子本身还需要钢筋、混凝土、管线、门窗,还需要一个总设计师来做整体规划。过去我们把所有精力都花在了"怎么把砖头烧得更好"上面,但真正的竞争已经转移到了"怎么设计这整套房屋结构"上。

所以我们看到Google最近在Gemini上的很多工作,其实已经不是单纯追求模型参数的变大,而是把大量精力放在多模态对齐、长上下文理解、工具调用、Agent能力这些方向上。这些都是"预训练之外"的增量。Jeff Dean想表达的核心观点是:预训练的下一个阶段,是让模型真正学会"思考"和"行动",而不仅仅是"记忆"。

2.3 后预训练时代的技术路径

如果预训练范式真的在走向终结,那接下来的技术路径是什么?从这场对话以及过去一年各家的技术动向来看,我认为有几个非常明确的方向。

第一个方向是从"通用底座"走向"复合系统架构"。未来的AI产品不会是"一个大模型解决所有问题",而更像一个"模型超市"——系统根据用户请求的类型,自动调度合适的模型。简单问题用轻量模型快速响应,复杂推理用深度模型慢慢想。这种思路在业内已经有了雏形,比如Google的Gemini系列本身就分了Ultra、Pro、Nano几个档位,背后就是一套模型路由的逻辑。到了更复杂的场景,系统还需要叠加向量数据库、知识图谱、外部API调用、代码解释器等模块,形成一套完整的"智能体"体系。

第二个方向是推理能力的深度强化。OpenAI的o1、o3系列模型已经验证了一个判断:让模型在推理阶段"多想几步",能够显著提升复杂问题的解决率。这种做法实际上是把"模型在预训练阶段学到的知识"和"模型在推理阶段进行的计算"分开对待。预训练的目的是打下知识基础,而真正的智能体现在推理过程中的"慢思考"上。Jeff Dean和Bill Dally在对话中都强调了这一点,这意味着未来模型的差异化竞争,会越来越多地从"预训练阶段"向"推理阶段"转移。

第三个方向是持续学习与在线自适应能力。目前的主流模型训练完之后基本上就冻结了,对外部世界的理解停留在训练数据的截止日期。但未来的AI系统需要具备与真实世界持续交互、不断吸收新信息、动态调整自身行为的能力。这个方向目前还没有特别成熟的技术方案,但已经有公司在做"模型热更新"和"持续学习"的探索。谁能在这一块率先突破,谁就能在未来的AI竞争中建立巨大的优势。

3. 延迟瓶颈不在计算:推理架构的范式转移

3.1 从"练得动"到"跑得快":AI算力重心正在迁移

过去几年,整个AI算力产业的核心叙事是"怎么把模型训练出来"。英伟达的A100、H100、H200,Google的TPU v4/v5,AMD的MI300系列,几乎所有芯片厂商在宣传自己的硬件时,卖点都是"训练效率提升多少倍"。但这场对话里Bill Dally提出了一个非常重要的观点:未来AI算力的真正瓶颈,不在计算本身,而在数据传输和内存带宽。

这句话怎么理解?我们可以把一次AI推理请求想象成一个餐厅出餐的过程。计算单元(GPU的算力核心)就是后厨的厨师,内存就是后厨的冰箱和储物柜,数据传输就是厨师取食材的过程。过去我们一直觉得"菜做得慢是因为厨师不够多、手艺不够好",于是拼命给后厨加人手(增加算力核心)。但当我们把厨师加到一定数量之后,突然发现瓶颈变成了"厨师从冰箱里取食材的速度跟不上",大家都在那儿排队等食材,后厨再多人也白搭。这就是Bill Dally要表达的核心逻辑:推理延迟的瓶颈已经从计算转移到了数据搬运上。

实际上,这个趋势在AI推理场景中表现得非常明显。以当前最火的大模型推理为例,模型参数量动辄几百亿甚至上千亿,单次推理需要读取的权重数据量极其庞大。而GPU的显存带宽虽然在不断提升,但相对于算力核心的增长速度来说,仍然严重滞后。这就导致了一个非常尴尬的现实:GPU的算力利用率可能不到50%,大部分时间都浪费在等待数据上。

3.2 真正卡住延迟的"隐形瓶颈"

那具体是什么在卡住推理延迟?Bill Dally在对话中重点提到了几个方向。首先是内存带宽,大模型推理的权重读取对显存带宽的要求极高,HBM(高带宽内存)虽然已经是目前最快的方案,但依然不能满足未来模型规模的需求。其次是芯片间互连,当模型大到单卡放不下的时候,必须做模型并行,把不同层分到不同的GPU上,那么层与层之间的激活值传输就会成为严重瓶颈。这个问题在超长上下文场景下尤其突出,因为KV Cache(键值缓存)的读写会产生巨量的数据流量。

再往深一层说,真正耽误时间的,其实是"内存墙"和"互连墙"。芯片的计算能力提升遵循摩尔定律,大概每两年翻一倍;但内存带宽的提升速度远低于这个水平,大概每三年多才能翻一倍。这就导致了一个越来越大的差距——计算能力在突飞猛进,内存却跟不上脚步。打个比方,你的电脑CPU再强,但如果硬盘是几十年前的老式机械硬盘,开机照样要等半天。AI推理就是这个道理,算得再快,数据供不上也白搭。

这也是为什么我们看到一个非常有趣的现象:NVIDIA在最新的GPU架构上,把大量精力放在了提升显存容量和带宽上,同时还推出了NVLink这样的高速互连方案,把多卡之间的通信延迟压缩到极低水平。另外,各种模型压缩技术——量化、剪枝、蒸馏——在做的事情,本质上都是"减少需要搬运的数据量"。H100在推理场景下比A100强很多,很大一部分功劳要归于HBM3带宽的提升以及Transformer Engine对各种精度格式的原生支持,而不仅仅是计算核心数量的增加。

3.3 推理优化的三条实战路线

这场对话关于延迟的讨论,其实给我们这些做工程的人带来了很多非常具体的启示。如果你正在部署大模型推理服务,下面几个优化方向值得重点关注。

模型量化是目前性价比最高的优化手段。把模型从FP16降到INT8,权重体积直接减半,推理延迟基本能下降30%到50%,而精度损失在大多数场景下都可以忽略不计。更激进一些的INT4量化,虽然精度损失会稍微大一些,但对于一些对精度不太敏感的任务(比如代码生成、闲聊对话)来说,还是可以接受的。关键心得是:量化不能只看权重,还要关注激活值的分布,尤其是当模型包含一些outlier神经元的时候,纯INT8量化可能会导致精度跳水。实践中更推荐"混合精度量化"——让敏感层保持FP16,非敏感层用INT8,这样可以在精度和性能之间取得更好的平衡。

KV Cache优化也是效果很好的手段。长上下文场景的显存开销主要来自KV Cache,它的大小跟序列长度的平方成正比。当上下文从4K扩展到128K时,KV Cache的内存占用会爆炸式增长。为了解决这个问题,业界已经探索出了很多方案:PagedAttention(页面注意力)把KV Cache分页管理,让显存利用率大幅提升;MQA(多查询注意力)/GQA(分组查询注意力)通过让多个注意力头共享部分KV缓存,把KV Cache的容量需求直接砍掉一半以上;还有针对超长上下文的上下文压缩技术(比如某些稀疏注意力机制),可以把不太重要的历史token从缓存中"摘除"。

第三个路线是"投机解码"(Speculative Decoding)和多级推理架构。自回归生成的核心痛点是逐token串行生成,每个token都要走一遍完整的前向计算。投机解码的思路是:先用一个速度快但精度稍低的草稿模型一次性生成多个候选token,然后用大模型并行验证这些token是否符合分布。如果验证通过,一次前向计算就能"产出"多个token,推理吞吐量可以翻好几倍。实践中草稿模型的质量是决定收益的核心指标——草稿模型太弱,验证通过率低,反而浪费计算;草稿模型太强,又失去了速度优势。通常的做法是拿轻量化蒸馏模型或者稍小尺寸的同系模型做草稿模型,目标是把接受率做到0.7到0.8以上。

4. AI的五年未来:从"大模型竞赛"到"智能体生态"

4.1 大模型竞赛的两个分化方向

聊完了预训练范式和推理瓶颈,这场对话的重头戏其实是Jeff Dean和Bill Dally对AI未来五年的展望。两个人的观点有不少共识,其中最核心的一个判断是:大模型竞赛正在分化为两个截然不同的方向。

第一个方向是"超级模型"路线,继续往更大的规模、更强的推理能力、更广泛的知识覆盖去走。这个方向会由少数几家巨头主导,因为所需要的资金、算力、数据资源不是一般公司能承受的。但它们的目标已经不是做一个更聪明的聊天机器人,而是打造一个更底层的"AI操作系统"——上面承载着各类Agent、各种应用,向下管理着庞大的算力资源池。就像当年的Windows和iOS一样,谁掌握了这个底层平台,谁就掌握了整个生态的话语权。

第二个方向是"轻量模型"的百花齐放。当基础模型的能力通过蒸馏、量化、剪枝等方式传递到中小尺寸模型上之后,会有大量针对特定场景、特定行业、特定硬件优化的轻量模型涌现出来。这些模型不需要几百亿参数,但它们在具体的垂直任务上可以做到非常极致。举个例子,一个专门为代码补全设计的3B参数模型,配合良好的IDE插件和本地硬件优化,在开发体验上完全可以超过一个通用的70B参数大模型。

这两个方向并存的结果就是:未来的AI生态不会是一个"一家独大"的格局,而是一个"金字塔"结构。顶部是少数通用超级模型,中间是行业模型和垂直模型,底部是无数的端侧小型模型。不同的层级之间通过API、模型网关、推理路由等基础设施连接起来,形成一套完整的生态系统。

4.2 智能体是下一个十年的操作系统

Jeff Dean在对话中用了相当大的篇幅来谈AI Agent。他的观点很明确:未来的AI应用形态不会是"对话框",而是一个能够自主完成任务的智能体系统。这个判断其实已经在很多场景中得到了验证。过去一年,我们看到了大量AI Agent的应用尝试——有自动写代码的、有自动做数据分析的、有自动管理日程的。虽然这些尝试大多还处于"半自动"的阶段,但方向已经非常明确了:AI正在从一个"回答问题"的工具,变成一个"执行任务"的伙伴。

Agent与目前主流大模型应用的差异,主要体现在两个核心能力上:规划能力和工具调用能力。规划能力指的是Agent能够把一个复杂任务拆解成一系列的子任务,并按照合理的顺序逐步执行。工具调用能力指的是Agent能够理解并使用外部API、数据库、代码解释器等工具来完成那些单靠模型本身搞不定的工作。这些能力对模型本身提出了全新的要求——它不仅需要知道"答案是什么",还需要知道"下一步该做什么"。

从工程架构上看,Agent系统的复杂度远高于传统的"请求-响应"模式。一个典型的Agent需要包含任务规划模块、工具注册与调度模块、记忆管理模块、结果验证模块等多个部分,这对底层的推理基础设施也提出了更高的要求。Jeff Dean在对话中提到,未来的Agent系统对延迟的敏感度会远超现在的聊天场景——因为一个复杂的Agent任务可能需要连续调用几十次甚至上百次模型推理,每一次都要求低延迟、高可靠。这就把话题又拉回到Bill Dally强调的推理优化上,两个人在这场对话中其实形成了很好的互补。

4.3 五年内的产业机会在哪里

如果站在2026年看未来五年,我觉得有几个确定性的趋势是值得提前布局的。

针对AI应用开发者和产品经理,Agent是最值得关注的方向。2025年被很多人称作"Agent元年",但真正的Agent爆发期我认为是在接下来的两三年内。关键驱动因素有三个:模型的工具调用能力越来越稳定、Agent框架(如LangGraph、AutoGen、CrewAI等)越来越成熟、推理成本持续下降。这三个因素叠加起来,会让Agent从"玩具"变成"生产力工具"。

针对AI基础设施和平台团队,推理优化是一条非常扎实的技术路线。随着AI应用的普及,推理成本会成为比训练成本重要得多的考量因素。那些能够在推理延迟、吞吐量、成本之间找到最佳平衡点的团队,将在未来的竞争中占据巨大的优势。这不仅仅是算法问题,更是系统工程问题——需要从硬件选型、模型压缩、推理框架、调度策略等多个维度综合考虑。

针对企业决策者,一个重要的判断是:未来AI的护城河不再是模型本身,而是数据管道和业务闭环。随着开源模型的性能持续逼近闭源模型,模型本身会越来越像"水电煤"一样的通用基础设施。真正的差异化竞争力,在于你能不能建立起一套持续产生高质量数据、快速迭代模型、紧密贴合业务场景的闭环系统。这个判断其实是整场对话的核心思想的延伸——预训练范式已死,因为未来属于那些能够把AI真正嵌入到业务流程中的创新者,而不是那些仅仅能够训练出一个大模型的团队。

5. 实操视角:怎样把这场对话的观点落到真实项目里

5.1 技术选型随"预训练范式终结"需要怎么变

听了两位技术大佬讲了这么多前沿理念,很多人最关心的问题其实是:这些观点对我眼下的技术选型和工作规划有什么直接影响?我结合自己的项目经验,谈几点特别具体的心得。

第一,如果你的公司还在纠结"要不要自研大模型",我的建议是可以彻底放下这个念头了。预训练范式走向终结,意味着做一个通用大模型的路越来越窄,投入产出比越来越低。除非你是头部大厂,有几十亿美元级别的预算和专门的顶级研究团队,否则自研通用大模型基本上就是一条不归路。更务实的策略是:站在开源模型(比如Llama系列、Qwen系列、DeepSeek系列)的肩膀上,把精力集中在数据工程和场景适配上面。

第二,如果你正在做AI应用开发,现在应该把重心从"怎么把模型调得更聪明"转向"怎么把Agent系统搭得更稳"。我见过太多AI产品团队,天天在调Prompt、微调模型,试图让AI准确理解用户意图,但真正的体验瓶颈往往出在"AI理解了但对实际环境操作不起来"。一个能稳定查询数据库、调用第三方API、操作办公软件、验证自身执行结果的Agent,哪怕用的是不那么强的模型,其实际价值都远远超过一个只会聊天的超大模型。这个判断我强烈建议你重视起来,因为它将深刻影响未来五年AI应用的产品形态和技术架构。

第三,重视"工程化"能力而不是"炼丹"能力。过去几年算法工程师的招聘市场上,"有预训练经验"是个高端标签,但现在你会看到,各大公司挂在嘴边的是AI工程化、模型推理优化、系统稳定性这些词。这些能力本质上就是Bill Dally说的那套东西——把延迟降下来、把吞吐提上去、把成本控制住。对于个人开发者来说,我认为这是非常值得投入的方向,未来几年的人才缺口会非常大。

5.2 延迟优化的落地顺序:先量化,再解耦,后投机

如果你正在负责一个真实的大模型推理服务,我建议的落地路径是非常清晰的,不需要一上来就把所有手段全部上齐,而是要按性价比一路做下去。

第一步是量化压箱底。先把FP16切到INT8,做一轮质量回归测试,确认精度影响可控后,基本就能看到20%到40%的性能提升。这一步的前提是你的推理框架和硬件已经支持INT8的算子加速。实测下来,TensorRT-LLM、vLLM对INT8的支持已经很成熟了,直接改一下模型精度配置即可,不需要动业务代码。

第二步是结合上下文做KV Cache的优化。这块要从两个方向同时入手:一个是算法层面的GQA/MQA改造(如果用的是比较老的模型架构),另一个是工程层面的PagedAttention和KV Cache量化。vLLM内置的PagedAttention已经比传统框架节省了90%以上的显存浪费,这是直接把可用上下文长度翻倍的改动,收益极其可观。

第三步才是投机解码和更高级的分布式推理。投机解码适合对"单token延迟"非常敏感的场景(比如实时对话、代码补全),它的收益受模型尺寸、草稿模型质量、批处理大小的影响很大,需要做实际benchmark来验证。分布式推理(张量并行、流水线并行)主要是为了解决"单卡放不下"的问题,它本身不会降低延迟,反而可能因为通信开销增加延迟,但在吞吐量上的收益是实打实的。

这里我要特别强调一个心得:延迟优化一定要从全局视角去看,不能只盯着模型那一层。很多时候,用户在意的"响应慢",至少有三分之一的瓶颈出在网络传输、API网关、业务逻辑这些地方。我曾经遇到过一个项目,模型推理本身只要200毫秒,但整个接口响应却要2秒,一查发现是上游数据服务有1.5秒的固定延迟。把那个优化掉,比做什么投机解码都来得实在。

5.3 给AI应用团队的两个"反共识"建议

最后分享两个我在实践中总结出来的、可能和大环境观念不太一样但非常实用的建议。

第一个建议是"不要等到模型完美再上线"。现在大模型技术迭代的速度是周更的,模型的"最佳版本"永远在下一个版本。如果你的产品设计和架构是基于"模型能力足够强"这个前提来做的,那你会发现你永远在追赶模型更新的速度,始终处于被动状态。反过来,如果你的架构设计了足够多的"外部缓冲"——比如通过RAG(检索增强生成)补充知识、通过外部工具执行动作、通过规则引擎兜底安全性——那么即使模型能力不够强,你的系统依然能给用户提供可用的价值。而且当更强的模型发布时,你的系统可以无缝升级到新模型上,不需要做架构改动。这种"模型无关"的架构思路,我强烈推荐。

第二个建议是重视"评估体系"而不是"模型调优"。很多AI应用团队把大量时间花在怎么让模型输出更符合预期上面,却忽略了一个更根本的问题:你怎么知道模型输出好不好?如果没有一套自动化的评估体系,你就无法量化模型的每一次改动带来了什么效果,也无法在多个候选方案之间做出理性的选择。我见过太多团队把模型调了几十版,最后问"哪个版本更好"的时候,居然没有一个能拿出客观的数据来回答。建立一套覆盖核心场景的自动化评估集、每次改动后跑一遍评估、对比前后差异,这个投入带来的长期回报,远远高于你在Prompt上抠来抠去的那点收益。

6. 写在最后:一边看风向,一边踩油门

说实话,听这场对话的时候,我最大的感受是:AI行业正在从"摸着石头过河"的阶段进入"修桥铺路"的阶段。过去五年,所有人的注意力都集中在"模型能力还能不能更强"上面,而未来五年,更核心的命题会是"AI系统能不能更可靠、更高效、更深入地融入真实世界"。预训练范式是否真的"已死"其实并不重要,重要的是那些存量的大模型能力,会以怎样的新方式被重新组合、重新激活。

我自己在实际操作中的体会是:方向判断和工程落地之间,隔着的从来不是智力,而是执行力。GTC这种级别的技术对话,最大的价值不是给你一个可以直接照抄的解决方案,而是帮你校准未来的方向感——哪些赛道会快速增长、哪些技能会持续增值、哪些投入需要及时止损。

如果你也想在AI这条路上走得更远,我建议你从今天开始,花更多时间去思考"怎么让AI在真实场景里把事情做成",而不是继续纠结"模型还能不能更聪明"。前者是工程问题,有路径可循;后者是科学问题,需要漫长的等待。对于绝大多数团队和个人来说,前者才是真正值得倾注心力的地方。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询