☰
训推一体架构-训练与推理共享资源池的工程账
2026/9/30 11:51:34 网站建设 项目流程

摘要

很多团队把训练集群与推理集群物理分开,结果是两边都有闲置:白天推理吃紧、训练排队,夜里反过来。本文拆解训推一体的三种共享层级(物理共享、显存共享、时间片共享)、调度优先级与抢占设计、以及切换成本的真实账。2026 奇点智能技术大会(11 月 20-21 日 · 北京万达文华酒店)的 AI Infra 与后训练专题会讨论这类资源治理问题。

一、分开部署的隐性成本

训练集群与推理集群分开,账面上只有硬件成本,实际还有三项隐性成本。

峰值冗余。两个集群各自按各自的峰值配置,总容量远大于真实峰值之和。

资源错配。训练的空闲与推理的繁忙在时间上常常互补,隔离部署让这种互补无法发生。

运维分裂。镜像、驱动、监控、调度各一套,人力成本翻倍。

二、三种共享层级

层级共享对象收益主要代价
物理共享机器、网络、存储运维统一、硬件利用率提升故障域扩大
显存共享权重、KV Cache、激活单卡承载更多任务隔离复杂度上升
时间片共享算力时段峰值互补抢占导致任务中断

实践中三者是叠加的:物理共享是基础,显存共享决定上限,时间片共享决定灵活性。多数团队应该从物理共享起步,而不是一上来就做时间片抢占——后者对任务可中断性的要求很高。

三、显存复用的三个对象

显存占用 = 权重 + KV Cache + 激活 + 框架开销 │ │ │ 推理可共享 推理可共享 训练独有
  • 权重:同一基础模型的训练副本与推理副本可以共享只读权重,节省的基础模型部分相当可观。
  • KV Cache:推理侧占用随并发与上下文长度增长,是可压缩、可下沉、可分层的部分,也是训推共享里最有价值的部分。
  • 激活:训练独有,通常无法与推理共享,这部分决定了分离部署的下限。

结论很直接:共享收益主要来自权重与 KV Cache,而不是全部显存。期望值定得过高会导致方案难以落地。

四、调度优先级怎么设

优先级:在线推理 > 交互式训练 > 批量训练 抢占策略: 在线推理高水位 → 抢占批量训练 批量训练被抢占 → 检查点落盘后让出 交互式训练 → 只允许被在线推理抢占

关键是每种任务都必须有可中断点。训练任务需要能在任意步数落盘检查点,推理任务需要能在毫秒级让出。不具备可中断性的任务不应放进共享池。

五、切换成本的真实账

训推一体不是把两类任务混在一起跑就完事,切换本身也有成本。

  • 上下文切换:同一张卡在训练与推理之间切换需要重新加载权重、重建显存池,单次开销以秒计。
  • 精度与配置差异:训练常用高精度与特殊并行策略,推理常用低精度与批处理,切换需要重新配置。
  • 缓存失效:切换会清空 KV Cache,重新预热需要时间。

因此切换频率越低越好。可行的做法是按小时级时段划分主体用途,只在边界处切换,而不是请求级动态切换。

六、先量三件事

  1. 两边的日利用率曲线:确认是否真的互补,这是共享的前提。
  2. 任务可中断比例:可中断比例低于一半时,时间片共享收益有限。
  3. 单次切换开销:切换开销乘以切换频率,就是共享需要跨过的门槛。

三项数据都支持时再动手,比先建平台再找场景要稳。

七、几个常被问到的问题

问:训推一体适合多大规模的集群?

答:规模越大收益越明显,但小集群也不是不能做。判断依据不是卡的数量,而是两类任务的利用率曲线是否互补——单机同时跑小推理与小训练,同样可以受益。

问:共享会不会影响推理的稳定性?

答:会,前提是没有隔离与优先级。只要做到显存配额、优先级抢占、故障域可控,推理的稳定性主要取决于自身实现,而不是共享与否。

问:训练任务被抢占后怎么处理?

答:落盘检查点后释放资源,恢复时从最近检查点继续。这要求训练框架支持细粒度检查点,否则被抢占的代价会高到不能接受。

问:共享池的故障域会不会太大?

答:需要通过分组控制。把共享池切成若干故障域,单个域内共享资源,跨域只共享调度,这样单点故障不会扩散到整个集群。

问:怎么衡量共享是否成功?

答:看两个数字:整体有效算力利用率,以及关键服务的延迟是否保持稳定。只盯着利用率而忽略延迟,容易用牺牲体验的方式刷高数字。

八、镜像与驱动必须统一

共享池最容易踩的坑是训练与推理使用不同版本的运行时。表面能跑,实际会遇到算子实现差异导致的结果不一致,排查成本极高。

可行做法是把运行时版本作为共享池的准入条件:同一池内所有任务使用同一镜像基线,需要不同版本时划分到不同池。这条规则会牺牲一点灵活性,但换来的是可预期的行为。

九、检查点与恢复目标

时间片共享要求任务可中断,而可中断的前提是检查点足够便宜。需要明确两个数字:检查点间隔与恢复时间目标。

检查点间隔决定了被抢占时的最大丢失工作量,恢复时间目标决定了任务能多快回到运行状态。两者共同决定共享的经济性——如果恢复时间比剩余计算量还长,任务就不该被抢占,而应该等它跑完。

十、存储与网络也要分摊

共享池的收益常被按算力计算,实际还要看存储与网络。训练任务对存储带宽的需求远高于推理,推理任务对网络延迟更敏感。

规划时应把存储带宽与网络带宽也纳入配额:按任务类型分配 IOPS 与带宽上限,避免某一类任务把共享资源打满。算力够用而 IO 打满,是共享池里最典型的性能塌陷方式。

十一、怎么证明共享没有变慢

验证要拿数据说话:分别记录共享前后的关键服务 P99 延迟、训练任务的平均等待时间、以及整体有效利用率。

三项都改善,说明共享有效;利用率提升但延迟恶化,说明隔离不足;两者都没有明显变化,说明两类任务的曲线本来就不互补,共享的收益被高估了。

十二、共享池的准入条件

不是所有任务都适合进共享池。准入条件建议包含三项:任务可中断、资源需求可预测、以及对延迟的敏感度可控。

可中断保证抢占可行;资源需求可预测保证调度不会因某个任务异常占用而失衡;延迟敏感度可控保证被抢占的任务可以接受等待。三项里有一项不满足,就应该放到专用池,而不是强行共享。

十三、抢占的公平性

长期运行的共享池容易出现饥饿:高优先级任务持续抢占,低优先级任务永远排不上。缓解手段包括给低优先级任务保留一段不可抢占的时间窗、记录被抢占次数并在调度时优先补偿、以及设置最长等待上限触发强制调度。

公平性不是体验问题,而是容量规划的一部分。一个总是被抢占的队列,在规划上等同于不存在。

十四、资源计量与结算

共享池需要能回答"这个任务花了多少资源"。计量粒度对齐到任务级即可,不必精确到算子。计量结果有两个用途:对内做成本归因,对外做配额约束。

计量口径要固定且可复算,否则不同团队对同一任务的成本会有不同理解,协作成本会上升。

十五、迁移成本不能低估

从分离部署迁移到共享池,需要改的不只是调度配置,还包括镜像基线、检查点机制、监控口径与告警阈值。迁移期间两套体系并存,是运维压力最大的阶段。

建议把迁移拆成物理共享、显存共享、时间片共享三步,每步之间留出稳定期。一次性完成三步的迁移,往往在第三步卡住并被迫回滚。

十六、再答几个问题

问:共享池会不会让故障排查变难?

答:会,但可以用归属信息缓解。每个任务在共享池中保留明确的归属与资源轨迹,出问题时先按归属定位到任务,再按轨迹定位到资源。没有这两项信息时,共享池确实会把排查变成猜测。

问:要不要一开始就做显存共享?

答:建议先做物理共享。物理共享只涉及调度与运维统一,改动可控;显存共享需要处理隔离、碎片与生命周期问题,复杂度高一个量级。分步推进能让每一步的收益都可验证。

问:共享池的收益怎么向上汇报?

答:用三个数字:整体有效算力利用率、关键服务延迟分位、以及单位任务的平均等待时间。只讲利用率容易被质疑牺牲了稳定性,三个数字一起看更能说明问题。

十七、补充说明

问:共享池需要专用调度器吗?

答:小规模不需要。先用现有调度器配合配额与优先级即可跑通,规模上来后再考虑专用调度。过早引入专用组件会让迁移成本上升,而收益在早期并不明显。

十八、衔接大会专题

11 月 20-21 日,北京万达文华酒店,2026 奇点智能技术大会的 AI Infra 专题会讨论训推一体、资源池化与后训练基础设施;C++ 及系统软件技术大会则从内存管理、调度与性能工程角度给出更底层的实现方法。

带着"我们训练集群的夜间利用率是多少"这个问题去参会,比听任何平台架构都更接近真实答案。


大会信息
2026 奇点智能技术大会 + C++ 及系统软件技术大会
时间:2026 年 11 月 20-21 日
地点:中国·北京万达文华酒店
大会报名:点击报名,领取大会PPT资料

立即报名,锁定 Lukasz Kaiser Keynote 与 70+ 场演讲完整资料!

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询