最近一条消息让搞大模型部署的圈子都躁动起来:DeepSeek 计划在内蒙古的数据中心,用华为昇腾 950DT 来跑模型。猛一看这只是一纸采购意向,但往深了想,它牵扯到算力从哪里来、模型怎么迁移、芯片生态怎么兼容、机房又该建在哪,一整套问题全都在里面了。这篇文章我想结合自己这些年做模型服务和底层推理优化的经验,把这条新闻背后的技术逻辑拆开揉碎讲清楚,也顺带聊聊普通开发者和企业接下来可以怎么跟进。
1. 从 API 排队到自建数据中心:DeepSeek 这一步的原因
1.1 模型服务做大了以后,租算力和自建算力的账
先理清一个背景。DeepSeek 的模型是开源的,但官方也提供 API 服务。过去大半年里,只要用过它 API 的人基本都有体感:高峰时段经常排队,响应速度不稳定。这不是 DeepSeek 一家的问题,是所有做模型服务的人都要面对的——当用户量和调用量上来了,算力供给就很容易跟不上增长曲线。
大多数新模型公司都会选择先租用云上的 GPU 实例,好处是灵活,坏处是单价高。以一台 8 卡的训练服务器为例,云上租赁按小时计费,满负荷跑一天的费用相当可观;如果按年长周期算,累积起来的租金已经足够在电价便宜的地区自建一个小规模机房。更麻烦的是,租赁环境下的机型、网络、存储都不是自己的,你想针对业务做长期稳定性优化,就得反复适配不同供应商的硬件环境,很多底层问题根本没法定制化解决。
所以 DeepSeek 若真要自建数据中心,一点都不让人意外。它是典型的"开源生态+API 商业服务"双轮驱动模式,模型权重全球开发者在用,API 又是数以万计的业务在调。这里的算力需求是持续且可预测的,恰好就是自建机房最理想的使用场景。
1.2 "计划"两个字说明了很多事情
标题里有一个词很关键:"计划"。也就是说,这不是"已经上线",而是"正在推进"。从行业经验来看,一座像样的数据中心从选址、基建、机电安装到网络打通,至少需要一年到一年半;昇腾 950DT 这种新芯片从工程样片到规模交付,同样有相当长的爬坡期。两件事叠加,可以判断真正的规模化落地大概率不会太快到来。
现阶段 DeepSeek 在线服务的主力算力,应该还是以通用 GPU 的云上资源或者自有机房为主。昇腾 950DT 的集群更可能按照"新集群验证→局部负载切换→全面推广"的节奏去推进。芯片要跑通模型不难,难的是在高并发场景下做到稳定、低时延、低成本,这需要花大量时间做压测和调优。
这其实也给大家一个冷静的预期:别指望明天 DeepSeek 的所有推理流量就跑在国产芯片上,这不现实,也不符合工程规律。
1.3 开源模型加自建算力,闭环价值很大
如果真的能在昇腾集群上稳定跑 DeepSeek 模型,带来的价值是双重的。对 DeepSeek 自己来说,算力成本会被显著摊薄,API 定价有了更多下调空间,服务排队问题也能缓解。对整个算力生态来说,顶级开源模型的成功迁移,等于给所有还处在观望期的团队打了一个样:国产芯片跑大模型,真的能干活、能省钱。
所以这条消息之所以被广泛讨论,与其说是关注 DeepSeek 一家公司,不如说是大家在关注"国产大模型+国产加速卡"这个组合到底能不能成立。
2. 昇腾950DT:芯片型号里的信息量
2.1 从昇腾产品线看 950DT 的定位
昇腾的产品线一直比较清晰。昇腾 310 主打边缘和低功耗推理,昇腾 910 系列是数据中心里的主力加速卡,910B、910C 是后来针对大模型场景不断迭代的版本。昇腾 950 系列在 2024 年下半年开始陆续有工程样片的信息流出,定位上属于新一代旗舰,工艺更先进,总算力更强。
型号里的字母其实也有信息量。"D"通常对应 Data Center 数据中心场景,"T"一般不会是单纯为了好看,更可能指向 Training(训练)或 Turbo(增强版本)。如果这个推测成立,昇腾 950DT 就是一款面向训练和重度推理场景的增强型数据中心加速卡。
当然,在官方没有公布完整规格之前,所有参数都要先打个问号。但按照昇腾 910C 的水平外推,950DT 在算力、显存容量和互联带宽上都会更进一步,这也是它能被选中去跑 DeepSeek 这种千亿参数级别模型的前提。
2.2 它和主流 GPU 放在一起是什么水平
结合公开信息和推测值做一张对比表,大家心里有个数。
| 项目 | 昇腾950DT(推测) | 昇腾910C | NVIDIA H20 | NVIDIA A100 |
|---|---|---|---|---|
| 定位 | 新一代旗舰训练/推理 | 上一代主力 | 面向大模型推理 | 上一代数据中心通用卡 |
| 显存容量 | 更高,瞄准千亿参数级 | 64GB级别 | 96GB | 80GB |
| 互联方案 | HCCS 增强互联 | HCCS | NVLink | NVLink |
| 场景侧重 | 训练+推理兼顾 | 通用大模型 | 推理场景偏多 | 训练推理均衡 |
对跑 DeepSeek 这类大模型来说,显存容量和互联带宽通常比单纯算力峰值更重要。模型参数巨大,显存放不下就得频繁做内存换入换出,速度会断崖式下跌;而模型推理时多个芯片之间又要频繁交换中间结果,互联带宽不够就会拖慢整体吞吐。昇腾系列有自己的 HCCS 高速互联方案,950DT 据说在这一块做了重点增强,这也是 DeepSeek 敢考虑大规模部署的关键原因。
2.3 为什么是昇腾,而不是继续买通用 GPU
讨论这个问题时,很多人习惯拿纸面算力做对比。但真正做过算力采购的人都知道,选型的核心因素从来不只有峰值性能。通用 GPU 的生态确实成熟,但供货周期、价格浮动、技术支持的响应速度,都是实打实的风险。
昇腾的优势在于三点:一是供货稳定,大客户能拿到明确的交付计划,排期可预期;二是软硬件绑定支持,出了问题能直接调动原厂团队解决,不用在多层代理商之间反复踢皮球;三是国内大型数据中心里已经有大量部署案例,从整机服务器到集群调度方案都是现成的。对于 DeepSeek 这种既要规模又要稳定性的服务商,这三点权重非常高。
3. 内蒙古数据中心:在"凉快"和"便宜电"旁边建算力
3.1 气候就是天然的散热系统
如果从机房维度讨论,内蒙古的优势非常直白:冷。AI 加速卡是发热大户,高功耗芯片满载时温度能逼近 100 摄氏度,机柜里塞满加速卡跑训练,空调系统稍微拉胯一点,整个集群就得降频保护。凉快的地方,散热成本会低很多。
数据中心行业有个关键指标叫 PUE,也就是总用电量与 IT 设备用电量的比值,越接近 1 说明电越少浪费在散热等辅助设备上。北方寒冷地区利用自然冷源可以大幅减少机械制冷的能耗,内蒙古的大型数据中心常年 PUE 可以做到 1.2 左右,比南方很多机房的数字要好看得多。对高密度 AI 机房来说,这点差距放大到全年,就是一笔非常可观的电费差异。
3.2 电力成本和加速卡一样重要
加速卡性能再强,也是靠电喂出来的。数据中心运营成本里,电力占比往往仅次于硬件折旧。内蒙古风能和太阳能资源丰富,绿电比例高,大工业电价也相对友好。同样跑一个千卡集群,每年电费差距可能非常明显。
更隐性的一层价值是绿电的长期意义。算力服务商对能耗指标的关注度逐年提升,直接用可再生能源既能让成本曲线更好看,也能为后续的绿色算力品牌做铺垫。这也是很多算力服务商把新机房放在北方省份的核心原因。
3.3 不同模型负载适合不同的机房节奏
内蒙古的数据中心并不是万能的。它离东部的核心用户群有一定物理距离,网络延迟天然会高一些,不适合做对响应时间极其敏感的在线实时推理,但非常适合两类任务。
第一类是模型预训练和持续训练。训练任务的特点是长时间运行、数据本地化、对延迟不敏感,放在电价便宜的地方再合适不过。第二类是批量离线推理,比如大规模评测、数据合成、批量内容生成,这类任务不需要毫秒级响应,更看重吞吐量和成本,放到内蒙古能有效摊薄单次调用成本。
综合来看,DeepSeek 如果真在内蒙古部署昇腾集群,最合理的分工是:训练和离线性负载占大头,面向实时场景的在线推理继续留在离用户更近的机房。这种"重负载放在能源区、低延迟服务放在城市侧"的布局,本身也是超大规模算力基础设施的标准解法。
4. 模型迁移到昇腾的硬骨头:不是把权重拷过去就完事
4.1 最大的门槛是 CUDA 惯性
很多从没做过加速卡适配的人会以为,开源模型的权重下载下来,放到昇腾服务器上就能直接跑。实际远没有这么简单。过去十年,深度学习生态几乎全部构建在 CUDA 之上,PyTorch 默认走 CUDA 后端,大量自定义算子、加速库也都是为 CUDA 写的。
昇腾有自己的软件栈,核心叫 CANN,相当于昇腾体系的底层计算库。生态差距不是一天两天能追平的,所以要把 DeepSeek 的模型跑到昇腾上,不能指望原生兼容,得走显式适配。好的一面是,昇腾在 MindIE、vLLM-Ascend 等推理引擎上已经做了大量工作,主流开源模型基本都有可以直接落地的推理方案,并不是从零开始。
4.2 算子适配、精度调度、专家并行的三重挑战
具体来说,迁移工作通常分三步走。
第一步是算子映射。模型里五花八门的算子不能全部直接用,需要把不兼容的算子替换成昇腾实现版本。这一步直接影响性能,替换得好,整体吞吐可以做到与 CUDA 版本同一量级;替换得不好,个别模块会慢好几倍,整个链路都会受影响。
第二步是精度和量化。大模型推理通常会用到 FP8、INT8 这类低精度格式来换取速度,昇腾 950DT 对低精度格式的支持程度,决定了加速效果的上限。量化参数选错了粒度,模型输出质量会明显退化,所以每一步都要盯着评测指标做回归验证。
第三步是分布式调度,也是最具挑战性的一环。DeepSeek 模型是专家混合架构,推理时并不是所有参数都被激活,只有部分专家模块参与计算。这需要在多张加速卡之间动态调度专家分布,尽量减少跨卡通信。昇腾芯片间的 HCCS 互联带宽,以及调度框架对 MoE 场景的优化深度,直接决定了模型的实际运行效率。这块没有几个月的压测打磨很难做到理想状态。
4.3 社区生态正在加速补位
从最近的热搜也能看出社区对 DeepSeek 的部署需求非常旺盛:"DeepSeek 本地部署""低显存运行模型""DeepSeek API 如何调用"这些话题热度一直居高不下。围绕 DeepSeek 的第三方部署工具也在快速涌现,像 deepseek harness、deepseek hermes 这类社区项目,本质上都是为了让开发者更容易地管理、调用和应用这个模型。
这种社区热度会反过来推动加速卡厂商加快适配节奏。芯片只是硬件,能不能被主流模型生态接受,要看有多少人在上面跑过、踩过坑、把经验沉淀成工具和文档。昇腾要承接 DeepSeek 这种级别的开源模型,本身就是一次高难度的生态检验。
5. 对于开发者和企业来说,接下来到底该怎么办
5.1 先用好最现成的 API 通道
别看 DeepSeek 在规划新算力,现阶段普通用户最稳妥的方式依然是调用官方 API。DeepSeek 接口兼容 OpenAI 格式,好处非常实际:大量现成工具,包括 Claude Code、Codex、VS Code 的各种 AI 插件,只要把 Base URL 和 API Key 换掉,就能接上 DeepSeek 的模型。
这里给一个最小的调用示例,流程一目了然。
from openai import OpenAI client = OpenAI( api_key="你的API Key", base_url="https://api.deepseek.com" ) resp = client.chat.completions.create( model="deepseek-chat", messages=[ {"role": "user", "content": "用一句话解释什么是数据中心 PUE"} ], stream=False ) print(resp.choices[0].message.content)代码本身没有魔法,关键逻辑在于走 OpenAI 协议:你原来写的代码完全不用动,只需要换掉 model 参数和 base_url。所以哪怕以后 DeepSeek 把部分服务迁移到昇腾集群上,对上层用户来说也应当是透明的。你在自己系统里接入的代码,大概率一行都不用改。
5.2 没有顶配显卡,也想本地跑模型怎么办
不是每个人都买得起顶配加速卡,也不是每次测试都想走外部 API。社区里最流行的路线是量化加 CPU/GPU 混合推理。比如用 llama.cpp 生态把模型量化成 GGUF 格式,一块 24GB 显存的消费级显卡也能跑起不小规模的模型,虽然速度比不上数据中心产品,但做开发测试完全够用。
如果只是想在命令行快速体验,Ollama 是最省事的选择,装好后几条命令就能把模型拉下来跑:
ollama pull deepseek-r1 ollama run deepseek-r1本地部署的核心价值在于隐私和自由度。数据不出内网,模型权重自己掌控,还能按业务场景做微调。对那些数据敏感、网络隔离要求高的团队来说,本地部署路线值得花时间研究,而且入门门槛并没有很多人想的那么高。
5.3 企业做选型决策前,建议先对照这几个问题
最后给需要拿主意的团队一份简单的决策清单,避免两个极端:一是觉得国产加速卡不行,直接不看;二是脑子一热全面切换,最后交付不了。
- 你的负载是训练型还是推理型?训练型对互联和生态要求高,推理型更看重成本和吞吐。
- 你的模型从哪来?如果深度绑定了 CUDA 专属代码,迁移成本会很高;如果基于主流开源模型二次开发,迁移顺畅度会好很多。
- 你对延迟的容忍度是多少?实时对话场景对延迟非常敏感,适合留在中心节点;离线批量任务放到大型数据中心完全没有问题。
- 预算怎么分配?自建机房前期投入大,但长期成本低;如果业务还在验证阶段,先用 API 或云上租用更稳妥。
想清楚这几条之后,昇腾也好、通用 GPU 也好、云 API 也好,在不同阶段会有不同的最优答案。
| 场景 | 优先方案 | 原因 |
|---|---|---|
| 快速验证、原型开发 | 官方 API | 零门槛,按量付费 |
| 数据敏感、内网隔离 | 本地量化部署 | 数据不出域,可控性高 |
| 大规模离线训练 | 能源区自建集群 | 电力成本占比最重 |
| 实时低延迟推理 | 靠近用户的中心机房 | 网络延迟决定体验 |
6. 一些更实际的想法
我自己最近也在折腾本地部署 DeepSeek 模型,用消费级显卡跑量化版本做代码补全和文本整理,体验比预想的要扎实。再回头看 DeepSeek 计划在内蒙古用昇腾 950DT 跑模型这件事,我的感受是:它真正的意义不在于"哪家芯片更强",而在于让市场看到,一线模型服务商正在认真把算力多元化当成可执行的项目去推进。
这两年我在不同加速卡适配项目里踩过不少坑,也见过实打实的性能提升。芯片的成长曲线从来不是一条平滑的线,它需要真实的业务负载去磨,需要开源社区的代码去填,也需要一家又一家团队敢于把重要业务放上去做灰度验证。DeepSeek 如果真的能把这套组合走通,受益的不只是它自己,还有所有想摆脱单一算力依赖的团队。
对于普通开发者,建议也很简单:先把 API 通道用熟练,再尝试本地小模型部署,最后再慢慢关注国产算力集群的新进展。基础能力握在自己手里,以后不管算力生态怎么变,你都能用最低的成本跟上变化。