9月11日,国产云端AI芯片企业燧原科技(688801)正式登陆上交所科创板,成为"国产GPU四小龙"中最后一家上市的公司。据报道,本次发行价142.18元/股,发行约4303.52万股,上市当日以410元开盘、397元收盘,收盘市值约1708.5亿元。在此之前,摩尔线程于2025年12月5日登陆科创板,沐曦股份于2025年12月17日上市,壁仞科技则在2026年1月2日于港股上市。至此,四家国产GPU公司齐聚资本市场。
对做开发和运维的人来说,比股价更值得关注的是:这四家里,燧原走了一条和别人不一样的技术路线。
DSA还是GPGPU,这是两条不同的路
四小龙中,只有燧原的芯片采用DSA架构(Domain-Specific Architecture,领域专用架构)。据公开信息,这种架构裁掉了通用GPU的图形渲染特性,专精通用计算和张量/矩阵计算。走类似路线的还有谷歌TPU、寒武纪、华为海思和阿里平头哥;另外三家四小龙成员则采用通用GPGPU路线,主要兼容或适配英伟达CUDA生态。
两条路线的取舍很清晰:
- DSA的优势在性价比。产量足够大时,能效比更高、单位算力成本更低。这也是为什么它常出现在有超大单一客户的场景里——腾讯就是燧原的第一大客户,据报道2025年有八成收入来自腾讯,微信语音转文字背后的推理卡就来自燧原。
- DSA的代价在生态。它没有CUDA那样的完整生态,需要自研编译器和定制算子库,客户把现有模型迁过来,通常要在框架、编译器、算子、集群软件几个层面做适配。
公开数据显示,燧原2023至2025年营收分别为3.01亿元、7.22亿元和9.90亿元,2026年上半年营收达11.20亿元,已超过2025年全年。同时公司目前尚未盈利,2023至2025年研发费用分别为12.29亿元、13.12亿元和11.35亿元,占营收比例从408%一路降到114.63%——典型的芯片行业"先重投入、后谈回报"节奏。出货量上,据IDC数据,2025年中国AI加速卡整体出货约400万张,英伟达以约220万张占约55%份额,燧原当年出货6.6万张,市占约1.7%。
- DSA的代价在生态。它没有CUDA那样的完整生态,需要自研编译器和定制算子库,客户把现有模型迁过来,通常要在框架、编译器、算子、集群软件几个层面做适配。
长于推理、短于训练,这不是巧合
一个容易被忽略的细节:2023至2025年,燧原AI加速卡及模组收入80%以上是推理产品。DSA架构在计算精度要求高、过程更复杂的AI训练任务上,表现不如通用GPU,所以这类公司往往先在推理侧站稳。
理解这一点,对做技术选型很关键。
对开发者和从业者的实际影响
如果你在做模型部署、推理服务或者算力选型,下面几条是能直接用的:
1. 迁移成本要提前算,不要等上线才发现。
从CUDA迁到国产DSA平台,工作量取决于模型类型、业务场景和现有工具链。先确认三件事:目标平台对PyTorch的适配程度、你用的算子(尤其是自定义算子)有没有覆盖、推理框架有没有对应的后端支持。算子没覆盖,往往就是最大的坑。
2. 别只看纸面算力。
TFLOPS是理论峰值,实际吞吐还受显存带宽、互联带宽和软件栈成熟度影响。评估时一定要用真实模型跑端到端延迟和吞吐。下面这段基准测试代码可以直接拿来用:
importtimeimporttorchdefbench_latency(model,x,warmup=5,iters=20):model.eval()dev=x.devicewithtorch.no_grad():for_inrange(warmup):# 预热,避免首次编译/加载影响结果model(x)ifdev.type=="cuda":torch.cuda.synchronize()t0=time.perf_counter()for_inrange(iters):model(x)ifdev.type=="cuda":torch.cuda.synchronize()# 等待异步算子真正执行完return(time.perf_counter()-t0)/iters ``` 注意:不同厂商加速卡的适配层命名和同步接口不一样,具体以官方文档为准,别把上面的 `cuda` 同步接口直接套到别的设备上。**3.推理优先看性价比,训练优先看生态和精度。**如果业务以推理为主、对成本敏感、模型相对固定,专用架构的性价比优势明显;如果训练任务多、模型结构变化频繁,通用GPU的生态成熟度仍然更省心。**4.关注"算力绑定"这条趋势线。**据报道,2026年9月DeepSeek计划采购16万颗华为昇腾950DT芯片并共建数据中心;京东云计划采购摩尔线程GPU构建十万卡国产算力集群;也有报道称字节跳动此前向寒武纪预购超20万片芯片。大模型厂商在用长期采购锁定供应链,这意味着国产算力的软件栈会随着真实业务场景快速迭代——对开发者来说,这是好事。## 写在最后四小龙上市只是一个节点。对一线开发者来说,国产算力真正能用起来的那天,不是市值高低决定的,而是算子覆盖率、迁移成本和工具链文档质量决定的。硬件参数可以追,生态是靠一个个项目磨出来的。 你所在的项目有没有评估过国产算力?迁移过程中踩过哪些坑?评论区聊聊。