☰
大模型推理成本暴跌99.7%:技术瘦身与云计算模式重塑
2026/9/24 21:01:09 网站建设 项目流程

1. 99.7%是怎么掉下来的:先算一笔看得懂的价格账

这个数字刚出现时,很多人第一反应是“标题党”。但如果你真的从2023年下半年一路盯着各路大模型API价格单看过来,会发现这不是夸张,而是把时间轴拉长之后的一笔真实账。

我在2023年底接了一个知识库问答类的项目,当时跑的是GPT级别的主流模型,算了一笔成本:每次问答平均消耗的输入加输出token大约在3000左右,折合人民币大约是几毛钱。单看一次并不贵,但业务量起来之后,一天几万次调用,一个月的推理账单轻松爬到六位数。当时安抚客户的话术是“模型能力会越来越便宜”,其实自己心里也没底,不知道这个“越来越”到底能走到什么程度。

到了2025年再回头看,同一个业务、几乎同样的模型能力水平,token单价已经跌到了当时的几十分之一。如果把2023年中的价格作为一个基准点,再算上各家厂商后来推出的夜间折扣、缓存命中优惠、包年资源包,综合降幅超过99%是成立的说法。也就是说,一年之前花100万推理费能支撑的业务量,今天只需要不到1万块——这就是“99.7%”背后最直白的含义。

1.1 一组公开价格的震撼对比

我们不用任何内部数据,就翻公开的API定价来做一个直观对比。

时间点典型模型级别输入价格(美元/百万token)输出价格(美元/百万token)综合成本感受
2023年中当时最强的商用闭源模型10 - 3030 - 60一个CV项目跑一个月推理,烧掉一台车
2024年中同级别开源模型API1 - 35 - 10同一个项目,成本下降一个数量级
2025年顶级的开源/推理模型API0.1 - 0.60.5 - 2.2个人开发者也能负担得起中等规模业务

注意,这里用的都是“百万token”作为计价单位。如果你对token没有直观概念,可以把它粗略理解成英文单词的数量,中文大约是1个汉字对应1到2个token。百万token大约对应一本300到500页的中文长篇小说。

从上面的表可以清楚看到:同样的计价单位,价格从“几十美元”滑落到“零点几美元”,这不是百分之几十的优化,而是数量级级别的压缩。配合各家API服务商在低谷期推出的特惠,实际感受会更强烈。

1.2 拆解99.7%的计算口径

为什么敢说99.7%而不是98%或者99%?关键在于你怎么计算综合降幅。

如果只看纯API标价,以“输入+输出各1:3权重”的典型会话场景来算,2023年年中的综合单价大约在每百万token 40美元左右,2025年同场景的综合单价大约在每百万token 0.1到0.2美元之间。以0.12美元来算,降幅就是 (40 - 0.12) / 40 ≈ 99.7%。

这个算法有一个前提:对比的是历史上那个“绝对高价位”的时期。而且这里的对比对象都是模型能力处于当时第一梯队的方案,不是拿今天的轻量小模型去碰当年的顶级大模型。

对话轮次多的业务里,缓存机制还会进一步改变计价结构。很多推理服务现在对命中缓存的输入token只收相当于正常输入价十分之一甚至更低的价格。多轮产品里,系统提示词和历史消息反复被命中缓存,长期跑下来,实际账单可能比单纯按标价估算还要低。

1.3 价格下跌和“模型变强”同时发生,才是真正的冲击

比价格暴跌更可怕的是,这轮降价不是以牺牲能力为代价的。

2023年底的顶级模型在数学推理、代码生成、长文本理解上,放到2025年已经被不少开源模型按在地上摩擦。也就是说,你花更少的钱,买到的是更强的能力,单位智能成本下降的幅度甚至比推理成本更多。

这一点对做技术选型的人尤其重要。以前“贵有贵的道理”可以用来安慰自己,现在这条逻辑越来越站不住脚了。当成本和能力曲线同时朝有利的方向移动,唯一理性的选择就是全量拥抱大模型基础设施化——这也正是云计算下一个十年故事的地基。

2. 推理账单背后的技术瘦身战:不是云厂商大发慈悲,是每一层都被狠狠优化过

价格能跌成这样,绝对不是某个厂商拍脑袋决定少赚点,背后是整个技术栈在过去两年里经历了一场近乎残酷的瘦身战。

我2022年底刚开始接触大模型服务时,GPU还处于一卡难求的状态。当时跑一次推理,GPU利用率低得令人发指:一个请求进来,显存加载完整个模型,显卡算力大部分时间在处理请求的间隙里空转。那时候的思路是“模型太大、显存不够”,所有优化都围绕怎么把模型塞进卡里。

当时大家没有意识到的是,真正卡住成本脖子的不是模型大小,而是推理过程的计算效率和资源利用率。接下来这几层优化,每一层都在“单位token成本”上动刀子。

2.1 从“全参数计算”到混合专家:让模型的大部分神经元学会休息

传统Transformer架构里,模型参数越多,每次推理激活的参数也越多,计算量近似跟总参数成正比。GPT-3时代的口号是“大力出奇迹”,但推理成本也无脑跟着涨。做API服务尤其痛苦:模型参数量翻一倍,算力成本也接近翻倍,而性能提升却远达不到翻倍的效果。

混合专家架构改变了游戏规则。简单理解,就是不再让模型里所有参数都参与每次计算,而是由一个“路由”网络动态判断:这一个token,应该交给哪几个专家子网络来处理。同样是万亿参数级别的总规模,每次推理只激活其中的百亿级别的参数,算力消耗直接降一个数量级。

这个优点的威力在推理定价上体现得淋漓尽致。2024年之后出现的高性能模型,普遍采用了这种“总参数量大、激活参数少”的路线。单位推理成本一下子从“跟总参数挂钩”变成“跟激活参数挂钩”,价格自然有了暴降的基础。

2.2 KV Cache与连续批处理:把每一毫秒的算力都榨干

模型层面瘦下来之后,服务端还有一场更细的仗要打:怎么让有限的GPU跑更多的并发请求。

Transformer推理时有一个特点:计算当前token时,需要反复读取之前所有token的中间状态,也就是我们常说的KV Cache。如果每来一个请求都重新计算前面的历史状态,浪费巨大;如果每个请求独占一台GPU,那更是巨大的浪费。

KV Cache的核心思路是把已经计算好的历史状态存下来,新token的计算只需要读取缓存并追加计算。这个机制大幅减少了重复计算,但带来一个新问题:不同请求的KV Cache长度不一样,像一堆长短不一的积木,很难整齐地塞进同一块显存。

PagedAttention这类技术解决了“显存碎片化”的问题,它把KV Cache划分成固定大小的块,像操作系统的内存分页一样灵活管理,显存利用率大幅提升。同时配合连续批处理,不再等一个请求完全结束才开始下一个,而是把多个请求交错填充到同一个计算批次里,让GPU在每一毫秒都有活干。

就这么一层一层地抠,单张GPU能够同时服务的请求数相比两年前提升了十倍甚至更多。算力单价不变的情况下,单位token成本就是按照这个倍数下降的。这是“99.7%”里非常核心的一笔账。

2.3 量化与推理引擎:精度上做减法,成本上做减法

模型训练的精度是FP32甚至FP16,但推理环节并不需要这么高精度。把权重从FP16压到INT8,模型体积减半,显存占用减半,推理速度大幅提升,而绝大部分场景的精度损失可以控制在可接受的范围内。压到INT4之后,模型甚至能跑到消费级显卡上。

过去两年,开源社区在量化工具上做了大量工作。今天你用消费级显卡本地跑一个7B、14B的模型做日常问答,体验已经接近商业API服务,这在两年前是没法想象的。

推理引擎的调度优化同样功不可没。以vLLM、SGLang为代表的新一代推理引擎在吞吐量上相比传统方案有数倍的提升。这里特别提一下SGLang Serve,很多团队的部署架构已经切换到了这类引擎上,配合RadixAttention等缓存机制,在长对话和多轮交互类场景里,吞吐量的提升是肉眼可见的。

sglang serve启动推理服务时,可以针对不同模型自动选择最优的并行策略和注意力实现,这种“开箱即用”的调度能力把很多原本需要在代码层面手动优化的活儿省掉了,也让中小团队能够直接享受到一线的性能优化成果。

2.4 硬件迭代:从等卡到挑卡,推理市场的供给侧变了

2023年最大的痛苦是“有钱买不到卡”。云计算厂商对客户按整卡甚至整机售卖,推理需求小、场景细碎的团队根本租不到合适的算力。那时服务器上跑着A100/H100,但很多AI初创其实只需要一块小卡来跑日常推理,供需严重错配。

之后两年,硬件市场出现了两个变化。一是大厂自研推理芯片逐步成熟,很多推理任务不再必须依赖最高端的加速卡,而是落在了性价比更高的推理专用芯片上;二是中低端算力大规模普及,那些“性能不高但稳定耐用、价格便宜”的卡成了推理部署的主力。

供给侧一宽松,推理资源的单价就开始回落。加上推理引擎对硬件的适配越来越完善,很多原本必须跑在高端卡上的模型,经过量化之后在普通卡上照样跑得飞快。算力市场的天平终于从“卖方市场”慢慢滑向“买方市场”,这也是写进“99.7%”里的又一笔关键账。

3. 从卖算力到卖token:云计算生意模式发生的变化

价格暴跌真正深远的影响,不在技术参数里,而在云计算的商业模式上。

过去十年,云计算的生意本质是卖资源:服务器、存储、带宽、GPU。客户买的是“一台台看得见摸得着的机器”,按时间计费。但大模型推理的普及正在把“算力”拆解成“能力”,云厂商的交付物从“你可以用这些机器跑你的代码”变成了“你直接调用这个模型的能力,按效果付费”。

这个转变不是简单的计价单位变化,而是整个产业链的分工重组,也带来了一系列新问题和新机会。

3.1 从“租GPU自己部署”到“直接调API”,中小团队彻底解放

2023年最常见的大模型落地路径是:租几台GPU服务器,拉一个开源模型,自己写部署脚本,搭推理服务,然后小心翼翼地维护着,生怕请求量一大服务就挂。

这条路在成本端越来越不划算了。随着各家大模型API的价格雪崩,调用API的边际成本已经低到低于自己部署的成本,尤其是你还要算上运维人力、GPU空闲损耗、模型更新迭代的迁移成本时,“自己养模型”在很多场景下纯属吃力不讨好。

我现在的建议很直接:如果业务量没有大到每天千万级token请求,优先考虑API,把精力花在业务逻辑上。自己部署的真正价值在于数据安全、定制化、极致降低边际成本,而不是“显得更专业”。

这也是云计算厂商愿意看到的趋势。早年卖GPU是“一锤子买卖”,客户买完机器,除了续费很少再花更多钱;而API服务是按token持续计费的,客户业务量与调用量直接挂钩,是真正的“卖水”生意,随着客户业务增长,收入自动增长,不用再催促客户扩容。

3.2 缓存命中带来的计价创新,改写了API服务的成本结构

过去云计算的基础设施是“存算分离”的哲学:存储归存储,算力归算力,各自计价。大模型推理打破了这种清晰边界,因为KV Cache既是推理状态,也是可以被反复读取的“临时记忆”。

现在许多推理API引入了缓存计价:同一个前缀在第一次计算后存下来,后续请求如果命中缓存,输入部分按远低于正常价的价格收费。这改变了开发者的成本规划方式。设计产品时,如果能让不同用户的请求共享同一段公共前缀(比如相同的系统提示词、相同的知识库上下文),实际成本可以大幅压缩。

更极端的情况是,有些服务商甚至推出了“夜间低谷时段特惠价”,把资源利用率波谷期的空闲算力以白菜价出售,用来承接对延迟不敏感的大规模离线推理任务。这类价格策略在传统的云计算时代几乎不可能出现——他们过去卖的物理资源有固定成本,但现在卖的是“对剩余容量的利用权”。

3.3 云厂商的算力产品重心:从“推理”转向“训练+推理混合调度”

推理成本的下降,反过来又推动了云厂商内部的资源调度改革。

过去训练集群和推理集群是分开的:训练任务吃满GPU,推理服务追求低延迟。现在越来越多的团队倾向于“混部”——在同一批硬件上,优先保证在线推理服务的延迟要求,空闲算力全部用来跑训练或微调任务。这种调度模式让“有效算力利用率”进一步提升。

云计算厂商也在往这个方向优化自家产品线。比如提供弹性的推理服务,按token精确计费,同时支持在低谷时段调用空闲算力做批量推理;又如提供“一键部署大模型”的托管服务,让用户把模型上传之后,自动完成量化、加速、弹性伸缩的全流程配置。这种产品设计本质上是在告诉你:别再把精力花在底层细节上,专注你的业务逻辑就好。

这种模式的转向是整个行业从“卖资源”走向“卖效果”的一个缩影。

4. 落到自己项目里:推理成本下降给开发者和企业带来的选型红利

说完了行业层面的抽象变化,该聊点能直接上手用的东西了。价格暴跌冲击的不只是云计算巨头,更深远的影响在每一个开发者和技术管理者的方案选型上。

4.1 API怎么选:别只盯着单价,要看综合成本模型

现在市面上的大模型API价格已经从“整齐划一”变成了“百花齐放”,各有各的促销策略。如果你还是在对比“每百万token输入多少钱”,那你可能还停留在上一代的决策逻辑里。

我评估一个API服务是否合适,一般看四个维度:

  • 实际命中缓存后的价格:多轮对话类产品的历史上下文重复率高,缓存命中率高的服务实际消耗远低于标价。
  • 输出质量与稳定性:同样价格的模型,在特定任务上的表现可能差距很大,这个需要通过自己的评测集验证。
  • 并发上限与扩缩容速度:遇到流量洪峰时,API服务能否快速扩容直接决定用户体验,有的服务在高峰期会排队甚至返回限流错误。
  • 生态兼容性:是否兼容OpenAI的接口协议,能否无缝接入现有框架,迁移成本高不高。

以我自己做过的中文知识库问答项目为例:初期采用闭源API,月成本一度高到需要客户特批预算;切换到缓存命中率较高的服务商,并调整了产品交互逻辑(将用户消息统一放在系统提示词之前,提高命中率)后,月成本直接降了一个数量级,这还是在完全没牺牲回复质量的前提下。

4.2 自己部署还是用API:边界条件已经发生了变化

以前大家默认的答案是“业务规模大了就要自己部署”,但这个边界在两年的价格变化中已经被显著移动了。

做一个简单的成本对比模型:假设你每天处理100万token的输入和30万token的输出,用商业API大约一个月的费用在几千元到上万元人民币之间。如果自己部署,需要付出的成本包括:一台或多台带GPU的服务器(或者云上租GPU)、模型权重下载和推理服务框架部署、日常运维和监控、模型升级时重新部署的时间成本。

结论是:如果业务量稳定且持续增长,当每天token消耗达到数百万级别时,自建推理集群会开始显示出成本优势。尤其是对延迟敏感、数据敏感、需要定制模型的场景,自建几乎是必选项。

但如果你的业务属于“波动大、增长不确定、非核心场景”,就算日token消耗偶发冲高,也建议继续走API。原因很简单:自建集群在流量波谷期是纯亏钱的,而API服务帮你把闲置算力的风险全部消掉了。

4.3 推理成本下降直接改变了产品交互设计的取舍

以前因为贵,产品经理在设计交互时往往刻意控制模型调用次数。比如“用户的每一条消息是否都需要经过大模型处理”这种问题,在2023年需要非常慎重的决策,很多团队选择用规则优先、模型兜底的策略来节省成本。

现在这条限制被彻底松绑了。同一笔预算下,你可以让模型参与更多的产品环节:意图识别、内容摘要、多轮追问、自动补全、纠错、情感分析。曾经“因为太贵所以不做”的功能,现在完全可以放进需求清单里。

根据我的实际观察,很多团队已经在大规模重构产品,从“人机交互靠规则”转向“人机交互靠模型”。这波重构背后最重要的推手,不是模型能力提升了多少,而是推理成本降到了可以让产品经理“不计较”的区间。当一项技术便宜到可以被产品随意使用时,它才真正称得上基础设施。

5. 推理成本暴跌之后:下一个十年的云计算会怎么演化

如果说前几年AI大模型和云计算的关系是“在云上跑模型”,那未来十年的关系会变成“云本身就是模型”。

5.1 从“模型即服务”到“推理即基础设施”:算力再分配

传统云计算格局里,算力像水电煤一样被输送到企业,但用户关心的是“我获得了多少计算能力”。大模型推理成本暴跌之后,算力的分配逻辑正在从“资源”变为“服务的原材料”。

推理能力会像数据库、消息队列一样,成为云平台上的一个基础组件。开发者不需要关心怎么部署模型、怎么优化推理、怎么调度GPU,只需要调用一个接口,按token或者按调用次数付费。模型本身,就像曾经的MySQL或者Redis一样,成为云服务商预置好的标准能力。

这个趋势已经在多个云平台上露出苗头:模型托管、自动推理优化、弹性Serverless推理服务等产品正在快速成熟。云计算厂商不再只提供“装模型的物理环境”,而是直接提供“模型能力即服务”的交付形态。

5.2 边界重塑:云端推理与端侧推理的再分工

推理成本下降并不代表所有任务都应该放在云端。恰恰相反,它推动了一个更合理分工的诞生。

端侧部署小参数模型来处理那些延迟敏感、隐私敏感、需要离线运行的场景(比如手机上的键盘输入、实时语音助手、摄像头终端的目标检测),云端大模型负责那些需要深度推理、长上下文理解、跨领域知识整合的任务。两者通过协同,让“大模型+小模型”的混合架构成为标准范式。

实际项目中,这种分工已经在落地了。我的一个合作伙伴在工厂质检场景里,先用端侧小模型做工件缺陷的初筛,只有遇到难以判定的边缘案例才把图像上传到云端大模型做深度分析。这样既保证了响应速度,又将云端推理成本压缩到原来的极小比例。端侧负责“快而准”,云端负责“难而深”,成本最低且效果最优。

5.3 新的竞争焦点:推理成本下降之后,什么会成为稀缺资源

推理不再稀缺之后,真正的稀缺资源会变成什么?我的判断是:高质量数据和能高效利用模型的工程能力。

模型能力可以被API化、产品成本可以被标准化,但每个行业里高质量的数据仍然极度稀缺。数据是模型的燃料,未来真正有壁垒的推理应用,一定是对特定场景数据有深度理解和积累的应用。

同时,“会用模型”和“不会用模型”的差距会进一步拉大。推理成本便宜到可以随意调用之后,真正的竞争优势在于知道“怎么用、在哪些环节用、用完之后如何评估反馈”。高质量数据和使用经验,会成为云计算之上新的技术壁垒。

5.4 对个人开发者和中小企业来说,这是个前所未有的窗口期

如果仔细观察云计算前两个十年的演进,不难发现一个规律:每一轮基础设施成本的下降,都催生了一批依托新基础设施成长起来的企业。

2008年前后服务器托管价格下降,催生了第一批个人站长;2012年云主机大规模普及,带动了移动互联网创业潮;2018年Serverless和对象存储成本走低,成全了无数独立开发者。现在,大模型推理成本历史性暴跌,正在为下一波个人开发者和小团队的创新打开一扇窗。

过去做一个AI原生应用,启动成本是几十万到几百万元——因为推理太贵了。现在同样的应用,启动成本降到几千元级别,唯一的门槛变成了:你是否真的理解某类用户的需求,并且能设计出正好命中需求的解决方案。

我强烈建议每个开发者都认真思考一次:“如果我拥有可以无限调用的大模型推理能力,成本几乎可以忽略不计,我的产品形态会发生什么变化?我能解决以前解决不了的问题吗?”这个问题值得反复追问。思考得越深,越能看清自己所在赛道的未来。

另外分享一个我自己的实操经验:现在尝试新想法,我习惯先用API搭一个最小可用原型,用真实用户流量测试一到两周,验证需求真实性和产品体验。只有在数据证明了确实有长期服务价值之后,才开始考虑自建推理或者更深度的优化。这个“先API、后自建”的路径,放在两年前成本上根本走不通,如今却成了最经济高效的创新姿势。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询