前言
你有没有想过,当你让ChatGPT帮你写一段代码、让Kimi帮你读一份财报、或者让智能体帮你订一张机票的时候,背后其实有一笔“小账”在悄悄跳动?
这笔账的计量单位,叫做 Token(词元) 。2026年3月,国家数据局将Token正式定名为“词元”。几乎同一时间,英伟达CEO黄仁勋在开发者大会上公开提出 “Token是新的货币” 。这不是一句空洞的口号——Token正在从技术术语变成一个真正的经济概念。
Token是什么?简单来说,它是大模型处理信息的最小单元。它既不完全等于一个字,也不完全等于一个词,而是介于两者之间的一种“语言碎片”。比如“今天”可能是一个Token,“国际化”可能被拆成“国际”和“化”两个Token。每一次你向AI提问,每一次AI回答你,都在消耗Token。而这背后,是一套正在快速成型的新经济学。
一、Token如何成为AI时代的“新货币”
回顾过去几年,AI行业经历了从“拼参数”到“拼Token”的转变。
2024年初,中国日均Token调用量约为1000亿。到2025年底,这个数字跃升至100万亿。2026年3月,已突破140万亿——两年增长超千倍。 豆包大模型日均Token使用量在2026年3月已突破120万亿。MiniMax在2026年2月平均单日词元消耗量达到2025年12月的6倍以上。
Token的爆发式增长背后,是三个层次的驱动力。
第一层是技术普及。 大模型从实验室走向千家万户,从网页端渗透到App、插件、操作系统,使用门槛越来越低。百度千帆平台产品负责人曾用一个比喻来解释Token的价格:“每百万Token几毛钱,1块钱可以让AI写大约1000篇800字作文。”当AI服务便宜到这个程度时,使用量必然井喷。
第二层是智能体的崛起。 如果说传统聊天是一次性的“单次对话”,那智能体就是一场“连续剧”。一个智能体在完成一项复杂任务时,往往需要进行数十次甚至数百次模型调用。每一次思考、每一次工具调用、每一次错误重试,都在消耗Token。智谱CEO张鹏曾解释:“Agent在面临复杂任务时,模型思考的链路很长,Token消耗量非常大。”换句话说,智能体把Token消耗从“单次问答”变成了“连续任务链”。
第三层是经济定位的明确。 黄仁勋提出了一个完整的经济框架:“算力即Token,Token即智能,智能即产值(output)”。Token成为了连接底层算力与上层商业价值的核心枢纽。浙江大学与阿里云等机构联合发表的综述论文,更是将词元重新定义为生产要素、交换媒介与记账单位。Token不再只是一个技术指标,它正在成为数字经济的 “新石油” 。
二、Token的定价逻辑:从“价格战”到“价值战”
既然Token是“货币”,那它的“汇率”是谁定的?怎么变的?
2025年到2026年初,国内大模型行业经历了一场惨烈的 “价格战” 。各大厂商竞相压价,DeepSeek在2026年4月、5月还在连续降价。Token的价格一度被压到成本线以下,整个行业处于“烧钱换用户”的阶段。
但到了2026年第二季度,风向逆转了。
根据摩根士丹利的统计,中国八家主流大模型厂商的平均API输入价格已升至 每百万Token 4.9元,输出价格升至 21.9元。相比2025年第一季度的3.3元和12.2元,分别上涨了48%和80%。
涨幅最夸张的是DeepSeek。2026年8月,DeepSeek宣布全面涨价并引入峰谷定价机制——高峰时段V4 Pro每百万Token输入9元(涨幅200%)、输出27元(涨幅350%)、缓存命中输入0.3元(涨幅1100%),最高涨幅达1100%。开发者们倒吸一口冷气:“27元一百万词元,涨了3倍多。”
为什么突然涨价?背后有三重原因:
首先是供需失衡。 Agent应用的爆发让推理需求指数级增长,DeepSeek单个模型日均处理已达数万亿Token量级,容量长期承压。
其次是成本压力。 头部厂商集体进入重资产建设期,巨额资本开支需要现金流支撑。靠融资补贴单价的模式很难持续。
第三是心态转变。 行业从“抢用户”转向“算账”,定价从营销工具回归成本函数。
不过,涨价并不是全球统一的趋势。2026年8月,OpenAI宣布将GPT-5.6 Sol API价格下调超20%。Anthropic甚至取消了Claude Sonnet 5原定50%的涨价计划。中美定价出现了罕见的“背道而驰”。
这种分化背后是两种不同的商业逻辑:美国厂商在玩“规模换生态”——低价锁定开发者,再从云服务和上层应用变现;中国厂商则在经历从“低价获客”向“价值回归”的过渡。正如华东师范大学邵怡蕾教授所说:“Token正在从相对同质的计费单位变成分层供给。普通文本生成、复杂推理、长上下文、低延迟调用,对算力的消耗不同,给用户带来的价值也不同。”
三、从“Token单价”到“单位任务成本”:一个更重要的概念
如果你只看Token单价,可能会得出一个错误的结论:Token越来越便宜了。
事实上,单Token成本确实在大幅下降。有研究显示,GPT-3.5的推理成本较初期下降了280倍。以早期GPT-4价格作为高位锚点,部分通用推理Token价格在三年内最高降幅达99%。如果只算“每一个Token多少钱”,确实越来越便宜。
但问题在于,一个任务需要的Token数量在暴涨。
这里就引出了一个关键的经济学概念—— “单位任务成本” 。Token的单价乘以完成任务所需的Token数量,才是真正的成本。而后者,正在以更快的速度膨胀。
来看几个真实的数据:
· 编码任务是Token消耗的重灾区。一篇关于Agent编程任务Token消耗的论文显示,Agentic编码任务的Token消耗量是普通代码问答的 约1000倍。
· 同样是代码助手,不同工具的差异惊人:Kimi Code每项任务使用61,000个Token,成本约0.22美元;而Claude Code则消耗340,000个Token,每项任务成本高达2.00美元。同样完成任务,成本相差近10倍。
· 多智能体协作进一步放大了消耗。智能体在完成单项任务的过程中,往往需要进行数十次甚至数百次模型调用。一个Agent完成任务的成本从2元涨到5元。Agent把单次任务的Token消耗放大了几倍到几十倍。
这意味着,Token的单价的下降,完全被任务复杂度的上升抵消了。甚至,总支出还在上升。
摩根士丹利在2026年8月的一份报告中提出了“杰文斯悖论”(Jevons Paradox)——19世纪蒸汽机效率提高后,煤炭消耗理论上应该减少,但实际煤炭总消耗反而暴涨。Token市场正在上演同样的剧情。清华大学的一份报告揭示:过去两三年,前沿大模型单次调用成本暴跌至约原来的1/280,但OpenAI的推理总支出却不降反增约2.4倍。
成本降了,总支出却涨了——这就是Token经济学的核心悖论。
四、“Token刺客”来了:当大厂也付不起AI账单
如果连普通开发者都觉得Token贵,那企业的感受只会更强烈。
Uber的案例最为典型。2026年4月,Uber的CTO公开承认,公司原本规划覆盖全年的Token预算,仅四个月便消耗殆尽。单个工程师月均AI开销达到500至2000美元。为遏制成本失控,Uber直接划定 单人每月1500美元的Token使用上限。在一次内部演示中,CTO本人仅仅两个小时就烧掉了价值1200美元的Token。
更令人担忧的是投入产出比。数据显示,Uber每投入1美元的AI Token费用,仅有18美分产生了触达用户的实际价值。这种低效让Uber高管直言:AI支出与产品改善之间“那条线还不存在”。
Uber不是孤例。Meta、亚马逊等全球科技巨头也纷纷为员工使用AI踩下刹车。银行也开始“算账”了——2026年6月底,某银行高层在半年总结会上明确提出:不能无休止地烧钱消耗Token,所有大模型及智能体研发应用都要建立投入产出比(ROI)评估机制。
企业开始意识到,单纯追求Token单价下降是一个陷阱。真正需要关心的是:完成一个有价值的工作单元,到底要花多少钱?
五、驯服“Token吞金兽”:企业如何控制成本
当Token成本成为企业利润的黑洞时,一套全新的成本治理体系正在形成。
Gartner在2026年的数据显示,企业级Agent项目运维成本中,LLM推理费用占比超过65%,30%的项目因Token消耗失控被迫缩减功能或下线。生产级Agent的月度推理成本平均超出预算4.2倍,其中68%的支出源于无效Token消耗、冗余模型调用与低效架构设计。
行业共识已从“追求最强模型”转向 “性价比最优解” 。以下是几种主流的成本控制策略。
动态模型路由是成本控制的第一道防线。不是所有任务都需要调用最贵的旗舰模型——简单问题用轻量级模型处理,复杂任务才动用重型武器。Coinbase等公司已经在试验这种策略,将最具挑战性的任务交给前沿模型,将简单重复的任务交给成本更低的模型。安永启用内部路由器,将员工查询自动导向最适切的模型,成功为部分部门降低六成Token用量。
语义缓存是第二道防线。当多个用户询问相似的问题时,不需要每次都调用大模型重新推理。通过语义级缓存,系统可以识别同义改写、语序调整等语义等价查询,直接返回缓存结果。这种技术能让高频问题的成本趋近于零。
上下文优化是第三道防线。很多Token被浪费在了无关信息上——检索返回20条文档片段全部拼入上下文,其中15条与当前问题弱相关,却占用了80%的Token预算。通过相关性过滤、长文档摘要压缩等手段,可以大幅削减无效消耗。
“超维语义压缩” 是更前沿的方向。有公司开发的技术能将自然语言重构为代码态结构化中间态,使智能体消耗的Token下降60%至70%,推理准确率超过99%,单任务算力成本降低60%以上。
TokenOps(Token运营管理)正在成为一门新学科。它的目标是实现100%可计量、预算0超支、成本优化30%。企业开始像管理云资源一样管理Token消耗——设置预算上限、建立预警机制、进行精细化归因。
六、Token经济的未来:从“计量单位”到“价值锚点”
Token经济学正在快速演化为一个独立的学科领域。
2026年,全国首个词元经济专项金融产品“Token贷”在广州海珠区正式发布。中国银行广州分行针对算力中小微企业推出专属融资产品,根据企业签订的Token实际消耗量核定额度。《海珠区促进词元经济发展若干措施》同步亮相,从词元生产、流通、应用、金融到出海等环节提供政策支撑,单项扶持金额最高达500万元。Token第一次可以像实物资产一样作为银行贷款的信用凭证——这是一个标志性的事件。
Token的本质属性正在被重新定义。浙江大学等机构的研究指出,词元兼具语义单元与数字凭证的双重属性,其核心价值在于 “可编程性” ——价值随应用场景呈万倍级跃迁。耶鲁大学的研究发现,同一词元用于闲聊与用于法律分析,其价值差可达万倍。这种由指令驱动的价值跃迁,使得词元成为“可合同化的计量单位”。
Token正在从三个层面重塑经济格局:
作为 生产要素,Token让“智能”第一次可以被精确计量、定价和交易。算力投入不再是一笔糊涂账,而是可以精确到每一个Token的成本核算。
作为 交换媒介,Token正在催生新的商业模式。国内三大运营商已推出面向个人和企业的Token套餐。阿里云AgentBay等平台也在探索基于Token的计价体系。
作为 记账单位,Token让AI服务的价值创造有了统一的衡量标准。企业可以像核算水电费一样核算AI支出,精确计算每一分投入的产出。
当然,Token经济学仍面临严峻挑战。计量标准碎片化——同一段文本在不同模型中被拆分的词元数量差异巨大,导致成本核算失去横向可比性。全行业尚未形成类似“米原器”的通用计量规范。更深层的矛盾在于:当前的计费模式仅统计“原始词元”的消耗量,却无法衡量其质量。学术界正呼吁建立以“有效词元”为核心的核算体系。
七、结语
Token正在成为AI时代最基础的“货币”——它计量着智能的消耗,也衡量着价值的创造。
回望过去两年,Token的单价下降了数百倍,但企业的AI总支出了数倍。这就是Token经济学的核心命题:成本下降并不等于总支出下降,效率提升反而可能带来消耗暴涨。 这个悖论正在重新定义AI商业化的底层逻辑。
对于开发者来说,理解Token经济学意味着从“选最贵的模型”转向“算最划算的账”。对于企业来说,它意味着从“跑马圈地”转向“精耕细作”。对于整个行业来说,它标志着AI从技术叙事正式进入经济叙事。
Token不会消失,只会越来越重要。它正在从大模型的技术参数,变成数字经济的基础设施。正如黄仁勋所说——Token是新的货币,而算力就是印钞机。谁能更高效地生产Token、更精准地配置Token、更聪明地利用Token,谁就能在这场AI经济革命中占据先机。
Token经济学的故事,才刚刚开始。