最近在 AI 行业讨论中,一个观点引发了不小的争议:AI 叙事的大衰退会以 Anthropic 上市为起点。第一次看到这个说法时,我更多把它当作一种“阶段性情绪”,毕竟大模型行业过去几年经历了太多“天上地下”的行情波动,已经不太容易被单一判断打动。但如果把这件事放到 AI 产业从故事驱动走向工程驱动的完整周期里去看,它确实可能成为一个标志性节点。
这篇文章不打算做投资分析,也不做股价预测,而是想从技术从业者的视角,拆解几个问题:AI 叙事到底是怎么建立起来的?上市为什么可能成为某种“叙事分水岭”?如果叙事进入衰退期,对后端开发、算法工程师、AI 产品经理和创业公司意味着什么?在“故事不再值钱”的下半场,有哪些能力会变得更稀缺,有哪些工作方法需要提前调整。
1. “AI 叙事衰退”的判断从何而来
要讨论“叙事衰退”,首先需要弄清楚什么叫做 AI 叙事。它并不仅是资本市场里的营销话术,而是一整套围绕 AI 技术进步展开的故事体系,通常包含几个层次。
第一层是技术叙事,代表的是类似于“参数规模越大,模型越智能”“下一个 Token 的自然涌现就接近 AGI”“Agent 会替代大部分白领工作”的判断。这类叙事将阶段性的技术趋势包装成确定性的历史进程,形成一种看起来不可逆转的发展斜率。第二层是商业叙事,说明“大模型不仅仅是聊天工具,而是新的计算平台”,企业服务、个人助理、代码生成、AI 搜索等场景会被重新定义。第三层是资本叙事,即一级市场愿意为这些预见支付高估值,二级市场愿意为相关概念股给出更高市盈率。
这三种叙事相互强化。技术突破带来新的演示效果,新的演示效果刺激需求预期,需求预期又反过来放大融资规模,让头部企业有更多经费去做更大规模的算力和数据投入。因此,在很长时间里,“AI 行业是否健康”几乎等同于“AI 叙事是否性感”。
但叙事本身也是会衰减的。任何一组叙事都有几个明显的生命周期特征:新概念涌现、早期采用者验证、群体模仿加速、边际感受钝化、审美疲劳出现。ChatGPT 刚出现时,一句自然语言就能生成论文大纲、营销文案或代码,这种新鲜感放大了一切想象空间。到了今天,一个普通用户对新模型 Demo 的反应往往变成“确实变强了一点,但好像没有本质区别”,这就是叙事边际钝化的典型表现。
专业开发者群体对这种钝化的体会更早。模型评测分数每年都在上涨,但真实业务系统里的收益并不同步增长:自动化客服仍需要兜底人工、Agent 在复杂流程中仍频繁出错、大模型生成内容的合规性风险仍需大量过滤。当实践者发现工具能力提升速度高于场景落地速度时,故事层面的“指数曲线”和工程层面的“对数曲线”之间就会出现越来越大的裂痕。这种裂痕积累到一定程度,就会表现为叙事的衰退。
看到这里可以理解,AI 叙事衰退并不是说大模型技术没有价值,而是意味着市场对 AI 的评价标准会从“它未来能做什么”切换到“它现在能稳定解决什么问题、成本是否划得来”。推动这一转变的不一定是某个具体的技术失败,也可能是一个足够有象征意义的商业化事件,比如 Anthropic 的上市。
2. Anthropic 为何可能成为关键转折点
在众多 AI 公司中,Anthropic 一直是比较特殊的存在。它由 OpenAI 前核心成员创立,长期以“AI 安全”作为标签,强调在构建强大模型的同时,让模型遵循人类意图、避免有害行为。与单纯追求“能力上限”的路线不同,Anthropic 更强调对齐(Alignment)和可解释性,Claude 系列产品在实际代码生成、长文本理解、复杂推理等场景中建立了不错的口碑,在北美企业服务市场尤其有影响力。
那么,为什么一家公司的上市,会被视作 AI 叙事大衰退的起点?核心原因不在于 Anthropic 本身,而在于“上市”这个动作改变了 AI 头部公司的叙事交换方式。
在一级市场,一家公司可以长期用愿景来融资。创始团队只需要向少量投资人说明未来十年 AI 会改变世界,投资人有足够耐心等待高增长兑现。估值可以由同行业公司的融资价格锚定,也可以由“潜在市场空间 × 预期渗透率”计算,甚至可以由“下一代模型能力跃迁”来背书。这种估值体系天然鼓励野心,因为故事的天花板越高,融资规模就可以越大。
但二级市场是完全不同的评价体系。一旦 Anthropic 上市,它就必须定期披露财务状况、用户增长、成本结构、研发投入和毛利率。市场会把这些数据和 OpenAI 等竞争对手做对比,也会把财报中的数字与 IPO 路演时的愿景做对比。此时,市场对公司的估值逻辑将从“相信未来的故事”变成“用当下现金流和可预期的成长性倒推未来,甚至给它一个更苛刻的对标企业”。
过去被掩盖的真实处境会被强制曝光,包括算力成本压力、推理成本、获客效率、API 调用增速、客户留存和毛利结构等数据。之前的 AGI 叙事有多大,上市之后财务指标的约束就会有多强。许多原本不需要回应的质疑,在公开市场都会被不断拷问。
更重要的是,Anthropic 上市可能引发的模仿效应。头部公司一旦进入公开市场,后续几家公司就可能跟进,用更常规的估值方式寻找退出路径。这种集体动作会让市场从“追逐下一个技术奇迹”切换到“逐个审查不同公司的收入质量”。过去几年习惯的融资式叙事循环被打断,新故事只能在财务安全边界内展开。
从历史经验看,新技术浪潮往往也会遵循类似的节奏。早期是一群富有远见的人用宏大叙事打开资本通道,中期是产品化能力不够导致预期回摆,后期才进入稳定应用和行业渗透。Anthropic 作为这一轮大模型浪潮中最受关注的公司之一,如果走向 IPO,恰好可能处在叙事疲劳的关口上。它承担的不只是自己的上市估值,更是整个行业从“想象力竞赛”转向“经营能力竞赛”的标尺。
需要说明的是,这并不等于 Anthropic 上市之后就会发展不好。上市完全可以给它带来更充足的资金、更透明的治理和更广泛的合作空间,让它进入新的增长阶段。这里讨论的“叙事衰退”,更多是行业集体预期的重构,而非某一家公司的命运判决。对能够把模型能力转化为客户价值的公司,叙事退潮反而会减少噪音,让真实优势浮出水面。
3. 叙事退潮不等于技术停滞
面对“叙事衰退”的讨论,很多技术人容易产生一种误解,认为 AI 算法突破的速度也会同步放缓。这种理解是不够准确的。
叙事衰退改变的是社会、资本和企业客户对 AI 的预期管理方式,并不会直接改变 Transformer 架构的演进、上下文窗口的扩展、多模态能力的融合等客观研究进程。模型厂商的研发计划通常以年为单位推进,一些前沿实验室的内部规划并不会因为某一家同行上市而推倒重来,反而可能因为新的融资渠道而获得更稳定的资源。
发生变化最明显的是资源分配结构。叙事狂热阶段,企业愿意为“哪怕暂时用不上的模型能力”付费,做技术预研和 demo 以获得市场关注;叙事退潮之后,企业会更严格地评估每一项 AI 支出,把预算倾斜到能直接带来留存、成单、降本的事情上。
这种变化会带来一个关键结果:技术研发开始分为两个方向。一个方向是继续前沿探索,投入大、周期长、但门槛极高,只有少数具备密集资本和顶级人才的组织能长期承受;另一个方向是把已有模型能力工程化,做成本压缩、延迟优化、稳定性建设、专业场景微调和知识库对接,让 AI 真正进入核心业务流。
对大多数技术团队而言,后者的机会不仅没有减少,反而可能增多。因为底层模型能力越强,客户越关心“如何在我的行业数据里稳定运行”,而不是“这个模型是否又刷新了几项评测基准”。换句话说,叙事退潮会把行业的重心从“AI 能不能做到”转向“AI 怎样做才能用得更便宜、更精准、更可靠”,由叙事驱动的偏好让位给工程驱动的取舍。
以企业级场景为例。过去很多团队采购大模型 API 是因为“别人都在做 AI 转型”,先接入再想应用场景。叙事退潮之后,企业会更加关注“模型幻觉率有没有降下来”“私有化部署的成本是否可接受”“推理延迟是否满足生产环境”“二次开发是否方便”。这些判断标准本质上都以工程实现为依据。
因此,谈到 AI 叙事衰退时,我认为真正该关注的不是技术路线的大转向,而是市场筛选机制的变化。那些依赖“包装成 AI 公司”的伪需求会退场,靠融资而非产品现金流维持的项目会出清,只承担技术演示而不产生业务价值的 Demo 会被取消预算。与此同时,愿意深入行业、理解痛点、并把模型调教成可用工具的公司,会获得更集中的市场关注和资源倾斜。
4. 对开发者和 AI 产品团队的实际影响
如果说产业叙事层面的变化离日常工作还有距离,那么它传导到开发者和产品团队身上只需要短短几个季度。以下是几个最可能被感知到的具体层面。
4.1 成本结构被重新审视
叙事狂热期,产品团队选择模型的逻辑经常是“谁的评测分数高选谁”,对成本的考量相对宽松。但在叙事退潮后,企业财务会介入得更深。即使模型调研再惊艳,只要单次调用成本让业务的毛利模型算不过来,就很难通过立项评审。
这里需要使用量化思维。模型调用的显性成本可以简化为一个公式:
单次请求成本 = (输入 Token 数 × 输入单价 + 输出 Token 数 × 输出单价) / 1000000不同模型的计费口径差异很大,并且缓存命中等机制会进一步改变实际成本。更合理的做法是不仅仅计算 API 单次价格,而是把整个链路费用放进去:
单次请求真实成本 = API 费用 + 向量数据库费用 + 中间层服务费用 + 人工抽检成本 + 错误补救成本很多团队上线 AI 功能后才发现,一次对话请求虽然只消耗几厘钱,但为了处理模型输出中的格式错误、敏感内容和事实偏差,背后采用了全套的校验、审核和兜底服务,这些隐形成本往往数倍于 Token 费用。当叙事退潮、预算收紧,产品团队被迫把所有隐藏成本都摆上台面,这时候还能保持正向收益的功能才会被留下来。
4.2 模型选型从崇拜转向匹配
过去选型讨论中常见类似“这个模型比那个模型更强,所以应该选它”的简单思维。实际生产环境中更适合的是按需匹配原则。
简单任务不需要动用大参数模型,复杂推理任务才需要前沿模型,中间态的海量任务可以被中小模型或蒸馏模型覆盖。合理的模型架构应当像微服务架构一样,为不同入口、不同流量、不同风险等级分配不同规格的模型。比如:
- 简单的意图识别、文本分类,用轻量模型即可,追求低成本和高吞吐。
- 涉及复杂代码生成、数学推理和长文档归纳的任务,再用前沿大模型。
- 对隐私要求高的业务,需要认真评估私有化部署可行性,而不用为了“云上最强模型”牺牲数据合规。
模型选择决策还需要配合合理的评测。不能只看公开榜单,还要在自己业务的回放数据上验证准确率、拒绝率、格式遵循能力和异常输入下的稳定性。模型评测不是一个一次性的动作,而是一套可以随数据回流不断更新的体系。
4.3 评估体系会替代炫技式 Demo
叙事衰退背景下,最能看出团队功底的是模型评测能力。过去一个 AI 项目的 demo 只需要在预先准备的小样本上连续输出三段精彩回答,就能让验收现场气氛热烈。可现在企业客户会更警觉,他们知道精心设计的演示材料不能代表真实数据分布。
成熟的团队会构建一套可持续运行的评测基线,包含历史线上数据回放、边界输入构造、多模型对比、回归测试和用户反馈回流等环节。这实际就是把传统软件工程里的质量保障思路迁移到模型链路中。
# 示例:AI 功能上线前评估关键指标 evaluation: sample_size: 2000 metrics: - exact_match_rate - semantic_similarity - answer_accuracy - format_valid_ratio - latency_p95 guardrails: - sensitive_word_check - prompt_injection_test - hallucination_spot_check regression: - previous_week_cases_replay代码思路是通用的,即使使用的评估框架不同,关键指标也会围绕“效果达不达标、稳定性强不强、成本能不能承接”三个维度展开。具备这种工程化评测能力的团队,在高预期幻灭后反而更容易获得客户信任。
4.4 Agent 应用从演示走向灰度
过去两年,Agent 是最热门的大模型叙事之一,各种“AutoGPT 替代程序员”“Agent 取代员工”的夸张表达充斥着信息流。但随着时间推移,人们开始意识到 Agent 在生产环境中的真实表现远没有那么激进:任务拆解不够稳定、工具调用出错后恢复困难、权限边界存在风险、每一层不确定性都会放大系统级故障。
叙事退潮后,Agent 的落地会往更务实的方向收敛:先把人类已经跑通的流程固化下来,用大模型处理少量需要理解和判断的节点,保留人工审核和异常后退机制。例如客服场景可以先用大模型做“会话摘要”和“知识库检索”,再逐步放开“低风险回复建议”;代码生成可以先用于“单函数补全”和“单元测试生成”,再扩展到仓库级任务编排。这种从小切口开始验证、逐步扩大边界的做法,比一开始就追求全自主 Agent 更符合技术演进的真实规律。
5. 企业层面:从“信仰”到“ROI”的转变
当一个行业从叙事驱动切换为 ROI 驱动,企业的人工智能决策机制会发生肉眼可见的变化。最典型的是采购流程从此前的“CTO/CIO 拍板”逐步转向“财务、业务、技术三方联合评审”。
过去企业上一个 AI 项目,内部立项材料里最常出现的是“行业趋势”“技术先进性”“未来想象空间”这类描述,很少看到对收益的量化计算。现在越来越多企业会问几个非常具体的问题:这个功能能减少多少人工成本?能提升多少转化率?上线后运营维护投入有多大?模型错误导致的风险损失如何估算?如果答案停留在“体验变好”这个层面,项目大概率被搁置。
这种转变对技术团队的交付方式提出了更高要求。以前可以只交付模型接口和前端页面,现在则需要在项目开始前定义清晰的业务指标,上线后通过数据看板追踪模型调用量、用户反馈、人工介入率、异常率等指标。AI 产品经理需要具备更强的成本意识和数据敏感度,后端同学要习惯为模型输出加缓存、限流、熔断、重试和审计等机制。
需要强调的是,ROI 驱动并不等于放弃高风险高回报的探索型项目。企业通常会把投入分成两部分:一部分投给守成项目,目标是优化现有流程;另一部分投给探索项目,目标是在新场景中积累能力。两者的区别在于,探索项目被赋予更明确的预算上限和阶段检查点,而不是无限烧钱试错。
对创业公司而言,叙事退潮的影响更为直接。过去靠“大模型潜力股”概念获得天使轮机会的窗口正在变小,投资人越来越看重三个东西:是否拥有独占的数据资产、是否在某个行业场景中有可复制的交付能力、是否已经验证了健康的单位经济模型。缺少其中任何一项,都很难仅凭“我在做 AI 创业”获得超额融资。
这里并不是说创业机会变少了,只是创业门槛从“会调用 API 做 demo”提高到了“能解决具体且持久的问题”。未来的 AI 创业更可能出现在行业纵深里,比如法律服务中的文档审查、医疗场景中的病历结构化、供应链场景中的非结构化数据处理,而不是通用聊天助手和高密度同质化的写作工具。
6. 在这种周期里,技术团队可以提前做什么
无论对 AI 叙事的判断是否准确,一些趋势性准备都是有必要提前做的。
首先,要培养对模型能力的“祛魅”心态。学会不看模型发布会 Demo,而是在自己手头的任务上反复验证同样的问题,记录成功率、失败模式和异常输出。只有大量接触模型的实际边界,才能在产品设计中对用户体验兜底。不要因为某个模型的演示视频很流畅,就在架构设计里对错误处理掉以轻心。
其次,把成本意识和可观测性嵌入开发流程。AI 应用不同于传统 API,Token 消耗、缓存命中率、上下文长度、模型调用次数都会直接影响成本。开发和运维侧应建立一套覆盖模型调用链路的监控体系,至少包括调用量、延迟分布、错误率、Token 成本、用户维度的用量分析。这样可以避免月底收到一张惊人账单时才发现系统存在严重的重复调用问题。
再次,保持对数据资产的重视。模型叙事可能会衰退,但企业自身的业务数据不会贬值。对话记录中的用户反馈、标注数据集里积累的领域知识、业务系统里沉睡的历史文档,这些数据在未来依然具有极高的工程价值。无论模型层如何更换,做了清洗、标注和结构化处理的数据资产都会长久地发挥杠杆作用。
技术团队还可以有意识地为模型设置一个“退出切换”机制。今天选择的模型再合适,也很难保证一年后仍然是最优解。API 层可以抽象成统一接口,让上层业务不依赖具体模型;评测集可以做到模型无关,只要接口规范和输入输出格式保持一致,过往所有回归数据都能用于新模型评估。模型不是不可替换的,能够在不同模型之间自由迁移的组织,才具备最强的议价能力。
还有一个容易被忽视的层面是安全合规。叙事退潮后,监管和审计对 AI 应用的要求不会放松,用户隐私、数据出境、生成内容合规、模型可解释性等问题会更加被关注。AI 应用开发需要从一开始就引入相应的校验机制,而不是等功能上线之后再做安全补丁。
下表给出几个当前值得投入的能力方向:
| 能力方向 | 现状 | 建议投入形式 |
|---|---|---|
| 模型评测与回归 | 很多团队依赖人工抽查 | 建设自动评测 Pipeline,持续回放线上数据 |
| 成本优化 | 只看 API 单价 | 监控 Token 消耗、缓存命中率、模型分层调用 |
| Agent 可靠性 | Demo 可用但生产不稳 | 设计人工审批、异常恢复、局部自动化 |
| 数据资产治理 | 数据散落各业务系统 | 统一清洗、标注、权限管理,形成可复用数据集 |
| 安全合规 | 上线前简单过滤 | 接入内容审核、隐私保护、权限审计全链路方案 |
这五类能力的共同点在于,它们都不依赖某一阶段的热门模型,而是围绕“如何把 AI 变成可维护的基础设施”展开。当叙事不再提供额外加分,这些基础能力恰恰是技术团队的核心竞争力。
7. 尾声
“AI 叙事大衰退将以 Anthropic 上市为起点”并不是一个悲观的预言,更像是一次对行业发展节奏的重新校准。过去两三年里,市场给予了 AI 行业极高的想象力溢价,使得技术迭代速度、融资估值和实际应用落地之间出现了明显的时间差。上市事件之所以可能成为转折点,是因为它把这种时间差强制拉回到现实尺度中,让所有参与者重新面对成本、收益和风险问题。
对于开发者来说,不必因为叙事退潮而焦虑,也不必因为某家公司上市而改变技术方向。大模型带来的工程范式变化是真实的:从自然语言交互界面到代码生成辅助,从知识库问答到智能体编排,软件开发的方式确实发生了深层转变。退潮之后,留下一批经得起计算、经得起长期运营的应用,反而更有利于行业的健康发展。
如果这轮调整最终真的发生,我们大概率会看到两个结果:一方面,那些不能回答“你的 AI 到底解决了什么问题、成本是否可控”的项目会快速终止;另一方面,愿意深耕行业、认真打磨数据链路和模型评测体系的团队会获得更清晰的正反馈。
AI 的长期价值从来不取决于叙事是否性感,而取决于它是否能在具体的业务场景里跑出稳定且可量化的结果。故事退场的时候,工程会重新成为主角。对热爱技术的人来说,这未必是坏事。