上周五我在整理 AI 视频生成工具的调研报告,顺手查了下 Sora API 的调用文档。页面上用灰色小字标了一行:「This API will stop accepting requests on September 24, 2026。」
不到一个月了。
距 Sora 2 独立 App 上线刷屏才过去半年多,当时朋友圈里满屏都是「导演要失业了」「影视行业变天」。现在回头看,那篇文档里的小字比任何分析文章都诚实——Sora 不是在竞争中被打败的,而是自己撑不住了。
这件事挺有意思。我翻了一周的资料,把 Sora 从上线到退场的时间线、国产视频模型接盘的真实水平、以及技术路线上的分歧,从工程师视角梳理了一遍。
一、Sora 为什么死?不是技术不行,是算力账算不过来
先给 Sora 把个脉。它的死因说复杂也复杂,说简单也简单——每天烧 100 万美元,但用户量从巅峰 100 万跌到了 50 万以下。
OpenAI 自己算过一笔账:Sora 2 单次视频生成的平均推理成本约 0.80 美元,而用户平均月付费只有 15-35 美元。一个重度用户一天生成 10 条视频,平台就得倒贴钱。更尴尬的是,Sora 的生成质量确实好,但好到「能用」和好到「值得用户付真金白银」之间,差了整整一个商业闭环。
Sam Altman 在 8 月 23 日接受采访时说了句实话:AI 的「iPhone 时刻」没来,核心原因是产品层面的失败——用户拿到强大的 AI 工具后,依然在用旧的工作流做事。这句话放在 Sora 身上特别贴切。Sora 生成的视频片段确实惊艳,但影视行业的生产流程是编剧→分镜→拍摄→后期→剪辑,Sora 只能替代中间一小段「生成视觉素材」,而前后端的工作流根本没接上。创作者拿到一段 10 秒的 AI 视频,还得手动拉到 Premiere 里拼剪辑、调色、加音效。这个「最后一百米」的问题,Sora 到死都没解决。
从技术层面看,Sora 的 Diffusion Transformer 架构本身没问题,问题出在推理效率上。DiT 每生成一帧都需要跑完整的扩散去噪过程,帧数一多,计算量线性增长。相比之下,国产视频模型在架构上做了两件事:一是用更小的潜空间降低每帧计算量,二是用 Cache 机制复用相邻帧的中间特征,推理成本直接砍了一半以上。
二、国产视频模型的「弯道超车」不是口号,是架构差异
Sora 退场消息出来之后,很多人说「国产视频模型赢了」。这话不完全准确,但也不全错。
准确地说,国产视频模型赢的不是「画质更好」,而是「成本-可用性-工作流」三角的平衡做得更务实。
先看几组数据。8 月 20 日发布的 MiniMax-H3,在 VBench 榜单上综合得分 84.3,和 Sora 2 的 85.1 已经非常接近。但 MiniMax-H3 的推理成本只有 Sora 的 1/5 左右。快手可灵(Kling 3.0)在长视频一致性上甚至超过了 Sora 2,特别是在 30 秒以上视频的角色保持和场景连贯性上,表现更稳定。
字节跳动的 Seedance 2.5 走的是另一条路——它不做「最惊艳的 5 秒」,而是做「能用的 2 分钟」。Seedance 在视频编辑 API 上下了很大功夫,支持局部重绘、风格迁移、背景替换,目的是让创作者不跳出 AI 工具就能完成大部分后期工作。这个问题我在前面说了,Sora 到死没解决,Seedance 在架构设计阶段就把它当核心需求了。
技术路线上,国产模型和 Sora 的分歧本质上是「更大更贵 vs 更小更省」。Sora 2 的主力模型参数量接近 30B,每次推理需要 8 张 H100 跑 3-5 分钟。国产模型普遍走的是 7B-15B 的轻量路线,配合 4-bit 量化和 NEON 指令集优化,单张 A100 甚至 RTX 4090 就能跑,推理时间缩短到 30-60 秒。这个差距不是技术代差,而是设计哲学的不同——Sora 追求「上限」,国产模型追求「下限够用」。
三、但别急着吹,国产视频模型还有三个硬伤
把国产模型吹上天也没意思。我实际跑了一圈,发现三个问题绕不过去。
第一个是语义理解深度。给国产模型写「一只戴墨镜的猫在雨中漫步,霓虹灯倒映在水洼里」这种有多层语义的 prompt,能同时准确还原墨镜、猫、雨、霓虹灯四个元素的,目前还没见到一个。Sora 2 在这类复杂 prompt 上的成功率大约在 70%,国产最好的模型大概在 45% 左右。差距在于训练数据的多样性和规模——Sora 的训练数据里包含大量高质量视频-文本对,而国产模型的训练数据在「视频内容多样性」上还有明显短板。
第二个是物理一致性。物体交互、重力响应、光影变化这些「物理常识」问题,是所有视频生成模型的通病。但 Sora 2 在物体长时间遮挡后的重新出现、多个物体同时运动时的轨迹保持上,明显比国产模型好。我猜这和 Sora 2 内部集成了一个轻量级的「物理先验」模块有关——它在生成视频时不仅做视觉生成,还隐式地做了一轮物理模拟来约束输出。这个思路国产模型还没跟进。
第三个是生态。Sora 虽然要关了,但 OpenAI 围绕它搭建的开发者生态(API、插件、评测工具、社区)在视频生成领域依然是最完整的。国产模型各自为战,每家都有自己的 API 格式、定价策略、调用限制。开发者想从 Sora 迁移过来,得改代码、调参数、适配新接口,迁移成本不低。好在 8 月底有消息说几家头部厂商正在推统一的视频生成 API 标准,如果能落地,算是个好消息。
四、格局已定:视频生成从「炫技」进入「基础设施」阶段
我自己的判断是,2026 年 8 月会是 AI 视频生成的一个分水岭。
Sora 的退场标志着「demo 驱动」时代的结束。下一个阶段,AI 视频生成的核心竞争力不再是「谁的视频最惊艳」,而是「谁的工作流最完整、谁的推理成本最低、谁的 API 最好接」。
这个转向的底层逻辑是:视频生成正在从「AI 能力展示」变成「创作基础设施」。就像当年云计算从「能跑虚拟机」进化到「有完整的 PaaS 生态」一样,AI 视频生成也需要经历从单一模型到完整工具链的跃迁。
从技术投资的角度看,有三个方向值得关注:
一是视频-语言联合训练。当前视频模型的语义理解瓶颈,本质上是因为视频编码器和文本编码器的对齐不够好。CLIP 之后,视频-语言对齐的研究进展一直比较慢,这是绕不开的基础问题。
二是流式生成架构。现在的视频生成还是「先写好再播放」的范式,延迟高、交互差。如果能做到像 LLM 那样 token-by-token 流式输出,创作者就能在生成过程中实时调整,大幅降低迭代成本。
三是端侧视频生成加速。如果视频生成能塞进手机芯片,那消费级应用的空间就完全不一样了。目前 MiniMax 和字节都在往这个方向试,但距离实用还有一段距离。
五、结尾
Sora 从刷屏到退场,不到一年。这其实挺说明问题的——AI 行业最不缺的就是「惊艳的 demo」,缺的是「能跑通商业闭环的产品」。
9 月 24 日之后,Sora API 彻底下线。到时候国产视频模型能不能真正接住这波流量,看的不是谁榜单跑分更高,而是谁能让创作者真正「用起来」。
我最近在试几个国产视频模型的 API,想做一个视频生成工具链的横向对比。你有什么推荐或者踩过什么坑,欢迎评论区聊聊。