模型每调用一次工具,终端日志、搜索结果、代码修改和报错信息都会继续塞进上下文。任务跑得越久,重新读入历史的计算越多,KV Cache 也越大。100 万 token 能不能装下,反倒只是最先遇到的问题。后面还有显存、SSD、带宽,以及长会话恢复时的等待。
近日,DeepSeek 发布 V4.1 Flash,目标“更强、更快、更普惠”。主要处理三个问题:减少长输入的重复计算,压低历史状态的存储开销,再给 Agent 的思考长度加上一档可调预算。
V4.1 Flash 的参数规模比上一代 Flash 大得多,运行时全局缓存却只有后者的约四分之一。报告中的多项设计都围绕这个对聊天模型来说,长上下文意味着一次可以多放几份文档。到了 Agent 场景,它会变成一笔不断滚大的账。变化展开。对聊天模型来说,长上下文意味着一次可以多放几份文档。到了 Agent 场景,它会变成一笔不断滚大的账。
01 代码和 Agent 成绩
DeepSeek V4.1 Flash 是原生多模态 MoE 模型,语言主干有 40 层 Transformer。它包含 552B 主干参数和 196B Engram 条件记忆参数;处理输入时,每个 token 激活约 8B 参数,生成阶段约激活 16B。上下文长度仍是 100 万 token。
主要 Agent 成绩包括:Terminal-Bench 2.1 为 90.6,DeepSWE v1.1 为 74.2,CyberGym 为 88.1,Automation-Bench 为 54.8。
Terminal-Bench 把模型放进终端。它得先判断当前环境里有什么,再执行命令、处理失败,最后交出能通过验证的结果。DeepSWE 更接近真实的软件工程:问题散落在仓库的多个文件中,一处修改可能引出新的测试失败。CyberGym 面向网络安全任务,Automation-Bench 则把模型放进跨应用操作流程。
单轮写代码只是其中很小的一部分。一个仓库任务跑到第三十轮时,Agent 可能已经看过几十个文件,改过配置,装过依赖,还留下两段失败日志。此时真正难的是别把最初的验收条件忘掉,也别把刚刚排除的错误再查一遍。V4.1 Flash 的高分主要出现在这类连续任务上。
这些成绩显示,V4.1 Flash 的代码能力已经延伸到更复杂的多轮执行。和 V4-Flash 0731 相比,Terminal-Bench 2.1 从 82.7 升到 90.6,DeepSWE v1.1 从 54.4 升到 74.2;NL2Repo-Bench、CyberGym 和 Automation-Bench 也分别提高了 11.2、11.4 和 17.1 分。无论是修改完整仓库、操作终端,还是处理安全任务和跨应用流程,进步都很明显。
横向比较同样出色。Terminal-Bench 2.1 的 90.6 高于表中的 Claude Opus 5、GPT-5.6-Sol、GLM-5.3 和 Kimi K3;DeepSWE v1.1 的 74.2 略高于 Claude Opus 5 的 74.0;CyberGym、Automation-Bench 和 Agents’ Last Exam 也拿到了表中最高分。这组结果说明,V4.1 Flash 已经能够承担强度较高的代码与 Agent 任务,而且优势并不限于某一种任务形式。
换用不同的 Agent 框架,分数会有波动,但整体仍处在较高水平。报告中,DeepSWE 得分落在 65.5 到 74.2 之间,Terminal-Bench 2.1 落在 84.1 到 90.6 之间。模型本身提供了扎实的能力底座,系统提示词、工具接口和上下文管理则会决定这些能力最终能发挥到什么程度。
更困难的评测上,差距仍然明显。Terminal-Bench 4.0 中,V4.1 Flash 为 31.2, Opus 5 为 51.8;HLE 分别是 36.8 和 56.3。
02 这次更新为什么一直在谈 KV Cache
过去几代模型已经把长序列的注意力计算压低了不少。计算下降之后,原本没那么显眼的 KV Cache 开始卡住部署。
KV Cache 保存历史 token 的注意力状态。模型生成下一个 token 时,可以直接取用这些状态,不必从头再算。问题是,长会话一多,缓存会迅速占满高带宽显存。为了让 Agent 之后接着干,还要把部分缓存放进主机内存或 SSD;恢复任务时,再把它们搬回来。于是,同一份上下文会同时消耗显存容量、持久化存储和传输带宽。
工具调用会频繁触发预填充。新的观察结果经常会连同旧历史一起送入模型;如果前缀缓存没有命中,整段输入就得重新处理。上下文已经累积到几十万 token 时,这一步很贵。
DeepSeek 为此设计了 Causal Encoder-Decoder,简称 CED。40 层网络从中间切开,前 20 层是因果编码器,后 20 层是解码器。长输入先经过编码器;解码器需要的全局 KV,不再由每一层拿着完整输入重新生成,而是从编码器最后一层的隐藏状态投影出来。
局部信息的处理没有省掉。每一层仍有滑动窗口注意力,照看离当前 token 最近的内容。恢复解码器局部状态时,系统只重放最近 128 个 token,而不是让整段历史再走一遍后 20 层。输入远长于窗口时,CED 可以把预填充计算降到原来的近一半。
压缩后的全局分支负责较远的历史,滑动窗口保留近期内容的完整状态。刚返回的报错和上一条工具结果通常需要逐字处理,几百轮之前的信息只在相关时被调回。
V4.1 Flash 还把原来的 mHC 改成 Single-Pass mHC。mHC 负责深层网络里的信息混合,旧实现要经过四个内核;新版把过程合并,相应的 Mega-mHC 内核将激活内存流量减半。它解决的是内存读写次数,而非注意力计算本身。
03CSA2 怎么把每个 token 压到 890 字节
CSA2 负责减少缓存。V4.1 Flash 放弃了上一代 CSA 与 HCA 混合的全局注意力结构。除编码器最前面的两层只使用滑动窗口外,其余层的全局分支统一改用 CSA2。
CSA2 有 Full、Reindex 和 Reuse 三种模式。Full 层负责生成全局 KV、索引键和 Top-K 位置;Reindex 层沿用前面 Full 层的 KV,但根据本层查询重新排一次相关位置;Reuse 层更省,KV 和 Top-K 结果都直接复用。三种模式仍会计算各自的查询,并保留本层的滑动窗口 KV。
FULL
完整缓存与索引
负责生成全局 KV、索引键和 Top-K 位置
REINDEX
重排相关位置
沿用前面 Full 层的 KV,根据本层查询重新排序
REUSE
直接复用结果
KV 和 Top-K 结果都直接复用,尽可能减少重复工作
Full 层承担完整的缓存和索引计算,Reindex 层保留本层重新选择相关位置的机会,Reuse 层则尽可能减少重复工作。这样既不用给每层各存一套全局 KV,也没有强迫所有层使用完全相同的检索结果。
解码器里还有一层粗筛。第一个索引器先从完整历史中找出最多 16384 个候选位置,后续索引器只在这个候选池里打分,最后取 Top-512 送入注意力。这样既缩小搜索范围,又允许后面的层根据自己的问题改变选择。
缓存精度也降了。全局 KV 使用 FP4,局部滑动窗口仍为 FP8。跨层复用、稀疏检索和低精度存储叠在一起后,V4.1 Flash 的全局 KV Cache 为 890 字节/token。上一代 V4 Flash 是 3514 字节,前者大约只有后者的四分之一;如果和 2023 年的 DeepSeek V1 相比,已经缩小约 437 倍。
运行时缓存主要待在 HBM,跨请求保存的持久化缓存则更多落在 SSD 或主机内存。SWA Bounded Replay 不再把每一层的滑动窗口 KV 全部写进 SSD,而是在会话恢复时,用最近一个窗口近似重建。根据报告,这带来的性能损失很小,持久化 KV Cache 则降至 V4 Flash 的约八分之一。
同样的显存因此可以容纳更多长会话,缓存落盘和恢复时需要传输的数据也更少。Agent 进行几十次工具调用后,历史还在继续增长,但缓存成本不会再按原来的幅度上涨。
04 Engram 和DSpark 各管一件事
V4.1 Flash 有 196B Engram 参数。
MoE 负责从大量专家中选出少数参与当前计算,Engram 更像一块可查询的条件记忆。它使用二元、三元和四元 n-gram,再通过八组哈希头定位记忆条目。相关内容可以从主机侧提前取回,不需要让全部 Engram 参数随每个 token 一起激活。
某些常见搭配、实体关联和局部知识可以直接查找;需要结合上下文判断的部分,再交给神经网络计算。这样增加模型容量,算力不必跟着总参数一比一增长。查找本身仍会占用带宽,因此 Engram 表采用分片存储,并通过 RDMA 提前取回可能用到的条目。
DSpark 处理的是另一段等待:逐 token 解码。它并行起草多个后续位置,再交给主模型验证。候选足够可靠就一次接纳多个 token,不可靠则回到常规生成。置信度调度器会根据候选质量决定验证时机。
DSpark 不改变主模型的答案能力,只缩短生成等待。
05 Agent 后训练要先解决沙箱
V4.1 Flash 使用 45T token 的多模态语料进行预训练,文本与多模态数据约为 7:1。视觉信息从语言模型预训练阶段就进入同一条序列。
视觉编码器 DeepSeek-ViT 支持可变分辨率。图片经过 3×3 pixel-unshuffle 后,视觉 token 数量减少九倍,支持的输入分辨率可到约 1344×1344。模型可以读取网页、图表、软件界面和执行后的截图。完成操作后再检查环境的新状态,它才有机会发现按钮点错了,或者生成的页面已经溢出。
后训练依次经过 SFT、异步强化学习和 OPD。算法名称并不新鲜,真正花力气的是训练环境。DeepSeek 为此建设了 DSec 沙箱系统,让代码、终端和工具任务可以大规模执行和验证。系统采用定制调度器,目标规模达到数百万容器;在相近负载下,单个物理节点的并发容器数量从约 1000 个提高到 2500 个以上。
这类环境决定了 Agent 能学到什么。如果训练数据只有问题和标准答案,模型很难学会命令失败之后怎么改。沙箱会返回真实日志、测试结果和系统状态,模型的整条操作轨迹都能被判断。报告还提到,有些训练中的 Agent 会删掉关键二进制文件、破坏文件系统,甚至尝试利用环境漏洞。DSec 用 AppArmor 和基于 eBPF 的网络策略做隔离,环境被破坏则把本轮轨迹记为失败。Agent 后训练因此需要建设和维护大量可执行环境。
06 思考越久不一定越划算
V4.1 Flash 把 reasoning effort 作为强化学习的显式条件,取值范围为 1 到 100。API 目前分成 low、high 和 max 三档,分别对应 50、75 和 100。
从 effort 25 提高到 100,八项推理测试的平均 Pass@1 从 67.1% 上升到 76.3%;DeepSWE 从 66.0% 升至 74.2%;Terminal-Bench 2.1 从 82.4% 升至 90.6%。平均输出 token 同时增加到约 2.5 倍。
曲线前半段涨得快,后半段逐渐变平。effort 60 到 80 已拿到大部分准确率收益;从 80 继续拉到 100,Agent 轨迹会增长约 1.6 至 1.8 倍,分数只再上升一点。日常代码修改把预算开到 max,往往只是让模型想得更久。跨文件调试、复杂安全任务或者需要多次验证的工作,才更值得付这笔 token 成本。
调用方可以根据任务难度调整预算。同一个 Agent 流程也不必从头到尾使用一档设置:先用中档定位问题,遇到测试反复失败,再把关键步骤升到高档。
07 100 万上下文的边界
部署门槛仍然很高。V4.1 Flash 每个 token 会激活数十亿参数,权重体量达到数百 GB。即使采用混合精度,普通工作站也很难完整承载;如果还要跑到 100 万 token,上下文缓存和服务冗余也要占掉额外资源。
V4.1 Flash 能接收 100 万 token,不表示放在窗口里的每个细节都能稳定找回。基础模型在 LongBench V2 上得到 45.2,只比 V4 Flash 的 44.7 略高,低于 V4 Pro 的 51.5。CSA2 可能选错相关位置,SWA Bounded Replay 的近似重建也可能在极端输入下损失信息。
DeepSeek 同时下调了 V4.1 Flash 的 API 价格。每百万 token 的空闲时段价格为:缓存命中输入 0.02 元,未命中输入 1 元,输出 4 元;高峰时段分别为 0.04 元、2 元和 8 元。
Agent 一项任务可能调用几十轮,还会携带越来越长的历史。此时总费用取决于缓存命中、输出长度和失败重试次数,不能只看一次请求的单价。
预填充少算近一半,全局 KV Cache 降到 890 字节/token,持久化缓存也只有上一代的约八分之一。长任务因此可以少占一些显存和存储,会话恢复时需要搬运的数据也更少。不过,缓存压缩解决不了所有问题。V4.1 Flash 在高难任务上仍有差距,100 万 token 的窗口里也可能漏掉线索。它到底能省下多少成本,最后还要看完成一项真实任务需要调用多少轮、生成多少 token,又会失败重试几次。
08 模型下载
OpenCSG社区:
https://opencsg.com/models/deepseek-ai/DeepSeek-V4.1-Flash
Hugging Face社区:
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
09 OpenCSG vs 魔搭:如何选择?
模型部署在魔搭、OpenCSG 等模型社区中均可实现,但 OpenCSG/CSGHub 的核心在于,它不只是让模型"跑起来",而是进一步支持企业把模型、数据集、代码和应用等 AI 资产放到本地、内网或离线环境中统一管理。它解决的不只是"模型怎么部署、怎么调用"的问题,更是"模型进入企业后如何被安全管理、版本沉淀、权限控制和持续运营"的问题。
对于企业来说,CSGHub 可以帮助构建自己的私有模型资产中心,降低对外部平台的依赖;对于个人开发者来说,也可以用更系统的方式管理模型、实验项目和 AI 应用流程。相比更偏向模型发现、体验和使用入口的魔搭,CSGHub 更适合那些希望把 AI 能力真正沉淀下来,并长期维护、持续迭代的用户。
关于 OpenCSG
OpenCSG是全球领先的开源大模型社区平台,致力于打造开放、协同、可持续生态,AgenticOps 是人工智能领域的一种 AI 原生方法论,由 OpenCSG(开放传神)提出。AgenticOps是 Agentic AI 的最佳落地实践也是方法论。核心产品 CSGHub 提供模型、数据集、代码与 AI 应用的一站式托管、协作与共享服务,具备业界领先的模型资产管理能力,支持多角色协同和高效复用。