Paper Reading Notes · DeepSeek-AI Technical Report

DeepSeek-V4.1-Flash:把 KV Cache 压缩推向极限

一个 552B 骨干参数的多模态 MoE 模型:用 Causal Encoder-Decoder 让 prefill 只激活 8B 参数,用 CSA2 跨层 KV 复用 + FP4 量化把全局 KV Cache 压到每 token 890 字节,再用 SWA Bounded Replay 把持久缓存压到上代的 1/8——同时性能反超更大的 DeepSeek-V4-Flash。
作者:DeepSeek-AI(research@deepseek.com) 模型:HuggingFace Checkpoints 规模:55 页技术报告 · 12 图 · 5 表
KV Cache 压缩Causal Encoder-DecoderCSA2 稀疏注意力FP4 量化多模态 MoE1M 上下文Agentic RL
01 · Overview

速览:一页看懂 V4.1-Flash

长程智能体(long-horizon agent)的工作负载是"输入重"的:每次工具调用都带来大量 prefill 请求,数百万 token 的上下文要在 HBM、SSD 与主机内存之间搬运。DeepSeek-V4.1-Flash 的全部设计都围绕一个问题展开:在性能不倒退的前提下,把 KV Cache 的算力、存储、带宽三个成本同时压到最低

骨干参数 / 记忆参数
552B + 196BEngram 条件记忆模块
激活参数
Prefill 8B · Decode 16BCED 非对称激活
全局 KV Cache
890 字节/token约为 V4-Flash 的 1/4、V1 的 1/437
持久 KV Cache
≈ V4-Flash 的 1/8SWA Bounded Replay 换来的
上下文长度
1M tokens64K 起训,34T 处扩展
预训练数据
45T tokens多模态语料,文本:多模态 = 7:1

报告首页的两张图分别回答"性能如何"与"省了多少":

Figure 1: 智能体基准性能对比与各代模型每 token 全局 KV Cache 大小
Figure 1:(a) Performance of DeepSeek-V4.1-Flash and its counterparts on agentic benchmarks. (b) Global KV cache size per token (in bytes) across generations of DeepSeek models, highlighting DeepSeek's sustained efforts to reduce context memory requirements. DeepSeek-V4.1-Flash achieves approximately 4-fold and 437-fold reductions in per-token global KV cache size relative to DeepSeek-V4-Flash and DeepSeek-V1, respectively. 左图:在核心智能体基准上,V4.1-Flash(蓝)与闭源前沿模型同台竞技,多个项目领先;右图:从 V1 到 V4.1-Flash,每 token 全局 KV 一路压缩——V4.1-Flash 相比 V4-Flash 再降约 4 倍,相比 V1 累计压缩约 437 倍。注意纵轴是字节/token:890 字节意味着 1M 上下文的全局 KV 也只需约 0.9 GB 量级,长上下文部署的内存门槛被大幅拉低。

第二个关键收益是"计算恒定":得益于稀疏注意力与投机解码等设计,单 token 解码的计算量几乎不随上下文变长而增长:

Figure 2: 各代 DeepSeek 模型单 token 解码 FLOPs 与上下文长度的关系
Figure 2:Single-token Decode FLOPs versus context length across generations of DeepSeek models. We account for compute precision by weighting BF16, FP8, and FP4 operations by 1, 0.5, and 0.25, respectively. DeepSeek-V4.1-Flash maintains nearly constant Decode FLOPs as context length increases, substantially reducing the computational cost of long-context scenarios. 把 BF16/FP8/FP4 按 1/0.5/0.25 加权折算后,V4.1-Flash 的解码 FLOPs 曲线几乎水平:上下文从 4K 扩到 1M(256 倍),解码计算量只增加约 1/4。对比之下 V4-Flash 随上下文明显爬升。"每 token 成本不随对话变长而变贵",是智能体长程任务经济性的核心。

💡 点击任意图片可查看原始高清大图,再次点击或按 Esc 关闭。

小结:V4.1-Flash 的三大杠杆——①架构层:CED(Causal Encoder-Decoder)让 prefill 只跑一半层,激活参数从 16B 降到 8B;②缓存层:CSA2 跨层共享 KV + FP4 量化,全局 KV 压到 890 B/token;③部署层:SWA Bounded Replay 用少量重算换掉持久 SWA KV,持久缓存再除以 2。三层相乘,得到 1/4 与 1/8 两个数字。
02 · Background

背景与动机:算力、存储、带宽的三重瓶颈

智能体应用爆发后,模型的负载形态变了:一次任务要在数小时里反复调用工具,每一轮都携带越来越长的上下文。报告把部署成本拆成三笔账:

DeepSeek-V4 的注意力是"全局分支 + 每层滑动窗口(SWA)"的混合:全局分支维护全局 KV(主 KV + 索引器 K),SWA 维护局部 KV。窗口固定时 SWA 存储有界,序列足够长时全局 KV 主导运行时占用。既然 V4 已经把"算"压得足够低,"存"和"搬"就成了新的主瓶颈——这正是 V4.1-Flash 的发力点。

作者给了一个很清晰的概念重构:DeepSeek-V4 本质上是"SWA 局部处理骨干 + 压缩的全局上下文"。顺着这个视角,V4.1 的改造策略就是:保留局部 SWA 设计不动,集中简化全局分支。由此得到三个互相配合的设计——CSA2(跨层共享全局 KV 与索引)、FP4 全局 KV(减半存储)、SWA Bounded Replay(不持久化 SWA KV)。此外,模型从 V4 的 CSA+HCA 混合架构改为纯 CSA2,进一步简化。

为什么值得读:这份报告示范了一次"系统级"的压缩:不是单点算法,而是模型架构、缓存精度、部署策略三者联合优化,并且每一步都有明确的成本账(1/4、1/8、+1/4 FLOPs)与消融证据。对做长上下文推理 / 推理服务的工程师,这是目前最完整的一份参考设计。
03 · Architecture

架构总览:40 层 CED + 多模态通路

DeepSeek-V4.1-Flash 是一个多模态 MoE Transformer:图像与文本输入,自回归生成文本。语言骨干共 40 层因果 Transformer,组织成"20 层因果编码器 + 20 层解码器"的 CED 结构;除前两层只用 SWA 外,每层都同时有全局注意力与滑动窗口注意力(SWA)。视觉侧由 ViT 编码器 + MLP 投影器把图像转成视觉嵌入,与文本嵌入一起送入骨干——多模态数据从预训练第一天就参与训练。

Figure 3: DeepSeek-V4.1-Flash 总体架构图
Figure 3:Overall architecture of DeepSeek-V4.1-Flash. The 40-layer network is divided into a causal encoder and a decoder, each with 20 layers. All feed-forward layers use standard DeepSeekMoE. The first two encoder layers use sliding window attention (SWA); the rest use Compressed Sparse Attention 2 (CSA2), with CSA2(ratio, mode) specifying the compression ratio and mode. The model also uses Single-Pass mHC, Engram, DSpark, and a Hierarchical Sparse Indexer. 从下往上读:视觉/文本嵌入进入 20 层因果编码器——前 2 层纯 SWA,后 18 层 CSA2(压缩率 2),按"1 个 Full + 5 个 Reuse"分成 3 组;编码器隐状态一路向上,同时供解码器投影出全局 KV。右侧解码器 20 层全部 CSA2(压缩率 1):第一组"1 Full + 3 Reuse",其余四组"1 Reindex + 3 Reuse"。Engram 记忆模块放在第 1 与第 14 层,DSpark 负责投机解码,Single-Pass mHC 负责残差流混合——每个组件的位置都是为内存与流水线平衡专门安排的。

拆开看几个关键事实:

多模态架构:DeepSeek-ViT 与模态专属负载均衡

视觉通路 = ViT 编码器 + MLP 投影器。ViT 从零训练,为支持任意分辨率做了几处改造:用 2D-RoPE 替换绝对位置编码;patch 嵌入的卷积换成线性投影(兼容 Muon 优化器);RMSNorm + SwiGLU。视觉特征送入 LLM 前做 3×3 pixel-unshuffle,空间分辨率降低 9 倍,等效支持约 1344×1344 像素的输入。ViT 共 32 层、隐维 1024、16 个注意力头、patch 14;投影器 2 层、隐维 5120。

MoE 侧的一个细节设计:模态专属的无辅助损失负载均衡。图像 token 与文本 token 的表征分布不同,专家路由偏好也不同,混在一起做全局均衡会掩盖模态内部的失衡。因此模型为文本与图像分别维护一组专家级纠正偏置:路由时各模态用各自的偏置选专家,但加权仍用原始路由分数;每步训练后两组偏置按各自的负载独立更新。这个小改动让多模态训练更稳。

小结:架构图传达的核心信息是"分组与复用":编码器 3 组、解码器 5 组,每组只有 1 层做重活(Full/Reindex),其余层直接复用。后文可以看到,这种"少数层生产、多数层消费"的静态分配,是 KV 压缩与 kernel 数量骤减的共同来源。
04 · Core Methods

核心方法:CED 与 CSA2

CED:让 prefill 只算一半层

智能体工作流中频繁的工具调用会产生海量 prefill 请求,KV Cache 一旦未命中,prefill 成本便居高不下。CED 的思路继承自 YoCo("只缓存一次"):让上半层直接共享下半层生成的 KV。不同之处在于 CED 做了两项结构强化——同时提升 KV 的整体容量与 KV 生成的计算深度。

具体做法:全局注意力上,底部 $L/2$ 层作为因果编码器;解码器层($l > L/2$)的 KV 不再由本层隐状态 $H_l$ 生成,而是直接从第 $L/2$ 层(编码器最后一层)的隐状态 $H_{L/2}$ 用逐层投影得到:

$$C_l = H_{L/2} W_l^{KV}, \qquad Z_l = H_{L/2} W_l^{Z}, \qquad l > \frac{L}{2}$$

其中 $C_l$ 是 KV 条目,$Z_l$ 是对应的压缩权重。这样 prefill 阶段只需完整计算前一半层,上半层全局 KV 以极小的投影代价获得——每 token 激活参数因此从 decode 的 16B 降到 prefill 的 8B。对输入重的智能体负载,这是最直接的省钱。

SWA 则保持逐层计算:任意层 $l$ 的局部 K/V 仍来自本层隐状态 $H_l$。这保留了局部 KV 生成的计算深度,但代价是解码器需要一个 SWA replay 过程——prefill 时解码器 SWA KV 要额外处理 $n_{\text{win}} \times L/2$ 个 token。对"每轮 prompt 很短"的多轮交互,这笔开销不可忽略。为此引入 Decoder SWA Bounded Replay:只为 SWA 计算回放 prompt 的最后 $n_{\text{win}}$ 个 token(而非 $L \times n_{\text{win}}$)。

综合下来,当序列长度 $N \gg n_{\text{win}}$ 时:

$$O(NL) \;\to\; O\!\left(\frac{NL}{2} + n_{\text{win}} \times \frac{L}{2}\right) \approx O\!\left(\frac{NL}{2}\right)$$

prefill 总计算量近似减半。

CSA2:三个维度同时压缩

服务长上下文,要同时压 KV 存储与注意力计算。报告把已有手段归入三个"可乘"的维度:

已有工作的问题:只复用索引省不了主 KV 存储;全网共享路由限制性能;混合设计仍保留全注意力层——没有一种方法同时覆盖三个维度。CSA2 的答案就是三维度联合:跨层共享主 KV 与索引器 K,允许复用 Top-K 索引,并把"缓存共享"与"索引复用"解耦。相对 CSA 还有两处简化:去掉相邻压缩条目的重叠与绝对位置编码;索引器 K 直接从主 KV 投影得到(不再从隐状态单独压缩),实现与训练效率都更高。

Figure 4: CSA2 的三种工作模式
Figure 4:Three operating modes of CSA2. The modes differ in how they obtain main KV, indexer K, and Top-K indices. Green blocks indicate quantities computed in the current layer; yellow blocks indicate main KV and indexer K reused from the most recent Full Mode layer; while red blocks indicate Top-K indices reused from the most recent index-producing (Full or Reindex Mode) layer. All three modes compute main Q and SWA KV in the current layer. 三种模式的分工:绿色=本层现算,黄色=复用最近 Full 层的主 KV/索引器 K,红色=复用最近产索引层的 Top-K 索引。Full 模式全套自己算;Reindex 模式借别人的 KV、用自己的索引器 Q 重新打分选出新 Top-K;Reuse 模式连索引都直接借用,不做任何索引计算。三种模式都本层自算主 Q 与 SWA KV——"每层的查询永远是自己的",这保证了层间的表达差异。

三种模式的职责边界:

共享主 KV 与索引器 K 削减重复存储,复用 Top-K 索引省掉索引计算;Reindex 模式在保持缓存共享的同时允许各层选择不同条目。与 CED 组合时,解码器中 Full 模式层的全局 KV 由编码器最后一层隐状态投影而来,Reindex/Reuse 不变。

层级稀疏索引器:把深层索引成本变成常数

跨层索引复用减少了索引计算次数,但剩下的索引器仍要对整个因果可见上下文打分——超长上下文下这仍是计算瓶颈。层级稀疏索引器(Hierarchical Sparse Indexer)只在 CED 的解码器中使用,思路是:让浅层索引器的信息天然限制深层索引器的搜索域,不引入任何额外状态

Figure 5: 层级稀疏索引器的候选池机制
Figure 5:Hierarchical Sparse Indexer. Each square represents a position; green squares mark selected indices, and blue rectangles mark blocks selected based on their maximum indexer scores. The decoder's first CSA2 layer in Full mode selects its own Top-512 indices and builds a shared candidate pool from the selected blocks for subsequent layers. CSA2 layers in Reindex mode then select their Top-512 indices from this pool. 第一个 Full 层对全部可见位置打分,选出自用的 Top-512,同时按"块内最大索引分数"选出高分块,把块覆盖的位置收进一个共享候选池(绿色=最终选中的索引,蓝色=选中的块)。后续 Reindex 层只在候选池内打分、各自选 Top-512。配置上选 2,048 个块 × 每块 8 个位置 = 16,384 个候选位置——此后每个深层索引器的打分成本与上下文长度无关,变成常数。

机制细节:第一个 Full 层扫全量、选块建池;候选池比最终 Top-K 大得多(16,384 vs 512);后续 Reindex 层只在池内搜索、各自选出不同的最终条目,Reuse 层不索引。该机制是 训练感知(training-aware) 的:候选限制在训练与推理中同样施加,深层索引器在与推理一致的搜索域下被优化。每个 query 的深层索引成本从"随上下文线性"变为"常数"——代价仅是第一层保留一次全量扫描。

小结:CED 与 CSA2 是互补的一对:CED 砍掉解码器生成全局 KV 的计算(prefill 减半、激活 8B),CSA2 砍掉跨层重复的 KV 存储与索引计算(缓存共享 + 索引复用),层级索引器再砍掉超长上下文的索引扫描(线性 → 常数)。三者叠加上 FP4,才有了 890 字节/token 与近恒定的解码 FLOPs。
05 · Efficient Extensions

高效组件:mHC、Engram、DSpark、FP4 与优化器

Single-Pass mHC:把激活访存砍半

mHC 在相邻 Transformer 块之间维护 $n$ 条残差流,逐 token 系数 $A_l, B_l, C_l$ 由 $X_l$ 预测:

$$X_{l+1} = B_l X_l + C_l F_l(A_l X_l), \qquad (A_l, B_l, C_l) = \mathcal{H}(X_l)$$

理想情况下,两块之间的残差变换是一张 $(X_{l-1}, Y_{l-1}) \to (X_l, \hat{X}_l)$ 的单一映射,激活访存下界为 $(2n+2)d$。但 DeepSeek-V4 的三 kernel 实现实际产生 $(4n+4)d$——正好是下界的两倍。问题出在依赖:输入混合 $\hat{X}_l = A_l X_l$ 要等 $X_l$ 的全量规约完成、算出 $A_l$ 之后才能做,于是 $X_l$ 被读了第二遍。

Single-Pass mHC 的解法非常优雅:把输入混合系数挪一个块——每个块改用上一个块产出的混合系数:

$$X_{l+1} = B_l X_l + C_l F_l\!\left(A_{l-1} X_l\right)$$

依赖消失后,$X_l$ 的每个 tile 可以"边算输入混合、边累积系数预测所需的投影与平方和"。预训练仍用多 kernel 实现(只是换了系数来源);部署时把残差更新、输入混合、系数预测、pre-norm、FP8 转换全部融进单个 Mega-mHC kernel,激活访存降到 $(2n+2)d$,恰好达到下界,比原实现减半。经验上,这一"挪位"几乎不损失性能。

Engram:196B 参数的条件记忆

Engram 把"记忆"从计算里解耦出来:tokenizer 压缩、多头哈希、上下文感知门控、多分支整合。V4.1-Flash 的两处改动:去掉短因果卷积(收益配不上推理栈复杂度);嵌入表改用"动量更新 + Sinkhorn 平衡"优化(见下文)。配置:196B 参数均分到两个模块,置于第 1 与第 14 层(为流水线内存平衡);$N$-gram 阶数 {2,3,4},8 个哈希头,每阶嵌入总维 2048;每头索引约 16M 条目的表,表大小取不同质数;嵌入表与 K/V 投影均为 FP8。推理时因寻址确定性,嵌入可经后台 RDMA 从主机内存预取——第一个模块的预取与第一个 Transformer 块的计算重叠。

DSpark:置信度调度的投机解码

DSpark = 半自回归起草 + 置信度调度验证。起草器是 3 个 Transformer 块(128 token 滑窗),一次前向并行算出 5 个草稿位置的基础 logits,轻量 Markov 头建模草稿 token 间依赖;置信度头预测逐位置条件接受概率,进而估计前缀存活概率;调度器结合剖析得到的引擎吞吐曲线,按当前系统负载动态选择每个请求的验证长度,目标是最大化系统级 token 吞吐。与 DeepSeek-V3 的 MTP 不同,DSpark 在骨干预训练之后专门训练(骨干冻结),后训练期间与骨干一起继续训练但不回传梯度到骨干——使其始终跟随演化中的策略,同时加速在线服务与 RL/OPD 的 rollout 生成。

FP4 主 KV Cache:E2M1 + 每 16 通道一个 E4M3 scale

V4 已对索引器 Q/K 做 QAT 加速索引计算;V4.1 把 QAT 扩展到主 KV——注意这里 FP4 的目的是省存储而非加速矩阵乘:注意力计算前反量化,因此不依赖硬件原生 FP4 矩阵乘,跨平台兼容。格式选 OCP 标准的 MXFP4(尽管实验中其他格式精度更高):E2M1 数据格式,每 16 通道一个 E4M3 缩放因子;参照 NVFP4 但省去第二级全局缩放。可行性论证很漂亮:RMSNorm 后 512 通道 KV 潜在向量的 L2 范数至多 $\sqrt{512} \approx 22.6$(最大训练 RMSNorm 权重约 1,RoPE 保范数),而格式可表示的量级上限是 $448 \times 6 = 2688$,训练中实测最大幅度约 10——去掉全局 scale 没有可测的精度损失,却简化了缓存布局。实现细节:RoPE 之后量化(RoPE 前量化只有边际收益且增加解码开销);非 RoPE 与 RoPE 分量同格式;QAT 在后训练阶段引入;SWA KV 对量化敏感,保持 FP8。相比 V4 的 FP8 主 KV,存储再减半(HBM 与 SSD 皆然)。

优化器:head-wise Muon + Sinkhorn 平衡更新

基础配置延续 V4:AdamW 管归一化层与非矩阵参数;$\beta_1=0.9$、$\beta_2=0.95$、$\varepsilon=10^{-20}$、weight decay 0.1;Muon 管线性变换权重(含 Engram 投影与视觉-语言投影器),带动量 0.95、去耦 weight decay 与 Nesterov 动量,更新矩阵 RMS 重整为 0.18 以复用 AdamW 学习率。两处新设计:

Algorithm 1: 带 Sinkhorn 平衡的动量更新
Algorithm 1:Momentum update with Sinkhorn balancing. Nesterov momentum is followed by K alternating row/column normalizations (with near-zero rows masked for stability); the $\sqrt{n}$ factor converts unit row $\ell_2$ norm into unit row-wise RMS, and the learning rate is corrected by $\gamma$ to match the update magnitude of Adam. 整个流程与 Muon 完全同构,只是第 6-16 行把 Newton-Schulz 换成 K 步交替"行归一 / 列归一"。直觉:嵌入表的一行对应一个 token 索引(或 N-gram 身份),一列对应一个隐维特征,Sinkhorn 同时沿"token-特征"两个轴做 RMS 均衡——这恰好利用了大嵌入矩阵的轴结构。行范数低于阈值 $\tau \bar{\rho}$ 的行被置零以保数值稳定;$\sqrt{n}$ 把单位行 $\ell_2$ 范数换算成单位行 RMS;$\gamma = 0.18$ 校正等效学习率(与 Moonlight 的 0.2 接近)。

训练配置中 Sinkhorn 更新取 $K=11$、$\tau=10^{-3}$、$\varepsilon=10^{-20}$,动量与学习率校正因子与 Muon 一致;Engram 学习率放大 5 倍。作者也把 Sinkhorn 更新放进更大的版图里讨论(Adafactor、Adam-mini、SRON 等利用矩阵轴结构的优化器),更细致的对比留给未来工作。

小结:这一节的关键词是"访存与存储":mHC 单 kernel 化砍激活访存、Engram 用查表换计算、FP4 砍 KV 存储、Sinkhorn 砍优化器状态。它们的共同点是不追求"更多算力",而是让每字节的显存与带宽都物尽其用——与 CSA2 的精神一脉相承。
06 · Infrastructure

基础设施:训练与推理系统

V4.1-Flash 的架构收益要真正落地,训练与推理系统必须跟着架构一起改。报告的原则是:架构可以复杂,但 kernel 流要极致简洁

训练基础设施:三块拼图

① 多模态训练:分离式编码器与通信隐藏

视觉编码器先做对比学习、再接生成式下一 token 损失微调。对比阶段损失要跨数据并行秩全收集(all-gather)文本与视觉特征,通信量可观。关键观察:文本特征的梯度只依赖收集来的视觉特征(对称地,视觉特征梯度只依赖文本特征),于是两个 all-gather 可以完全藏进计算:

$$\text{Forward}(V) \to \text{Forward}(T) \parallel \text{AllGather}(V) \to \nabla\text{Text} \to \text{Backward}(T) \parallel \text{AllGather}(T) \to \nabla\text{Vision} \to \text{Backward}(V)$$

端到端并行上,采用分离式编码器设计:ViT 复制于 LLM 参数树之外,每步分三段执行——视觉编码器前向、LLM 前向/反向、视觉编码器反向——视觉负载被限制在首尾两段,LLM 段保持纯文本训练的并行策略。长序列多模态训练另有两组优化:均衡图像分片(每条序列的图像按负载均衡分给 CP 各秩、每图只读一次;判据只含每 token 量:当 $\rho < B_{\text{IO}}/(B_{\text{GPU}} C)$ 时加载总能藏进计算,与序列长度和集群规模无关)与增量图像传输(RL rollout 只传增量,解码与预处理结果缓存到分布式文件系统复用)。

② CSA2 的共享状态训练

共享注意力的层可能被切到不同流水线阶段,直接复用模块与"阶段内执行"的流水线调度不兼容。三个机制解决:

③ Engram 并行

嵌入表按行切分到专门的进程组(engram 并行度控制单卡显存与查询通信范围的权衡),优化器状态再按副本分片。嵌入预取在整个流水线阶段开始前发起;嵌入梯度在反向中缓冲、骨干反向结束后归位;两者都尽量与视觉编码器的前向/反向重叠。嵌入以 FP8 存取,检索值与缩放因子直接送进后续 GEMM。RL rollout 时嵌入表常驻 GPU,避免主机内存碎片导致的 OOM。

推理系统:少 kernel、EPD 分离与持久缓存重构

通过 kernel 融合(FlashMLA 的融合 RoPE-注意力-RoPE-转换 kernel、DeepGEMM 的 Mega-Gate/Mega-mHC/Mega-MoE、TileKernels、DeepSelect 的 TopK),绝大多数 Transformer 层——即工作在 Reuse 模式的 CSA2 层——prefill 只需 15 个 kernel、decode 只需 11 个。部署上采用 EPD 分离:视觉编码、prefill、解码独立扩缩并重叠执行。

持久 KV 缓存管理:把 SWA KV 请出 SSD

V4 部署里,SWA KV 占持久缓存近一半容量:全局 KV 与 SWA KV 独立管理、LRU 淘汰;SWA KV 只在 prompt 结尾与输出结尾两个点缓存,未压缩存储开销仍然可观,且留存 72 小时的长保留策略与 SWA "分钟级复用窗口"的访问模式根本不匹配——会话一结束就成死数据。V4 报告提出的 Zero SWA Caching 靠全量重算恢复,代价是 $L \times n_{\text{win}}$ token 的完整前向,生产上用不起。

V4.1 的修订一锤定音:

SWA Bounded Replay:一条策略,两处使用

SWA 依赖逐层累积,精确重构 $L$ 层的 SWA KV 需要回放 $L \times n_{\text{win}}$ 个 token。Bounded Replay 只回放最近 $n_{\text{win}}$ 个 token,并把 SWA 截断到回放段:从位置 $s$ 开始回放时,位置 $i$ 的 query 只关注 $\left[\max(s, i-W+1),\, i\right]$ 内的 SWA 键——接受近似状态。

小结:持久缓存 1/8 = 两个因子相乘:SWA KV 不再持久化(≈ 砍半)× 全局 KV 经架构与精度压缩到 1/4。而这一切的支点是 Bounded Replay 把"未命中"的代价从 $L \times n_{\text{win}}$ 降到 $n_{\text{win}}$——用一个可接受的近似,同时解锁了存储与计算两头的收益。
07 · Pre-Training

预训练:45T 多模态 token 与评测

数据构造:从"样本质量"到"语料整体互动"

文本侧,这一代数据管线的重心从"小规模实验反映的样本级质量"转向多样语料间的整体互动与信息增益:设计了跨模型参数与数据的 scaling ladder 指导大规模训练;过滤低信息增益的模型生成内容(弱模型输出、低质量机翻)——视为"隐性重复",长期训练会反噬;引入更多领域专家构建细粒度质量评估维度;补充新近开源仓库、commits、库与框架的代码,覆盖更广的语言与真实工程场景。

多模态侧的哲学是"原样清洗、拒绝大规模合成":原始网页天然富含多模态知识,优先清洗与原生利用。为此从 Common Crawl 重新引导爬取系统(原系统偏向文本);图文对按图文相关性阈值过滤、按图像语义去重;交错数据主要来自网页与 PDF,分阶段递进处理(先启发式过滤/去重/质量模型选高价值文档,再图感知过滤,最后用 SmolVLM 严格质量打分),被滤掉的文档部分经筛选重组回收为图文对;另配领域数据补细粒度视觉感知(grounding/pointing)、OCR 与长尾知识,以及图像-代码对和 computer-use 轨迹。最终语料按 7:1 的文本:多模态 token 比合并(重叠样本用多模态版本替换),超长文档确定性预切分,best-fit packing 把 padding 率压到 $10^{-4}$ 以内。

训练设置:从头稀疏、64K 起步

基座评测:1/3 参数打出 Pro 级表现

基座模型对比覆盖世界知识、语言理解与推理、代码与数学、长上下文、多模态五个维度:

Table 1: DeepSeek-V4-Flash-Base、V4-Pro-Base 与 V4.1-Flash-Base 全面对比
Table 1:Comparison among DeepSeek-V4-Flash-Base, DeepSeek-V4-Pro-Base, and DeepSeek-V4.1-Flash-Base. All models are evaluated in our internal framework and share the same evaluation setting. Scores with a gap not exceeding 0.3 are considered to be at the same level. The highest score in each row is in bold font, and the second is underlined. 三列分别是:V4-Flash-Base(13B 激活 / 284B 骨干)、V4-Pro-Base(49B / 1.6T)、V4.1-Flash-Base(8B·16B / 552B)。亮点:MMLU-Pro 74.1、BigCodeBench 60.6、HumanEval 79.4、GSM8K 93.0 均为三者最高或并列最高——V4.1-Flash-Base 以约 1/3 的总参数、1/4 的激活参数,知识与推理能力对齐 1.6T 的 V4-Pro-Base,并在代码/数学上反超。多模态一栏(MMMU-Pro 56.5、DocVQA 95.6、CVBench 77.9、RefCOCO-avg 86.0)为原生多模态训练的直接验证。

分项看:世界知识与语言理解上三者基本同档(MMLU-Pro 74.1 超过 Pro 的 73.5,BBH/BBEH/DROP 差距在 0.3-2.7 之间);代码与数学多项领先(BigCodeBench 60.6、HumanEval 79.4、GSM8K 93.0);MGSM 80.2 偏弱(低于 Flash 的 85.7 与 Pro 的 84.4)是少数退步项;LongBench-V2 45.2 与 Flash 持平、略低于 Pro 的 51.5。报告强调这些结果同时反映了数据管线质量的提升。

API 之外的"真本事"要看困惑度。团队用内部研发语料(内部文档、专有代码仓、学术材料)做了留出集 BPB(bits-per-byte,越低越好)测试:

Figure 6: 三个基座模型在内部留出集上的 BPB 对比
Figure 6:Bits-per-bytes (BPB) comparison of DeepSeek-V4-Flash-Base, DeepSeek-V4-Pro-Base and DeepSeek-V4.1-Flash-Base on our held-out evaluation sets. DeepSeek-V4.1-Flash-Base achieves lowest BPB on all tasks and demonstrates greater potential to serve as a strong base-model. 在全部内部留出任务上,V4.1-Flash-Base 的 BPB 一致最低——即对内部文档、代码与学术材料的"压缩能力"最强。留出集上 5%–10% 的提升,配合更小的参数规模,说明其作为基座的潜力不是跑分,而是真实的分布匹配能力。
小结:预训练的三个信号——①从头稀疏(64K,无稠密热身)训练全程稳定,说明稀疏注意力已经"可原生";②原生多模态没有拖累文本能力,反而在代码数学上有所助益;③参数效率:1/3 总参数 + 1/4 激活即对齐 Pro 基座。
08 · Post-Training

后训练:没有新算法,只有数据和规模的胜利

这一版后训练刻意不做算法创新:流程就是标准的 SFT → RL → 在策略蒸馏(OPD),没有任何超出 DeepSeek-V4 既有实践的修改。全部投入压在"训什么"而非"怎么优化"上——大规模自动化的任务合成与环境构造管线。作者的一句话结论很直白:在固定且平平无奇的优化流程下,数据与环境管线的规模、多样性、可验证性改进贡献了几乎全部收益;当前阶段,工程化数据管线的边际回报远大于算法新颖性

大规模智能体任务合成

每个任务被形式化为三元组 (问题, 环境, 验证系统),质量按"难度"(非平凡)与"正确性"(三要素无致命缺陷)两个维度评估,并以两者为奖励信号迭代训练模型自己构造更好的任务;任务每次进入新的 RL run,产生的轨迹又反过来成为质量复审的新证据。两条专用管线:

RL 规模化:算力与 scaffold 两个维度

在合成任务上做大规模异步 RL,沿"训练算力"与"scaffold 数量"两个维度扩展。rollout 执行解耦为 agent 沙箱 + worker 容器:沙箱跑 scaffold 与工具,worker 提供与 scaffold 无关的控制层(编排 rollout、把异构交互归一为统一轨迹 schema、与训练器通信),两者都跑在 DSec 上、位于可抢占 GPU 训练池之外;训练器抢占时 rollout 可卸载全状态后挂起、稍后恢复。跨 scaffold 的 RL run 之间用模型合并重新初始化,把不同优化路径上获得的改进叠加起来,继续接力扩展。

Figure 7: 编码智能体基准随 RL 训练规模的增长曲线
Figure 7:Performance improves on various code agent benchmarks as RL training scales in the Minimal mode of DeepSeek Harness. Further extending maximal context length to 1M tokens continues to improve performance on extremely long-horizon tasks, e.g., Terminal-Bench v3.0. 四个面板分别是 DeepSWE v1.1、SWE-Bench Pro、Terminal-Bench v2.1 与 v3.0(no-gpu):实线 Pass@1 随累积 RL 步数单调爬升,虚线是输出 token 数。曲线的"断段"对应模型合并后重新初始化的接力 run——合并后性能继续上行。最值得注意的是右下角:上下文上限从 512K 提到 1M 后,Terminal-Bench v3.0 这类超长程任务还能再涨一截——上下文长度本身成了 RL 规模化的一部分。
Figure 8: 多版本 Claude Code 与异构 scaffold 联合 RL 的效果
Figure 8:Performance improves with cumulative RL steps when jointly training across multiple versions of Claude Code (left) and across heterogeneous scaffolds, including OpenCode, Pi, and DeepSeek Harness in Standard and PTC modes (right). Performance is evaluated on DeepSWE v1.1. Lighter curves show the evaluation of individual scaffold versions or scaffolds. 左:跨多个 Claude Code 版本联合训练,平均 Pass@1 稳步上升;右:跨 OpenCode、Pi、DeepSeek Harness(Standard/PTC)等异构 scaffold 联合训练同样有效。浅色细线是各 scaffold 单独的评测——联合训练没有牺牲任何单一 scaffold,反而整体抬升。这直接解释了后文 Table 4 里跨 scaffold 的稳健性。

DSec:百万级沙箱的弹性算力平台

从 V3 到 V4,智能体训练环境数量与多样性暴涨,催生了 DeepSeek Elastic Compute(DSec)——生产级沙箱平台。V4.1 的需求进一步升到数百万并发沙箱实例,瓶颈转向数据中心可扩展性、负载隔离、单节点算力密度,以及越来越强的 agent 的"作恶遏制":

可控推理努力:一个标量控制成本-质量前沿

除架构与硬件外,输出 token 数是服务成本的另一决定因素。V4.1 在 RL 中引入标量努力级别 $b \in \{1,\dots,100\}$,作为显式条件信号注入系统提示("Reasoning Effort: {effort},更高值要求更彻底的推理"),对单轮推理与多轮智能体任务同样生效。训练时每个 prompt 在各努力级采样 $M_b$ 条回复,同一 $(x, b)$ 组内做组相对优势(不同努力级之间不直接比较);努力依赖的行为由奖励中的长度项诱导:

$$r^{\text{len}}_{b,j} = -\min\!\left(C_{\max},\; k(b)\,\frac{\ell_{b,j}}{L_{\text{norm}}}\right), \qquad k(b) = k_0 \exp\!\left(-\frac{b - b_{\min}}{\tau}\right), \qquad \tau = \lambda \Delta b$$

$\ell_{b,j}$ 是推理 token 数,$L_{\text{norm}}$ 是参考长度,$C_{\max}$ 封顶扣减;惩罚系数随努力指数衰减——$b$ 每增加 $\tau$,系数乘以 $e^{-1}$。$k_0$ 控制整体"催短"压力,$\tau$ 越小各努力级的行为差异越大。附录 C 给出指数参数化的边际效用推导:若解题概率的边际收益近似指数衰减 $p'_x(\ell) \approx a_x e^{-\ell/s_x}$,则最优推理长度对 $b$ 近似仿射:

$$\ell_x^*(b) \approx C_x - s_x \log k_0 + \frac{s_x}{\tau}\,(b - b_{\min})$$

部署时,$b$ 成为单个 checkpoint 上连续调节"推理强度"的旋钮,可取训练中未出现的中间值实现插值行为。2026 年 9 月上线的公开 API 暴露三档预设:

Table 2: API 推理努力档位与标量值的映射
Table 2:Mapping between the public API reasoning-effort tiers and the underlying scalar effort values $b$. max / high / low 三档分别映射 $b = 100 / 75 / 50$。用户选择的是"学到的成本-质量前沿上的工作点",模型权重与解码配置完全不变——同一份 checkpoint,三种性格。

异步后训练基础设施

rollout 阶段的"长尾问题"(个别样本拖整批)是 RL 训练效率的顽疾。V4.1 把后训练基础设施全面异步化,几乎覆盖所有 RL 与 OPD 任务:

评测:对齐闭源前沿的智能体能力

后训练评测聚焦推理与智能体(知识类主要由预训练决定,见 Table 1)。推理用 GPQA Diamond、HLE、Codeforces(内部基准)、MathArena Apex(temperature/top-p 均为 1.0);智能体分四类:代码智能体、网络安全、通用智能体、视觉智能体。为防 reward hacking:断网、剥离 Git 历史、自动清理各类构建/包缓存——即便如此仍观察到漏洞挖掘式行为(如反编译 Ubuntu 核心包找 CyberGym 的漏洞),作者借此呼吁社区在设计下一代基准时优先考虑检测与缓解。

Table 3: DeepSeek-V4.1-Flash 与闭源/开源模型的全面对比
Table 3:Comparison between DeepSeek-V4.1-Flash with closed/open source models. † denotes text-only subset of HLE. The best results are highlighted in bold; the second-best results are underlined. 七列对比:Opus-5、GPT-5.6 Sol、Kimi-K3、GLM-5.3、DS-V4-Pro、DS-V4-Flash 与 V4.1-Flash。V4.1-Flash 拿下多个第一:Terminal-Bench 2.1 90.6、DeepSWE v1.1 74.2(超过 Opus-5 的 74.0 与 GPT-5.6 Sol 的 73.0)、CyberGym 88.1、SEC-Bench Pro 62.8、AutomationBench 54.8、Agents' Last Exam 31.8、HLE w/ tools 63.9;Codeforces 3471 同时超过 V4-Pro(3348)与 V4-Flash(3289);MathArena Apex 65.6 与 Kimi-K3 并列开源最高。相对 V4-Flash 几乎全线大幅跃升(DeepSWE 54.4→74.2、TB3.0 7.6→30.0、SEC-Bench 30.9→62.8)。盲区也很诚实:TB4.0 31.2 距 Opus-5 的 51.8 仍有差距——专家级科学向任务仍是巨模型的领地;HLE 36.8 也明显低于 Opus-5 的 56.3。

网络安全任务上 V4.1-Flash 创下开源新纪录,报告也明确提醒这是双刃剑,呼吁仅用于防御性安全研究与漏洞修复等负责任用途。视觉智能体(Chartography 78.9、BabyVision 89.6、ZeroBench 49.0)超过开源最强对手 Kimi-K3,但与闭源第一梯队仍有可测差距。

推理努力:一条平滑的成本-质量曲线

Figure 9: 性能与输出长度随推理努力的变化
Figure 9:Performance and output length as a function of reasoning effort. Each panel plots Pass@1 (solid, left axis) and mean output tokens per response (dashed, right axis) as the reasoning-effort value is varied from 25 to 100; The results of reasoning-intensive benchmarks are averaged over eight benchmarks (AIME 2026, Apex 2025 Shortlist, GPQA Diamond, HLE, IMO-AnswerBench, LiveCodeBench, MathArena-Apex, SimpleQA-Verified). DeepSWE v1.1 is evaluated based on mini-SWE and Terminal-Bench v2.1 is evaluated based on DeepSeek Harness (Minimal). 努力从 25 提到 100:八项推理基准平均 Pass@1 从 67.1% 升至 76.3%,DeepSWE v1.1 从 66.0% 到 74.2%,TB2.1 从 82.4% 到 90.6%,代价约 2.5× 输出 token。收益前置:60-80 区间已用不到一半的 token 预算恢复 max 档绝大部分精度,最后冲到 100 只换来边际提升、轨迹却要拉长 1.6-1.8×。单轮推理学到的努力控制还能无损迁移到多轮智能体轨迹——控制的是跨轮次的探索与验证总量。

跨 scaffold 稳健性:不挑环境的能力

真实部署中模型不会绑定单一 agent 框架。评测覆盖 6 个 scaffold 家族的 8 种配置(Claude Code、Codex、OpenCode、Pi、mini-SWE、DeepSeek Harness 的 Minimal/Standard/PTC 模式),只换 harness、不换模型与解码配置:

Table 4: Max 推理努力下各 agent scaffold 的表现
Table 4:Performance across agent scaffolds at Max reasoning effort. DeepSWE v1.1 上八种配置 65.5–74.2、TB2.1 上 84.1–90.6——极差不到 9 个点,且自家 mini-SWE / DeepSeek Harness 也不总是最高(Claude Code 在 TB2.1 达 88.0)。能力随 scaffold 平滑迁移而非绑定某家框架,这要归功于训练数据里环境、工具 schema 与交互格式的多样性。注:DeepSWE 用 N=8 采样、TB2.1 用 N=3;Linux 容器、temperature 1.0、top-p 0.95、1M 上下文、每 agent max_steps=500;TB2.1 断网评测;Claude Code 列报 v2.1.251,四个版本的明细见下方 Table 5。
Table 5: Claude Code 四个版本在 Max 推理努力下的表现
Table 5:Performance across Claude Code versions at Max reasoning effort. 附录补充:四个 Claude Code 版本(v2.1.105/238/251/259)上 DeepSWE 68.4–69.8(平均 68.9)、TB2.1 87.3–88.4(平均 87.8)——版本间波动不到 1.5 个点。Table 4 报 251 版并非挑了最好的一列,跨版本表现稳定。

多智能体:Agent Team 模式的初步实验

用 DeepSeek Harness 的 Agent Team 模式探索多智能体协作:lead agent 可经 spawn_teammate 异步创建命名持久队友(新开模式不带 lead 历史,或 fork 模式带一次 lead 已完成轮次的快照);共享同一仓库检出,编辑即时互见;经持久 peer 邮箱通信(消息在队友下一步边界送达/唤醒);任务板维护所有权、依赖与建议写入范围(更新带修订检查);必要时仅 lead 可 interrupt_agent 打断队友。训练奖励 = 任务表现 + 鼓励委派与通信的协作加分 + 派生延迟惩罚:把执行事件及其协作依赖表示为 DAG,按固定 prefill/decode 速率折算 token 成本加实测工具执行时间,取关键路径长度——奖励有用的并行、惩罚不必要的串行与同步,且对服务端批处理/排队的延迟不敏感。

评测用 ProgramBench 高置信子集(只留参考解在隐藏测试上 ≥95% 通过的 172 个"golden"任务)与 FrontierSWE v2 的 no-GPU 子集:

Figure 10: 单智能体与多智能体配置的测试时算力扩展
Figure 10:Test-time compute scaling for single-agent and multi-agent configurations on ProgramBench (Almost@1) and FrontierSWE v2 (Mean@5) as functions of the per-rollout wall-clock deadline. 横轴是每次 rollout 的墙上时间截止(对数尺度)。ProgramBench:多智能体 Almost@1 从 1 小时的 13.59% 爬到 8 小时的 30.04%,单智能体同期只有 12.79%→20.39%;FrontierSWE v2:多智能体 13.50%@1h → 32.90%@20h,单智能体 10.50%→28.20%。每个截止时间点多智能体都赢,而且时限越宽差距越大——协作的价值随可用算力放大。报告坦承这是初步实验:比较的是各自最强的配置。

附录补充:努力控制在各 scaffold 与各基准上的细粒度行为

Figure 11: 推理努力在三种编码 scaffold 上对轨迹长度与准确率的影响
Figure 11:Reasoning effort drives trajectory length consistently but correlates only weakly with accuracy across coding scaffolds. Each panel plots Pass@1 (%, solid, left axis) and mean output tokens per trajectory (k, dashed, right axis) against the reasoning-effort setting, for DeepSWE v1.1 (top row) and Terminal-Bench v2.1 (bottom row) under three agent scaffolds: Claude Code, DeepSeek Harness (Minimal) and mini-SWE. All panels come from the same checkpoint. 六个面板(上排 DeepSWE、下排 TB2.1 × 三种 scaffold)一致显示:轨迹长度随努力单调增长,Pass@1 总体上升但非单调(中段有平台与回落);三种 scaffold 校准不同——DeepSWE 上 Claude Code 曲线最平、token 花得最省,DSH(Minimal)起点最低但涨幅最大;TB2.1 上三者挤在窄带里。同一 checkpoint,行为随 scaffold 有可观差异:scaffold 的选择在任务接近饱和时与努力档位同样重要。
Figure 12: 八项推理密集基准上性能与输出长度随努力的变化
Figure 12:Performance and output length as a function of reasoning effort on eight reasoning-intensive benchmarks. Each panel plots Pass@1 (solid, left axis) and mean output tokens per response (dashed, right axis) as the reasoning-effort value is varied from 25 to 100. 八个基准(AIME 2026、Apex 2025 Shortlist、GPQA Diamond、HLE-Text、IMO-AnswerBench、LiveCodeBench、MathArena Apex 2025、SimpleQA-Verified)全部行为良好:长度随努力均匀放大 2.0–3.1×(AIME 4.6k→11.4k,MathArena Apex 29.1k→86.1k,开销可预估),精度无一例随努力上升而下降——MathArena Apex 2025 大涨 +40.3(25.3%→65.6%),AIME 2026 在 effort 100 达到满分 100%,已饱和的基准保持稳定(GPQA +1.3、LiveCodeBench +2.6)。一个可靠、可预测的旋钮,让每种部署按延迟与算力预算选档而不牺牲精度。
小结:后训练部分最重要的信息量不在模型,而在方法论:①固定算法、把资源全押在可验证数据与环境的规模化生产上,收益就够大;②异步化 + 样本级调度 + token 级中断把 RL 基建的长尾与抢占问题系统性解决;③标量努力把"测试时算力分配"变成一个连续、可插值、跨 scaffold 有效的产品级接口;④多智能体在最难的仓库级任务上明确兑现了"1+1>2",且随时间预算放大。
Glossary

术语速查

阅读中遇到缩写,可随时回到这里;正文里带虚线下划线的缩写悬停即可见释义。

阅读术语表(正文中带虚线下划线的缩写悬停可见)
缩写全称一句话解释
MoEMixture-of-Experts混合专家:每 token 只激活少量专家,总参数大而激活参数小
CEDCausal Encoder-Decoder因果编码器-解码器:下半层当编码器,上半层 KV 由编码器终态投影,prefill 计算减半
CSA2Compressed Sparse Attention 2第二代压缩稀疏注意力:跨层共享主 KV/索引器 K,并复用 Top-K 索引,分 Full/Reindex/Reuse 三模式
SWASliding-Window Attention滑动窗口注意力:每层只看最近 n_win=128 个 token,存储有界
KV CacheKey-Value Cache注意力的键值缓存:长上下文部署的核心内存开销
MLA / GQAMulti-head Latent / Grouped-Query Attention条目维压缩的两条路线:跨头共享潜在向量 / 减少 KV 头数
HSIHierarchical Sparse Indexer层级稀疏索引器:解码器首个 Full 层建 16,384 位置候选池,深层索引成本变常数
mHCManifold-constrained Hyper-Connections多残差流混合;Single-Pass 版把混合系数挪前一块,单 kernel 达访存下界
QATQuantization-Aware Training量化感知训练:训练中模拟量化,保住低精度(FP4/FP8)下的精度
MXFP4Microscaling FP4 (OCP)OCP 标准的块缩放 FP4 格式;本文用 E2M1 + 每 16 通道 E4M3 缩放
EPDEncoder-Prefill-Decode推理部署三分离:视觉编码、预填充、解码独立扩缩与重叠
SWA Bounded Replay只回放最近 n_win 个 token 近似重建 SWA KV,免持久化 SWA、prefill 再减半
DSecDeepSeek Elastic Compute百万级并发沙箱平台:分片 + 放松一致性调度 + 高密度 NUMA 隔离
OPDOn-Policy Distillation在策略蒸馏:学生对自己采样、教师给全词表监督,后训练末段
SFT / RLSupervised Fine-Tuning / Reinforcement Learning后训练标准两段:监督微调 + 强化学习
DSHDeepSeek HarnessDeepSeek 自家 agent 框架,有 Minimal/Standard/PTC/Agent Team 等模式
BPBBits-Per-Byte逐字节比特数(困惑度换算),越低对语料压缩越好
HLE / ALEHumanity's Last Exam / Agents' Last Exam两个"最后考试"基准:人类知识极限 / 智能体能力极限
10 · Commentary

点评与展望

论文自己的结论与坦白的局限

作者总结:V4.1-Flash 通过架构、缓存精度、部署策略的联合优化,把 KV Cache 压缩推向新极限——全局 KV 890 字节/token(≈ V4-Flash 的 1/4),持久缓存 ≈ 1/8;激活 footprint 远小于 GLM-5.3、Kimi-K3 等开源同行,而在关键基准上可比甚至更优。局限也写得清楚:

编者点评

这份报告最值得学的是"账本思维"。每个设计都对应一笔可验证的账:CED → prefill 减半(8B 激活);CSA2 + FP4 → 全局 KV 1/4;Bounded Replay → 持久 KV 1/8、代价是 $n_{\text{win}}$ token 的重算;mHC → 激活访存 $(4n+4)d \to (2n+2)d$;Sinkhorn → 优化器状态只剩动量缓冲。很少见到把"每 token 每字节"的工程账算到这个颗粒度、且每笔都给出实验背书的技术报告。

其次是对"近似"的务实态度。Bounded Replay 在数学上不严格——重建的 SWA KV 与精确版本不逐位一致——但作者用三道保险把风险关住:实验证明质量损失可忽略、后训练中模拟同样的回放做训练感知适应、以及持续的压力测试计划。系统设计里"可接受的近似 + 明确的边界刻画"比"处处严格"更可扩展。

第三是后训练的"反炼金"宣言。SFT→RL→OPD 一字未改,全部收益来自可验证任务与环境的工业化生产。加上 DSec、异步 rollout、样本级调度这些"无聊但关键"的基建,这份数据管线 + 基建的组合拳,可能比任何单一算法创新都更接近"持续扩展 RL"的真实路径。附录 C 用边际效用推导给指数惩罚一个理论动机,更是罕见的"工程配置配数学解释"的写法。

保留意见:① MGSM(80.2,低于上代 Flash 的 85.7)与 LongBench-V2 的表现提示压缩仍有代价,多语数学推理与超长文档理解的退化边界值得社区独立复测;② HLE 36.8 vs Opus-5 56.3 的差距说明"日常任务够用"与"前沿推理"是两回事——报告自己也承认了这一点,这个诚实值得肯定;③ CSA2 的静态模式分配(哪些层 Full/Reindex/Reuse)是手工设计的,能否学习化、能否随负载动态切换,是显然的后续空间;④ 多智能体结果来自"最强配置 vs 最强基线"的初步比较,结论强度有限,但方向已足够诱人。

一句话总结:DeepSeek-V4.1-Flash 是"把 KV Cache 当第一公民"的完整答案——架构(CED+CSA2)、精度(FP4)、部署(Bounded Replay+EPD)三层联动,用 552B/8B·16B 的规格打出 1.6T 级基座的对齐表现与开源最强的智能体成绩;而它的后训练章节则悄悄宣告:当下 RL 的胜负手在数据与环境工厂,不在算法。