快速结论
报告重点是降低长上下文推理时的 KV Cache 显存占用:跨层复用 CSA2 与 FP4 KV Cache 将全局缓存压到论文所称约 890 字节/Token,滑动窗口机制进一步减少常驻缓存。它是 arXiv 技术报告,数字来自作者评测;不意味着任意模型或 API 用户都能得到相同比例的成本下降。
- 论文于 2026 年 9 月 17 日提交 arXiv,研究对象为 DeepSeek-V4.1-Flash 的推理架构。
- 作者报告采用 552B 参数 MoE 主干、每 Token 激活约 8B(预填充)或 16B(解码),上下文长度为 1M Token。
- CSA2 跨层复用与 FP4 KV Cache 组合后,论文报告全局 KV 占用约 890 字节/Token;SWA Bounded Replay 将持久缓存进一步压至约八分之一。
- 相关架构与压缩率是论文作者的模型与实现结果;未独立审计,也不能直接推导线上延迟、API 价格或所有上下文长度下的显存成本。
本次更新:依据 arXiv 摘要、论文正文和版本记录整理模型结构、KV 压缩机制与作者报告的指标,标注技术报告的证据边界。
核验时间:2026 年 10 月 2 日;arXiv 提交日期:9 月 17 日。DeepSeek-AI 发布《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》技术报告,讨论长上下文推理中的键值缓存(KV Cache)占用。报告提出跨层缓存复用、低精度缓存和滑动窗口管理的组合方案,并给出模型结构及内存指标。
一、报告研究的是什么
模型处理长上下文时,需要在生成过程中保留注意力计算所需的历史状态。KV Cache 会随上下文长度和并发请求增长,成为推理显存占用的重要部分。论文报告的 V4.1-Flash 使用 552B 参数的 MoE 主干,预填充阶段每 Token 激活约 8B 参数,解码阶段约 16B,并支持最长 1M Token 上下文。这些属于论文描述的模型配置。
二、三项缓存设计
- CSA2 跨层复用:报告通过跨层共享注意力状态减少重复存储,并以压缩映射和重建方式适配不同层的计算。
- FP4 KV Cache:以低位宽格式存储缓存,降低每个 Token 的内存开销;低精度实现需要配套量化、缩放和内核支持。
- SWA Bounded Replay:结合滑动窗口注意力与有限范围重放,控制持续保留的状态规模。
论文报告 CSA2 与 FP4 组合后,跨层全局 KV 占用约为每 Token 890 字节;SWA Bounded Replay 进一步将持久 KV 占用降到基准的约八分之一。不同策略适用于不同注意力路径,不能将单一压缩比例简单乘到任意服务的显存账单上。
三、对工程团队有什么参考
如果团队在做长上下文推理,可以把这份报告拆成三个评估问题:缓存精度降低后模型质量如何变化;跨层复用带来多少内存节约和额外计算;滑动窗口与回放对检索、长程推理及多轮会话有何影响。评测应同时报告峰值显存、Prefill/Decode 吞吐、首 Token 延迟、长文本任务质量和并发量。
四、适用边界
这是一篇 arXiv 技术报告,而非已确认经过同行评审的结论。论文中的架构和跑分由作者报告,依赖特定模型、内核和测试设置。它没有宣布 DeepSeek API 的模型 ID、价格或 SLA 变化,也不能据此断言其他模型部署能够复制相同压缩效果。
运营观察:这篇报告的看点在“模型结构与缓存实现协同设计”,而不是一个可直接套用的压缩百分比。基础设施团队可把它列入长上下文推理的架构参考,采用前仍需用目标模型与真实负载复测。
参考资料
本文依据以下资料整理,版本与接口信息请以来源页面的现行说明为准。