每个 token 只占 890 字节:DeepSeek 削掉的是 Agent 最贵的隐形账
DeepSeek V4.1 Flash 把每 token 的全局 KV 缓存压到 890 字节——相对上一代对 HBM 的需求降到 1/4,相对初代累计缩小 437 倍。文章拆解它怎么做到的(CSA2 的三种层模式 + FP4 训练期就压缩),以及论文里那个证明「4 比特够用」的论证。

先从一个让人犯迷糊的地方说起
DeepSeek V4.1 Flash 发布后,标题里出现过两个数:「KV 缓存暴降 437 倍」和「对 HBM 的需求降到 1/4」。
同一件事,两个数字差了整整两个数量级。到底是媒体乱写,还是自己看错了?
我去翻了 DeepSeek 官方原文,答案是:两个都对,但基准不同。
- 「与上一代模型相比,对 HBM 的需求减少到 1/4,对 SSD 的需求减少到 1/8」
- 「相对于初代模型,KV Cache 已经缩小了 437 倍」
一句话说清:1/4 是跟上一代比,437 倍是从初代算起。 大多数转述把这两句话并排放在标题里,读者自然以为在比同一件事。
而我认为最该被反复引用的,其实是官方给的另一个绝对值——每个 token 的全局 KV 缓存占用只有 890 字节。

专业分析
一、为什么这件事值得单独拎出来讲
KV 缓存是每一条对话、每一个并发请求都要在显存里占一块的东西。它决定了你一张卡能同时服务几个人、能撑多长的上下文。
DeepSeek 官方对它的定位说得很直白:
在 Agent 使用场景中,缓存命中的费用往往占比较高,对 KV Cache 的压缩大幅降低了 Agent 类任务的使用成本。
这就是关键。普通问答的上下文短、生命周期短,缓存压力可控;但 Agent 不一样——它要反复读工具定义、读文件、读历史轨迹,输入侧被反复重放,缓存长期驻留。Agent 跑得越久、上下文越复杂,这笔账越贵。
所以压缩 KV 缓存,省的不是"一次推理的电费",而是Agent 能不能长期跑得起的门票钱。
二、怎么压下来的:一个架构设计和一次精度赌博
按公开的技术说明,DeepSeek 这次是三条路一起走。
第一条:压缩稀疏注意力(CSA2)——让不同层别重复劳动。
这里的难点很实在:模型有很多层,每层都要检索上下文。如果每层都自己重算一遍缓存、重搜一遍索引,就是纯粹的重复劳动。但如果简单复用,又会出问题——每层需要的历史 token 其实不一样,缓存复用了、检索结果也跟着不变,不同层看到的上下文就完全一样了,模型表达能力会被削弱。
它的解法是给每层分配三种模式之一:
| 模式 | 干什么 |
|---|---|
| Full | 自己算缓存、自己搜索引 |
| Reindex | 复用前面层算好的缓存,但索引重新搜一遍 |
| Reuse | 缓存和索引全盘复用,什么都不算 |
既复用了计算,又保住了每层检索的差异性。 这是这次压缩在架构层面的主要来源。
第二条:从训练阶段就直接用 FP4 存全局缓存。
注意"从训练阶段"这四个字——不是推理时临时量化,而是模型一开始就按 4 比特的格式训练。每 16 个通道配一个 E4M3 缩放因子来兜住数值范围。
FP4 什么概念:每个数值只占 4 个比特,比传统的 16 比特少了四分之三。
三、4 比特会不会把模型变傻?论文里有个漂亮的论证
这是最该问的问题。精度砍到 4 比特,语言模型赖以工作的数值分辨率还剩多少?
技术报告里给了一段论证,思路很干净:
- 训练中最大的 RMSNorm 权重幅度大约为 1
- 归一化之后,512 通道的 KV 潜向量 L2 范数最多约等于 √512 ≈ 22.6
- RoPE 旋转保持范数不变,所以最大绝对值被限制在 22.6 左右(实测观测到的约 10)
- 而 FP4 的 E2M1 格式能表示的幅度上限是 448 × 6 = 2688
结论:表示范围远超实际需要的量级。
这段论证的价值不在于它证明了"绝对无损"——精度损失客观存在——而在于它说明了这个损失是被量级余量接住的,而不是靠运气。工程上能算清的取舍,才算真取舍。
四、代价在这里
必须说清楚:KV 缓存的压缩不是免费的。
- FP4 是从训练期开始的,意味着这套压缩没法简单地"打补丁"到已有模型上
- 缓存压缩得越狠,长上下文里"记住多少细节"就越考验注意力机制的检索质量——这也是为什么它要在索引复用上花那么多功夫
- 大规模自部署有门槛:官方明说了,需要 2k 卡 GPU + 存储集群才谈得上

关联信息与影响
第一,这条线和我们上周写的记忆赛道其实是同一个问题的两面。
我们对比过四个 Agent 记忆项目(cognee / hindsight / Memori / ai-memory),它们的核心指标是「取回记忆要花多少 token」——Memori 的 721 token/查询被当成优势来讲。DeepSeek 这次是从另一头解同一个问题:把每个 token 存在缓存里的成本压下去。 一个省"取"的量,一个省"存"的价。
对做 Agent 产品的团队来说,这两件事加起来才是完整的成本图。
第二,官方给出的下线动作说明他们自己押得很重。
- 模型名改为
deepseek-flash,旧名暂时路由到新模型 - 9 月 14 日 12:00 之后,
deepseek-v4-pro的请求全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费 - 峰谷定价:闲时价格是高峰的一半
- WorkBuddy(含 CodeBuddy)与 OpenCode 作为官方合作伙伴全量接入
主动把上一代旗舰路由到新模型,并降价——这不是常规迭代的节奏,是把资源集中押在一个结构上。
未来展望
短期,判断模型好不好用的坐标系会变。当缓存成本降到这个量级,"能不能跑长任务"的瓶颈会从显存移到别处——比如工具调用的稳定性、上下文管理的策略。
中期,这件事会推动缓存策略成为模型架构的一等公民。这一代是"层间复用索引、训练期就 FP4";下一代可能出现的,是让模型自己决定"这段上下文值不值得留在缓存里"。
长期看,推理成本曲线的下降会改变产品形态:很多今天因为"跑不起"而没做的东西(长期驻留的个人 Agent、常开的多 Agent 工作流)会在成本降到某个阈值后突然变得可行。这条曲线的拐点,通常不会提前公告。
信号强度
- 做 Agent 产品的团队:把「每 token 缓存成本」纳入成本模型,和「每次检索的 token 数」一起看——这是同一个账本的两端。
- 做推理部署的工程师:CSA2 的三种层模式(Full / Reindex / Reuse)是这轮最值得复现的设计,它解决的"复用但不削弱"是个通用问题。
- 关心模型选型的决策者:别只看基准分数。这次发布的实质是成本结构的改变,而成本结构决定哪些业务从"不划算"变成"可以做"。
- 普通用户:短期感受不到变化。但"闲时半价"这类定价已经在暗示——未来 AI 的价格里,时间会变成一个变量。
「437 倍」和「1/4」这两个都在传的数字,其实基准不同:437 倍是相对初代累计,1/4 是相对上一代——官方原文分得很清楚,媒体混着用。真正该盯的是那个绝对值:每 token 890 字节。在 Agent 场景里缓存命中费用占比很高,这一刀砍的是长期跑 Agent 最贵的那笔隐形账。
本文基于 AI 情报库收录的条目展开深析;事实性信息以原始报道为准,分析与展望为编辑观点。
原始报道:https://www.deepseek.com/news/deepseek-v4-1-flash/(DeepSeek)

