深信号· DEEPSIGNAL
深信号· DEEPSIGNALRSS
SIGNAL DEEP-DIVE

每个 token 只占 890 字节:DeepSeek 削掉的是 Agent 最贵的隐形账

2026-09-11·DeepSeek·模型推理DeepSeekKV CacheFP4CSA2Agent 成本
▮ SIGNAL SUMMARY · 摘要快读

DeepSeek V4.1 Flash 把每 token 的全局 KV 缓存压到 890 字节——相对上一代对 HBM 的需求降到 1/4,相对初代累计缩小 437 倍。文章拆解它怎么做到的(CSA2 的三种层模式 + FP4 训练期就压缩),以及论文里那个证明「4 比特够用」的论证。

每个 token 只占 890 字节:DeepSeek 削掉的是 Agent 最贵的隐形账

先从一个让人犯迷糊的地方说起

DeepSeek V4.1 Flash 发布后,标题里出现过两个数:「KV 缓存暴降 437 倍」和「对 HBM 的需求降到 1/4」。

同一件事,两个数字差了整整两个数量级。到底是媒体乱写,还是自己看错了?

我去翻了 DeepSeek 官方原文,答案是:两个都对,但基准不同。

一句话说清:1/4 是跟上一代比,437 倍是从初代算起。 大多数转述把这两句话并排放在标题里,读者自然以为在比同一件事。

而我认为最该被反复引用的,其实是官方给的另一个绝对值——每个 token 的全局 KV 缓存占用只有 890 字节。

一长排整齐的浅色存储方块从近延伸到远处,越往远处方块越薄越紧凑,末端几乎聚成一条线
缓存压缩不是「快一点」,是「能不能塞得下」。

专业分析

一、为什么这件事值得单独拎出来讲

KV 缓存是每一条对话、每一个并发请求都要在显存里占一块的东西。它决定了你一张卡能同时服务几个人、能撑多长的上下文。

DeepSeek 官方对它的定位说得很直白:

Agent 使用场景中,缓存命中的费用往往占比较高,对 KV Cache 的压缩大幅降低了 Agent 类任务的使用成本。

这就是关键。普通问答的上下文短、生命周期短,缓存压力可控;但 Agent 不一样——它要反复读工具定义、读文件、读历史轨迹,输入侧被反复重放,缓存长期驻留。Agent 跑得越久、上下文越复杂,这笔账越贵。

所以压缩 KV 缓存,省的不是"一次推理的电费",而是Agent 能不能长期跑得起的门票钱

二、怎么压下来的:一个架构设计和一次精度赌博

按公开的技术说明,DeepSeek 这次是三条路一起走。

第一条:压缩稀疏注意力(CSA2)——让不同层别重复劳动。

这里的难点很实在:模型有很多层,每层都要检索上下文。如果每层都自己重算一遍缓存、重搜一遍索引,就是纯粹的重复劳动。但如果简单复用,又会出问题——每层需要的历史 token 其实不一样,缓存复用了、检索结果也跟着不变,不同层看到的上下文就完全一样了,模型表达能力会被削弱。

它的解法是给每层分配三种模式之一:

模式干什么
Full自己算缓存、自己搜索引
Reindex复用前面层算好的缓存,但索引重新搜一遍
Reuse缓存和索引全盘复用,什么都不算

既复用了计算,又保住了每层检索的差异性。 这是这次压缩在架构层面的主要来源。

第二条:从训练阶段就直接用 FP4 存全局缓存。

注意"从训练阶段"这四个字——不是推理时临时量化,而是模型一开始就按 4 比特的格式训练。每 16 个通道配一个 E4M3 缩放因子来兜住数值范围。

FP4 什么概念:每个数值只占 4 个比特,比传统的 16 比特少了四分之三

三、4 比特会不会把模型变傻?论文里有个漂亮的论证

这是最该问的问题。精度砍到 4 比特,语言模型赖以工作的数值分辨率还剩多少?

技术报告里给了一段论证,思路很干净:

  1. 训练中最大的 RMSNorm 权重幅度大约为 1
  2. 归一化之后,512 通道的 KV 潜向量 L2 范数最多约等于 √512 ≈ 22.6
  3. RoPE 旋转保持范数不变,所以最大绝对值被限制在 22.6 左右(实测观测到的约 10)
  4. 而 FP4 的 E2M1 格式能表示的幅度上限是 448 × 6 = 2688

结论:表示范围远超实际需要的量级。

这段论证的价值不在于它证明了"绝对无损"——精度损失客观存在——而在于它说明了这个损失是被量级余量接住的,而不是靠运气。工程上能算清的取舍,才算真取舍。

四、代价在这里

必须说清楚:KV 缓存的压缩不是免费的。

两块相邻的硅片在放大镜下对比:一块内部结构密集厚重,另一块被压缩成极薄的精密层叠,光从侧面穿过
从 16 比特到 4 比特,省下的不是空间,是账本。

关联信息与影响

第一,这条线和我们上周写的记忆赛道其实是同一个问题的两面。

我们对比过四个 Agent 记忆项目(cognee / hindsight / Memori / ai-memory),它们的核心指标是「取回记忆要花多少 token」——Memori 的 721 token/查询被当成优势来讲。DeepSeek 这次是从另一头解同一个问题:把每个 token 存在缓存里的成本压下去。 一个省"取"的量,一个省"存"的价。

对做 Agent 产品的团队来说,这两件事加起来才是完整的成本图。

第二,官方给出的下线动作说明他们自己押得很重。

主动把上一代旗舰路由到新模型,并降价——这不是常规迭代的节奏,是把资源集中押在一个结构上。

未来展望

短期,判断模型好不好用的坐标系会变。当缓存成本降到这个量级,"能不能跑长任务"的瓶颈会从显存移到别处——比如工具调用的稳定性、上下文管理的策略。

中期,这件事会推动缓存策略成为模型架构的一等公民。这一代是"层间复用索引、训练期就 FP4";下一代可能出现的,是让模型自己决定"这段上下文值不值得留在缓存里"。

长期看,推理成本曲线的下降会改变产品形态:很多今天因为"跑不起"而没做的东西(长期驻留的个人 Agent、常开的多 Agent 工作流)会在成本降到某个阈值后突然变得可行。这条曲线的拐点,通常不会提前公告。

信号强度

SIGNAL FILE · 情报档案

「437 倍」和「1/4」这两个都在传的数字,其实基准不同:437 倍是相对初代累计,1/4 是相对上一代——官方原文分得很清楚,媒体混着用。真正该盯的是那个绝对值:每 token 890 字节。在 Agent 场景里缓存命中费用占比很高,这一刀砍的是长期跑 Agent 最贵的那笔隐形账。

本文基于 AI 情报库收录的条目展开深析;事实性信息以原始报道为准,分析与展望为编辑观点。

原始报道:https://www.deepseek.com/news/deepseek-v4-1-flash/(DeepSeek)

RELATED SIGNALS · 关联信号