深信号· DEEPSIGNAL
深信号· DEEPSIGNALRSS
SIGNAL DEEP-DIVE

552B 的模型,每次只激活 8B:DeepSeek V4.1 Flash 上线就把 V4 Pro 砍了

2026-09-10·机器之心·模型推理DeepSeekMoE非对称计算KV Cache推理成本Agent
▮ SIGNAL SUMMARY · 摘要快读

DeepSeek V4.1 Flash 在网页、App、API 全线替换 V4 Pro:552B 总参数、全新 Causal-Encoder-Decoder 架构、输入侧只激活 8B 而输出侧激活 16B,官方宣称性能全面超越上一代旗舰,并把 KV Cache 对 HBM 的需求压到 1/4。

552B 的模型,每次只激活 8B:DeepSeek V4.1 Flash 上线就把 V4 Pro 砍了

综述

周四上午,DeepSeek V4.1 Flash 同时在网页、App、API 三端上线。据官方披露,它在性能、响应速度、效率上全面超越上一代旗舰 V4 Pro——而 DeepSeek 的信心直接体现在动作上:已经发公告要把 V4 Pro 砍掉。

架构层面的关键数字是这样的:

「非对称」这个词值得停一下。传统大模型里,读入和写出走的是同一套参数通路;这次 DeepSeek 把两条路拆成了不同宽度——理解成本低,生成成本高,而生成侧给的资源更多。

一座巨大的水坝横跨河谷,一侧是安静蓄水的宽阔湖面,另一侧是奔涌而出的瀑布
输入 8B、输出 16B:同一个模型里,读取与书写走两条不同宽度的河道。

专业分析

一、为什么要「非对称」:它压的是 Agent 的成本结构

非对称设计背后是一个很具体的观察:不同类型负载的输入/输出比例差别巨大。

普通问答的 token 结构大致对称——问一句、答一段。但 Agent 类负载完全不是这样:一次任务里,模型要反复读上下文、调工具、看返回、再决定下一步。输入侧往往是被反复重放的既有信息(对话历史、工具定义、文件内容),而输出侧才是真正要「想出来」的部分。

如果两侧用同样宽的通路,就意味着大量重复的读取被赋予了和创造同等的计算成本。把输入侧压到 8B,等于在说:读已知的东西不需要那么贵的脑力,把算力留给生成。这个取舍对长期跑的 Agent 尤其有效。

二、KV Cache 才是这次更硬的一刀

官方数据里,另一条主线容易被忽视——KV Cache 的压缩

这条为什么重要?因为长上下文推理的真实瓶颈,很多时候不在算力,而在显存。KV Cache 是每个并发请求都要在显存里占一块的东西——它决定了你一张卡能同时服务几个人、能撑多长的上下文。

把它压到 1/4,意味着同样的硬件可以承载更多并发、更长的对话。对部署方来说,这不是「快一点」,而是「能不能跑得起、能不能划得来」的差别。

三、基准要拆开看:赢的地方很窄,输的地方很明显

官方展示的结果里,有两组数字必须同时读:

赢的:DeepSWE v1.1、CyberGym、Automation-Bench 上拿下最高分——但要注意,DeepSWE 只领先 Opus 5 大约 0.2 分。0.2 分在基准波动范围内的位置,很难说是「超越」。

输的:Terminal-Bench 3.0 上只有 30.0 分,明显低于 Opus 5 的 43.3 和 GPT-5.6 Sol 的 34.4。此外在 GPQA Diamond、ProgramBench 等项目上也与顶级闭源模型存在差距。

所以这组数据最诚实的读法是:它在部分 Coding 与 Agent 任务上具备竞争力,但不是全面领先。 官方「全面超越 V4 Pro」的说法,比较对象是自家上一代,而不是别人家的旗舰——这两句话的分量完全不同。

一组高低不齐的柱状图立在桌面上,几根柱子顶端闪着光,另几根明显矮了一截
赢在部分 Coding 与 Agent 基准,输在终端操作与通用推理——真正的图景是一片高地,不是一条平线。

关联信息与影响

这次发布对生态的影响,可能比模型本身更大。

第一,它重新定义了「性价比旗舰」的位置。 过去开源模型与闭源旗舰的关系是「便宜但差一档」;这次是「部分任务打平、部分任务落后、成本明显更低」。这条曲线对自建 Agent 的团队是直接的账本变化——很多场景本来就不需要全能冠军。

第二,非对称架构可能会被跟进。 一旦「输入侧压窄、输出侧保宽」被证明有效且可训练,其他厂商没有理由不做同样的事。这会改变模型架构讨论的重点:从「多大参数」转向「给哪一侧更多参数」。

第三,KV Cache 压缩对本地部署的意义被低估了。 消费级显卡跑长上下文一直是显存先撞墙。HBM 需求降到 1/4 这个量级,会直接扩大「能在本地跑」的场景范围。

需要泼的冷水有两条:一是基准分数的可信度——0.2 分的领先幅度不适合作为结论;二是「砍掉 V4 Pro」的代价——老用户被迫迁移,如果新模型的某些能力(尤其终端操作类)确实回退,迁移体验会成为口碑风险。

未来展望

短期,V4.1 Flash 会成为大量 Agent 项目的默认底座选项:它的定位非常明确——不是最强的模型,但是「跑一整天也不心疼」的模型。对高频调用的产品,这比跑分第一重要。

中期值得关注的是非对称架构的极限在哪里。如果输入侧可以压到 8B,为什么不是 4B?边界取决于「读取的复杂度」到底需要多少参数——这个数值会随着后续版本暴露出来。

长期看,这一轮竞争真正在争的不是智能上限,而是「每百万 token 成本」这个单一坐标轴。当开源模型在这个轴上持续压价,闭源旗舰必须证明自己贵出来的部分是真实的能力差距,而不是品牌溢价。

信号强度

SIGNAL FILE · 情报档案

「非对称计算」是这次真正的新东西:同一模型里,读入和写出走两条不同宽度的通道(输入 8B / 输出 16B)。配合 KV Cache 大幅压缩(HBM 需求降至 1/4、SSD 降至 1/8),它压的不是算力峰值,而是长期跑 Agent 时最贵的那部分成本。

本文基于 AI 情报库收录的条目展开深析;事实性信息以原始报道为准,分析与展望为编辑观点。

原始报道:https://mp.weixin.qq.com/s/8nunFKmZ4T30rGHCKJNqtA(机器之心)

RELATED SIGNALS · 关联信号