DeepSeek V4.1 Flash架构全解:KV Cache压缩至初代1/437
nashnova research
DeepSeek发布V4.1 Flash模型,以90.6分登顶Terminal-Bench 2.1;其51页技术报告揭示核心目标——将KV Cache压缩至初代的1/437,让长上下文Agent在成本上真正跑得通。
为什么一切都围着KV Cache转?
KV Cache是大模型推理时的"记忆缓冲区"——上下文越长,缓冲区越大,显存和存储成本就越高。这意味着→ 谁能把缓冲区压得更小,谁就能用更少的钱跑更长的对话。
从V1到V4.1 Flash,KV Cache缩小到原来的1/437;与上一代相比,对高带宽内存(HBM)的需求降至1/4,对固态硬盘(SSD)的需求降至1/8。
用大白话说= 同样长度的对话,硬件账单砍掉了大半,这是把"实验室能跑"变成"商业上能卖"的关键一步。
输入和输出为什么要分开处理?
V4.1 Flash采用因果编码器-解码器(CED)架构:前20层只管"读"输入,后20层负责"写"输出,总参数5520亿,输入激活仅80亿、输出激活160亿。
核心省在哪?解码器的全局缓存不从每一层自己算,而是直接从编码器最后一层"投影"过来。这意味着→ 大部分输入token只走前20层就够了,不用跑满40层。
对于长序列场景,预填充计算量从O(NL)降到约O(NL/2),接近减半。用大白话说= 读一篇长文档的"准备工作"几乎省了一半算力。
缓存怎么做到沿三个方向同时压缩?
V4.1 Flash用CSA2(压缩稀疏注意力2)取代了上一代的混合注意力架构,沿条目大小、序列维度、层维度三个方向同时压缩,并跨层复用全局KV和Top-K索引。
CSA2设了三种工作模式:Full(完整计算并生成自己的全局KV)、Reindex(复用前序层的KV但重新选Top-K)、Reuse(最轻量,直接复用前序层的KV和索引)。
解码器还引入层次化稀疏索引器:第一个Full层先建共享候选池,后续层只在池子里找,深层索引的计算量不再随上下文变长而膨胀。这反映出 DeepSeek在"压缩"上已经不是单点优化,而是把整条注意力链路都重新设计了。
缓存精度和存储怎么安排?
主KV Cache从FP8进一步压到FP4(E2M1方案),通过量化感知训练(QAT)引入;对精度更敏感的滑动窗口注意力KV仍保留FP8。用大白话说= 能省的地方用"低清"存,不能省的地方保"高清",两套精度并行。
部署时缓存分两级:滑动窗口KV放在各机主机内存池,生命周期只有分钟级;全局KV留在SSD持久缓存上,保留数十小时。这意味着→ 短期记忆用快但贵的内存,长期记忆用慢但便宜的硬盘,成本结构完全不同。
预训练和后训练有什么新判断?
预训练在数十万亿token多模态语料上完成,全程无不稳定事件。DeepSeek提出两个数据判断:弱模型生成内容和低质量机器翻译被定义为"隐性重复"并过滤;同时发现爬虫系统过度偏向纯文本网页,从Common Crawl重新引导抓取以覆盖更多多模态来源。
后训练沿用SFT+RL+离线偏好蒸馏(OPD)标准范式,但改进全部集中在数据和环境管线。技术报告原文写道:「在当前阶段,工程化数据和环境管线的边际回报远超后训练中算法创新的边际回报。」
支撑RL规模的是自研沙箱平台DSec,并发实例达百万级,未用Kubernetes而是自研放置引擎,以弱一致性换扩展性。这反映出 DeepSeek对"基础设施即竞争力"这条路线押注很重。
这个模型在商业上意味着什么?
V4.1 Flash是DeepSeek首个原生支持多模态视觉理解的正式版模型,此前视觉能力以实验版单独提供,现已统一。
自9月14日起,所有V4 Pro的API请求将被重新路由至V4.1 Flash,直至V4.1 Pro上线前只提供这一个模型。这意味着→ DeepSeek对这套架构的信心大到愿意把全部流量切过来。
API对外暴露三档effort级别控制推理强度;蒸馏阶段动用了逾40个教师模型。用大白话说= 能不能凭这套"架构级降本"在开发者生态中形成规模化采用,是验证其商业价值的关键节点。
市场有风险,内容仅供研究参考,不构成投资建议。