DeepSeek V4.1 Flash架構全解:KV Cache壓縮至初代1/437
nashnova research
DeepSeek發佈V4.1 Flash模型,以90.6分登頂Terminal-Bench 2.1;其51頁技術報告揭示核心目標——將KV Cache壓縮至初代的1/437,令長上下文Agent在成本上真正行得通。
點解所有創新都圍住KV Cache轉?
KV Cache是大模型推理時的「記憶緩衝區」——上下文愈長,緩衝區愈大,顯存同儲存成本愈高。這意味著→ 邊個能將緩衝區壓得更細,邊個就能用更少錢跑更長對話。
從V1到V4.1 Flash,KV Cache縮小至原來的1/437;與上一代相比,對高帶寬記憶體(HBM)的需求降至1/4,對固態硬碟(SSD)的需求降至1/8。
簡單來說= 同樣長度的對話,硬件賬單砍掉大半,呢步係由「實驗室跑得到」變成「商業上賣得出」的關鍵。
輸入同輸出點解要分開處理?
V4.1 Flash採用因果編碼器-解碼器(CED)架構:前20層只管「讀」輸入,後20層負責「寫」輸出,總參數5520億,輸入激活僅80億、輸出激活160億。
核心慳喺邊?解碼器的全局緩存唔係由每一層自己算,而係直接從編碼器最後一層「投影」過嚟。這意味著→ 大部分輸入token只走前20層就夠,唔使跑滿40層。
對於長序列場景,預填充計算量從O(NL)降到約O(NL/2),接近減半。簡單來說= 讀一篇長文檔的「準備工夫」幾乎慳咗一半算力。
緩存點樣做到沿三個方向同時壓縮?
V4.1 Flash用CSA2(壓縮稀疏注意力2)取代上一代的混合注意力架構,沿條目大小、序列維度、層維度三個方向同時壓縮,並跨層複用全局KV同Top-K索引。
CSA2設三種工作模式:Full(完整計算並生成自己的全局KV)、Reindex(複用前序層的KV但重新選Top-K)、Reuse(最輕量,直接複用前序層的KV同索引)。
解碼器另引入層次化稀疏索引器:第一個Full層先建共享候選池,後續層只在池內搜索,深層索引的計算量唔再隨上下文變長而膨脹。這反映出 DeepSeek喺「壓縮」上已經唔係單點優化,而係將成條注意力鏈路重新設計。
緩存精度同儲存點樣安排?
主KV Cache從FP8進一步壓到FP4(E2M1方案),透過量化感知訓練(QAT)引入;對精度更敏感的滑動窗口注意力KV仍保留FP8。簡單來說= 能慳的地方用「低清」存,唔能慳的地方保「高清」,兩套精度並行。
部署時緩存分兩級:滑動窗口KV放喺各機主機記憶體池,生命周期得分鐘級;全局KV留喺SSD持久緩存上,保留數十小時。這意味著→ 短期記憶用快但貴的記憶體,長期記憶用慢但平的硬碟,成本結構完全唔同。
預訓練同後訓練有咩新判斷?
預訓練喺數十萬億token多模態語料上完成,全程無不穩定事件。DeepSeek提出兩個數據判斷:弱模型生成內容同低質素機器翻譯被定義為「隱性重複」並過濾;同時發現爬蟲系統過度偏向純文字網頁,從Common Crawl重新引導抓取以覆蓋更多多模態來源。
後訓練沿用SFT+RL+離線偏好蒸餾(OPD)標準範式,但改進全部集中喺數據同環境管線。技術報告原文寫道:「在當前階段,工程化數據和環境管線的邊際回報遠超後訓練中算法創新的邊際回報。」
支撐RL規模的係自研沙箱平台DSec,並發實例達百萬級,冇用Kubernetes而係自研放置引擎,以弱一致性換擴展性。這反映出 DeepSeek對「基礎設施即競爭力」呢條路線押注好重。
呢個模型喺商業上意味著咩?
V4.1 Flash係DeepSeek首個原生支援多模態視覺理解的正式版模型,此前視覺能力以實驗版單獨提供,而家已統一。
自9月14日起,所有V4 Pro的API請求將被重新路由至V4.1 Flash,直至V4.1 Pro上線前只提供呢一個模型。這意味著→ DeepSeek對呢套架構的信心大到願意將全部流量切過嚟。
API對外提供三檔effort級別控制推理強度;蒸餾階段動用逾40個教師模型。簡單來說= 能唔能憑呢套「架構級降本」喺開發者生態中形成規模化採用,係驗證其商業價值的關鍵節點。
市场有风险,内容仅供研究参考,不构成投资建议。