AI Newsway

DeepSeek-V4.1-Flash 把 KV 快取壓到每個 token 890 位元組

552B 開放權重 MoE,預填階段僅啟用 80 億參數,直指長時間執行的代理工作階段

|5分鐘閱讀0
Partially populated server racks — DeepSeek-V4.1-Flash targets the memory ceiling that limits how many concurrent agent sessions a machine can host.
Partially populated server racks — DeepSeek-V4.1-Flash targets the memory ceiling that limits how many concurrent agent sessions a machine can host.

DeepSeek 發布了 DeepSeek-V4.1-Flash,這是一款 5,520 億參數的多模態混合專家(MoE)模型,而它主打的數字不是benchmark分數,而是儲存量:每個 token 的全域鍵值(KV)快取只需 890 位元組。在相同序列長度下,這大約只有前一代的四分之一,也正是決定一台機器能同時撐住多少個代理工作階段的關鍵數字。模型權重與技術報告已以 MIT 授權放上 Hugging Face。

重點摘要

  • DeepSeek-V4.1-Flash 把全域 KV 快取壓縮到每個 token 890 位元組,約為 DeepSeek-V4-Flash 的四分之一,持久化快取更降到約八分之一。
  • Causal Encoder-Decoder 的切分讓預填階段只啟用 80 億參數,解碼階段則為 160 億,針對輸入遠多於輸出的代理工作負載而設計。
  • 官方公布的成績包括 GPQA Diamond 90.9 分、Terminal-Bench 2.1 90.6%、Codeforces 等級分 3471,脈絡視窗達到一百萬 token。

KV 快取為何成為瓶頸

長時間執行的代理流程打破了舊有的成本模型。每一次工具呼叫都會拉長脈絡,而存放先前所有鍵與值的快取也跟著膨脹,先是佔滿加速器上的 HBM,等到為了前綴重用而保留工作階段時,又溢出到主機記憶體甚至 SSD。稀疏注意力早已削減長序列處理的運算量,卻沒有削減儲存量,也沒有削減搬運這些資料所耗掉的頻寬——而服務成本如今正集中在這裡。

DeepSeek 的做法不是把單一環節最佳化,而是同時從三個方向壓縮快取:減少頭數讓每一筆項目變小,以區塊層級壓縮減少項目數量,再透過跨層共享直接消除重複副本,整個四十層網路只保留三份編碼器快取與一份解碼器快取。在這之上,採用 E2M1 格式、以每 16 個通道為單位設定縮放係數的 FP4 量化再把剩下的位元組往下砍。

編碼器與解碼器的切分實際做了什麼

底層的架構變動是 Causal Encoder-Decoder(CED),改編自 You Only Cache Once 這條研究路線。模型的四十層平均切成兩半:下方二十層扮演編碼器,建立可重複使用的脈絡表示;上方二十層則不自行計算鍵值,而是把編碼器最後的隱藏狀態投影過來取得。

結果是長提示詞中的多數位置只需要走過半個網路。預填每個 token 啟用 80 億參數,解碼則啟用 160 億。這種不對稱之所以重要,正因為代理流量偏重輸入:一個反覆讀取大量脈絡、只吐出一段簡短工具呼叫的模型,運算幾乎都花在剛剛變便宜的那一半上。

編碼器內部的注意力機制採用 DeepSeek 稱為 CSA2 的設計,把處理局部脈絡的 128 token 滑動視窗,與全域稀疏檢索及跨層重用結合在一起。每一層都被指定為 Full、Reindex 或 Reuse 其中一種固定模式,決定它要重新計算稀疏注意力索引還是直接繼承,如此就不必把檢索決策重算四十次。部署端還有另一項技巧——對滑動視窗快取進行有界重播,這正是讓持久化儲存降到前一代約八分之一的原因。

成績表現

在推理強度調到最高時(模型提供 1 到 100 的強度旋鈕),DeepSeek 回報 GPQA Diamond 90.9 分、MMLU-Pro 74.1%、Codeforces 等級分 3471。代理類評測才是它的強項:Terminal-Bench 2.1 拿到 90.6%,CyberGym 88.1%,DeepSWE v1.1 則解決了 74.2% 的問題。程式撰寫類的分數相對偏低,HumanEval 為 79.4%,BigCodeBench 為 60.6%。

稀疏化設定相當激進:每一層配置 1 個共享專家與 384 個路由專家,每個 token 只啟用其中 6 個。多模態路徑加上了 patch size 為 14 的 32 層 vision transformer,每張影像的視覺 token 上限為 1,024,模型預訓練用了 45 兆個 token。以 zartbot 為名寫作的工程師另外做了一份獨立的架構拆解,實測速度約為每秒 420 個 token,並認為這次的跨度之大,讓「小版號更新」這個命名顯得低估了它。

對開放權重部署的意義

這裡的競爭主軸是部署經濟性,而非排行榜名次。一個以 MIT 條款釋出的開放權重模型把快取佔用砍到四分之一,自行架設的成本結構就會改變,因為在固定的 GPU 預算下,決定同時工作階段數量的是記憶體與快取頻寬,而不是純粹的算力。DeepSeek 先前就打過同一張牌,當時V4 Pro 以前沿模型零頭價格正式上線,把可用的權重與異常低廉的服務成本綁在一起。

尚未解決的問題是品質衰減。跨層重用與四位元快取量化在本質上都是有損的,而要偵測那種深入百萬 token 工作階段之後才浮現的退化,綜合benchmark是很鈍的工具。每個 token 890 位元組能否撐過漫長的代理執行,最終得由實際部署、而不是評測套件來給答案。

常見問題

DeepSeek-V4.1-Flash 是開源的嗎

權重以 MIT 授權發布於 Hugging Face,允許商業使用、修改與再散布。不過與多數開放權重的發布一樣,訓練資料與完整訓練流程並未一併公開,因此它算是開放權重,而非完全意義上的開源。

KV 快取比 DeepSeek-V4-Flash 小多少

全域 KV 快取約為每個 token 890 位元組,在相同序列長度下大約是前一代模型的四分之一。至於在保存工作階段以重用前綴時特別關鍵的持久化快取,則因為滑動視窗快取的有界重播而進一步降到約八分之一。

為什麼預填與解碼啟用的參數量不同

Causal Encoder-Decoder 的設計讓上方二十層不必自行計算鍵值,而是從編碼器輸出投影取得。因此長提示詞只需要走完網路的前半段,啟用 80 億參數;逐 token 生成時則會用到整個堆疊,也就是 160 億。

對這篇文章有什麼感想?

SJ
載入中...

相關文章