卡內基美隆大學資訊科學系助理教授Tim Dettmers週一發表部落格文章,預告實驗室所稱的「開源週」:兩個開源專案與四篇論文一次推出,核心主張是那些大家以為非得資料中心才跑得動的模型,如今裝得進讀者手邊既有的硬體。
重點整理
- Dettmers表示,實驗室的推論框架能讓1250億參數的Qwen 3.8 Flash Next跑在單張24GB消費級GPU上,5500億參數的DeepSeek V4.1則可跑在AMD Strix機器、NVIDIA DGX Spark,或記憶體128GB的MacBook上。
- 他們把代理放到框架的Metal核心上自行最佳化,做出Qwen 3.6 35B-A3B在每個權重1.5位元下每秒450個token的量化推論成績,記憶體用量約為半精度版本的十分之一。
- 實驗室的自動壓縮技術CliffCompaction據稱可把代理成本砍掉約一半;一家合作企業在內部導入後,實測整體AI預算下降45%。
這套框架宣稱能在本地跑什麼
比較的重點是同一家族的兩個模型。270億參數的Qwen 3.8在Alibaba把整個系列開源之後,成了手上有一張好顯卡的人最常用的本地模型。Dettmers的說法是,同一張卡應該拿來跑1250億參數的版本,而一台128GB的筆電就該跑得動5500億參數的模型。
這段差距靠激進的量化加上自動壓縮與脈絡處理來補。他說使用者不必動任何設定,長脈絡下推論速度依然維持得住。
Mac與Metal這部分,是他用來支撐第二項主張的證據——這些軟體是怎麼寫出來的。他說一道指令就把實驗室的代理框架指向那些核心,接著全程放手、不給任何回饋,回來的就是1.5位元、每秒450個token的結果。他對這套框架設計目標的說法很直接:只有資深研究者才跑得起來的開源,不算開源。
撐起這一切的成本主張
Dettmers說,CliffCompaction是實驗室用得最兇、講得最少的一塊。他描述動輒數百萬token的工作階段,其中自己有幾次超過一億token,整體成本卻只有原本的一半左右;他並表示這項技術在KernelBench上達到最佳水準,以他形容的大幅差距勝過AlphaEvolve一類做法與階層式記憶系統。
省下來的成本再投回去。同樣的預算不再只買一次rollout,而是買下好幾次。他把這說成第一個能在固定成本下、把多次rollout真正轉換成效能提升的實用方法,但也承認它還不適合用在日常工程工作上。
最大膽的主張是那套研究系統。它建在代理框架與本地推論堆疊之上,在完全沒有網路連線的情況下運作,據稱勝過前沿實驗室的深度研究系統,在自主研究上也贏過Sakana AI的系統與Google的ScientistOne。他舉的示範是一道生物資訊學題目,之所以挑這題,正是因為他不懂這個領域:代理提出三個候選問題,在第一題上花了大約兩小時,產出啟發式方法的新下界、文獻中最佳啟發式的可執行實作,以及該領域所倚賴的評估資料中的瑕疵。他也指出,整題而言並未達到最佳水準。
為什麼那句但書很重要
這些全是一間實驗室在程式碼與論文落地前一天,對自家成果的說法。每秒450個token、45%的預算降幅、KernelBench的成績,都還沒有實驗室以外的人重現過,文章裡也沒有提到任何第三方評估。這則公告在Hacker News上的討論串,發布數小時後留言數仍停在個位數。
即便如此,這週仍值得關注,關鍵在於背後那個賭注。Dettmers在那篇文章裡講得很明白:一間只有幾張GPU的小實驗室,也能做出跟前沿競爭的系統,因為那些成本低、價值高的問題,正好是握有龐大算力預算的人誰都懶得碰的。這次的釋出就是這個說法的驗證,而且驗證過程是公開的。
常見問題
實驗室說跑125B模型需要什麼硬體?
依Dettmers的說法,一張24GB的GPU就夠,就是一般桌機裡會有的那種。至於參數量達5500億、大上許多的DeepSeek V4.1,他列出的是AMD Strix系統、NVIDIA DGX Spark,或搭載128GB統一記憶體的MacBook。
dlab開源週的程式碼現在拿得到嗎?
公告當下還沒有。Dettmers寫道,這一週的行程延後了一天,兩個開源專案與四篇論文會從隔天開始陸續放出,而且是刻意當成一整套生態系一次推出,而非分散在好幾週。
CliffCompaction跟現有編碼代理的壓縮差在哪?
它是一種自動壓縮技術,讓代理在對話原本該結束的地方繼續工作下去。Dettmers宣稱它的能力明顯勝過Claude Code或Codex內建的自動壓縮,能支撐數百萬token的工作階段,同時把整體成本砍掉約一半。這個比較出自他的實驗室,不是獨立的基準測試。






