AI Newsway

「只有幾張GPU」的實驗室宣稱:125B模型塞得進單張24GB顯卡

Tim Dettmers預告dlab開源週:兩個專案、四篇論文,以及一組實驗室外還沒有人驗證過的本地推論數字。

|5分鐘閱讀0
A consumer desktop graphics card installed in a PC case — the class of hardware Tim Dettmers says his lab's inference framework targets for 125-billion-parameter models.
A consumer desktop graphics card installed in a PC case — the class of hardware Tim Dettmers says his lab's inference framework targets for 125-billion-parameter models.

卡內基美隆大學資訊科學系助理教授Tim Dettmers週一發表部落格文章,預告實驗室所稱的「開源週」:兩個開源專案與四篇論文一次推出,核心主張是那些大家以為非得資料中心才跑得動的模型,如今裝得進讀者手邊既有的硬體。

重點整理

  • Dettmers表示,實驗室的推論框架能讓1250億參數的Qwen 3.8 Flash Next跑在單張24GB消費級GPU上,5500億參數的DeepSeek V4.1則可跑在AMD Strix機器、NVIDIA DGX Spark,或記憶體128GB的MacBook上。
  • 他們把代理放到框架的Metal核心上自行最佳化,做出Qwen 3.6 35B-A3B在每個權重1.5位元下每秒450個token的量化推論成績,記憶體用量約為半精度版本的十分之一。
  • 實驗室的自動壓縮技術CliffCompaction據稱可把代理成本砍掉約一半;一家合作企業在內部導入後,實測整體AI預算下降45%。

這套框架宣稱能在本地跑什麼

比較的重點是同一家族的兩個模型。270億參數的Qwen 3.8在Alibaba把整個系列開源之後,成了手上有一張好顯卡的人最常用的本地模型。Dettmers的說法是,同一張卡應該拿來跑1250億參數的版本,而一台128GB的筆電就該跑得動5500億參數的模型。

這段差距靠激進的量化加上自動壓縮與脈絡處理來補。他說使用者不必動任何設定,長脈絡下推論速度依然維持得住。

Mac與Metal這部分,是他用來支撐第二項主張的證據——這些軟體是怎麼寫出來的。他說一道指令就把實驗室的代理框架指向那些核心,接著全程放手、不給任何回饋,回來的就是1.5位元、每秒450個token的結果。他對這套框架設計目標的說法很直接:只有資深研究者才跑得起來的開源,不算開源。

撐起這一切的成本主張

Dettmers說,CliffCompaction是實驗室用得最兇、講得最少的一塊。他描述動輒數百萬token的工作階段,其中自己有幾次超過一億token,整體成本卻只有原本的一半左右;他並表示這項技術在KernelBench上達到最佳水準,以他形容的大幅差距勝過AlphaEvolve一類做法與階層式記憶系統。

省下來的成本再投回去。同樣的預算不再只買一次rollout,而是買下好幾次。他把這說成第一個能在固定成本下、把多次rollout真正轉換成效能提升的實用方法,但也承認它還不適合用在日常工程工作上。

最大膽的主張是那套研究系統。它建在代理框架與本地推論堆疊之上,在完全沒有網路連線的情況下運作,據稱勝過前沿實驗室的深度研究系統,在自主研究上也贏過Sakana AI的系統與Google的ScientistOne。他舉的示範是一道生物資訊學題目,之所以挑這題,正是因為他不懂這個領域:代理提出三個候選問題,在第一題上花了大約兩小時,產出啟發式方法的新下界、文獻中最佳啟發式的可執行實作,以及該領域所倚賴的評估資料中的瑕疵。他也指出,整題而言並未達到最佳水準。

為什麼那句但書很重要

這些全是一間實驗室在程式碼與論文落地前一天,對自家成果的說法。每秒450個token、45%的預算降幅、KernelBench的成績,都還沒有實驗室以外的人重現過,文章裡也沒有提到任何第三方評估。這則公告在Hacker News上的討論串,發布數小時後留言數仍停在個位數。

即便如此,這週仍值得關注,關鍵在於背後那個賭注。Dettmers那篇文章裡講得很明白:一間只有幾張GPU的小實驗室,也能做出跟前沿競爭的系統,因為那些成本低、價值高的問題,正好是握有龐大算力預算的人誰都懶得碰的。這次的釋出就是這個說法的驗證,而且驗證過程是公開的。

常見問題

實驗室說跑125B模型需要什麼硬體?

依Dettmers的說法,一張24GB的GPU就夠,就是一般桌機裡會有的那種。至於參數量達5500億、大上許多的DeepSeek V4.1,他列出的是AMD Strix系統、NVIDIA DGX Spark,或搭載128GB統一記憶體的MacBook。

dlab開源週的程式碼現在拿得到嗎?

公告當下還沒有。Dettmers寫道,這一週的行程延後了一天,兩個開源專案與四篇論文會從隔天開始陸續放出,而且是刻意當成一整套生態系一次推出,而非分散在好幾週。

CliffCompaction跟現有編碼代理的壓縮差在哪?

它是一種自動壓縮技術,讓代理在對話原本該結束的地方繼續工作下去。Dettmers宣稱它的能力明顯勝過Claude Code或Codex內建的自動壓縮,能支撐數百萬token的工作階段,同時把整體成本砍掉約一半。這個比較出自他的實驗室,不是獨立的基準測試。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

Meta 開源 Astryx:一套可供智慧體直接查詢的 React 設計系統
Developer Tools

Meta 開源 Astryx:一套可供智慧體直接查詢的 React 設計系統

Meta 於 6 月以 MIT 許可證釋出了 Astryx 公測版,這套 React 設計系統已在公司內部單一程式碼庫中打磨了八年。

Seung Jung8 天前
LLM修復程式碼時弄壞可用程式碼的次數,是真正修好次數的十倍
Developer Tools

LLM修復程式碼時弄壞可用程式碼的次數,是真正修好次數的十倍

一項arXiv研究測得LLM修復迴圈破壞正確程式的比率為0.261,修復缺陷程式的比率僅0.023,並找到了驅動這一行為的內部方向。

Seung Jung9 天前
Vercel 因一年前就修好的錯誤,全平台關閉 AVIF
Developer Tools

Vercel 因一年前就修好的錯誤,全平台關閉 AVIF

Vercel 將回報的 Next.js RCE 追查到 libheif,於 8 月 13 日在全平台停用 AVIF,並在 8 月 25 日前協調完成 sharp、libvips 與 libheif 的修補。

Seung Jung3 天前
AI智慧體向RubyGems傾瀉2000多個包,新使用者註冊被關閉四天
Developer Tools

AI智慧體向RubyGems傾瀉2000多個包,新使用者註冊被關閉四天

一份取證報告還原了5月的GemStuffer行動:AI智慧體推送兩千多個gem,迫使RubyGems凍結新使用者註冊四天。

Seung Jung10 天前
ZCode每次快照打包42,411個檔案,只有Z.ai解得開
Developer Tools

ZCode每次快照打包42,411個檔案,只有Z.ai解得開

逆向工程報告指出,Z.ai的ZCode把完整Git歷史加密後送往阿里雲,而能解開這層加密的只有該公司的伺服器。

Seung Jung3 天前
Claude Code Projects 回歸,化身統籌平行雲端執行緒的協調者
Developer Tools

Claude Code Projects 回歸,化身統籌平行雲端執行緒的協調者

重新設計的 Claude Code Projects 在工作執行緒之上擺了一個協調者,每條執行緒都是跑在自有分支上的完整雲端工作階段,並且共用同一份記憶。

Seung Jung4 天前