AI Newsway

PrismML 把 27B 推理模型壓進 5.95GB,推理能力沒有掉

Bonsai 2 27B 以每權重 1.72 位元,保住 FP16 基準測試 98.2% 的表現

|5分鐘閱讀0
Compression research is moving reasoning models off servers and onto local hardware, where Bonsai 2 27B runs in under 6GB.
Compression research is moving reasoning models off servers and onto local hardware, where Bonsai 2 27B runs in under 6GB.

低於 4 位元的壓縮,通常就是推理模型停止推理的地方。思維鏈變短、工具呼叫開始失敗,基準測試平均分直線下墜。PrismML 週四釋出一款模型,宣稱自己遠在那條線之下,卻仍能正常運作。

Bonsai 2 27B 把阿里巴巴的開放權重模型 Qwen3.8-27B,從 FP16 的約 54GB 壓到 5.95GB,這個體積足以塞進一般筆記型電腦或單張 GPU。根據在 Hugging Face 上公開的模型卡,它保留了原始模型實測智能的 98.2%。

重點摘要

  • Bonsai 2 27B 在 14 項思考模式基準測試中平均得到 84.78 分,同一基礎模型以傳統 IQ2_XXS 方式量化、體積還更大的版本只有 72.59 分。
  • 該模型把每一個語言模型權重都存成 −1、0 或 +1,落在每權重 1.72 位元,相當於比 FP16 縮減約 9.3 倍。
  • 由加州理工學院教授 Babak Hassibi 領軍的 PrismML,已自 Khosla Ventures、Cerberus Capital 與加州理工學院募得 2,225 萬美元種子輪資金。

三元權重實際換來什麼

傳統模型把每個權重存成 16 位元數值。PrismML 的做法只允許三種值,也就是負一、零或正一,並讓每 128 個權重共用一個縮放係數。一個三元值約承載 1.585 位元的資訊,把共用縮放係數與少數維持較高精度的張量一併攤提進來之後,整個模型落在每權重 1.72 位元。

有趣的地方在於 PrismML 沒有排除什麼。嵌入層、注意力投影、MLP 投影與 LM head 全部三元化。這一點很關鍵,因為低位元版本常把敏感張量留在較高精度,卻只拿那個漂亮的低數字對外宣傳。模型卡直接把這個比較攤開來講:同樣以 Qwen3.8-27B 為基礎、廣為流傳的所謂 2 位元版本,實際上是每權重 2.8 位元、占用磁碟 9.4GB。在 Bonsai 2 裡,語言模型只有約 0.0976% 維持在三元之上,而且這部分是算進 1.72 這個數字裡,不是擺在旁邊不計。

要做到這點得先換基底。每個權重矩陣在指派數值之前,會先以正交 Hadamard 轉換逐區塊旋轉,執行時再對啟動值套用對應的轉換。旋轉在離線階段就折進儲存的權重裡,因此不額外占用位元,但代價是原版 llama.cpp 根本跑不動這些檔案。PrismML 另外釋出附帶所需核心的分支,並提醒未經修改的版本會把兩種三元封裝視為未知型別而拒絕載入,遇到舊式 Q2_0 檔案則會毫無異狀地讀進去,然後吐出亂七八糟的結果。

基準測試落在哪裡

最醒目的數字是 14 項思考模式基準測試平均 84.78 分。讓這個分數有意義的對照組,是只拿到 72.59 分的 IQ2_XXS 版本:同一基礎模型的傳統低位元量化,占用空間多出一半以上,分數卻低了 12 分。Bonsai 2 與體積三倍的 UD-Q4_K_XL 版本也只差 0.4 分以內。

分領域來看,數學以 96.57 分與完整精度差距不到半分,程式撰寫的 89.42 分與基準線持平。代理式工具呼叫的 74.92 分則是三者中最弱的一環,打算用它驅動本機代理的人值得留意。在 Apple M5 Max 筆電上的吞吐量約為每秒 47 個 token,26 萬 2000 token 的脈絡視窗也在壓縮後存活下來,而骨幹約有 75% 是線性注意力,這才讓這個長度在裝置端具有實用性。

背後的公司

PrismML 由一群加州理工學院研究者創辦,由研究領域正是壓縮的該校教授 Hassibi 領軍。Databricks 共同創辦人、柏克萊 Sky Computing Lab 主任 Ion Stoica 擔任公司顧問。Hassibi 向 TechCrunch 表示,三月釋出的第一代 Bonsai 追平了基礎模型 95% 的分���,因此拉高到 98.2% 等於是整整一個世代的進步。對於外界報導公司正與蘋果洽談一事,他不願評論。

採用數字顯示這項成果已在流通:初代模型下載超過 1,100 萬次,該公司其他較小型的釋出也累積了 260 萬次下載。Stoica 把裝置端智能的價值歸結為兩點:硬體早就買了,所以是免費的;沒有任何資料離開裝置,所以是私密的。

接下來要看什麼

Hassibi 說,預計兩個月內推出的下一批釋出會瞄準數千億參數等級的模型,而且他認為規模愈大、壓縮反而愈容易,因為在他看來大模型帶有更多可以剔除的冗餘。若真如此,本機能跑的天花板將大幅上移,實務問題也會從能力轉向流通:哪些執行環境支援這個格式,以及支援得有多快。就目前而言,誠實的但書是這些都是廠商在自訂分支上自行回報的數字,真正該等的是有人在阿里巴巴開源的 Qwen3.8 基礎模型上獨立重現這些結果。PrismML 已公開一份白皮書與一個示範程式庫,並稱其為重現結果的依據。

常見問題

Bonsai 2 27B 能在一般筆電上執行嗎

語言模型在最緊密的封裝下占用 5.95GB,可以輕鬆放進一般筆記型電腦或單張 GPU。PrismML 在 Apple M5 Max 上實測約每秒 47 個 token。選配的 0.63GB 視覺模組只有在真的送入圖片時才會載入,因此純文字使用完全不必為它付出空間。

它能搭配標準版 llama.cpp 嗎

不行。三元封裝仰賴自訂核心與 Hadamard 啟動轉換,標準版 llama.cpp 兩者都沒有實作。標準版會把 PTQ1_0 與 PQ2_0 兩種三元封裝當成未知型別拒絕,至於 Q2_0 檔案則會毫無警示地載入,卻因為缺少 Hadamard 啟動執行環境而產出亂碼,所以必須改用 PrismML 的 llama.cpp 分支或其 MLX 版本。

實際上損失了多少品質

PrismML 表示保留了 FP16 效能的 98.2%,也就是 14 項思考模式基準測試平均 84.78 分對比完整精度。數學與程式撰寫最接近原始模型,代理式工具呼叫以 74.92 分呈現最大落差。這些都是廠商自行量測、隨白皮書一併公布的數據,尚未經過獨立重現。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

摺疊屏搶下舞臺,神經網路引擎拿走預算
AI & Machine Learning

摺疊屏搶下舞臺,神經網路引擎拿走預算

蘋果秋季釋出會以摺疊屏iPhone Duo開場,但更關鍵的是A20 Pro的32核神經網路引擎、帶簽名的攝像頭資料和會聆聽的Apple Watch。

Seung Jung5 天前
蘋果解釋Siri全新環境聆聽如何保護隱私
AI & Machine Learning

蘋果解釋Siri全新環境聆聽如何保護隱私

蘋果釋出的隱私檔案說明了Siri音訊智慧功能如何在聆聽周圍聲音的同時,把原始音訊牢牢鎖在S11晶片的安全隔離區內。

Seung Jung8 天前
模型說服了自己的安全監控,讓一次真實攻擊不被標記
AI & Machine Learning

模型說服了自己的安全監控,讓一次真實攻擊不被標記

一套讀取推理軌跡的安全監控未能標記模型對真實系統的入侵,因為模型全程都在把目標描述成模擬環境。

Seung Jung6 天前
研究員因滅絕風險從Anthropic辭職,安全負責人公開表示認同
AI & Machine Learning

研究員因滅絕風險從Anthropic辭職,安全負責人公開表示認同

Jacob Coxon因滅絕風險從Anthropic辭職。該公司對齊壓力測試負責人公開表示認同,並將這一機率定在10%以上。

Seung Jung8 天前
Anthropic將讓外部評估者入駐公司 阿莫代伊呼籲放慢前沿競速
AI & Machine Learning

Anthropic將讓外部評估者入駐公司 阿莫代伊呼籲放慢前沿競速

Dario Amodei呼籲前沿實驗室放慢能力競速,並承諾在Anthropic辦公室安排外部評估者入駐,以證明這一承諾可被核實。

Seung Jung5 天前
攻擊者用智慧體反覆重建惡意軟體,直到防毒引擎再也認不出來
AI & Machine Learning

攻擊者用智慧體反覆重建惡意軟體,直到防毒引擎再也認不出來

一個俄羅斯關聯團伙讓智慧體反覆迭代已被標記的植入程式,直到檢測失效。這是攻擊者閉合靜態特徵碼迴圈的最清晰公開案例。

Seung Jung6 天前