低於 4 位元的壓縮,通常就是推理模型停止推理的地方。思維鏈變短、工具呼叫開始失敗,基準測試平均分直線下墜。PrismML 週四釋出一款模型,宣稱自己遠在那條線之下,卻仍能正常運作。
Bonsai 2 27B 把阿里巴巴的開放權重模型 Qwen3.8-27B,從 FP16 的約 54GB 壓到 5.95GB,這個體積足以塞進一般筆記型電腦或單張 GPU。根據在 Hugging Face 上公開的模型卡,它保留了原始模型實測智能的 98.2%。
重點摘要
- Bonsai 2 27B 在 14 項思考模式基準測試中平均得到 84.78 分,同一基礎模型以傳統 IQ2_XXS 方式量化、體積還更大的版本只有 72.59 分。
- 該模型把每一個語言模型權重都存成 −1、0 或 +1,落在每權重 1.72 位元,相當於比 FP16 縮減約 9.3 倍。
- 由加州理工學院教授 Babak Hassibi 領軍的 PrismML,已自 Khosla Ventures、Cerberus Capital 與加州理工學院募得 2,225 萬美元種子輪資金。
三元權重實際換來什麼
傳統模型把每個權重存成 16 位元數值。PrismML 的做法只允許三種值,也就是負一、零或正一,並讓每 128 個權重共用一個縮放係數。一個三元值約承載 1.585 位元的資訊,把共用縮放係數與少數維持較高精度的張量一併攤提進來之後,整個模型落在每權重 1.72 位元。
有趣的地方在於 PrismML 沒有排除什麼。嵌入層、注意力投影、MLP 投影與 LM head 全部三元化。這一點很關鍵,因為低位元版本常把敏感張量留在較高精度,卻只拿那個漂亮的低數字對外宣傳。模型卡直接把這個比較攤開來講:同樣以 Qwen3.8-27B 為基礎、廣為流傳的所謂 2 位元版本,實際上是每權重 2.8 位元、占用磁碟 9.4GB。在 Bonsai 2 裡,語言模型只有約 0.0976% 維持在三元之上,而且這部分是算進 1.72 這個數字裡,不是擺在旁邊不計。
要做到這點得先換基底。每個權重矩陣在指派數值之前,會先以正交 Hadamard 轉換逐區塊旋轉,執行時再對啟動值套用對應的轉換。旋轉在離線階段就折進儲存的權重裡,因此不額外占用位元,但代價是原版 llama.cpp 根本跑不動這些檔案。PrismML 另外釋出附帶所需核心的分支,並提醒未經修改的版本會把兩種三元封裝視為未知型別而拒絕載入,遇到舊式 Q2_0 檔案則會毫無異狀地讀進去,然後吐出亂七八糟的結果。
基準測試落在哪裡
最醒目的數字是 14 項思考模式基準測試平均 84.78 分。讓這個分數有意義的對照組,是只拿到 72.59 分的 IQ2_XXS 版本:同一基礎模型的傳統低位元量化,占用空間多出一半以上,分數卻低了 12 分。Bonsai 2 與體積三倍的 UD-Q4_K_XL 版本也只差 0.4 分以內。
分領域來看,數學以 96.57 分與完整精度差距不到半分,程式撰寫的 89.42 分與基準線持平。代理式工具呼叫的 74.92 分則是三者中最弱的一環,打算用它驅動本機代理的人值得留意。在 Apple M5 Max 筆電上的吞吐量約為每秒 47 個 token,26 萬 2000 token 的脈絡視窗也在壓縮後存活下來,而骨幹約有 75% 是線性注意力,這才讓這個長度在裝置端具有實用性。
背後的公司
PrismML 由一群加州理工學院研究者創辦,由研究領域正是壓縮的該校教授 Hassibi 領軍。Databricks 共同創辦人、柏克萊 Sky Computing Lab 主任 Ion Stoica 擔任公司顧問。Hassibi 向 TechCrunch 表示,三月釋出的第一代 Bonsai 追平了基礎模型 95% 的分���,因此拉高到 98.2% 等於是整整一個世代的進步。對於外界報導公司正與蘋果洽談一事,他不願評論。
採用數字顯示這項成果已在流通:初代模型下載超過 1,100 萬次,該公司其他較小型的釋出也累積了 260 萬次下載。Stoica 把裝置端智能的價值歸結為兩點:硬體早就買了,所以是免費的;沒有任何資料離開裝置,所以是私密的。
接下來要看什麼
Hassibi 說,預計兩個月內推出的下一批釋出會瞄準數千億參數等級的模型,而且他認為規模愈大、壓縮反而愈容易,因為在他看來大模型帶有更多可以剔除的冗餘。若真如此,本機能跑的天花板將大幅上移,實務問題也會從能力轉向流通:哪些執行環境支援這個格式,以及支援得有多快。就目前而言,誠實的但書是這些都是廠商在自訂分支上自行回報的數字,真正該等的是有人在阿里巴巴開源的 Qwen3.8 基礎模型上獨立重現這些結果。PrismML 已公開一份白皮書與一個示範程式庫,並稱其為重現結果的依據。
常見問題
Bonsai 2 27B 能在一般筆電上執行嗎
語言模型在最緊密的封裝下占用 5.95GB,可以輕鬆放進一般筆記型電腦或單張 GPU。PrismML 在 Apple M5 Max 上實測約每秒 47 個 token。選配的 0.63GB 視覺模組只有在真的送入圖片時才會載入,因此純文字使用完全不必為它付出空間。
它能搭配標準版 llama.cpp 嗎
不行。三元封裝仰賴自訂核心與 Hadamard 啟動轉換,標準版 llama.cpp 兩者都沒有實作。標準版會把 PTQ1_0 與 PQ2_0 兩種三元封裝當成未知型別拒絕,至於 Q2_0 檔案則會毫無警示地載入,卻因為缺少 Hadamard 啟動執行環境而產出亂碼,所以必須改用 PrismML 的 llama.cpp 分支或其 MLX 版本。
實際上損失了多少品質
PrismML 表示保留了 FP16 效能的 98.2%,也就是 14 項思考模式基準測試平均 84.78 分對比完整精度。數學與程式撰寫最接近原始模型,代理式工具呼叫以 74.92 分呈現最大落差。這些都是廠商自行量測、隨白皮書一併公布的數據,尚未經過獨立重現。






