AI Newsway

Holo4 最強電腦操作模型開放權重,但不准商用

H Company 的 27B 代理在 OSWorld 2.0 拿下 61.7%,成本只有 Opus 5.5 的七分之一,但掛上 Apache 2.0 授權的卻是表現較弱的 Mixture-of-Experts 版本

|5分鐘閱讀0
A person working alongside an on-screen assistant — the kind of desktop interaction Holo4 is trained to perform on its own.
A person working alongside an on-screen assistant — the kind of desktop interaction Holo4 is trained to perform on its own.

總部位於巴黎的 H Company 於 9 月 28 日發表 Holo4,兩款開放權重的電腦操作模型中,參數 270 億的較小版本在該實驗室公布的每一項分數上都居首——卻無法合法放進商業產品裡。

問題不在發表文,而在模型卡。Hugging Face 上的 Holo4-27B 採用 CC BY-NC 4.0 授權,僅限非商業用途。掛上 Apache 2.0 的只有表現較弱的兄弟模型 Holo4-35B-A3B,而它在長時間桌面流程上的分數大約只有一半。

Key takeaways

  • Holo4-27B 在 OSWorld 2.0 拿下 61.7%,每項任務估計 1.22 美元;同一測試中 Claude Opus 5.5 為 81.8%、8.48 美元。
  • 27B 權重為 CC BY-NC 4.0;Apache 2.0 只適用於 35B-A3B 的 Mixture-of-Experts 版本,該版本在同一測試僅 30.9%。
  • H 以自家 Agentic Task Factory 生成的約 1 萬項任務訓練兩款模型,並公開所有基準測試的執行軌跡供重播檢驗。

一個模型同時處理 GUI、程式與工具呼叫

Holo4 的設計目標,是不論眼前是什麼介面都能操作軟體:在畫面上點擊與輸入、自己撰寫並執行程式,或呼叫 MCP 與 API 工具。H 在發表文章中指出,多數代理模型只走其中一條路:以 GUI 訓練的模型沒有畫面就寸步難行,工具呼叫型模型則會卡在不提供 API 的應用程式前——但一件實際業務任務往往兩者都需要。

同一份檢查點可在桌面、網頁、Android、程式沙箱與企業 API 上運作,呼叫方式完全一致。兩種尺寸都在發表當天上線 H Models API,同時推出的還有更新後的小型模型 Holotron4 Nano。

這些數字實際落在哪裡

在原始的 OSWorld 桌面測試中,Holo4 27B 以每項任務 0.08 美元達到 85.2%,略高於其基礎模型 Qwen3.8 27B 的 84.3%(0.22 美元),僅次於 Fable 5 的 86.0%。差距在難度更高、以長流程為主的 OSWorld 2.0 拉開:Holo4 27B 的部分分數為 61.7%、完全成功率 41.5%,以約三分之一的成本勝過 Qwen3.8 27B 的 48.0% 與 19.4%。

它並未超越前沿模型。Opus 5.5 在 OSWorld 2.0 以 81.8% 領先,專家流程項目 ALE-CLI 也以 63.7% 勝過 Holo4 的 44.1%;AutomationBench 則由 Opus 5 以 50.3% 壓過 45.4%。H 主打的是分數旁邊那一欄成本:AutomationBench 每項任務 0.05 美元對 3.05 美元。在 AndroidWorld 上,27B 模型拿下 85.1%,落後 Fable 5 的 88.8%。

訓練方式

H 的 Agentic Task Factory 只靠文件就能建構互動環境與可驗證任務,素材是產品文件以及真實網站或開源軟體的截圖。該實驗室表示目前已產出約 1 萬項任務,大致分為網頁應用 4,000 項、MCP 伺服器 3,000 項、桌面與作業系統 3,000 項。

監督式微調用掉 1,270 億 token,其中約四分之三是成功的代理軌跡,且明顯偏重桌面工作。接著以非同步線上強化學習訓練兩個專門的 LoRA 專家,一個負責桌面與網頁,另一個負責終端機、MCP 與 API,最後以相同權重合併回微調後的模型,未再另行訓練。

H 也重建了模型外圍的執行框架,把上限從兩小時 200 個動作提高到六小時 500 個動作。該實驗室指出,提升最大的兩項改動,是讓代理在數百個步驟間保有持久記憶,以及直接在桌面機器上開一個 shell。

接下來要看什麼

公布分數背後的每一條軌跡都可下載。對一個高舉基準測試成績的實驗室來說,這是相當罕見的揭露,也為阿里巴巴 Qwen3.8 開放釋出所未提供的獨立重播留下空間。最佳化的 DSpark drafter 檢查點預告數日內推出。不過,對今天就需要商業授權的團隊而言,實際選項只剩付費的託管 API,或是分數只有一半的 Apache 授權模型。

FAQ・常見問題

Holo4 可以用在商業產品上嗎

只有部分可以。Holo4-35B-A3B 以 Apache 2.0 釋出,可商業部署;分數較高的 Holo4-27B 則是 CC BY-NC 4.0,僅限非商業用途。兩款模型也都透過付費的 H Models API 提供,該途徑沒有這類限制。

在電腦操作上,Holo4 和 Claude Opus 5.5 相比如何

準確度落後,成本領先。OSWorld 2.0 上 Opus 5.5 為 81.8%,Holo4 27B 為 61.7%;但 H 估算每項任務成本為 Opus 5.5 的 8.48 美元對自家模型的 1.22 美元。Opus 的數字並非 H 自行實測,而是取自 Anthropic 公布的最大算力(max-effort)執行結果。

Holo4 的基礎模型是什麼

依據 Hugging Face 模型卡,密集型 27B 由 Qwen3.8-27B 微調而來,Mixture-of-Experts 版本則來自 Qwen3.6-35B-A3B。H 將兩者分別與各自的基礎模型比較,提升幅度最大的是多步驟的長流程任務,而非單一畫面的操作。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

Qwen-Image-2.1 用 70 億參數裝下透明圖層編輯,授權條款卻擋住商業使用
AI & Machine Learning

Qwen-Image-2.1 用 70 億參數裝下透明圖層編輯,授權條款卻擋住商業使用

阿里巴巴 Qwen 團隊推出 70 億參數的圖像生成與編輯統一模型,具備原生透明度與最多 10 張參考圖合成,但採用僅限研究的授權。

Seung Jung8 天前
小米 MiMo-V2.6-Pro 登上開放權重第一,而上一代在 DeepSWE 只拿了 19 分
AI & Machine Learning

小米 MiMo-V2.6-Pro 登上開放權重第一,而上一代在 DeepSWE 只拿了 19 分

小米以 MIT 授權釋出 MiMo-V2.6-Pro 權重,Artificial Analysis 指數 46 分,為開放模型最高。上一代 DeepSWE 只有 19.0,這一代來到 71.9。

Seung Jung7 天前
只是叫它修個 bug,程式代理卻重新訓練並換掉了自己的模型
AI & Machine Learning

只是叫它修個 bug,程式代理卻重新訓練並換掉了自己的模型

AI 安全實驗室 Irregular 給了 Qwen3.5-27B 代理一項維護任務。它微調並重新部署了同時驅動這支應用與它自己的模型。

Seung Jung9 天前
Gemini在5月入侵3個外部系統,Google到9月才公開
AI & Machine Learning

Gemini在5月入侵3個外部系統,Google到9月才公開

Google確認Gemini在5月的評估期間存取了3個外部系統,其中一組憑證是猜出來的,另外兩組則在公開程式碼儲存庫中找到。

Seung Jung10 天前
Anthropic在灣區經營一座實體生物學實驗室
AI & Machine Learning

Anthropic在灣區經營一座實體生物學實驗室

Anthropic確認在灣區經營一座進行實體生物學實驗的溼實驗室,並正在測試Claude能否指揮機器人系統完成這些實驗。

Seung Jung10 天前
第二個模型破解了一則恩尼格瑪電文,這次人力介入更深
AI & Machine Learning

第二個模型破解了一則恩尼格瑪電文,這次人力介入更深

Claude Opus 5 破解了第二則未解的恩尼格瑪電文,但人力引導遠多於數日前的 Astra 那次。目前還剩七則未破譯。

Seung Jung3 天前