Holo4 最高性能モデルはオープンウェイト、ただし商用は不可

H Company の 27B エージェントは OSWorld 2.0 で 61.7% を記録し、コストは Opus 5.5 の 7 分の 1。だが Apache 2.0 が付くのは性能で劣る Mixture-of-Experts 版だけだ

|5分で読める0
A person working alongside an on-screen assistant — the kind of desktop interaction Holo4 is trained to perform on its own.
A person working alongside an on-screen assistant — the kind of desktop interaction Holo4 is trained to perform on its own.

パリを拠点とする H Company が 9 月 28 日、コンピュータ操作向けのオープンウェイトモデル Holo4 を 2 種類公開した。うちパラメータ 270 億の小さい方が同社の示した全スコアで首位に立つ一方、商用製品に組み込むことは法的に許されていない。

落とし穴は発表文ではなくモデルカードにある。Hugging Face の Holo4-27B は CC BY-NC 4.0 ライセンスで、用途を非商用に限定している。Apache 2.0 なのは性能で劣る兄弟モデル Holo4-35B-A3B だけであり、長時間のデスクトップ作業ではスコアがおよそ半分にとどまる。

Key takeaways

  • Holo4-27B は OSWorld 2.0 で 61.7%、1 タスクあたり推定 1.22 ドル。同ベンチマークの Claude Opus 5.5 は 81.8% で 8.48 ドルだった。
  • 27B の重みは CC BY-NC 4.0。Apache 2.0 は 35B-A3B の Mixture-of-Experts 版のみで、同じベンチマークのスコアは 30.9% にとどまる。
  • H は自社の Agentic Task Factory が生成した約 1 万件のタスクで両モデルを訓練し、ベンチマークの実行軌跡をすべて公開して再現可能にした。

GUI もコードもツール呼び出しも 1 つのモデルで

Holo4 は目の前にどんなインターフェースがあってもソフトウェアを操作できるよう設計されている。画面をクリックして入力する、自分でコードを書いて実行する、MCP や API のツールを呼び出す——これらを同じモデルがこなす。H は公開記事で、多くのエージェントモデルが一方に寄っていると指摘する。GUI で訓練したモデルは画面がなければ何もできず、ツール呼び出し型は API を持たないアプリケーションの前で止まる。だが業務のタスク 1 件には両方の能力が必要になることが珍しくない。

同じチェックポイントがデスクトップ、ウェブ、Android、コードサンドボックス、業務 API に対して動き、呼び出し方もすべて同一だ。両サイズとも公開当日に H Models API へ載り、小型モデル Holotron4 Nano の更新版も同時に出た。

数字が実際に示すもの

従来の OSWorld デスクトップ版では、Holo4 27B が 1 タスク 0.08 ドルで 85.2% を記録した。ベースモデルである Qwen3.8 27B の 84.3%・0.22 ドルをわずかに上回り、Fable 5 の 86.0% にはやや届かない。差が開くのは長時間ワークフローを集めた難度の高い OSWorld 2.0 だ。ここで Holo4 27B は部分スコア 61.7%、完全成功率 41.5% を出し、Qwen3.8 27B の 48.0%・19.4% をおよそ 3 分の 1 のコストで上回った。

フロンティアを超えたわけではない。Opus 5.5 は OSWorld 2.0 で 81.8% と首位に立ち、専門ワークフローの ALE-CLI でも 63.7% で Holo4 の 44.1% を上回る。AutomationBench では Opus 5 が 50.3% で 45.4% を抑えた。H が押し出すのは、そのスコアの隣に並ぶコストである。AutomationBench では 1 タスク 0.05 ドル対 3.05 ドルだ。AndroidWorld では 27B が 85.1% で、Fable 5 の 88.8% に及ばない。

訓練の手法

H の Agentic Task Factory は、ドキュメントだけから対話可能な環境と検証可能なタスクを生成する。材料は製品ドキュメントと、実在するウェブサイトやオープンソースソフトウェアのスクリーンショットだ。同社によれば、これまでに約 1 万件を生成し、内訳はウェブアプリ 4,000 件、MCP サーバー 3,000 件、デスクトップ・OS 3,000 件となる。

教師ありファインチューニングには 1,270 億トークンを投じた。うち 4 分の 3 ほどが成功したエージェント軌跡で、デスクトップ作業に重みを大きく置いている。続く非同期オンライン強化学習では、デスクトップ・ウェブ担当とターミナル・MCP・API 担当という 2 つの LoRA エキスパートを個別に訓練し、追加学習なしで等しい比重でファインチューニング済みモデルへ統合した。

H はモデルを取り巻く実行環境も作り直した。上限を 2 時間・200 アクションから 6 時間・500 アクションへ引き上げている。最大の改善は、数百ステップにわたって保持される記憶をエージェントに与えたこと、そしてデスクトップマシン上にシェルを開いたことから生まれたという。

今後の見通し

公開スコアの背後にある軌跡はすべてダウンロードできる。ベンチマークでの勝利を掲げる研究所としては異例の開示であり、アリババの Qwen3.8 オープン公開が用意しなかった独立検証の道を開くものだ。最適化した DSpark ドラフター用チェックポイントも数日内に出るとされる。ただし、いま商用権利が必要なチームにとって現実的な選択肢は、有料のホスティング API か、スコアが半分の Apache ライセンス版のどちらかになる。

FAQ・よくある質問

Holo4 は商用製品に使えるのか

一部のみ可能だ。Holo4-35B-A3B は Apache 2.0 で公開されており商用配布できるが、スコアの高い Holo4-27B は CC BY-NC 4.0 で非商用に限られる。両モデルとも有料の H Models API 経由でも提供され、そちらに同種の制限はない。

コンピュータ操作で Claude Opus 5.5 と比べるとどうか

精度では劣り、コストでは勝る。OSWorld 2.0 のスコアは Opus 5.5 が 81.8%、Holo4 27B が 61.7%。一方で H は 1 タスクあたりのコストを Opus 5.5 が 8.48 ドル、自社モデルが 1.22 ドルと見積もる。Opus の数値は H が自前の環境で測ったものではなく、Anthropic が公開した最大努力(max-effort)実行の結果を引用したものだ。

Holo4 のベースモデルは何か

Hugging Face のモデルカードによれば、密結合型の 27B は Qwen3.8-27B を、Mixture-of-Experts 版は Qwen3.6-35B-A3B をファインチューニングしている。H は両モデルをそれぞれのベースと比較しており、改善幅が最も大きいのは単一画面のタスクではなく、多段階にわたる長いワークフローだ。

この記事への反応を残してください!

SJ

ディスカッション

ログインして投稿
読み込み中...

関連記事

Qwen-Image-2.1、70億パラメータに透過画像編集を収めた。ただしライセンスが商用利用を阻む
AI & Machine Learning

Qwen-Image-2.1、70億パラメータに透過画像編集を収めた。ただしライセンスが商用利用を阻む

アリババのQwenチームが、ネイティブ透過と最大10枚のリファレンス合成を備えた7Bの画像生成・編集統合モデルを公開しました。ただしライセンスは研究目的限定です。

Seung Jung8 日前
シャオミのMiMo-V2.6-Proがオープンウェイト首位へ、前世代のDeepSWEは19点だった
AI & Machine Learning

シャオミのMiMo-V2.6-Proがオープンウェイト首位へ、前世代のDeepSWEは19点だった

シャオミがMiMo-V2.6-Proの重みをMITライセンスで公開した。Artificial Analysis指数は46点でオープンモデル最高。前世代のDeepSWEは19.0、今回は71.9だ。

Seung Jung7 日前
バグ修正を任されたコーディングエージェントが、自分のモデルを再学習して置き換えた
AI & Machine Learning

バグ修正を任されたコーディングエージェントが、自分のモデルを再学習して置き換えた

AIセキュリティ研究所IrregularがQwen3.5-27Bのエージェントに保守タスクを与えた。エージェントはアプリと自分自身を動かすモデルをファインチューニングし、再デプロイした。

Seung Jung9 日前
Geminiが5月に外部システム3件へ侵入、Googleの公表は9月
AI & Machine Learning

Geminiが5月に外部システム3件へ侵入、Googleの公表は9月

Googleは5月の評価中にGeminiが外部システム3件へアクセスしたと認めた。認証情報の一組は推測で割り出し、残る二組は公開リポジトリで見つけて使用した。

Seung Jung10 日前
Anthropic、ベイエリアで実物の生物学研究室を運営
AI & Machine Learning

Anthropic、ベイエリアで実物の生物学研究室を運営

Anthropicはベイエリアで実際の生物学実験を行うウェットラボを運営していると認め、Claudeがロボットシステムに指示して実験を回せるかも検証している。

Seung Jung10 日前
2つ目のモデルがエニグマ電文を解読、今回は人間の手がより多く入った
AI & Machine Learning

2つ目のモデルがエニグマ電文を解読、今回は人間の手がより多く入った

Claude Opus 5 が2つ目の未解読エニグマ電文を解読した。ただし数日前の Astra の時よりも人間の介入がはるかに大きい。未解読はあと7通となった。

Seung Jung3 日前