パリを拠点とする H Company が 9 月 28 日、コンピュータ操作向けのオープンウェイトモデル Holo4 を 2 種類公開した。うちパラメータ 270 億の小さい方が同社の示した全スコアで首位に立つ一方、商用製品に組み込むことは法的に許されていない。
落とし穴は発表文ではなくモデルカードにある。Hugging Face の Holo4-27B は CC BY-NC 4.0 ライセンスで、用途を非商用に限定している。Apache 2.0 なのは性能で劣る兄弟モデル Holo4-35B-A3B だけであり、長時間のデスクトップ作業ではスコアがおよそ半分にとどまる。
Key takeaways
- Holo4-27B は OSWorld 2.0 で 61.7%、1 タスクあたり推定 1.22 ドル。同ベンチマークの Claude Opus 5.5 は 81.8% で 8.48 ドルだった。
- 27B の重みは CC BY-NC 4.0。Apache 2.0 は 35B-A3B の Mixture-of-Experts 版のみで、同じベンチマークのスコアは 30.9% にとどまる。
- H は自社の Agentic Task Factory が生成した約 1 万件のタスクで両モデルを訓練し、ベンチマークの実行軌跡をすべて公開して再現可能にした。
GUI もコードもツール呼び出しも 1 つのモデルで
Holo4 は目の前にどんなインターフェースがあってもソフトウェアを操作できるよう設計されている。画面をクリックして入力する、自分でコードを書いて実行する、MCP や API のツールを呼び出す——これらを同じモデルがこなす。H は公開記事で、多くのエージェントモデルが一方に寄っていると指摘する。GUI で訓練したモデルは画面がなければ何もできず、ツール呼び出し型は API を持たないアプリケーションの前で止まる。だが業務のタスク 1 件には両方の能力が必要になることが珍しくない。
同じチェックポイントがデスクトップ、ウェブ、Android、コードサンドボックス、業務 API に対して動き、呼び出し方もすべて同一だ。両サイズとも公開当日に H Models API へ載り、小型モデル Holotron4 Nano の更新版も同時に出た。
数字が実際に示すもの
従来の OSWorld デスクトップ版では、Holo4 27B が 1 タスク 0.08 ドルで 85.2% を記録した。ベースモデルである Qwen3.8 27B の 84.3%・0.22 ドルをわずかに上回り、Fable 5 の 86.0% にはやや届かない。差が開くのは長時間ワークフローを集めた難度の高い OSWorld 2.0 だ。ここで Holo4 27B は部分スコア 61.7%、完全成功率 41.5% を出し、Qwen3.8 27B の 48.0%・19.4% をおよそ 3 分の 1 のコストで上回った。
フロンティアを超えたわけではない。Opus 5.5 は OSWorld 2.0 で 81.8% と首位に立ち、専門ワークフローの ALE-CLI でも 63.7% で Holo4 の 44.1% を上回る。AutomationBench では Opus 5 が 50.3% で 45.4% を抑えた。H が押し出すのは、そのスコアの隣に並ぶコストである。AutomationBench では 1 タスク 0.05 ドル対 3.05 ドルだ。AndroidWorld では 27B が 85.1% で、Fable 5 の 88.8% に及ばない。
訓練の手法
H の Agentic Task Factory は、ドキュメントだけから対話可能な環境と検証可能なタスクを生成する。材料は製品ドキュメントと、実在するウェブサイトやオープンソースソフトウェアのスクリーンショットだ。同社によれば、これまでに約 1 万件を生成し、内訳はウェブアプリ 4,000 件、MCP サーバー 3,000 件、デスクトップ・OS 3,000 件となる。
教師ありファインチューニングには 1,270 億トークンを投じた。うち 4 分の 3 ほどが成功したエージェント軌跡で、デスクトップ作業に重みを大きく置いている。続く非同期オンライン強化学習では、デスクトップ・ウェブ担当とターミナル・MCP・API 担当という 2 つの LoRA エキスパートを個別に訓練し、追加学習なしで等しい比重でファインチューニング済みモデルへ統合した。
H はモデルを取り巻く実行環境も作り直した。上限を 2 時間・200 アクションから 6 時間・500 アクションへ引き上げている。最大の改善は、数百ステップにわたって保持される記憶をエージェントに与えたこと、そしてデスクトップマシン上にシェルを開いたことから生まれたという。
今後の見通し
公開スコアの背後にある軌跡はすべてダウンロードできる。ベンチマークでの勝利を掲げる研究所としては異例の開示であり、アリババの Qwen3.8 オープン公開が用意しなかった独立検証の道を開くものだ。最適化した DSpark ドラフター用チェックポイントも数日内に出るとされる。ただし、いま商用権利が必要なチームにとって現実的な選択肢は、有料のホスティング API か、スコアが半分の Apache ライセンス版のどちらかになる。
FAQ・よくある質問
Holo4 は商用製品に使えるのか
一部のみ可能だ。Holo4-35B-A3B は Apache 2.0 で公開されており商用配布できるが、スコアの高い Holo4-27B は CC BY-NC 4.0 で非商用に限られる。両モデルとも有料の H Models API 経由でも提供され、そちらに同種の制限はない。
コンピュータ操作で Claude Opus 5.5 と比べるとどうか
精度では劣り、コストでは勝る。OSWorld 2.0 のスコアは Opus 5.5 が 81.8%、Holo4 27B が 61.7%。一方で H は 1 タスクあたりのコストを Opus 5.5 が 8.48 ドル、自社モデルが 1.22 ドルと見積もる。Opus の数値は H が自前の環境で測ったものではなく、Anthropic が公開した最大努力(max-effort)実行の結果を引用したものだ。
Holo4 のベースモデルは何か
Hugging Face のモデルカードによれば、密結合型の 27B は Qwen3.8-27B を、Mixture-of-Experts 版は Qwen3.6-35B-A3B をファインチューニングしている。H は両モデルをそれぞれのベースと比較しており、改善幅が最も大きいのは単一画面のタスクではなく、多段階にわたる長いワークフローだ。






