「GPUが数枚だけ」の研究室、125Bモデルが24GBカード1枚で動くと主張

Tim Dettmers氏がdlab Open Source Weekを予告した。2つのプロジェクトと4本の論文、そして研究室の外では誰も検証していないローカル推論の数字が並ぶ。

|5分で読める0
A consumer desktop graphics card installed in a PC case — the class of hardware Tim Dettmers says his lab's inference framework targets for 125-billion-parameter models.
A consumer desktop graphics card installed in a PC case — the class of hardware Tim Dettmers says his lab's inference framework targets for 125-billion-parameter models.

カーネギーメロン大学コンピュータサイエンス学部の助教、Tim Dettmers氏が月曜のブログ記事で、自身の研究室が「Open Source Week」と呼ぶ企画を予告した。オープンソースプロジェクト2件と論文4本を同時に公開するもので、データセンターがなければ動かないと思われてきたモデルが、読者の手元にあるハードウェアに収まるという主張を軸に据えている。

要点

  • Dettmers氏によれば、研究室の推論フレームワークは1250億パラメータのQwen 3.8 Flash Nextを24GBのコンシューマー向けGPU1枚で、5500億パラメータのDeepSeek V4.1をAMD Strix搭載機、NVIDIA DGX Spark、あるいはメモリ128GBのMacBookで動かせるという。
  • フレームワークのMetalカーネルにエージェントを差し向けた結果、Qwen 3.6 35B-A3Bを重み1ビットあたり1.5ビットに量子化し、毎秒450トークンを記録した。半精度の複製が必要とするメモリのおよそ10分の1にあたる。
  • 研究室の自動圧縮技術CliffCompactionは、エージェントの費用を半分程度に抑えるとされる。社内導入したパートナー企業1社は、AI予算全体が45%減ったと計測している。

ローカルで動くとされるもの

比較の核になるのは同じ系列の2つのモデルだ。270億パラメータのQwen 3.8は、Alibabaがファミリーをオープンソース化して以来、まともなカードを1枚持つ人にとって標準的なローカルモデルになった。Dettmers氏の主張は、同じカードで1250億パラメータ版を動かすべきであり、128GBのノートPCなら5500億パラメータのモデルを扱えるというものだ。

その差は、思い切った量子化に自動圧縮とコンテキスト処理を重ねて埋める。利用者が何も調整しなくても、長いコンテキストで推論速度が落ちないと同氏は説明する。

MacとMetal周りの成果は、そのソフトウェアがどう書かれたかという第二の主張の根拠として示されている。コマンド1つで研究室のエージェントハーネスをカーネルに向け、実行中はフィードバックを一切与えずに放置したところ、1.5ビットで毎秒450トークンという結果が返ってきたという。ハーネスの設計目標についての同氏の言い方は率直だ。経験豊富な研究者にしか動かせないオープンソースは、オープンソースではない。

すべての土台にあるコストの主張

CliffCompactionは、研究室が最もよく使いながら最も語ってこなかった技術だとDettmers氏は言う。数百万トークン規模のセッション、自身の例では1億トークンを超えるものまで、全体の費用をおよそ半分に抑えて回してきたという。KernelBenchではこの手法が最高水準に達し、AlphaEvolve系のアプローチや階層型メモリシステムを大差で上回ったというのが同氏の評価だ。

浮いた分は再投資される。ロールアウト1回の代わりに、同じ予算で複数回を回す。同氏はこれを、固定費のまま複数ロールアウトを実質的な性能向上に変える初の実用的手法だと位置づける一方、日々のエンジニアリング業務に使うにはまだ実用的でないとも認めている。

最も大胆な主張は研究システムだ。ハーネスとローカル推論スタックの上に構築し、インターネット接続を完全に断った状態で、フロンティア各社のディープリサーチ系システムを上回り、自律研究でSakana AIのシステムやGoogleのScientistOneを凌ぐとされる。示された実例は、自分の知らない分野をあえて選んだというバイオインフォマティクスの問題だ。エージェントは候補となる問題を3つ提示し、そのうち最初の1つに約2時間を費やして、ヒューリスティック手法の新たな下界、文献にある最良のヒューリスティックの検証済み実装、そしてこの分野が依拠してきた評価データの欠陥を示した。ただし問題全体で最高水準には届かなかったと同氏は付け加えている。

留保が重要な理由

これらはすべて、コードと論文が出る前日に、1つの研究室が自らの成果を語った内容だ。毎秒450トークンも、予算45%減も、KernelBenchの結果も、研究室の外でまだ誰も再現しておらず、記事には第三者評価への言及がない。発表を扱ったHacker Newsのスレッドも、投稿から数時間たってコメントは1桁にとどまっていた。

それでもこの週が注目に値するのは、背後にある賭けのためだ。Dettmers氏は当の記事でそれをはっきり述べている。GPUが数枚しかない小さな研究室でも、フロンティアと競えるシステムは作れる。なぜなら、安く攻められて解けば価値の大きい問題こそ、巨大な計算予算を持つ側が誰も手をつけていない領域だからだ。今回の公開はその賭けの検証であり、結果は誰にでも見える形で出る。

FAQ

125Bモデルを動かすにはどんなハードウェアが必要だとされているのか

Dettmers氏によれば、一般的なデスクトップに入る24GBのGPU1枚でよいという。5500億パラメータとはるかに大きいDeepSeek V4.1については、AMD Strix搭載機、NVIDIA DGX Spark、またはユニファイドメモリ128GBのMacBookを挙げている。

dlab Open Source Weekのコードはもう入手できるのか

発表時点では公開されていない。Dettmers氏は、企画が1日遅れたこと、翌日からオープンソースプロジェクト2件と論文4本が順次出ていくことを記している。数週間に分けるのではなく、1つのエコシステムとしてまとめて出す方針だ。

CliffCompactionは既存のコーディングエージェントの圧縮と何が違うのか

通常なら会話が終わってしまう地点を越えてエージェントを動かし続けるための自動圧縮技術だ。Dettmers氏は、Claude CodeやCodexの自動圧縮よりかなり高性能で、数百万トークンのセッションを支えながら全体の費用をおよそ半分に削ると主張する。この比較は研究室自身によるもので、独立したベンチマークではない。

この記事への反応を残してください!

SJ

ディスカッション

ログインして投稿
読み込み中...

関連記事

Meta、エージェントが直接照会できるReactデザインシステム「Astryx」をオープンソース公開
Developer Tools

Meta、エージェントが直接照会できるReactデザインシステム「Astryx」をオープンソース公開

Metaは社内モノレポで8年かけて成熟させたReactデザインシステムAstryxを、6月にMITライセンスのパブリックベータとして公開しました。

Seung Jung8 日前
LLMのバグ修正は、直した数の10倍も動くコードを壊していた
Developer Tools

LLMのバグ修正は、直した数の10倍も動くコードを壊していた

arXivの研究で、LLM修復ループが正しいプログラムを壊す率は0.261、バグを直す率は0.023だった。著者らはその挙動を駆動する内部方向まで突き止めた。

Seung Jung9 日前
Vercel、1年前に修正済みの不具合でプラットフォーム全体の AVIF を停止
Developer Tools

Vercel、1年前に修正済みの不具合でプラットフォーム全体の AVIF を停止

Vercel は報告された Next.js の RCE を libheif まで追跡し、8月13日にプラットフォーム全体で AVIF を無効化、8月25日までに sharp・libvips・libheif の修正を調整した。

Seung Jung3 日前
AIエージェントがRubyGemsに2000超のパッケージを投下、新規登録は4日間停止
Developer Tools

AIエージェントがRubyGemsに2000超のパッケージを投下、新規登録は4日間停止

フォレンジック報告が5月のGemStufferキャンペーンを再構成した。AIエージェントが2000超のgemを投下し、RubyGemsは新規登録を4日間凍結した。

Seung Jung10 日前
ZCodeが1スナップショットに42,411ファイルを梱包、復号できるのはZ.aiだけだった
Developer Tools

ZCodeが1スナップショットに42,411ファイルを梱包、復号できるのはZ.aiだけだった

Z.aiのZCodeがGit履歴ごとアリババクラウドへ送信し、暗号を解けるのは同社サーバーだけだったとリバースエンジニアリング報告が指摘した。

Seung Jung3 日前
Claude Code Projectsが刷新、並列クラウドスレッドを束ねる調整役に
Developer Tools

Claude Code Projectsが刷新、並列クラウドスレッドを束ねる調整役に

刷新されたClaude Code Projectsは、作業スレッドの上に調整役を置きます。各スレッドは自前のブランチで動く完全なクラウドセッションで、メモリを共有します。

Seung Jung4 日前