antirezのds4、M5 MaxでDeepSeek V4 Flashを毎秒34.4トークン — DGX Sparkは14.4

MITライセンスのCエンジンは自前のGGUFしか読み込まない。公開されたリファレンス表は、プリフィルを見るか生成を見るかでハードウェアの順位が逆転する。

|5分で読める0
Apple's Mac Studio: high-memory Apple Silicon desktops are ds4's primary Metal target for running DeepSeek V4 Flash locally.
Apple's Mac Studio: high-memory Apple Silicon desktops are ds4's primary Metal target for running DeepSeek V4 Flash locally.

Redisの作者サルヴァトーレ・サンフィリッポ氏がCで書いたMITライセンスの推論エンジンDwarfStar 4(ds4)のリファレンスベンチマークが、個人向けAIワークステーションを選ぶ人には見過ごせない分岐を浮かび上がらせた。ともに128GBを積む2台のうち、一方はプロンプトの取り込みが圧倒的に速く、もう一方はトークンを返す速度が2倍を超える。

DeepSeek V4 Flashをq2、コンテキスト32,768トークンで動かすと、ds4はユニファイドメモリ128GBのM5 Max Macで毎秒34.4トークンを生成する。同じ128GBのNVIDIA DGX Sparkは14.4トークンだ。プリフィルでは順位が逆転する。同じコンテキストでSparkは毎秒855.9トークンを取り込むのに対し、Macは557.0にとどまる。コンテキストを65,536トークンまで伸ばすとSparkは823.0とほとんど落ちないが、Macは398.5まで下がる。

要点

  • ds4はサルヴァトーレ・サンフィリッポ氏による自己完結型のMITライセンスCエンジンで、汎用のGGUFランナーではなく特定のオープンウェイトモデルだけを狙う。
  • DeepSeek V4 Flash q2、コンテキスト32,768トークンで公開された数値は、128GB M5 Maxが毎秒34.4トークン生成、128GB DGX Sparkが14.4トークン。プリフィルはSparkが855.9でMacの557.0を上回る。
  • バイナリは3つが同時に配布される。CLI、OpenAIおよびAnthropic互換のローカルサーバー、そしてソケット越しではなくプロセス内で推論を回すコーディングエージェントだ。

ds4があえて目指さないもの

プロジェクトのドキュメントは、ds4が汎用のGGUFランナーではないと明言している。読み込むのはプロジェクト自身が生成したGGUFファイルだけで、モデルのサポートは機会主義的だと説明される。より良い代替が現れれば既存のモデルは外される。エンジンはGGMLとリンクしないが、llama.cppへの謝辞を記し、そこから引き継いだMITライセンスの量子化レイアウト、CPUの内積ロジック、一部のカーネルを保持している。

現在サポートされる系統は、DeepSeek V4 Flash(実験的なビジョンチェックポイントを含む)、DeepSeek V4.1 Flash、DeepSeek V4 PRO、GLM 5.2と5.3、GLM 5.3 Flash、Qwen3.8 Flash Nextである。Macでは96GB以上の機種を狙うMetalが主なターゲットだ。CUDA側の作業はDGX Sparkを中心に据えつつ、L40SのようなAda Lovelaceカードを使うマルチGPU構成にも広がり、ROCmはFramework DesktopのようなStrix Haloシステムを受け持つ。

巨大なMoE(混合専門家)モデルを机の上の1台に載せる鍵は、非対称な量子化にある。ルーティングされる専門家は大胆に圧縮し、共有される重要な経路は精度を保つ。Qwen3.8の小さいQ2ビルドはメインの重みとマルチトークン予測の重みを合わせて41.73GiBに収まり、プロジェクトはこれを64GB Macの入門向け選択肢と位置づけている。

エージェントをエンジン内部で動かす理由

ds4-serverバイナリはOpenAIおよびAnthropic形式のAPIを話すため、Claude CodeやCodex CLI、OpenCodeといったツールはベースURLをローカルマシンに向けるだけで済む。別バイナリのds4-agentはその境界ごと省いてプロセス内で推論を駆動する。するとコーディングセッション自体がディスク上のKVキャッシュになる。長いプレフィックスはSSDへ保存され、再起動後に再度取り込み直すのではなく、プロンプトのハッシュで引き継がれる。

そこがエージェント作業のうちコストの大きい半分だ。DeepSeekもモデル側から同じレバーを引いており、V4.1 FlashはKVキャッシュを1トークンあたり890バイトまで削った。

留保は明記されている

サンフィリッポ氏はこのソフトウェアをベータ品質と呼ぶ。リリースごとに大規模なQAを通すが、それでも退行は起こりうるという。さらに、ds4はAIコーディングエージェントの強力な支援を受けて構築し、アイデアとテスト、デバッグは人間が主導したと開示したうえで、AIが書いたコードに納得できない読者は別を探してほしいと書いている。完成した製品というより、各自のエージェントで拡張してもらう前提の動くテンプレートだという位置づけだ。

分散構成の数値は、マシンを連結したくなる衝動を冷ます。M5 Max Mac 2台をThunderbolt 5でつないでFlash Q4を動かすと、プリフィルはスケールするが生成はスケールしない。自己回帰の性質が残り、単体機に対して約19%のペナルティを払う。より密度の高いL40S 8枚構成は、同時16セッションで生成の合計が毎秒約126トークンと報告されている。チャット1本が速くなるのではなく、マルチユーザーサーバーの性格だ。

数値はds4-benchによるものだ。パブリックドメインのテキストを2,048トークン刻みで各コンテキストの境界まで送り、グリーディなトークン128個を測る方式のため、どの行も実行全体の平均ではなく、そのコンテキストサイズでのスループットである。これらはプロジェクトのパフォーマンスガイドに掲載され、コミュニティのDwarfStarベンチマーク表にも転載されている。同表は現在、ROCmと一般的なCUDA環境の所有者に自分の測定結果の提出を呼びかけている。

FAQ よくある質問

ds4はオープンソースなのか

そうだ。ds4はMITライセンスで公開されており、llama.cppから取り入れた量子化テーブルやカーネルも同じライセンスに従う。ソースはgithub.com/antirez/ds4にあり、リポジトリにはプロジェクトのGGUF、imatrix、品質および速度の各ツールも同梱されている。

ds4で任意のGGUFモデルファイルを動かせるのか

できない。このエンジンは設計上対象が狭く、サポート系統向けにプロジェクトが生成したGGUFファイルのみを実行する。他所から入手した汎用のGGUFファイルは対象外と明記されている。サポートする各レイアウトを端から端まで検証するために払った対価だ。

ds4でDeepSeek V4 Flashを動かすにはどれだけメモリが必要か

Metalは96GB以上のMacを狙っており、リファレンス値は128GBの機種で計測された。より小さい構成はSSDストリーミングで対応でき、41.73GiBのQwen3.8 Q2ビルドが64GB Macの出発点として示されている。

この記事への反応を残してください!

SJ

ディスカッション

ログインして投稿
読み込み中...

関連記事

「GPUが数枚だけ」の研究室、125Bモデルが24GBカード1枚で動くと主張
Developer Tools

「GPUが数枚だけ」の研究室、125Bモデルが24GBカード1枚で動くと主張

CMUのTim Dettmers氏が、研究室のフレームワークで125Bモデルを24GBのGPU1枚で、550Bモデルを128GBのMacBookで動かせると明らかにした。6件を一挙に公開するオープンソース週間を翌日に控えた発表だ。

Seung Jung11 日前
Claude Opus 5.5で400を返すようになったOpus 5のリクエスト4パターン
Developer Tools

Claude Opus 5.5で400を返すようになったOpus 5のリクエスト4パターン

Claude Opus 5.5はOpus 5より20%安い一方、Opus 5が通していた4つのリクエストにHTTP 400を返す。5つ目の変更はエージェントの進捗表示を黙らせる。

Seung Jung5 日前
Docker、AIエージェント用サンドボックスをクラウドへ 秒単位課金で1時間0.07ドルから
Developer Tools

Docker、AIエージェント用サンドボックスをクラウドへ 秒単位課金で1時間0.07ドルから

Dockerがマイクロ VM によるエージェント分離をホスト型コンピュートに広げるCloud Sandboxesを発表した。1時間0.07ドルから秒単位で課金し、Kits仕様はCNCFに提出する。

Seung Jung8 日前
開発者305人調査、71%が「理解していないAIコード」をそのまま本番投入
Developer Tools

開発者305人調査、71%が「理解していないAIコード」をそのまま本番投入

CoddyがAIコーディングツールを週1回以上使う開発者305人を調査。5人に4人が「強みではなく依存」と答え、時間外コーディングの比率はツール別に36%から62%まで開いた。

Seung Jung13 日前
Vercel、1年前に修正済みの不具合でプラットフォーム全体の AVIF を停止
Developer Tools

Vercel、1年前に修正済みの不具合でプラットフォーム全体の AVIF を停止

Vercel は報告された Next.js の RCE を libheif まで追跡し、8月13日にプラットフォーム全体で AVIF を無効化、8月25日までに sharp・libvips・libheif の修正を調整した。

Seung Jung14 日前
OpenAI、中位モデルのトークン単価を半額に ただし2つのベンチマークではGPT-5.6が依然優位
Developer Tools

OpenAI、中位モデルのトークン単価を半額に ただし2つのベンチマークではGPT-5.6が依然優位

OpenAIが火曜日に中位モデル2種を投入し、訴求点のほぼすべてを価格に置いた。GPT-6 Solは入力100万トークンあたり2ドル、出力100万トークンあたり10ドルだ。

Seung Jung10 日前