Redisの作者サルヴァトーレ・サンフィリッポ氏がCで書いたMITライセンスの推論エンジンDwarfStar 4(ds4)のリファレンスベンチマークが、個人向けAIワークステーションを選ぶ人には見過ごせない分岐を浮かび上がらせた。ともに128GBを積む2台のうち、一方はプロンプトの取り込みが圧倒的に速く、もう一方はトークンを返す速度が2倍を超える。
DeepSeek V4 Flashをq2、コンテキスト32,768トークンで動かすと、ds4はユニファイドメモリ128GBのM5 Max Macで毎秒34.4トークンを生成する。同じ128GBのNVIDIA DGX Sparkは14.4トークンだ。プリフィルでは順位が逆転する。同じコンテキストでSparkは毎秒855.9トークンを取り込むのに対し、Macは557.0にとどまる。コンテキストを65,536トークンまで伸ばすとSparkは823.0とほとんど落ちないが、Macは398.5まで下がる。
要点
- ds4はサルヴァトーレ・サンフィリッポ氏による自己完結型のMITライセンスCエンジンで、汎用のGGUFランナーではなく特定のオープンウェイトモデルだけを狙う。
- DeepSeek V4 Flash q2、コンテキスト32,768トークンで公開された数値は、128GB M5 Maxが毎秒34.4トークン生成、128GB DGX Sparkが14.4トークン。プリフィルはSparkが855.9でMacの557.0を上回る。
- バイナリは3つが同時に配布される。CLI、OpenAIおよびAnthropic互換のローカルサーバー、そしてソケット越しではなくプロセス内で推論を回すコーディングエージェントだ。
ds4があえて目指さないもの
プロジェクトのドキュメントは、ds4が汎用のGGUFランナーではないと明言している。読み込むのはプロジェクト自身が生成したGGUFファイルだけで、モデルのサポートは機会主義的だと説明される。より良い代替が現れれば既存のモデルは外される。エンジンはGGMLとリンクしないが、llama.cppへの謝辞を記し、そこから引き継いだMITライセンスの量子化レイアウト、CPUの内積ロジック、一部のカーネルを保持している。
現在サポートされる系統は、DeepSeek V4 Flash(実験的なビジョンチェックポイントを含む)、DeepSeek V4.1 Flash、DeepSeek V4 PRO、GLM 5.2と5.3、GLM 5.3 Flash、Qwen3.8 Flash Nextである。Macでは96GB以上の機種を狙うMetalが主なターゲットだ。CUDA側の作業はDGX Sparkを中心に据えつつ、L40SのようなAda Lovelaceカードを使うマルチGPU構成にも広がり、ROCmはFramework DesktopのようなStrix Haloシステムを受け持つ。
巨大なMoE(混合専門家)モデルを机の上の1台に載せる鍵は、非対称な量子化にある。ルーティングされる専門家は大胆に圧縮し、共有される重要な経路は精度を保つ。Qwen3.8の小さいQ2ビルドはメインの重みとマルチトークン予測の重みを合わせて41.73GiBに収まり、プロジェクトはこれを64GB Macの入門向け選択肢と位置づけている。
エージェントをエンジン内部で動かす理由
ds4-serverバイナリはOpenAIおよびAnthropic形式のAPIを話すため、Claude CodeやCodex CLI、OpenCodeといったツールはベースURLをローカルマシンに向けるだけで済む。別バイナリのds4-agentはその境界ごと省いてプロセス内で推論を駆動する。するとコーディングセッション自体がディスク上のKVキャッシュになる。長いプレフィックスはSSDへ保存され、再起動後に再度取り込み直すのではなく、プロンプトのハッシュで引き継がれる。
そこがエージェント作業のうちコストの大きい半分だ。DeepSeekもモデル側から同じレバーを引いており、V4.1 FlashはKVキャッシュを1トークンあたり890バイトまで削った。
留保は明記されている
サンフィリッポ氏はこのソフトウェアをベータ品質と呼ぶ。リリースごとに大規模なQAを通すが、それでも退行は起こりうるという。さらに、ds4はAIコーディングエージェントの強力な支援を受けて構築し、アイデアとテスト、デバッグは人間が主導したと開示したうえで、AIが書いたコードに納得できない読者は別を探してほしいと書いている。完成した製品というより、各自のエージェントで拡張してもらう前提の動くテンプレートだという位置づけだ。
分散構成の数値は、マシンを連結したくなる衝動を冷ます。M5 Max Mac 2台をThunderbolt 5でつないでFlash Q4を動かすと、プリフィルはスケールするが生成はスケールしない。自己回帰の性質が残り、単体機に対して約19%のペナルティを払う。より密度の高いL40S 8枚構成は、同時16セッションで生成の合計が毎秒約126トークンと報告されている。チャット1本が速くなるのではなく、マルチユーザーサーバーの性格だ。
数値はds4-benchによるものだ。パブリックドメインのテキストを2,048トークン刻みで各コンテキストの境界まで送り、グリーディなトークン128個を測る方式のため、どの行も実行全体の平均ではなく、そのコンテキストサイズでのスループットである。これらはプロジェクトのパフォーマンスガイドに掲載され、コミュニティのDwarfStarベンチマーク表にも転載されている。同表は現在、ROCmと一般的なCUDA環境の所有者に自分の測定結果の提出を呼びかけている。
FAQ よくある質問
ds4はオープンソースなのか
そうだ。ds4はMITライセンスで公開されており、llama.cppから取り入れた量子化テーブルやカーネルも同じライセンスに従う。ソースはgithub.com/antirez/ds4にあり、リポジトリにはプロジェクトのGGUF、imatrix、品質および速度の各ツールも同梱されている。
ds4で任意のGGUFモデルファイルを動かせるのか
できない。このエンジンは設計上対象が狭く、サポート系統向けにプロジェクトが生成したGGUFファイルのみを実行する。他所から入手した汎用のGGUFファイルは対象外と明記されている。サポートする各レイアウトを端から端まで検証するために払った対価だ。
ds4でDeepSeek V4 Flashを動かすにはどれだけメモリが必要か
Metalは96GB以上のMacを狙っており、リファレンス値は128GBの機種で計測された。より小さい構成はSSDストリーミングで対応でき、41.73GiBのQwen3.8 Q2ビルドが64GB Macの出発点として示されている。






