Claude CodeやCodex CLIをAPIで回していて、月末の請求が気になりませんか? DwarfStar 4(ds4)はMacの中でコーディングエージェントを動かせるローカル推論エンジンで、従量課金はゼロにできます。そのかわり、メモリとSSDと電気代、それに部屋に響くファンの音で払うことになります。
DwarfStar 4は、汎用を捨てたローカル推論エンジン
DwarfStar 4は、Redisの作者として知られるantirezさんが2026年5月に公開した、C言語の推論エンジンです。READMEは自分を「not a general GGUF runner」と説明していて、llama.cppのように手元のGGUFを何でも読み込む道具とは違います。使えるのは、プロジェクトが配るGGUFだけです。
対応モデルは、DeepSeek V4 Flash、DeepSeek V4.1 Flash、GLM 5.2と5.3、GLM 5.3 Flash、DeepSeek V4 PRO、Qwen3.8 Flash Nextです(2026年10月4日時点のREADME)。V4.1 FlashとQwen3.8 Flash Nextへの対応は、9月12日から14日にかけて入りました。READMEには、モデル対応は「opportunistic」で、より良い代わりが出たら外すこともある、とはっきり書かれています。
ここは見落とせない点ですね。今日使っているモデルが、半年後も残っている保証はありません。
コーディングエージェントとして使う入口は2つです。ds4-agentはHTTPサーバーを介さずに推論を直接回すエージェントで、ds4-serverはClaude CodeやCodex CLI、OpenCodeなどをつなぐためのサーバーです。Claude CodeならANTHROPIC_BASE_URLにhttp://127.0.0.1:8000を指定します。設定の全体は公式のCLIENTS.mdにあります。
API課金ゼロの代わりに払うもの
従量課金が消えても、支払いそのものは消えません。公式資料を読みながら台帳にすると、こうなります。
--powerでGPU負荷を下げられる公式サイトのハードウェア表には、Apple Siliconの「64 GB+」の行に「Runs well」とあります。READMEのほうは主対象を96GB以上としていて、64GBは工夫して載せる位置づけです。64GBで始めるなら、Qwen3.8 Flash NextのQ2を8Kコンテキストから試すのが、READMEの挙げる入り口です。
ディスクの重さも、メモリと同じくらい効いてきます。Qwen3.8 Flash NextのQ2はファイルが137.10GiBあり、RAMに載る重みは41.73GiB、残りの95.37GiBはSSDから直接読みます。V4.1 FlashのQ2は341GiBで、128GBのMacではSSDストリーミングが前提です。あなたのMacの内蔵SSD、いま何GB空いていますか?
DwarfStar 4の公式の速度は、どこまで当てになるか?
公式のPERFORMANCE.mdには、M5 Max(128GB)でDeepSeek FlashのQ2を回した記録が載っています。2048トークンの文脈で、プロンプトの読み込みが毎秒790.18トークン、生成が毎秒39.35トークン。65536トークンまで伸ばすと、それぞれ398.50と27.64に下がります。
ただし原文は、この数字を「記録済みのベースライン」と呼び、以降のコミットごとに測り直したものではないと断っています。計測は貪欲法の固定プローブで、区切りごとに128トークンを生成する形です。長い文脈を何往復もさせるコーディングエージェントの使い方とは、条件が違います。
SSDから読みながら動かすと、数字は大きく変わります。同じM5 Max 128GBでGLM 5.3 FlashのQ4_K(177.77GiB)を動かした記録では、最初のトークンを待つ時間込みで、生成が毎秒11.9〜14.9トークンでした。ドキュメントには、起動できても対話には遅すぎることがある、という一文もあります。
公式資料に、Mac Studioでの数字は見当たりません。M5 Maxの数字をそのまま自分のMacに当てはめるのは、やめておいたほうがいいと思います。あなたが回したいのは短い修正の頼みごとですか、それともリポジトリ全体を読ませる長い仕事ですか?
ローカルLLMのファンと電気代は、自分のMacで測る
速度の数字も気になるけど、録音中にファンが回り出すかどうかのほうが、わたしには大事なんですね。ミックスを書き出している横にAIを常駐させるなら、知りたいのは部屋の静けさが保てるかどうかです。
公式資料に、ワット数やファン音、温度の記載はありません。あるのは--powerオプションだけです。DeepSeek V4では--power 70のように値を下げると、速度と引き換えにGPUの持続的な負荷を抑えられます。既定値は100で、V4.1とGLMは今のところ100が必須です。
わたしなら、導入前に次の4つを測ります。
- コンセントにワットチェッカーを挟み、待機中と生成中の消費電力を比べる
sudo powermetrics --samplers cpu_power,gpu_power -i 1000で、CPUとGPUの電力を1秒ごとに見る- 長めの生成を流し、ファンの音が聞こえ始めるまでの時間を計る
- DeepSeek V4なら
--power 70に下げて、同じことをもう一度やる
電気代は、測った値を式に入れれば出せます。ワット数×1日の時間×日数÷1000が月のkWhで、それに電気の単価を掛けます。たとえば150Wで1日8時間、30日回すと36kWhで、1kWhあたり31円なら月1,116円です。150Wと31円は計算用の仮の数字なので、自分の測定値と契約の単価に置き換えてください。
あなたのMacは、寝室や仕事部屋と同じ空間に置いてありませんか? だとしたら、電気代より先にファンの音が気になってくると思います。
夜にコーディングエージェントを回すなら、キャッシュの置き場所から
寝ている間にコーディングエージェントを回し、朝に結果を見る。API課金を気にしなくていいなら、試したくなる使い方ですね。ただ、公式資料にこの使い方の案内はないので、前提は自分でそろえます。
ds4-agentの会話は~/.ds4/kvcacheに保存され、/saveや/list、/switchで行き来できます。画像を含む会話は、まだ保存できません。ds4-serverのほうは、--kv-disk-dirと--kv-disk-space-mbでディスクにキャッシュを置けます。
気をつけたいのは、その中身です。公式のドキュメントは、キャッシュファイルにはプロンプトの本文が入るので、ディレクトリを非公開のものとして扱うように書いています。公式の例は/tmp/ds4-kvですが、仕事のソースコードを読ませるなら、置き場所と消すタイミングを先に決めておきたいところです。
もう1つは更新の速さです。READMEは自分をbeta品質と呼び、変化がとても速いと書いています。夜に回すなら、更新した直後の晩は避けて、昼のうちに短い生成で動作を確かめておくと安心です。
DwarfStar 4は、APIを減らす道具として試す
最初の一歩は、短い生成で十分です。SSDストリーミングのドキュメントにも、長いタスクに入る前に短い生成で試すように、と書かれています。
- メモリとSSDの空きを見る。96GB以上ならDeepSeek V4 FlashのQ2を
./download_model.sh ds4f-q2で落とし、64GBならQwen3.8 Flash NextのQ2をREADMEのとおり--ctx 8192 --prefill-chunk 1024の8Kコンテキストから makeでビルドし、./ds4で短い生成を流して、速度とファンの音を確かめる- 問題がなければ
ds4-serverを立てて、Claude Codeなどを向ける
逆に、64GB未満のMacで使いたい人や、静かな部屋で一日中回したい人、安定性を何より優先したい人には、まだ向かないと思います。品質がAPIの最上位モデルとどこまで近いかも、公式資料では比べられていません。
API課金をゼロにする道具というより、夜の雑用や小さな修正をローカルに逃がして、請求を減らす道具だと思います。128GBのMacに空いている時間があるなら、ひと晩回す前に、まず10分だけ短い生成を流してみる価値はあります。

コメント
ログイン か 会員登録 するとコメントできます