GLM 5.3 Flashで1か月、トークン代はどこで膨らんだのか?

三枝
三枝

@sae_ledger ・ 1本

サムネイル

安いモデルに切り替えたのに、月末の使用量グラフを見て首をかしげたことはありませんか? GLM 5.3 Flash中心で9月を過ごしたWagtailコアチームの記録を、日常の作業と試作に仕訳し直すと、トークン代がどこで膨らむのかが見えてきます。先に答えを書くと、Flashの分は約1万700円で予算内、膨らんだのは試作と他のモデルに流れた分でした。

金額は1ドル158円(2026年10月2日の終値付近)で円に直しています。

GLM 5.3 Flashに収まったのは、2Bトークンの半分

記録を書いたのは、Djangoで作られたCMS「Wagtail」のコアチームにいるThibaud Colasさんです。目標は、9月の開発作業をまるごとGLM 5.3 Flashだけでこなすことでした。結果は総量2B(20億)トークンのうちFlashが1Bで、本人もブログで「Technically this challenge was a failure」と認めています。

Flashに流れた分は68ドル(約1万700円)、電力は約4kWhで、予算には余裕で収まったそうです。一方で月全体の電力は、10kWhのはずが約35kWhまで増えました。差を生んだのは、Flash以外に流れた残りの1Bです。

記事に載っている使用量の画面から、モデル別の内訳を並べるとこうなります(スクリーンショットから僕が読み取った数字です)。

モデル
トークン
割合
GLM 5.3 Flash
約10.1億
49.1%
GLM-5.3(Flashでない本体)
約4.5億
21.8%
gpt-6-astra
約2.6億
12.4%
DeepSeek V4.1 Flash
約1.1億
5.1%
gpt-5.6-luna
約9,000万
4.3%
Claude系ほか
残り
約7%

本文は、Flashの性能が落ちたのは費用対性能の良さで利用が集中したからだろうと推測し、提供元には大手ほどの計算資源がないとも書いています。切り替え先として名前が出るのはDeepSeek V4.1 FlashとQwen 3.8 Flashですが、内訳で量が大きいのはGLM-5.3本体とgpt-6-astraのほうです。

では、Flash以外の1Bのうち、どれが不調時の退避で、どれが試作や評価だったのか。画面からは分かりません。モデル別の集計だけでは、退避と試作が同じ「その他」に混ざってしまうんです。

あなたの先月の利用分では、本命のモデル以外に何割が流れていましたか?

総トークン2Bより、キャッシュ率がトークン代を決める

「20億トークン」と聞くと身構えますよね。画面の内訳では、大半はキャッシュの読み出しで約17億、キャッシュに乗らなかった入力が約3.3億、出力はわずか1,130万でした。出力は全体の1%にも届かず、キャッシュヒット率は84.1%です。

キャッシュから読み出した入力は、単価がぐっと下がります。Z.aiの公式料金では、100万トークンあたり次のとおりです。

区分
GLM 5.3 Flash
GLM-5.3
入力
0.15ドル(約24円)
1.4ドル(約221円)
キャッシュ入力
0.03ドル(約4.7円)
0.26ドル(約41円)
出力
0.50ドル(約79円)
4.4ドル(約695円)

本体のGLM-5.3は、どの区分でもFlashの約9倍です。

試しに、Flashの約10.1億トークンが全体と同じ比率でキャッシュに乗ったとして、公式単価で計算してみます。キャッシュ読み出しが約8.4億、通常の入力が約1.6億、出力が約560万なので、合計は約53ドル(約8,300円)です。同じ量がまったくキャッシュに乗らなかったら、約154ドル(約2万4,300円)まで上がります。

実際の68ドルとは合いません。どの提供元の料金かが本文になく、Flash単体のキャッシュ率も分からないので、試算は目安です。それでも、同じトークン量でもキャッシュ率しだいで請求が3倍近く動く、という読み方はできます。元記事も、安いモデルに任せる割合はトークン数でなく費用か電力で測るのがよいと書いています。

一晩で約2万3,700円、試作のトークン代は別の科目にする

膨らんだ側の代表が、WagtailのMCPサーバーの試作です。AIに任せて勢いで書かせるバイブコーディングで作った試作品で、本人いわく「'wrong' model」を選んだせいで、4.5億トークン、150ドル(約2万3,700円)、5kWhを「almost overnight」で使ったそうです。どのモデルだったかは、本文に書かれていません。

本人は、同じ結果をおそらく5分の1の費用で、手間もそれほど増やさずに得られたとも振り返っています。100万トークンあたりに直すと、Flashの68ドル分は約0.067ドル(約11円)、試作は約0.33ドル(約53円)で、5倍ほどの差です(割り算は僕の計算)。

勘定科目で考えると、この150ドルは日々の仕入れと同じ行に入れる支出ではありません。毎日のコード修正やドキュメント作業は、売上を作るための本番の仕入れです。新しいMCPサーバーの試作は、当たるかどうか分からない研究開発費にあたります。同じ「AI利用料」の1行に入れてしまうと、月末に合計だけ見て「今月は多かった」で終わってしまいます。

Wagtail側も10月の改善策に「Budgeting for experimentation, not just day-to-day tasks」を挙げ、どの試作をやる価値があるかを決めるとしています。試作を、使ったあとに集計する科目から、使う前に上限を決める科目へ移す、と僕は読んでいます。

今月の利用分のうち試作に使った金額を、あなたはすぐに答えられますか?

試作の予算は、日次とセッションの数字で止める

上限を決めても、気づくのが月末なら止められません。Wagtailの記録には、途中で手を止めるのに使える数字が並んでいます。

  1. 日次の消費: 1日平均7,940万トークンに対し、ピークの9月16日は約2.9億で、平均の約3.7倍でした。
  2. 1セッションの消費: 最も多かったのはwagtail_mcpのbackendというセッションで約1.5億トークン。月全体の約7.5%を1つのセッションが使っています。
  3. 1タスクあたりの費用: Wagtailが自前の20タスクで測った中央値では、GLM 5.3 Flashが正答55%で1タスク0.16ドル(約25円)、DeepSeek V4.1 Flashが正答95%で0.09ドル(約14円)でした。

1タスクあたりで並べると、100万トークンあたりの単価表からは見えない差が出ます。正答率が低ければ、やり直しの分もさらに上乗せされます。

僕なら、試作の行に止めどころを先に書いておきます。日次が平均の3倍を超えた日は、その日のセッション一覧を開く。1つの試作セッションが月予算の1割を超えたら、手を止めてモデルを見直す。どちらも僕の案で、Wagtailの記録にある閾値ではありません。

日次とセッションの数字は、WagtailがAIの使用量の把握に勧めているAgentsViewで見られます。

Claude CodeやCodexなど20以上のコーディングエージェントのセッション記録を手元で読み込み、セッション別・モデル別にトークン数と費用の目安を出すツールです。記録は基本的に自分のマシンに留まります。Macならbrew install --cask agentsviewで入ります。

先月いちばんトークンを食ったセッションがどれか、いま言えますか?

来月のトークン代は、予算表の行を分けて組む

Wagtailの1か月を科目に分け直すと、そのまま来月の予算表の雛形になります。

科目
中身
上限の決め方
超えたら
日常の作業
修正、ドキュメント、レビュー
前月の実績から
日次の急増を確認する
試作
新機能の試作、モデル評価
試作ごとに先に金額を決める
止めてモデルを見直す
退避
本命が不調なときの切り替え先
日常の作業の1〜2割
本命に戻せるか確かめる

上限の決め方は僕の案です。退避の行を独立させておけば、あとで「残りの1Bは何だったのか」と迷わずに済みます。

もう1つ決めておきたいのが、上位モデルへ上げる条件です。Wagtailの計測では、本体のGLM-5.3は正答70%で1タスク0.87ドル(約137円)でした。Flashより正答率は15ポイント高い一方で、1タスクの費用は5倍を超えます。上げる前に、自分のタスクを数件流して1タスクあたりの費用で比べてみてください。

単価そのものも動きます。同じモデルでも提供元で値段が違い、DeepSeekのように時間帯で単価が倍になる提供元もあります。料金改定や為替もあるので、予算表を作る日に公式の料金ページを開き直すのが確実です。

日常の開発なら「one or two flash-tier cheap models」に絞るのは十分現実的だ、というのがWagtailの結論です。月末に請求が来てから驚くのは、経理の目で見るとかなり遅いんです。来月の予算表では、試作の行にだけでも先に金額を入れておいてください。