Kimi K3をMax設定でエージェントに回すと、1タスクの出力が5万トークン近くまで膨らむことがあります。Fireworksが9月23日に公開したEmber-1は、そのK3の「考える量」を削るために追加学習したモデルで、見出しには「40%少ないトークン」と書かれています。ところが公式ブログを数字ごとに読み分けると、この4割は思考トークンの数字ではありませんでした。
Ember-1の「4割減」は、どのトークンの数字か?
Ember-1はFireworks Researchの最初のモデルで、中身はKimi K3をポストトレーニングしたものです。新しいベースモデルを作ったわけではなく、同じK3に「考えすぎない」癖をつけ直した版だと捉えると分かりやすいです。
モデルが答えを出す前に内部で考える部分も、出力トークンとして課金されます。これが思考トークン(推論トークン)です。公式ブログに出てくる削減率は1つではなく、並べるとこうなります。
思考トークンが大きく減ったと言えるのは、71.3%の1社分だけです。「思考トークン4割減」という単一の数字は公式のどこにもなく、4割に近いのは総トークンのほうでした。
その1社の表を細かく見ると、品質スコアはK3が0.751、Ember-1が0.753でほぼ同じです。1タスクのステップ数は23.8から21.4に、出力トークンは49.3Kから29.9Kに減りました。推論が7割減っても出力全体は4割減にとどまるので、コードやツール呼び出しなど推論以外の出力はそれほど減っていない計算になります。
K3と単価が同じなら、請求額はどこまで下がるのか?
Ember-1の料金は100万トークンあたり、入力3ドル(約450円)、キャッシュ入力0.30ドル(約45円)、出力15ドル(約2,250円)です。FireworksでのKimi K3の料金とまったく同じで、安くなるのは生成する量だけです。
先ほどの1社分を出力単価に当てはめると、1タスクの出力代はK3が約111円、Ember-1が約67円になります(1ドル150円で換算)。1日1,000タスクを回すチームなら、出力だけで1日約4万4千円の差です。これは大きいですよね。
ただ、エージェントの請求は出力だけでは決まりません。仮に1タスクで20万トークンをキャッシュなしで読み込むとすると、入力代が約90円乗ります。合計はK3が約201円、Ember-1が約157円で、削減率は2割強まで縮みます。
入力トークンの量は公式に出ていないので、ここは私が置いた仮の数字です。ステップが減った分だけ入力も減るはずですが、その幅も公開されていません。長い資料を読ませて短く答えさせる仕事ほど、4割という数字は請求書に出てこないと考えておくのが安全です。
品質はK3 Maxと並ぶのか、ベンチごとに見ると?
公式ブログの表は、K3の推論を最大にしたK3 Maxとの比較です。
DeepSWE 1.1は8.8ポイント上がった一方で、SWE-bench Verifiedは1.0ポイント、SWE-Interactは1.3ポイント下がっています。問題数が50〜500と小さいので、1〜2問の差で入れ替わる幅です。「品質そのまま」は、多くの項目で同等、一部でわずかに低下、と読むのが正確です。
ここで面白いのが右端の列です。ターミナル操作のTerminal Benchでは半分以上削れているのに、航空会社の顧客対応を模したτ-2 Bench Airlineでは6%弱しか減っていません。もともと推論を長く書く仕事ほど、削れる余地も大きいわけです。
「K3のeffortを下げれば同じでは?」という疑問にも、公式は答えを用意しています。問題数が50を超えるベンチでは、Ember-1はK3 Lowより品質もコストも上回ると書かれています。とはいえ、削減率の表はすべてK3 Max比です。普段HighやLowで回しているなら、手元での削り幅は表より小さくなると私は見ています。
数字はすべてFireworksの自社評価で、第三者による再現はまだ見当たりません。
Ember-1を、本番の処理に組み込んでいいのか?
いまの時点では、おすすめしません。理由は提供の形にあります。
Ember-1はResearch Previewとして、Kimi K3と並ぶ選択肢の1つとして出ています。公式ブログによると、研究リリースは開発者に2週間のServerless提供を行い、恒久化するかはコミュニティの需要で決めるという扱いです。モデルページを見ても、使えるのはServerlessのみで、ファインチューニングには対応していません。
重みの公開についても、公式ブログに記載はありません。ベースのKimi K3は7月27日にHugging Faceで重みが公開されているので、ここは対照的です。企業向けには、自社用のEmber-1を学習させる支援を始めると書かれています。OpenRouterからもFireworks経由で呼べます。
私なら、Ember-1をどの仕事に回すか?
回すなら、K3 Maxで動かしているコーディングエージェントのうち、ターミナル操作が多いバッチ処理です。公開されている数字で削減率が一番大きく、失敗しても再実行できるので、提供が止まっても痛くありません。
逆に、日本語の業務文書や問い合わせ対応には回しません。A/Bテストは2社のコーディング用途だけで、日本語のデータは出ていないからです。顧客対応に近いτ-2 Bench Airlineで削減率が6%弱だったことも、この判断を後押ししています。
Ember-1の4割は、思考トークンの4割でも、請求書の4割でもありません。推論を長く吐く仕事で、出力が4割前後減るという話です。いま自分のK3の請求で、出力代が何割を占めているか把握していますか? そこが分かれば、Ember-1に切り替える価値があるかどうかは、提供が続いているうちに判断できます。

コメント
ログイン か 会員登録 するとコメントできます