Fireworks AIが、Moonshot AIのKimi K3を基盤とする推論モデルEmber-1を公開した。ベースモデルと同等の品質に達しながら、出力するトークンは約40%少ないという。9月24日にFireworksのサーバーレスプラットフォームでリサーチプレビューとして稼働を開始し、公開されている料金表はK3と同一である。キャッシュされていない入力が100万トークンあたり3ドル、キャッシュ済み入力が0.30ドル、出力が15ドル。トークン単価は何も変わっていない。請求額が下がるのは、請求書に載るトークンの数が減るからだ。
記事の要点
- Ember-1の公開価格は入力100万トークンあたり3ドル、出力15ドルで、学習元となったKimi K3ベースモデルと同じ。コンテキストウィンドウは1,048,576トークンである。
- 公開ベンチマーク7種と顧客2社の本番トラフィックにおいて、K3の推論を精度を落とさずに35〜50%短縮できたとFireworksは報告する。
- 顧客2社のコーディング業務を対象としたライブA/Bテストでは、同等の品質でタスクあたりのトークンを約35%削減し、2社のうち1社はすでに本番へ移行した。
推論の過程が高コストになった理由
K3のような推論モデルは、生成トークンの大半を、ときには90%を超える分を、ユーザーが読む答えではなく内部の熟考に費やす。
エージェントのループはそのコストを複利に変える。ターンごとに直前までの記録をまるごと入力し直すため、1ターン目に書いた推論はその後のすべてのターンで再び課金される。Fireworksが説明するように、コンテキストウィンドウはターン数のほぼ二乗で膨らむ。
思いつく回避策は通用しない。K3の推論強度の設定を下げればトークンは減るが、精度を手放しすぎたと同社の発表は述べている。そこでFireworksは、節約を設定で与えるのではなく学習で埋め込む道を選んだ。
どのように推論を短く学習させたか
ここに至るまでに、自社のサーバーレス学習製品上で50回を超える学習実験と200回を超える評価を重ねた。精度を落とさずに思考連鎖の出力を圧縮する新しいアルゴリズムも用意した。使ったのは顧客データではなく自社データだとFireworksは明言する。
チームが意図的に残した推論が一つある。自己検証だ。前提を再確認したり、結果を前段の判断までたどり直したりする作業は、モデルが自らの誤りから立ち直る助けになる。そのため目標は、その働きを保ったまま実りのない反復だけを削ることだった。学習の構成は数学とコーディングから検索、ツール利用、ソフトウェア工学まで幅広く保った。ベンチマークの形をした問題でだけ簡潔になる、という典型的な失敗への備えである。
公開ベンチマーク7種と顧客2社の本番トラフィックにおいて、FireworksはK3の推論を精度を犠牲にせず35〜50%短縮できたと報告する。学習された振る舞いは失敗した試行でも抑制を見せ、請求額を最も押し上げる長引いたループをまさに途中で切り上げる。
ベンチマークとA/Bテストが示したもの
Fireworksは数日前に公表した自社のSpecialized Intelligence IndexでEmber-1を評価した。10の専門分野にわたり医師が検証した臨床症例500件から成るDoximityのBedside Benchもそこに含まれる。この項目のタスクあたりコストで、Ember-1はGPT-5.6 SolやGPT-6 Astra、Claude Opus 5を含むオープン・クローズド双方のモデルに対して新たなパレート最前線を引いたと同社は主張する。
本当に意味がある比較は、推論強度を三段階に設定したK3自身との対決である。サンプル数が50を超えるすべてのベンチマークで、FireworksはEmber-1をコストと品質の最前線上かその近くに置く。K3を最も安く動かす方法は、もはや「考える量を減らせと指示すること」ではないという言い方もできる。
本番での裏づけは範囲が狭いぶん具体的だ。顧客2社のコーディング業務を対象としたライブA/Bテストで、Ember-1は同等の品質のままタスクあたりのトークンを約35%削減し、タスク完了率や成功スコア、失敗率は維持または改善した。2社のうち1社はその後本番に移し、ベースモデルの退役を予定している。社内では自社の開発者たちが切り替えに気づかなかったとFireworksは伝えている。
今後の見通し
引っかかるのは技術ではなく構造の側だ。Ember-1は2週間のリサーチプレビューとして提供され、恒久化はコミュニティの需要があった場合に限られる。OpenRouterでも提供事業者は1社だけである。節約が量に依存する仕組みであるため、推論がすでに出力のごく一部にとどまる業務では効果が小さくなる。
その間にK3は、第三者が再学習して売り直すベースへと位置を変えた。Moonshot AIの売上の軌跡にすでに現れている変化だ。Fireworksは企業がEmber-1をさらに特化させられるよう、このモデルの学習も開放する。
FAQ — よくある質問
Ember-1はKimi K3よりトークン単価が安いのか
安くない。Ember-1の公開価格はキャッシュされていない入力が100万トークンあたり3ドル、キャッシュ済み入力が0.30ドル、出力が15ドルで、K3と同じである。コストが下がるのは単価の引き下げではなく、同じタスクに対して推論トークンを少なく生成することに全面的に由来する。
Ember-1はオープンソースなのか
Fireworksは Ember-1の重みを公開していない。自社のサーバーレスプラットフォーム上でベースモデルのKimi K3と並ぶホスティング提供の選択肢として、またOpenRouter経由で提供され、当初はリサーチプレビューの扱いである。
40%という数字はどこまで外部で検証されているのか
トークン削減の数字はFireworks自身のベンチマーク実行と、社名非公開の顧客2社の本番トラフィックでのA/Bテストから出ている。独立に再現した結果を公表した第三者はいない。35〜50%という幅はベンダー申告の数字として読むべきだ。






