AI Newsway

Ember-1每個詞元的價格與Kimi K3相同,用掉的詞元卻少了40%

Fireworks Research表示,讓模型學會把推理過程寫短——而不是把推理強度的旋鈕調低——才是它在七項基準與兩家客戶的線上程式開發流量中守住準確度的原因。

|5分鐘閱讀0
Server racks in a computer room installation — Ember-1 targets the inference bill that long reasoning traces run up in multi-turn agentic workloads.
Server racks in a computer room installation — Ember-1 targets the inference bill that long reasoning traces run up in multi-turn agentic workloads.

Fireworks AI發布了Ember-1,這是一款以Moonshot AI的Kimi K3為基礎打造的推理模型,該公司表示它達到基礎模型的品質,輸出的詞元卻少了約40%。這款模型在9月24日以研究預覽的形式在Fireworks的無伺服器平台上線,公布的費率表與K3完全相同:未快取的輸入每百萬詞元3美元,已快取每百萬0.30美元,輸出每百萬15美元。每個詞元的價格分毫未改;帳單金額下降,只因為帳單上的詞元數變少了。

重點摘要

  • Ember-1的公告定價為輸入每百萬詞元3美元、輸出每百萬15美元,與它訓練所本的Kimi K3基礎模型公開費率一致,脈絡視窗為1,048,576個詞元。
  • 在七項公開基準與兩家客戶的線上流量中,Fireworks表示它把K3的推理縮短了35至50%,準確度沒有下滑。
  • 在兩家客戶程式開發工作負載的線上A/B測試中,Ember-1在品質相當的情況下每項任務少用約35%的詞元,其中一家已將它移入正式環境。

推理過程為何成為最花錢的一段

像K3這樣的推理模型,把生成詞元的大部分——有時超過90%——花在內部推敲,而不是使用者實際讀到的答案上。

代理程式的多輪迴圈把這筆成本變成複利。由於每一輪都會把先前的完整紀錄重新送入,第一輪寫下的推理會在之後的每一輪再付一次錢,而Fireworks描述的脈絡視窗大致隨輪數呈平方成長。

最直覺的變通做法站不住腳。根據該公司的公告,把K3的推理強度旋鈕調低雖然減少了詞元,卻犧牲了太多準確度,因此Fireworks決定把節省訓練進模型,而不是靠設定去配置它。

Fireworks如何把推理訓練得更短

走到這一步,用掉了該公司無伺服器訓練產品上超過50次訓練實驗與超過200次評測,還開發了在不損失準確度的前提下壓縮思維鏈輸出的新演算法。Fireworks表示它使用的是自家資料,而非客戶資料。

團隊刻意保留了一類推理:自我反省。重新檢視某個假設、或把結果回溯到更早的判斷,能幫助模型從自己的錯誤中脫身,所以目標是保住這部分、只剪掉沒有產出的迴圈。訓練組合刻意維持寬廣——從數學與程式開發,一路延伸到搜尋、工具使用與軟體工程——用以防範最明顯的失敗模式:一個只在基準題型上變簡潔的模型。

在七項公開基準與兩家客戶的線上流量中,Fireworks表示K3的推理可以縮短35至50%而不犧牲準確度。訓練出來的行為在失敗的嘗試上同樣展現節制,恰恰截斷了那些把帳單推到最高的冗長迴圈。

基準與A/B測試呈現了什麼

Fireworks以自家幾天前推出的Specialized Intelligence Index評估Ember-1,其中包含Doximity的Bedside Bench——涵蓋10個專科類別、經醫師驗證的500個臨床案例。該公司表示,在這一項的每任務成本上,Ember-1相對於開放與封閉模型都劃出了新的柏拉圖前緣,包括GPT-5.6 Sol、GPT-6 Astra與Claude Opus 5。

真正關鍵的比較是與三種推理強度設定下的K3自身對決。在所有樣本數超過50的基準上,Fireworks都把Ember-1放在成本與品質前緣之上或附近,換個說法就是:讓K3跑得最便宜的辦法,已經不再是叫它少想一點。

正式環境的證據範圍較窄,卻更具體。在兩家客戶程式開發工作負載的線上A/B測試中,Ember-1在品質相當的情況下每項任務少用約35%的詞元,任務完成度、成功分數與失敗率則維持或改善。其中一家已將它移入正式環境,並計畫讓基礎模型退役。Fireworks還提到,公司內部自家開發者並未察覺模型被換掉。

後續觀察

值得留意之處在結構而非技術。Ember-1以為期兩週的研究預覽推出,只有在社群有需求時才會轉為長期提供,而且在OpenRouter上只有單一供應商提供。由於節省來自用量,在推理本來就只占輸出一小部分的工作負載上,效益會縮水。

在此期間,K3已成為第三方再訓練、再轉售的基礎——這個轉變在Moonshot AI的營收軌跡上已經看得出來。Fireworks也開放針對Ember-1的訓練,讓企業能進一步把它專門化。

FAQ — 常見問題

Ember-1每個詞元比Kimi K3便宜嗎

並沒有。Ember-1公布的定價與K3一致:未快取輸入每百萬詞元3美元、已快取輸入每百萬0.30美元、輸出每百萬15美元。成本下降完全來自同一項任務生成較少的推理詞元,而不是費率變低。

Ember-1是開源的嗎

Fireworks並未釋出Ember-1的權重。它以託管服務選項的形式,與基礎模型Kimi K3一同放在Fireworks的無伺服器平台上,並透過OpenRouter提供,初期為研究預覽。

40%這個數字有多少經過獨立驗證

詞元減量的數字出自Fireworks自家的基準測試,以及兩家未具名客戶線上流量上的A/B測試。沒有第三方公布獨立重現的結果,因此35至50%這個區間應視為業者自行揭露的數字。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

GPT-6 Astra上崗:OpenAI最貴模型把全部籌碼押在電腦操作上
LLM & Chatbots

GPT-6 Astra上崗:OpenAI最貴模型把全部籌碼押在電腦操作上

OpenAI的GPT-6 Astra面向企業使用者開放,具備電腦操作能力、百萬token上下文和10/50美元定價,其頭條成績則附帶測試框架的註腳。

Seung Jung18 天前
ChatGPT 在 79% 的購物回答中直接點名首選,Gemini 只有 7%
LLM & Chatbots

ChatGPT 在 79% 的購物回答中直接點名首選,Gemini 只有 7%

一份針對 1,536 則 AI 購物回答的稽核發現,ChatGPT 有 79% 以第一人稱表態偏好,Gemini 僅 7%,兩者引用的來源也幾乎不重疊。

Seung Jung11 天前
ChatGPT Images 2.5生成延遲減半,新增手繪畫布
LLM & Chatbots

ChatGPT Images 2.5生成延遲減半,新增手繪畫布

OpenAI推出ChatGPT Images 2.5,延遲最多降低50%,新增Sketch繪圖畫布、模板、定點批註,並向API釋出兩款新模型。

Seung Jung17 天前
OpenAI 的 Astra for Law 不是新模型,而是一套 2.3 億網址的法律檢索索引
LLM & Chatbots

OpenAI 的 Astra for Law 不是新模型,而是一套 2.3 億網址的法律檢索索引

OpenAI 推出 Astra for Law,替 GPT-6 Astra 接上涵蓋 2.3 億個網址的法律索引,法律研究基準正確率自 38.7% 升至 54%。

Seung Jung10 天前
Gemini登陸Windows:一個Alt+Space快捷鍵,直撲桌面入口
LLM & Chatbots

Gemini登陸Windows:一個Alt+Space快捷鍵,直撲桌面入口

谷歌Windows版Gemini原生應用可用Alt+Space浮在任意程式之上,接入Gmail和Google Drive,面向全球Windows 10和11開放。

Seung Jung17 天前
Meta的Muse智慧體,盯上了你的郵箱、日曆和信用卡
LLM & Chatbots

Meta的Muse智慧體,盯上了你的郵箱、日曆和信用卡

Meta釋出個人AI智慧體Muse,在美國通過iOS、安卓、網頁和WhatsApp代替使用者訂行程、付賬單和購物。

Seung Jung17 天前