程式忍者PGNinja

Hacker News

Fireworks 推出 Ember-1,省四成 token 用量

· Fireworks Research 基於 Kimi K3 打造 Ember-1,維持輸出品質的同時把推理耗用的 token 減少約四成,已有客戶導入生產環境測試。

Ember-1 是 Fireworks Research 以 Kimi K3 為基礎打造的專門化模型。團隊發現思考型模型常把超過九成的產出 token 花在內部推理,而非最終答案,在需要多輪呼叫的智能代理工作流程中特別昂貴,因為先前的推理過程會在每次後續呼叫時重新讀取並計費。Ember-1 的目標就是在不犧牲答案品質的前提下,大幅減少這類浪費。

團隊透過 Fireworks Serverless Training 基礎設施,進行超過 50 次訓練實驗與 200 多次評估,訓練資料涵蓋數學、程式編碼、指令遵循、對話、搜尋與工具使用等多種任務。核心做法是讓模型學會保留真正必要的自我反思推理,同時捨棄多餘的推理迴圈,藉此在維持答案品質的前提下壓低整體 token 用量。

官方公布的數字顯示,在 Terminal Bench 2.1 測試中 token 用量減少 51.9%,成本省下 23.1 美元;在 DeepSWE 1.1 測試中則減少 23.7% 的 token。一項正式客戶的 A/B 測試也顯示總 token 用量減少約 39%,而且內部開發者在切換模型後並未察覺差異,顯示品質沒有明顯下降,目前已有客戶將 Ember-1 導入生產環境並計畫全面取代原本的基礎模型。

這則新聞比較偏產業面,主要是雲端 AI 服務商之間在推理成本上的競爭,不是給初學者的程式工具或教材。不過它說明了一個值得留意的觀念:AI 模型『想得多』不代表『答得好』,如何用更少運算換到一樣的品質,本身就是重要的工程問題,也是未來想投入 AI 領域的孩子可以延伸認識的方向。

AI大型語言模型產業動態雲端服務

其他新聞