程式忍者PGNinja

Hacker News

新創 PrismML 把 27B 大模型壓縮到近乎無損還能跑在筆電上

· PrismML 發布開源模型 Bonsai 2 27B,用三元權重把模型壓小九倍,效能只掉一點點,還能在一般裝置上跑。

PrismML 發布了名為 Ternary Bonsai 2 27B 的多模態語言模型,是以 Qwen3.8 27B 為基礎改造而成。PrismML 是一支源自加州理工學院(Caltech)研究團隊的公司,背後有 Khosla Ventures、Cerberus 和 Google 的支持。這個模型要解決的問題是:大型 AI 模型雖然能力強,但又大又耗資源,很難在一般電腦或筆電上順暢執行,他們想在幾乎不犧牲效能的前提下,把模型體積大幅壓小。

技術做法上,他們把模型的權重改成三元表示法,也就是每個權重只能是 −1、0 或 +1,再搭配 FP16 的分組縮放係數做調整,平均下來每個權重只用「1.76 個有效位元」來儲存,遠比一般模型的 16 位元或 8 位元小得多。最終整個模型只有 5.9GB,比原始版本小了 9 倍,支援 NVIDIA GPU(CUDA)和蘋果裝置(MLX)。

這則消息值得注意的地方在於數字:壓縮到九分之一大小之後,整體評測分數是 83.9 分,跟全精度版本的 85.4 分相比只掉了一點點,官方稱之為「近乎無損」;在 RTX 5090 上可以跑到每秒 143 個 token,在 Mac M5 Max 上也有每秒 46.8 個 token,而且模型以 Apache 2.0 授權開源,權重公開放在 Hugging Face 上,任何人都能下載使用。

對正在學程式、對 AI 有興趣的孩子和家長來說,這則新聞比較偏產業面,牽涉到的位元壓縮、量化技巧屬於進階的機器學習知識,不是入門內容。但它傳達了一個值得知道的方向:AI 模型不是只能往「更大」發展,怎麼把模型變小、變省資源、還能在自己的電腦上跑,同樣是很多工程師在努力的題目。

AI開源機器學習

其他新聞