Strata 是開發者 Niko1221 開源的專案,目標是讓一般玩家用的電競電腦,也能運行原本需要伺服器級硬體才能跑的大型語言模型 Qwen3.8-Flash-Next。這個模型有 1250 億個參數,一般情況下需要數百 GB 顯示記憶體,遠超過個人電腦的硬體等級,Strata 要解決的就是這個落差。
技術上,Strata 採用混合專家(MoE)架構,把模型拆成 24,576 個小型專家模組,每次處理一個詞彙只需要呼叫其中 10 個專家,再搭配 GPU、系統記憶體、CPU 與 SSD 的分層管理,把常用的專家放在顯示記憶體,其他放在容量更大但較慢的儲存裝置,並用推測解碼技術讓回答速度提升 1.6 到 1.8 倍。
根據專案的實測數字,在一張 12GB 的 NVIDIA RTX 5070 顯卡上,Strata 可以讓模型跑出每秒 94 個 token 的生成速度,讀取長文本時速度更可以超過每秒 1,000 個 token。這個專案在 GitHub 上已經累積超過一萬顆星星,顯示不少開發者對「在自家電腦跑大型 AI 模型」這件事很感興趣。
對學程式的孩子與家長來說,這則新聞偏向進階的系統工程與 AI 基礎設施,不是入門內容,但背後的概念值得理解:好的工程設計可以讓昂貴的技術,在便宜的硬體上也能運作。這也提醒大家,學 AI 不只是會用模型,理解電腦的記憶體、儲存與運算怎麼分工,同樣很重要。
AI開源開發工具