程式忍者PGNinja

Hacker News

德國 Kolibri 開源模型解析:78B 參數只用 3.5B

· 德國 Aleph Alpha 發布開源模型 Kolibri,技術部落格拆解其省算力與抗幻覺設計。

Kolibri 是德國公司 Aleph Alpha 在 2026 年 10 月 3 日發布的開源權重大型語言模型,採用 Apache 2.0 授權,支援德文與英文,訓練用的基礎設施位於德國與芬蘭。這篇技術部落格要解釋的,是 Kolibri 如何在符合歐洲資料隱私與環境法規的前提下,仍做出效能不差的模型。

Kolibri 用的是混合專家架構,總共有 780 億參數,但處理每個字詞時只會用到其中約 35 億參數,大幅降低運算成本。模型每層有 384 個子網路,路由機制只挑 6 個專家處理。詞元切分器用名為 UniBPE 的演算法,針對德文複合字最佳化,比 GPT-5 的詞元切分器少用 15% 的詞元量。

文章也提到 Kolibri 的注意力層設計:50 層裡有 40 層只看前面 512 個字詞,每 5 層才看完整上下文,藉此支援長達 100 萬字詞的輸入。模型還透過 Merlin-Arthur 訓練方式,讓模型在不確定答案時傾向承認不知道,而不是亂編答案。

對正在學程式或 AI 的孩子來說,這篇文章是很好的入門教材:它示範了「參數很多」和「每次真正用到的運算量」是兩件不同的事,也說明了語言模型處理不同語言時,切字的方式會直接影響效率。對家長而言,也能看到歐洲業者在意的重點,不只是模型夠不夠強,還包含資料隱私與能源成本。

AI開源大型語言模型

其他新聞