程式忍者PGNinja

Hacker News

開源工具 Livenerf 追蹤 Claude Opus 5.5 是否被悄悄弱化

· 工程師針對「模型發布後會變差」的傳聞,建立每日基準測試,用固定題目與統計方法長期追蹤 Claude Opus 5.5 的表現變化。

Livenerf 是一個公開在 GitHub 上的基準測試專案,作者帳號為 ninjahawk,用意是驗證社群裡「Anthropic 會在模型上線後悄悄弱化效能」的傳聞是否屬實。因為 Claude Opus 5.5 在 2026 年 9 月 22 日發布,作者從發布當天就開始記錄基準線,希望用長期數據取代各說各話的直覺爭論。

作法是每天用 90 道固定題目測試模型,題目涵蓋 GPQA Diamond、MMLU-Pro、競賽數學與 AIME 2025-26,並刻意挑選「有時答對、有時答錯」的 78 題,而非簡單題,藉此放大效能變化的訊號。測試流程凍結提示詞內容與 CLI 版本,並以同一批題目每週重複測試,和自身過去的表現做配對比較,同時用 Claude Opus 5 當作對照組,統計方法則採用 Anthropic 論文提出的聚類標準誤方法。

這個專案的特別之處在於先把決策規則與指標「預先登記」下來,避免事後套用數據去支持特定結論,也先驗證系統確實能偵測出已知的效能衰退,才開始正式收集資料。作者也坦承目前的方法無法區分同系列模型(例如 Opus 5 與 5.5)之間的細微差異,樣本數不足以達到 99% 信心水準,這種誠實揭露限制的態度,也是它在 Hacker News 上獲得高分討論的原因之一。

對正在學程式的孩子與家長來說,這則新聞比較偏產業面,不是入門教材,但它示範了一個很實用的觀念:要驗證一個「感覺」是否真實,可以設計可重複的測試、記錄固定樣本,再用統計方法檢查結果,而不是憑印象下結論。這種用資料說話的科學方法,其實也很適合用在孩子自己寫程式做小實驗、比較不同做法效果時練習。

AI開源評測開發工具

其他新聞