程式忍者PGNinja

GitHub Blog

GitHub 推出 ReviewBench 公開 AI 審查基準測試

· GitHub 推出 ReviewBench,用 219 個真實 PR 評測 AI 程式碼審查工具精確度與召回率。

ReviewBench 是 GitHub 與微軟團隊共同發佈的開放基準測試,用來評估 AI 程式碼審查代理的實際表現。不同 AI 審查工具在抓出問題的數量、誤判比例與關鍵缺陷偵測能力上差異很大,但業界一直缺乏公開、可重複驗證的比較方法,ReviewBench 希望填補這個空白。

測試資料涵蓋 219 個公開 Pull Request,橫跨 19 種程式語言與 187 個開源專案,分布比例比照整個 GitHub 的真實情況。團隊彙整人類審查者、作者後續提交、靜態分析工具與多個 LLM 的候選發現,去重後以 Claude Sonnet 5 擔任評判模型統一驗證,產生精確度、召回率等六項指標。

GitHub 已用 ReviewBench 來改善自家的 Copilot 程式碼審查功能,一次多模型整合實驗顯示,離線測出的精確度與召回率提升幅度,和正式上線後 A/B 測試的結果方向一致。這代表團隊能先用基準測試快速驗證改動,再決定要不要上線,也讓外部開發者有同一套標準可以比較不同 AI 審查工具。

對正在學程式的孩子或家長來說,這則新聞比較偏產業面:ReviewBench 本身是軟體公司用來評測 AI 審查工具的進階主題。不過背後的精神值得參考,不管是人或 AI 寫的程式,養成讓別人或工具審查程式碼、找出錯誤的習慣,是每個學程式的人都該培養的好習慣。

AI開源開發工具

其他新聞