程式忍者PGNinja

GitHub Blog

GitHub 檢討 8 月當機事件,公布強化系統的具體計畫

· GitHub 說明 8 月 17 日長達近 8 小時的全球大當機原因,並公布擴充機房容量與改善系統架構的具體計畫。

GitHub 在部落格中說明 2026 年 8 月 17 日發生的重大當機事件,事故共持續 7 小時 47 分鐘,影響範圍涵蓋 github.com、帳號登入、GitHub Actions、API、Pull Request、Issue 與 Copilot 等核心服務,全球開發者與企業用戶都受到影響。

GitHub 指出,事故起因是流量創下新高峰,位於美國中部資料中心的一項關鍵基礎設施元件,容量沒能即時跟上流量成長,導致壓力沿著系統擴散,進一步引發身分驗證失敗。Copilot 服務內部的重試機制又讓問題被放大,工程團隊必須先處理這個重試迴圈,才能讓流量安全地逐步恢復。

這是 GitHub 同一個月內第二次重大事故,稍早 8 月 6 日也曾出現 Actions 服務失效。GitHub 強調,兩次事故都不是程式碼或設定變更造成,而是單純的容量問題;文章提到,每月 commit 次數已從 4 月的 14 億次,成長到近期的 29 億次。

這則新聞比較偏產業面,講的是大型網路服務如何應對流量成長與硬體容量的挑戰。對正在學程式的孩子來說,可以從中理解一個道理:程式能在自己電腦上跑,跟能撐住全世界同時使用,是完全不同層級的問題,工程師需要不斷評估系統能承受多少壓力。

平台功能工程開發工具

其他新聞