![]()
2026 年 7 月 22 日,谷歌云公布一起荷蘭數(shù)據(jù)中心故障的初步調(diào)查報(bào)告。
![]()
上游公共電網(wǎng)發(fā)生電氣故障后,數(shù)據(jù)中心供電設(shè)備和制冷系統(tǒng)受到影響,機(jī)房溫度快速升高。谷歌隨后關(guān)閉服務(wù)器、存儲(chǔ)集群和網(wǎng)絡(luò)交換機(jī),防止硬件在高溫環(huán)境下?lián)p壞。
此次事故影響谷歌云荷蘭區(qū)域 europe-west4 的 europe-west4-a 可用區(qū),涉及 Google Cloud VMware Engine、Google Cloud NetApp Volumes 和 Bare Metal Solution 三項(xiàng)服務(wù)。
整體服務(wù)中斷時(shí)間接近 15 小時(shí),其中 Bare Metal Solution 受影響時(shí)間最長(zhǎng),達(dá)到 12 小時(shí) 57 分鐘。
根據(jù)谷歌云初步事故報(bào)告,故障發(fā)生于當(dāng)?shù)貢r(shí)間 7 月 16 日凌晨。
數(shù)據(jù)中心上游電網(wǎng)首先出現(xiàn)電氣故障,隨后干擾內(nèi)部配電裝置及制冷設(shè)備。
冷卻能力下降后,受影響機(jī)房的環(huán)境溫度迅速升高。
谷歌監(jiān)控系統(tǒng)從美國太平洋時(shí)間 7 月 15 日 16 時(shí) 39 分開始收到溫度異常和硬件無法連接告警。
為避免設(shè)備過熱,谷歌關(guān)閉部分主機(jī)、存儲(chǔ)節(jié)點(diǎn)和網(wǎng)絡(luò)設(shè)備。相ngine 服務(wù)中斷 9 小時(shí) 24 分鐘。
該服務(wù)用于在谷歌云中運(yùn)行 VMware 私有云環(huán)境。
事故期間,europe-west4-a 可用區(qū)內(nèi)的私有云和底層網(wǎng)絡(luò)交換設(shè)備被關(guān)閉,客戶無法連接私有云及其中運(yùn)行的虛擬機(jī)。
谷歌在早期公告中還建議客戶主動(dòng)關(guān)閉 VMware 虛擬機(jī),以降低非正常斷電帶來的恢復(fù)風(fēng)險(xiǎn)。
現(xiàn)場(chǎng)環(huán)境恢復(fù)穩(wěn)定后,工程團(tuán)隊(duì)先恢復(fù)網(wǎng)絡(luò)架構(gòu),再逐步啟動(dòng)各個(gè)私有云,并通知客戶檢查虛擬機(jī)運(yùn)行狀態(tài)。
Google Cloud NetApp Volumes 服務(wù)中斷 8 小時(shí) 31 分鐘。
NetApp Volumes 是谷歌云提供的企業(yè)級(jí)文件存儲(chǔ)服務(wù)。
受高溫影響,谷歌主動(dòng)關(guān)閉 ONTAP 存儲(chǔ)集群,Standard、Premium 和 Extreme 三種服務(wù)等級(jí)均受到影響。
客戶在故障期間無法訪問存儲(chǔ)卷,新建存儲(chǔ)池、存儲(chǔ)卷及備份等控制平面操作也出現(xiàn)失敗。供電和制冷恢復(fù)后,谷歌逐步啟動(dòng)存儲(chǔ)服務(wù)器,并確認(rèn)受影響節(jié)點(diǎn)恢復(fù)運(yùn)行。
Bare Metal Solution 服務(wù)中斷 12 小時(shí) 57 分鐘,是此次事故中恢復(fù)時(shí)間最長(zhǎng)的服務(wù)。
Bare Metal Solution 主要面向需要物理服務(wù)器運(yùn)行數(shù)據(jù)庫和關(guān)鍵業(yè)務(wù)系統(tǒng)的企業(yè)客戶。谷歌關(guān)閉部分裸金屬服務(wù)器及存儲(chǔ)設(shè)備后,客戶無法連接數(shù)據(jù)庫服務(wù)器和相關(guān)存儲(chǔ)資源。
由于裸金屬設(shè)備需要逐臺(tái)啟動(dòng)并完成健康檢查,其恢復(fù)速度慢于另外兩項(xiàng)服務(wù)。大部分服務(wù)器上線后,谷歌仍與少量受影響客戶繼續(xù)處理殘余問題。
事故發(fā)生后,谷歌工程團(tuán)隊(duì)與第三方數(shù)據(jù)中心運(yùn)營(yíng)商共同恢復(fù)主供電和冷卻設(shè)備。機(jī)房溫度降至安全范圍后,現(xiàn)場(chǎng)及遠(yuǎn)程工程師按照服務(wù)器、存儲(chǔ)節(jié)點(diǎn)和網(wǎng)絡(luò)設(shè)備的順序進(jìn)行啟動(dòng)和檢查。
谷歌還執(zhí)行自動(dòng)化恢復(fù)程序,重新啟動(dòng)底層交換機(jī)和路由基礎(chǔ)設(shè)施。網(wǎng)絡(luò)恢復(fù)后,存儲(chǔ)設(shè)備和計(jì)算集群才陸續(xù)重新上線。
此次事故沒有可直接使用的臨時(shí)解決方案。
谷歌在故障期間建議采用多區(qū)域部署的客戶將流量切換至其他站點(diǎn),單一區(qū)域部署的客戶只能等待數(shù)據(jù)中心恢復(fù)。
谷歌表示,底層基礎(chǔ)設(shè)施目前已經(jīng)恢復(fù),三項(xiàng)服務(wù)均恢復(fù)正常運(yùn)行。
云頭條聲明:如以上內(nèi)容有誤或侵犯到你公司、機(jī)構(gòu)、單位或個(gè)人權(quán)益,請(qǐng)聯(lián)系我們說明理由,我們會(huì)配合,無條件刪除處理。
![]()
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.