![]()
AI 大廠正從「訓練模型」走向「建設計算工廠」。
作者丨鄭佳美
編輯丨馬曉寧
過去兩年,全球人工智能行業(yè)最搶手的東西,是英偉達 GPU。
從 OpenAI 到 Meta,再到 Google、Amazon,幾乎所有希望在 AI 領域占據(jù)優(yōu)勢的公司,都在爭奪計算資源。
行業(yè)最初盯著模型能力,后來逐漸發(fā)現(xiàn),模型背后的那套“機器”,同樣決定著迭代速度。
算法可以調整,數(shù)據(jù)可以補充,算力中心卻不能臨時搭建。
芯片要提前采購,機房要提前建設,電力也要排隊接入。等模型方案確定后再尋找資源,往往已經晚了。
于是,AI 行業(yè)出現(xiàn)了一個頗有反差的場景:一群研究最前沿軟件的公司,開始忙著找土地、談能源、修數(shù)據(jù)中心。
就在這輪建設潮中,智譜完成了一座規(guī)模達到 1GW 的 AI 數(shù)據(jù)中心。據(jù)彭博社報道,該中心全部采用中國制造的芯片,并將用于模型訓練。
單獨看,這像是一條國產芯片新聞。但放進全球 AI 公司的動作里,它更像一個新的產業(yè)信號:大模型公司正在從算力使用者,變成算力基礎設施的組織者。
![]()
01
大模型公司開始提前備貨
過去,大模型公司通常從云廠商手中購買算力。
這套方式適合創(chuàng)業(yè)初期。公司不需要自己買地、建機房,也不必管理復雜的硬件集群,租用 GPU 就可以開始訓練。
但當計算需求從幾百張芯片增長到幾萬甚至幾十萬張時,云端資源很難像水龍頭一樣隨開隨有。
前沿模型的訓練可能持續(xù)數(shù)月,期間還要同時安排后訓練、推理和大量實驗。頭部公司需要的已經不是一次性的計算資源,而是一套能夠長期調動的系統(tǒng)。
OpenAI 因此推進 Stargate,首批設施從 1GW 級起步,整體規(guī)劃達到數(shù) GW;
xAI 在孟菲斯建設 Colossus,并把規(guī)模擴大到約 2GW;Meta 的 Hyperion 目標達到 5GW,其更大的基礎設施規(guī)劃還準備繼續(xù)擴張;
Anthropic 則通過與 Amazon 的長期合作鎖定約 5GW 算力。Google 很早就圍繞 TPU 建立自己的計算集群,國內的字節(jié)和智譜也都進入了 1GW 級建設階段。
這些公司的方式并不相同。有的直接修建園區(qū),有的和云廠商深度綁定,有的擁有自研芯片。但它們面對的是同一個時間差:模型幾個月就會更新一次,數(shù)據(jù)中心卻需要幾年才能建成。
今天簽下的土地和電力合同,服務的可能是三年后的模型。所謂建設算力中心,其實是在為尚未確定的下一代技術提前留位置。
![]()
02
軟件生意開始有了鋼筋水泥味
算力中心把 AI 公司帶進了一個陌生世界。
軟件產品開發(fā)完成后,可以近乎零成本地復制給更多用戶;數(shù)據(jù)中心卻需要土地、變電設施、冷卻設備、高速網絡和長期能源合同。
服務器進入機房前,可能已經有數(shù)十億美元投入到看不見的土建和供電工程里。
過去,一家 AI 公司最重要的能力是招到研究人員、訓練模型和推出產品。現(xiàn)在,它還要處理電網接入、施工進度、設備折舊和資本安排。基礎設施基金、能源企業(yè)、地產商和長期債務,也開始進入大模型產業(yè)鏈。
這讓 AI 競爭多了一層賭注。
頭部公司普遍相信,未來的模型會消耗更多計算資源,因此必須提前擴建。雷峰網
但幾年后的訓練方式會不會改變,新增算力能否被充分利用,模型收入又能否覆蓋持續(xù)增長的成本,目前都沒有確定答案。
一座空閑的數(shù)據(jù)中心不會因為屬于 AI 行業(yè)就變得更便宜。昂貴芯片只有持續(xù)運行,才可能轉化為研發(fā)效率;一旦需求低于預期,它也可能迅速變成沉重的折舊負擔。
算法公司最擅長預測下一個詞,現(xiàn)在卻不得不預測幾年后的電力需求。
![]()
03
路怎么修?
智譜項目與海外同行最大的差別,在于它全部采用中國制造的芯片。雷峰網
全球公司的底層選擇已經開始分化:OpenAI 和 xAI 主要依賴英偉達,Meta 在采購英偉達的同時推進自研 MTIA,Anthropic 使用 Amazon Trainium 與英偉達,Google 堅持 TPU,字節(jié)的相關項目采用華為昇騰。
智譜則把整座 1GW 數(shù)據(jù)中心放在國產芯片體系上運行。
當模型公司只是在云上租用算力時,芯片更像一項被封裝好的服務。
開始建設自己的數(shù)據(jù)中心后,底層硬件會牽動整套系統(tǒng):服務器如何設計,芯片之間如何通信,編譯器和訓練框架如何適配,故障發(fā)生后如何恢復,都需要重新磨合。
單顆芯片能夠運行模型,和成千上萬顆芯片能夠一起高效訓練,并不是同一件事。
集群擴大后,任何通信延遲、軟件兼容問題或者設備故障,都可能讓大量機器停下來等待。
英偉達的優(yōu)勢,很大一部分來自 CUDA 和長期積累的工程生態(tài)。
使用這套體系擴建算力,更像在已經鋪好的高速公路上增加車道。智譜面對的情況更復雜:它既要擴大車流,還要參與修路。
所以,1GW 只是一個工程規(guī)模,不能直接等同于模型能力。
這座數(shù)據(jù)中心最終有沒有價值,要看它能否穩(wěn)定承擔大規(guī)模訓練,是否能保持較高利用率,以及能不能真正縮短 GLM 系列模型的迭代周期。
只有當機房里的芯片持續(xù)轉化成新的模型和產品,算力中心才不只是一個醒目的數(shù)字。
過去,人們習慣通過排行榜和發(fā)布會觀察 AI 競爭。下一輪差距,可能在模型登場前就已經形成——藏在提前鎖定的電力、尚未安裝的服務器,以及那些需要幾年才能建成的數(shù)據(jù)中心里。
智譜進入的,正是這場更慢、更重,也更難臨時追趕的比賽。
https://www.bloomberg.com/news/articles/2026-07-20/z-ai-completes-giant-data-center-with-chinese-chips-to-train-ai
https://x.com/lentils80/status/2079270703224811777?s=46
![]()
上車,帶你看遍全球 AI 頂會精華
可獨家暢覽:
專家演講PPT
大會報告全文
熱門論文解讀
學術新星訪談
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.