文 | 反熵
今年WAIC最熱鬧的展區(qū)是機(jī)器人,最安靜卻同樣受到關(guān)注的展品,當(dāng)屬一排排算力機(jī)柜。
華為、阿里、百度、中興、沐曦等廠商集中展示超節(jié)點和算力集群,算力與具身智能也成為大會兩條最清晰的產(chǎn)業(yè)主線。一邊是會走路、能搬運的機(jī)器人,另一邊是幾乎不會動的服務(wù)器,看起來相距甚遠(yuǎn),但卻有著同一套產(chǎn)業(yè)邏輯。
![]()
模型負(fù)責(zé)產(chǎn)生智能,機(jī)器人和智能體負(fù)責(zé)把智能帶進(jìn)現(xiàn)實,數(shù)據(jù)中心里的芯片、服務(wù)器和網(wǎng)絡(luò)則支撐它們持續(xù)運行。AI應(yīng)用越接近落地,算力問題反而更重要。
人工智能浪潮中,英偉達(dá)是最受益的企業(yè)之一。
從GPU芯片和CUDA,到服務(wù)器、網(wǎng)絡(luò)互聯(lián)與數(shù)據(jù)中心解決方案,英偉達(dá)已經(jīng)建立起一套覆蓋硬件、軟件和基礎(chǔ)設(shè)施的完整計算體系。黃仁勛在2025年GTC大會上曾表示,英偉達(dá)正在從芯片公司轉(zhuǎn)向AI基礎(chǔ)設(shè)施公司。這也道出了它真正的優(yōu)勢。
GPU性能是進(jìn)入AI時代的門票,CUDA生態(tài)則構(gòu)成了更長期的壁壘。
2006年推出CUDA之后,大量開發(fā)者、算法工具和企業(yè)應(yīng)用逐漸圍繞這套體系建立,PyTorch、TensorFlow等主流AI框架也長期深度支持CUDA。企業(yè)如果更換計算平臺,需要重新進(jìn)行軟件適配、流程調(diào)整、人才培養(yǎng)和已有應(yīng)用遷移,付出的遠(yuǎn)不只是采購一批新芯片的成本。
這也是英偉達(dá)能夠保持較高盈利能力的重要原因之一。客戶購買的不只是一塊GPU,而是一套已經(jīng)被產(chǎn)業(yè)驗證過的AI計算基礎(chǔ)設(shè)施。
01 英偉達(dá)為何領(lǐng)先
英偉達(dá)最初并不是一家人工智能企業(yè)。
1993年成立時,它主要做游戲顯卡。GPU最初的用途,是提升圖形處理能力,讓游戲畫面更流暢。
深度學(xué)習(xí)興起后,研究人員發(fā)現(xiàn),GPU非常適合處理神經(jīng)網(wǎng)絡(luò)訓(xùn)練中的并行計算任務(wù)。傳統(tǒng)CPU擁有少量高性能核心,更擅長復(fù)雜邏輯處理。GPU擁有大量并行計算單元,可以同時完成海量矩陣運算,而人工智能模型訓(xùn)練,恰恰需要不斷進(jìn)行這類計算。
2012年,AlexNet在ImageNet圖像識別競賽中取得突破,深度學(xué)習(xí)由此進(jìn)入快速發(fā)展階段。GPU也逐漸從圖形處理設(shè)備變成AI計算的重要工具。
大模型時代進(jìn)一步放大了這一需求。模型規(guī)模越大,需要協(xié)同工作的GPU越多,訓(xùn)練周期和計算成本也越高。但英偉達(dá)真正難以復(fù)制的優(yōu)勢,并不只在硬件性能。經(jīng)過近二十年積累,CUDA已經(jīng)連接起芯片、軟件工具和開發(fā)者生態(tài)。
芯片性能可以通過一代代產(chǎn)品追趕,開發(fā)習(xí)慣和軟件生態(tài)卻很難在短時間內(nèi)復(fù)制。這也是國產(chǎn)AI芯片必須面對的核心挑戰(zhàn)。
02 AI為何越來越吃算力
一個模型從研發(fā)到應(yīng)用,需要經(jīng)歷預(yù)訓(xùn)練、微調(diào)、對齊和推理等多個階段。
預(yù)訓(xùn)練階段通常消耗最大。模型需要從海量數(shù)據(jù)中學(xué)習(xí)語言規(guī)律、知識結(jié)構(gòu)和復(fù)雜關(guān)系,大規(guī)模模型訓(xùn)練往往需要數(shù)千張計算卡持續(xù)運行數(shù)周甚至更長時間。
微調(diào)和對齊,則是讓模型適應(yīng)具體任務(wù)。一家銀行訓(xùn)練客服模型,需要讓它理解業(yè)務(wù)規(guī)則和金融產(chǎn)品;一家醫(yī)院開發(fā)輔助診斷模型,需要讓它掌握專業(yè)知識和醫(yī)療規(guī)范。
但真正讓算力需求持續(xù)增長的,是推理。
模型訓(xùn)練完成后,每一次客服問答、代碼生成、辦公協(xié)作和內(nèi)容創(chuàng)作,依然需要計算資源。智能體進(jìn)一步放大了推力需求:普通聊天通常是一問一答,智能體為了完成一項工作,還要拆解任務(wù)、查找資料、調(diào)用工具并反復(fù)檢查結(jié)果。一次看似簡單的用戶指令,背后可能對應(yīng)多輪模型調(diào)用。
今年WAIC上,智能體從聊天框走向工作臺,成為貫穿模型、終端和行業(yè)應(yīng)用的重要主線。AI從“回答一個問題”走向“完成一項工作”之后,計算消耗不再只取決于用戶問了多少次,還取決于任務(wù)鏈條有多長。
![]()
根據(jù)國家數(shù)據(jù)局披露的數(shù)據(jù),中國公有云大模型Token調(diào)用量已從2024年初的日均約1000億,增長至2025年底的日均百萬億級規(guī)模。DeepSeek等模型降低調(diào)用成本后,更多應(yīng)用開始具備落地條件。應(yīng)用規(guī)模越大,調(diào)用頻率越高,對算力的需求也越強(qiáng)。
訓(xùn)練能力決定模型能夠達(dá)到怎樣的水平,推理能力則決定這些能力能服務(wù)多少用戶。
03 中國如何補(bǔ)上算力短板?
大模型競爭看起來發(fā)生在云端,真正的起點卻在機(jī)房。
對于中國而言,建設(shè)自主AI算力體系,既關(guān)系到產(chǎn)業(yè)發(fā)展,也決定著未來人工智能應(yīng)用能擴(kuò)展到多大規(guī)模。
目前,中國企業(yè)正在圍繞不同技術(shù)路線探索AI計算能力。
華為昇騰是其中最具代表性的方向之一。它沒有把競爭局限在單顆芯片,而是圍繞昇騰處理器、Atlas服務(wù)器、CANN軟件平臺、高速互聯(lián)和開發(fā)生態(tài),建立一套完整的計算體系。
2025年,華為推出昇騰384超節(jié)點方案,通過384張計算卡協(xié)同提升系統(tǒng)算力。今年WAIC上,Atlas 950 SuperPoD完成真機(jī)首展,最大可擴(kuò)展至1024張計算卡,并通過高速互聯(lián)和統(tǒng)一內(nèi)存編址,降低設(shè)備之間的數(shù)據(jù)傳輸損耗。
![]()
這并不意味著國產(chǎn)單卡已經(jīng)全面追平英偉達(dá),但可以說明競爭有了另一種解法。在單顆芯片和先進(jìn)制程仍有差距的情況下,通過更大規(guī)模的系統(tǒng)協(xié)同提高整體計算能力。
國內(nèi)其他廠商也在沿著不同路徑推進(jìn)。寒武紀(jì)、海光信息從芯片切入,在訓(xùn)練和推理場景中尋找突破。百度昆侖芯、阿里平頭哥與自身云計算業(yè)務(wù)結(jié)合,以內(nèi)部應(yīng)用帶動芯片迭代。摩爾線程、沐曦則瞄準(zhǔn)通用GPU,希望在圖形計算、通用計算和AI加速之間建立更廣泛的能力。
今年WAIC上,多家廠商集中展示了超節(jié)點或集群方案。它們的互聯(lián)架構(gòu)、芯片配置和軟件體系并不相同,但行業(yè)共識已經(jīng)達(dá)成。國產(chǎn)算力的競爭單位,已經(jīng)從一顆芯片擴(kuò)大到由芯片、互聯(lián)、整機(jī)和軟件構(gòu)成的完整系統(tǒng)。
國產(chǎn)算力需要補(bǔ)上的,也從來不只是一顆芯片。
04 算力競爭走向系統(tǒng)
大模型通常需要被拆分到多張計算卡上運行,芯片數(shù)量越多,數(shù)據(jù)交換越頻繁。如果互聯(lián)速度不足,大量時間便會消耗在設(shè)備之間搬運數(shù)據(jù),形成“通信墻”。如果不同設(shè)備的顯存無法被統(tǒng)一、高效調(diào)度,模型規(guī)模和算力利用率又會受到“顯存墻”限制。
機(jī)器增加一倍,算力未必增長一倍。有時規(guī)模越大,協(xié)調(diào)損耗反而越嚴(yán)重。
超節(jié)點要解決的,就是如何讓幾十張、幾百張甚至上千張計算卡更像一臺機(jī)器。英偉達(dá)通過NVLink和InfiniBand網(wǎng)絡(luò)提高GPU集群的協(xié)同能力。華為、阿里、百度、中興等國內(nèi)廠商也在高速互聯(lián)、統(tǒng)一內(nèi)存編址、液冷和軟件調(diào)度方面推出系統(tǒng)級方案。
競爭的重點因此從誰的單卡更快,逐漸轉(zhuǎn)向了誰能讓更多芯片高效協(xié)同。
根據(jù)WAIC相關(guān)報道,昇騰上一代384卡超節(jié)點已累計發(fā)貨750套,覆蓋互聯(lián)網(wǎng)、運營商、金融、教育、醫(yī)療、交通和制造等多個行業(yè)。超節(jié)點開始離開展臺,進(jìn)入真實業(yè)務(wù)。
客戶關(guān)心的也不再只是理論峰值,而是系統(tǒng)能否穩(wěn)定運行、軟件是否容易遷移,以及每投入一度電,最終能夠產(chǎn)出多少有效Token。
能源供應(yīng)和數(shù)據(jù)中心建設(shè)也隨之進(jìn)入競爭范圍。一個萬卡級訓(xùn)練集群,功率可能達(dá)到數(shù)十兆瓦。數(shù)據(jù)中心的選址、電力成本、液冷散熱和算電協(xié)同能力,都會影響最終的算力價格。
今年WAIC上,超聚變等廠商集中展示高密度液冷和多元算力集群方案,國家電網(wǎng)、南方電網(wǎng)等企業(yè)也在推進(jìn)算電協(xié)同。算力競爭已經(jīng)不只是半導(dǎo)體產(chǎn)業(yè)的問題,它開始將通信、電力、能源和工程建設(shè)卷入同一套體系。
![]()
對于后發(fā)者而言,這種變化提供了新的空間。即使單顆芯片暫時存在差距,也可以通過互聯(lián)、調(diào)度、整機(jī)和應(yīng)用適配,提高整個系統(tǒng)的有效計算能力。
但系統(tǒng)競爭并不等于依靠數(shù)量堆疊。芯片、互聯(lián)、軟件和能耗中的任何一項出現(xiàn)短板,都可能拖累整體效率。國產(chǎn)算力真正要完成的跨越,是從“能夠運行”走向“穩(wěn)定、好用和經(jīng)濟(jì)”。
05 算力最終要變成智能
互聯(lián)網(wǎng)時代,服務(wù)器、通信網(wǎng)絡(luò)和數(shù)據(jù)中心支撐了數(shù)字經(jīng)濟(jì)的發(fā)展。AI時代,算力正在成為新的基礎(chǔ)設(shè)施。
大模型訓(xùn)練需要算力,智能體運行需要算力,機(jī)器人理解環(huán)境、規(guī)劃動作,同樣需要算力。超節(jié)點、智能體和機(jī)器人之所以在今年WAIC同時成為焦點,也正因為他們處在同一個循環(huán)中。更大的模型推動算力系統(tǒng)升級,更低的計算成本讓智能體和機(jī)器人打開商業(yè)空間,更多應(yīng)用又會產(chǎn)生新的計算需求。
但算力本身不是終點。一座數(shù)據(jù)中心建設(shè)得再大,如果無法轉(zhuǎn)化為更好的模型、更便宜的Token和真正有人使用的產(chǎn)品,也只是一臺昂貴的機(jī)器。
所以,AI競爭為什么先比算力?
因為算力決定了參賽資格。模型決定AI能夠完成什么,算力則決定這些能力能否以足夠低的成本服務(wù)更多人。
拿到參賽資格之后,真正決定勝負(fù)的,仍然是模型能夠創(chuàng)造多少實際價值。
下一篇,我們討論DeepSeek之后,大模型競爭正在進(jìn)入怎樣的新階段。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.