![]()
【摘要】AI算力競(jìng)賽正在告別單芯片英雄主義。真正稀缺的已不只是峰值算力,還有讓上千顆芯片持續(xù)協(xié)同、把每一度電和每一張卡變成有效Token的系統(tǒng)能力。
本屆WAIC,壁仞科技以BR2xx系列芯片、BLink 2.0超節(jié)點(diǎn)互連協(xié)議、NPO光互連超節(jié)點(diǎn)以及Token工廠為核心,通過系統(tǒng)級(jí)創(chuàng)新精準(zhǔn)破解行業(yè)痛點(diǎn),為中國(guó)AI產(chǎn)業(yè)的Agentic AI時(shí)代筑牢了堅(jiān)實(shí)的算力底座。
一套超節(jié)點(diǎn)方案,正在揭開國(guó)產(chǎn)算力的新問題:制程之外,還有什么是改寫牌局的路徑?
以下為正文:
2016年,黃仁勛親自把第一臺(tái)DGX-1送到舊金山的OpenAI辦公室。那是一只黑色機(jī)箱,里面裝著8顆Tesla P100。英偉達(dá)稱它為“盒子里的超級(jí)計(jì)算機(jī)”。
照片里的人們圍著它微笑,當(dāng)時(shí)可能還沒人想到,僅僅十年后,決定AI競(jìng)爭(zhēng)勝負(fù)的基本單元,就從8張卡的服務(wù)器擴(kuò)張成數(shù)百乃至上千張卡協(xié)同工作的超節(jié)點(diǎn)。
![]()
OpenAl的研究人員聚集在首個(gè)AI超級(jí)計(jì)算機(jī)NVIDIA DGX-1周圍
2026年的WAIC,恰好記錄了這個(gè)尺度變化。壁仞科技的1024卡NPO光互連超節(jié)點(diǎn)方案登場(chǎng),華為展出1024卡昇騰950超節(jié)點(diǎn),百度天池512、阿里磐久AL128、中興OEX、沐曦“曦景”S系列也相繼出現(xiàn)。
一個(gè)明顯的感覺是,大家愈發(fā)意識(shí)到,芯片必須在系統(tǒng)里才能兌現(xiàn)價(jià)值。成百上千張GPU能夠高效、穩(wěn)定地協(xié)同,才是一種生產(chǎn)能力。二者之間,隔著通信、內(nèi)存、軟件生態(tài)等多重關(guān)口。
這實(shí)際上也是“單芯片英雄主義”的退潮。當(dāng)芯片數(shù)量從兩張變成數(shù)百?gòu)垺⑸锨垼y題卻沒有改變。模型運(yùn)行怎樣足夠快?一張卡失靈,整項(xiàng)任務(wù)能否繼續(xù)?上一代卡算力尚在,卻因軟件和代際壁壘閑置,又該怎么辦?
01
超節(jié)點(diǎn)重新定義“計(jì)算”這件事
2012年,AlexNet之所以被拆到兩張各有3GB顯存的GTX 580上運(yùn)行,一個(gè)直接原因是單卡裝不下。研究者讓兩張顯卡分別承擔(dān)一部分網(wǎng)絡(luò),只在必要的層交換數(shù)據(jù)。
這個(gè)看似窘迫的選擇,提前揭示了AI硬件此后十余年的主線:模型增長(zhǎng)總會(huì)越過單顆芯片的邊界,然后迫使計(jì)算機(jī)重新定義自己。
四年后,DGX-1把8顆GPU封裝成一個(gè)軟硬一體單元;再往后,機(jī)柜成為基本單元;到了超節(jié)點(diǎn)時(shí)代,幾十只機(jī)柜也要在軟件看來像一臺(tái)機(jī)器。
這一過程在MoE與Agent時(shí)代突然加速。MoE模型看似節(jié)省計(jì)算,每個(gè)Token不激活全部參數(shù),只選擇少數(shù)專家。但計(jì)算復(fù)雜度并沒有憑空消失,它只是轉(zhuǎn)移給了通信。專家分散在不同GPU上,Token每經(jīng)過一層路由,都可能觸發(fā)All-to-All數(shù)據(jù)交換。模型越稀疏、專家越多,網(wǎng)絡(luò)越像車流驟增的十字路口。
Agent又增加了另一種壓力。一次復(fù)雜任務(wù)往往包含多輪規(guī)劃、調(diào)用工具、讀取長(zhǎng)文檔和反復(fù)糾錯(cuò)。模型不只是在算,還要持續(xù)記。算力、顯存容量、帶寬與訪問時(shí)延,任何一項(xiàng)落后都會(huì)讓昂貴的計(jì)算單元停下來等數(shù)據(jù)。
這就是超節(jié)點(diǎn)與普通GPU集群的分界。Scale-up超節(jié)點(diǎn)把跨卡訪問變成接近機(jī)器內(nèi)部的動(dòng)作。其目標(biāo)是降低軟件感知到的距離。
壁仞科技正是圍繞這些痛點(diǎn)建立了技術(shù)優(yōu)勢(shì)。BR1xx以Chiplet組織封裝內(nèi)的多個(gè)芯粒,第一代BLink從設(shè)計(jì)之初就考慮跨節(jié)點(diǎn)互連;BR2xx進(jìn)一步把內(nèi)存語義、在網(wǎng)計(jì)算等納入BLink 2.0。Chiplet與超節(jié)點(diǎn)看似分屬芯片和系統(tǒng),底層思想?yún)s相同——單個(gè)物理單元不再是能力邊界,互連本身成為計(jì)算架構(gòu)。
這也是壁仞科技方案的第一個(gè)產(chǎn)業(yè)價(jià)值。它能夠把“差多少算力”的靜態(tài)問題,轉(zhuǎn)化為“多少算力能同時(shí)有效工作”的動(dòng)態(tài)問題。前者由制程與晶體管決定,后者則給架構(gòu)、互連和軟件留下了創(chuàng)新空間。
這讓市場(chǎng)意識(shí)到,國(guó)產(chǎn)GPU可以爭(zhēng)奪的,還有整套系統(tǒng)——在一定時(shí)間、電力和故障率下,究竟交付多少可用Token。
02
物理上拆開,邏輯上更近
1976年問世的Cray-1,是計(jì)算機(jī)史上最容易辨認(rèn)的機(jī)器之一。它沒有被做成長(zhǎng)方形機(jī)柜,而是彎成一個(gè)“C”形。
這個(gè)形狀是直接服務(wù)于計(jì)算速度的工程設(shè)計(jì)。據(jù)計(jì)算機(jī)歷史博物館的資料,Cray-1內(nèi)部有超過60英里的線纜,但為了減少信號(hào)延遲,沒有一段超過3英尺。工程師把原本可能排成直線的機(jī)柜“彎”成約270度的弧形,把對(duì)速度最敏感的部件布置在內(nèi)圈。
因此,歷史告訴我們,幾英尺的銅線,也屬于計(jì)算機(jī)架構(gòu)。
半個(gè)世紀(jì)后,超節(jié)點(diǎn)再次撞上同一堵墻。GPU互連帶寬進(jìn)入TB/s級(jí),單端口速率邁向224Gbps,銅纜中的高頻電信號(hào)會(huì)遭遇更大的衰減、串?dāng)_和功耗上升。
傳統(tǒng)超節(jié)點(diǎn)的思路,本質(zhì)是不斷把卡做的更近:線越短,延遲越低。如此一來,GPU、交換機(jī)、供電、液冷和機(jī)柜就會(huì)鎖成一臺(tái)“現(xiàn)代大型機(jī)”。頭部互聯(lián)網(wǎng)公司憑借采購(gòu)規(guī)模優(yōu)勢(shì)可以要求供應(yīng)商為自己高度定制整機(jī)柜超節(jié)點(diǎn),但大量運(yùn)營(yíng)商、智算中心和行業(yè)客戶,卻沒有這樣的采購(gòu)規(guī)模和工程團(tuán)隊(duì)。
壁仞科技NPO光互連、分布式解耦架構(gòu)超節(jié)點(diǎn)方案的有趣之處,是反過來處理距離。這是壁仞科技把超節(jié)點(diǎn)從一個(gè)大機(jī)柜推進(jìn)到“跨機(jī)柜、可分布部署的邏輯整機(jī)”的實(shí)現(xiàn)路徑。
它把NPO光引擎放到GPU或交換芯片附近,以極短電連接完成光電轉(zhuǎn)換,再讓低衰減光纖跨越機(jī)柜。壁仞科技給出的方案還去掉了傳統(tǒng)可插拔光模塊中的高功耗DSP,以降低光電轉(zhuǎn)換帶來的時(shí)延和能耗。
光纖的價(jià)值改變了系統(tǒng)設(shè)計(jì)中的距離函數(shù)。當(dāng)數(shù)百米外仍能維持高速互連,GPU服務(wù)器和交換機(jī)便不必焊死在同一套定制柜體里。
壁仞科技選擇這條路,與其此前積累有關(guān)。2025年,壁仞科技、曦智科技和中興通訊以BR166、分布式光交換dOCS構(gòu)建“光躍LightSphere X”超節(jié)點(diǎn),獲得WAIC最高獎(jiǎng)SAIL獎(jiǎng),并在國(guó)家級(jí)智算平臺(tái)落地2048卡光互連光交換集群。
dOCS與NPO不是同一條技術(shù)支線,卻讓壁仞科技提前經(jīng)歷了GPU、光器件、服務(wù)器和平臺(tái)軟件的聯(lián)合調(diào)優(yōu)。到BR2xx與BLink 2.0階段,光互連進(jìn)一步向千卡Scale-up域推進(jìn)。
03
讓舊卡重新上崗
實(shí)際上,熱火朝天的AI產(chǎn)業(yè)一邊喊算力短缺,另一邊仍有算力沉睡。
智算中心分批建設(shè),機(jī)房里同時(shí)存在不同代際、不同顯存容量、不同互連能力甚至不同廠商的GPU。同構(gòu)軟件棧為了獲得可預(yù)測(cè)性能,往往只把同型號(hào)卡編成集群。
新模型、新框架或新卡進(jìn)入后,一些上一代卡雖然仍能計(jì)算,卻因?yàn)樗阕印⑼ㄐ藕托阅懿町愅顺龊诵娜蝿?wù)。
這個(gè)沉睡的代價(jià)遠(yuǎn)比想象中高。Alphabet在2023年把服務(wù)器及部分網(wǎng)絡(luò)設(shè)備的預(yù)計(jì)使用壽命調(diào)整為6年,當(dāng)年折舊費(fèi)用因此減少39億美元。它揭示了一件事:當(dāng)基礎(chǔ)設(shè)施達(dá)到一定規(guī)模,即使能讓設(shè)備多工作一年,也會(huì)節(jié)省下數(shù)十億美元的成本,這是一個(gè)重要的市場(chǎng)。
壁仞科技軟件棧里一個(gè)不容易被注意到的亮點(diǎn),正是異構(gòu)混合推理。大模型推理不是一種均勻勞動(dòng),用同一種GPU包辦預(yù)填充和解碼兩個(gè)階段,當(dāng)然可以運(yùn)行,卻未必經(jīng)濟(jì)。
壁仞科技能夠把不同代際、不同規(guī)格乃至不同廠商的GPU分配到更適合的階段:計(jì)算能力強(qiáng)的卡,顯存更大、帶寬特征合適的卡,能夠分配不同的任務(wù),再由統(tǒng)一中間件、低時(shí)延通信和智能路由完成協(xié)同。
其披露的場(chǎng)景測(cè)試中,異構(gòu)混推帶來20%的有效吞吐提升。壁仞科技還參與DeepLink多元算力混推,在四家國(guó)產(chǎn)廠商的多款芯片之間進(jìn)行聯(lián)合調(diào)度,并牽頭制定異構(gòu)混推國(guó)家標(biāo)準(zhǔn)。
過去,新卡與舊卡是替代關(guān)系:新產(chǎn)品進(jìn)入,舊產(chǎn)品逐步退出;異構(gòu)混推成熟后,它們可能變成分工關(guān)系:如新卡算力更強(qiáng)則處理預(yù)填充任務(wù),舊卡的顯存容量和帶寬尚可,則處理解碼任務(wù),繼續(xù)發(fā)揮作用。
“Token工廠”延續(xù)了同一種經(jīng)濟(jì)學(xué)。Agent執(zhí)行任務(wù)時(shí),大量歷史上下文會(huì)反復(fù)使用;若每次都重新計(jì)算KV Cache,最昂貴的GPU其實(shí)在重復(fù)生產(chǎn)已經(jīng)存在的中間結(jié)果。壁仞科技用GPU顯存、CPU內(nèi)存、CXL擴(kuò)展內(nèi)存、磁盤和分布式共享存儲(chǔ)組成五級(jí)緩存方案,在內(nèi)部應(yīng)用場(chǎng)景取得了95%以上的KV Cache命中率。既能節(jié)省時(shí)間,又能避免不必要的計(jì)算。
這也重新定義了壁仞科技的軟件價(jià)值,軟件是GPU資產(chǎn)的經(jīng)營(yíng)系統(tǒng)。對(duì)客戶而言,這些指標(biāo)最終都會(huì)匯入同一張表:?jiǎn)挝籘oken的全生命周期成本。
04
尾聲
回看計(jì)算機(jī)產(chǎn)業(yè)史,技術(shù)躍遷常常發(fā)生在邊界出現(xiàn)的時(shí)刻。今天的超節(jié)點(diǎn),面對(duì)的是怎樣把數(shù)百上千顆芯片、內(nèi)存和交換設(shè)備重新畫進(jìn)“一臺(tái)計(jì)算機(jī)”的邊界。
壁仞科技的特殊性,在于其路線存在一種連續(xù)的架構(gòu)優(yōu)勢(shì):從Chiplet開始,公司就傾向于通過互連組織多個(gè)計(jì)算單元;從BLink 1.0與dOCS,再到BLink 2.0與NPO,能夠把這種組織能力從封裝內(nèi)推向機(jī)柜外。芯片、系統(tǒng)與軟件其實(shí)是同一方法論在不同尺度上的展開。
評(píng)價(jià)超節(jié)點(diǎn)的尺度也應(yīng)該改變了。不只是芯片數(shù)量疊加峰值算力,還要包含有效吞吐、資產(chǎn)壽命、能源、故障與遷移成本。
壁仞科技在WAIC上告訴我們,國(guó)產(chǎn)算力新增的供給不只來自下一片晶圓,也來自更短的數(shù)據(jù)路徑、更靈活的系統(tǒng)組合,以及每一張仍能工作的舊卡。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.