快科技7月23日消息,英偉達(dá)官方發(fā)布了Rubin GPU架構(gòu)技術(shù)詳解,這也是英偉達(dá)即將推出的Vera Rubin平臺(tái)的核心計(jì)算單元。
根據(jù)官方公布的數(shù)據(jù),在單位能耗下,Rubin NVL72+Vera CPU的Agentic AI推理吞吐量,相比Blackwell NVL72+x86 CPU提升最高可達(dá)10倍。
![]()
Vera Rubin平臺(tái)相比Blackwell的10倍智能體推理性能提升
完整的Vera Rubin NVL72機(jī)架由36個(gè)Vera CPU和72個(gè)Rubin GPU組成,有關(guān)Vera CPU我們已經(jīng)介紹過(guò),今天的重點(diǎn)是Rubin GPU。
![]()
整體來(lái)看,Rubin GPU采用臺(tái)積電3nm N3P制程工藝,由兩顆計(jì)算芯粒組成,通過(guò)NVIDIA高速片間互聯(lián)接口NV-HBI統(tǒng)一在單個(gè)封裝上。
整顆芯片集成3360億個(gè)晶體管,擁有224個(gè)SM流處理器和896個(gè)Tensor Core張量核心,搭載第三代Transformer引擎,可提供最高50 PF的NVFP4推理性能。
![]()
Rubin GPU芯片架構(gòu)框圖
顯存方面,Rubin集成最高288GB HBM4,共配置8組12-Hi堆疊,峰值帶寬達(dá)22TB/s,相比Blackwell和Blackwell Ultra提升2.8倍。
![]()
Rubin內(nèi)存帶寬相比Blackwell提升2.8倍
此外,第六代NVLink提供3600GB/s擴(kuò)展帶寬用于GPU間全互聯(lián)通信,NVLink-C2C提供1800GB/s用于CPU-GPU一致性通信,PCIe Gen6 x16提供256GB/s主機(jī)連接。
針對(duì)當(dāng)前主流MoE(混合專家)模型的擴(kuò)展瓶頸,Rubin增強(qiáng)了Tensor Memory Accelerator(TMA),通過(guò)優(yōu)化描述符管理機(jī)制,可更高效地定位和調(diào)度專家權(quán)重,減少數(shù)據(jù)搬運(yùn)開(kāi)銷。
多個(gè)內(nèi)核還可為共享相同布局的張量保留統(tǒng)一描述符,在運(yùn)行時(shí)直接通過(guò)TMA指令覆蓋內(nèi)存指針和步長(zhǎng)等字段,減少元數(shù)據(jù)管理和數(shù)據(jù)搬運(yùn)開(kāi)銷,讓更多GPU時(shí)間用于實(shí)際推理計(jì)算。
![]()
Rubin簡(jiǎn)化MoE描述符管理機(jī)制,右為Rubin架構(gòu)
Rubin另一項(xiàng)核心升級(jí)是Tensor Core,每時(shí)鐘周期的K維度吞吐量翻倍,意味著更少的循環(huán)迭代次數(shù),Blackwell需要4次K迭代的GEMM運(yùn)算,Rubin只需2次即可完成,減少了循環(huán)開(kāi)銷并提高了Tensor Core利用率。
![]()
左為Blackwell,右為Rubin
長(zhǎng)上下文注意力加速是Rubin的另一大升級(jí),Rubin將激活稀疏化與自適應(yīng)壓縮結(jié)合,將中間數(shù)據(jù)加載為2:4稀疏格式,僅保存非零數(shù)據(jù)及對(duì)應(yīng)元數(shù)據(jù)。
后續(xù)softmax和第二注意力GEMM均可基于非零值運(yùn)算,同時(shí)保持最終輸出仍為標(biāo)準(zhǔn)Dense格式,在不改變模型接口的前提下減少計(jì)算量和數(shù)據(jù)搬運(yùn)。
此外,Rubin還提升了Softmax及指數(shù)運(yùn)算性能,F(xiàn)P32吞吐達(dá)到GB300水平,是GB200的2倍;BF16/FP16吞吐相比GB200提升4倍,相比GB300提升2倍。
![]()
Rubin自適應(yīng)壓縮稀疏化
在內(nèi)核間依賴調(diào)度方面,Rubin實(shí)現(xiàn)了比Blackwell更精細(xì)的協(xié)調(diào),Blackwell啟動(dòng)允許Kernel更早開(kāi)始工作,但仍需等待激活數(shù)據(jù)可用。
而Rubin支持瓦片級(jí)觸發(fā),允許后續(xù)Kernel在所需輸入數(shù)據(jù)準(zhǔn)備完成后即可提前啟動(dòng),不用等待更大范圍的工作完成,從而壓縮GPU時(shí)間線中的空閑間隙。
![]()
上為Blackwell批量觸發(fā),下為Rubin瓦片級(jí)觸發(fā)
GPU間通信方面,Rubin引入了計(jì)數(shù)寫入(Counted Writes)機(jī)制用于設(shè)備發(fā)起的NVLink通信。傳統(tǒng)GPU間數(shù)據(jù)傳輸需要額外的協(xié)調(diào)和同步步驟,計(jì)數(shù)寫入則允許接收端GPU更高效地跟蹤傳輸完成狀態(tài),減少同步延遲,讓計(jì)算不必等待同步操作。
![]()
通過(guò)計(jì)數(shù)寫入加速NVLink通信,左為Blackwell,右為Rubin
在機(jī)架級(jí)能效管理上,Vera Rubin NVL72將計(jì)算、網(wǎng)絡(luò)、液冷、功率調(diào)節(jié)和智能功率平滑整合為單一執(zhí)行域。系統(tǒng)通過(guò)集成儲(chǔ)能模塊,可吸收GPU瞬時(shí)功率波動(dòng),平均功耗降低約10%,50毫秒峰值功耗降低約20%。
![]()
英偉達(dá)還推出DSX OS操作系統(tǒng),其中集成DSX MaxLPS,可統(tǒng)一管理GPU、機(jī)柜、液冷系統(tǒng)以及AI工作負(fù)載,可在相同功率預(yù)算下多部署最多40%的GPU。
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.