英偉達的Blackwell GB300與GB200圖形處理器憑借持續的技術優化,在各項人工智能工作負載中持續展現出領先性能。隨著新一代AI平臺在全球范圍內陸續部署,外界或許曾推測英偉達會將重心轉移至魯賓架構,但事實證明,已在無數數據中心投入實戰的Blackwell系列同當年的Hopper架構一樣,仍在通過軟件持續升級釋放驚人潛力,其中GB300更是不斷在人工智能運算任務中創下性能新高。
![]()
根據英偉達官方公布的數據,針對Blackwell平臺進行的持續優化大幅提升了整體性能與能效比。在僅短短3個月的時間內,英偉達在運行DeepSeek R1 0528 - 1K/1K工作負載的同一套GB200 NVL72配置上,將每兆瓦吞吐量提升了4倍之多。在此期間,該公司通過運行超過25萬種模擬配置,為Blackwell平臺增添了38項重大優化,累計耗費了140萬個GPU測試小時。值得一提的是,超過90%的優化成果均可適用于其他人工智能模型,這充分彰顯了英偉達在全新平臺逐步普及之際,依然對既有AI平臺保持著深度投入的承諾。
![]()
另一方面,英偉達旗下的GB300“Blackwell Ultra”平臺則在人工智能訓練領域持續占據主導地位。在使用256張GPU運行DeepSeek-V3 671B模型時,其Megatron Core核心創下了每張GPU高達1648太洛普斯的驚人記錄,實現了相比GB200 606太洛普斯的3倍性能飛躍。利用GB300 NVL72對DeepSeek-V3 671B進行預訓練,能夠以世界紀錄般的每GPU 1648太洛普斯運行效率,讓相同的訓練任務僅需極少部分的硬件規模便能達成既定性能。同時,相同的GB300 NVL72系統在經過持續優化后,其性能在過去6個月內也實現了高達1.5倍的增長。
此外,英偉達還與PyTorch以及JAX開源社區展開了深度合作,推動各項優化成果在其人工智能產品矩陣中全面落地。在利用PyTorch原生訓練棧TorchTitan運行DeepSeek-V3 671B模型時,Blackwell Ultra機架在沒有任何初始優化的基礎上實現了高達6倍的性能提升。JAX框架則取得了更為顯著的增長,其速度飆升至每GPU 1025太洛普斯,單GPU吞吐量最高可達每秒4082個Token,相較于今年1月份的基準實現了10倍的性能飛躍。
![]()
![]()
![]()
![]()
![]()
不僅如此,英偉達還在面向預訓練的所有主流框架中,實現了從256到1024張GPU的世界級擴展性能。在達到1024張GPU的規模時,Megatron Core能夠保持高達98.5%的擴展效率,而TorchTitan與JAX框架的擴展效率也維持在97%的水平。支撐這一卓越擴展表現的核心組件,正是集成在每個NVL72機架內部的英偉達800Gb/s橫向擴展網絡芯片。從模型訓練到推理部署,英偉達正不斷在人工智能領域樹立全新標桿,而在魯賓平臺已經登場并帶來更大性能增益的背景下,其他競爭對手無疑面臨著不小的追趕壓力。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.