“如果全部算力都用于推理,曙光8000將是中國最大的Token工廠,能支撐當前全國5%~10%的Token需求。”在一次采訪中,中科曙光公司高級副總裁李斌的換算,讓現場嘉賓對國產十萬卡集群的體量有了最直觀的感受。
7月,光合組織2026智能計算應用大會期間,首臺全國產十萬卡量級AI超集群系統——曙光8000(登峰)正式落成,一周后真機在世界人工智能大會(WAIC)正式亮相。據了解,這也是國內首臺明確采用“超智融合”技術路線的系統。
![]()
根據曙光8000(登峰)公布的最新運行數據,集群正式上線市場需求火爆,首周即實現應用滿載運行,目前日均處理作業數突破15萬個,單日處理作業峰值超過50萬個。
落成即投用,投用即滿載。從萬億級參數大模型的訓練和高通量推理,到超300余個重點科學工程計算應用,再到AI4S(AI for Science)的前沿探索,曙光8000承擔的任務量被迅速拉滿的同時,還為下一代十萬億參數大模型預留了空間。
但挑戰隨之而來。當建設成本與運營復雜度呈指數級攀升,這套在2024年底完成研制并在接下來一年多時間內完成批量部署的系統,究竟如何撐起十萬卡的野心?
十萬卡集群的工程硬仗
故事的開端并不在AI。
早期大規模GPU集群主要服務于模擬仿真、流體力學等高性能計算場景。轉折出現在2018年。英偉達發布的HGX-2統一計算平臺,不僅驗證了大規模GPU互連的可行性,更值得注意的是,其搭載的V100憑借Tensor Core,首次將AI混合精度計算能力推至百TFLOPS級別。
同年公布的全球超算TOP500榜單顯示,Tensor Core GPU已廣泛進入超級計算機系統。這意味著,原本主要服務于科學計算的基礎設施,開始具備支撐大規模AI訓練的能力。
但真正推動AI基礎設施擴張的是AI訓練需求的爆發。彼時OpenAI披露了一組數據:自2012年AlexNet點燃深度學習熱潮以來,用于最大規模AI訓練的算力增長了超30萬倍。OpenAI同時預警:業界必須為“遠超當前算力水平的全新系統”做好準備。
大模型時代迅速驗證了上述判斷。模型參數、訓練數據和推理需求的膨脹,對總算力不斷提出更高要求,集群規模亟待擴展。
而曙光集群的演進軌跡,也成為了不斷突破集群規模邊界的顯著標志。
2010年發布的曙光6000(星云)采用CPU-GPU異構架構,驗證了大規模異構計算系統的可行性;進入大模型時代后,曙光開始圍繞AI訓練重新設計基礎設施,2025年發布國內首個基于AI計算開放架構設計的曙光AI超集群系統,隨后在年底發布了全球領先的大規模智能計算系統scaleX萬卡超集群。直至今日發布的曙光8000,代表著國產AI基礎設施首次向十萬卡規模發起挑戰。
集群規模每發生一次躍遷,技術可能性的天花板也隨之被抬高一層。與此同時,工程層面的考驗也在升級。李斌將核心挑戰歸結為兩點:性能效率與可靠性。
![]()
如何讓增加的計算卡真正轉化成有效算力,也是今天所有超大規模AI集群落地時首先需要回答的問題。
“保證效率和卡數量一樣呈線性增長,這是最大的挑戰。”李斌解釋,此時的互聯網絡極度復雜,包含Scale-Out和Scale-Up兩層架構。任何一個計算與網絡的重疊掩蓋沒做好或系統設計存在任何短板,性能就發揮不出來。
據李斌介紹,中科曙光首先在Scale-up層面提升單柜計算密度,將640張加速卡集成于單個機柜內,盡可能縮短GPU之間的互連距離,并優先采用銅互聯,以降低通信時延、功耗和系統復雜度。
他解釋,在短距離條件下,銅連接通常具有成本、功耗和可靠性優勢。英偉達NVL72等高密度方案同樣遵循這一思路。但他同時表示,隨著傳輸速率繼續提高,銅互聯必然面對物理瓶頸。
“預計在2029年至2030年前后,硅光和CPO(光電共封裝)可能進一步進入柜內互聯,屆時計算芯片與光纖之間的距離會繼續縮短。”李斌表示曙光目前也正在布局相關技術路徑。
而在機柜間,中科曙光自研400G高速網卡和880G交換芯片,構建起國產原生RDMA(Remote Direct Memory Access,遠程訪問內存)高速互連網絡Scale Fabric,實現十萬卡規模下的高帶寬、低時延通信。
針對這一早在今年3月首發的網絡方案,李斌表示,經過長時間的性能、可靠性與應用兼容性驗證,Scale Fabric未來有能力實現對InfiniBand的全面國產化替代。
除此之外,十萬卡規模攀升背后是數量增加十倍的元器件。當潛在故障點隨之翻倍,維持整個集群長期穩定運行的難度也在成倍放大。
李斌坦言,解決方式沒有捷徑,從最微小的部件到每一塊板卡,曙光選擇的是把每個單點的可靠性再提高一個數量級。
在這套邏輯下,液冷的角色被重新定義。李斌指出,液冷的關鍵作用并非單純降低PUE,而是讓系統運行在一個恒定的、穩定的環境中,從而大幅提高整機可靠性。
在后續的國家超算互聯網核心節點實地探訪中,雷峰網見到了中科曙光最新一代相變浸沒式液冷機柜集群。機器運轉的那一刻,一個感受變得具體:十萬卡集群真正的工程復雜度,不只在于“點亮”,更在于持續運營。
這無疑重新劃定了算力產業的競爭邊界。
國海證券計算機首席分析師劉熹認為,千卡集群的表現更多受到GPU和服務器等硬件性能影響,但隨著規模走向萬卡、十萬卡乃至更大規模,組網、系統集成、散熱、電源和軟件調度等環節的重要性反而更加凸顯。
另一位券商分析師補充,這種系統級能力無法通過短期采購快速獲得,而是依賴長期積累的工程經驗、方法論和工具鏈。
當AI基礎設施的競爭從誰擁有性能更高的GPU升維至系統集成、工程經驗和工具鏈的厚度,中科曙光顯然已經站在前列。
超智融合,為什么成為十萬卡的主戰場?
但這并不代表模型已經進入十萬卡時代。
在發布會現場,李斌透露目前曙光8000已與國內大模型團隊合作完成語言模型、語義模型和世界模型的萬卡級預訓練,并為超過400個主流模型提供線上推理服務,此外還針對PD分離、KV Cache等推理部署完成了大量高通量優化。
“比較遺憾的是,現在沒有找到任何一個大模型能跑到10萬卡。”李斌解釋,當前模型參數擴展到萬卡規模后,即使繼續增加計算資源,性能也很難實現同步上升。
這意味著,當基礎設施的擴張速度開始快于模型擴展能力,下一階段比拼的不再只是有效算力的供給,而在于模型架構、訓練算法和系統工程化層面的協同。
不過,這并不影響十萬卡系統”跑滿“應用需求。在“超智融合”技術路線的指引下,已接入國家超算互聯網的曙光8000更像一座共享算力底座。
![]()
李斌指出,一方面,大模型時代的AI需要借助超智融合架構提供算力支撐;另一方面,傳統的科學與工程計算也在AI4S的推動下走向智能化——這類場景本身就是混合負載。
他表示,當前基于曙光8000運轉的AI4S項目中,超過40%已結合了機器學習方法。隨著智能體、物理AI等方向持續發展,這一融合趨勢還將加速。
值得注意的是,中科曙光的超智融合路線并非在不同機房里分別部署超算設備和智算設備,而是讓同一個計算單元同時覆蓋科學工程計算與神經網絡計算。
根據其已披露的架構,曙光8000支持從FP64到INT8的多種計算精度,并可進行混合精度調用;底層平臺由6款達到了國際先進水平的核心國產芯片、存儲和互連系統等部件共同構成。
李斌介紹,當前超300項的超智融合應用優化覆蓋了大模型、機器人、創新藥、天文氣象等二十余領域,其中70余項已完成萬卡規模擴展,驗證了核心節點在極端負載下的穩定性。此外,蛋白質折疊、萬億原子水分子模擬、百萬億網格湍流模擬等重點應用也已跑通。
隨著曙光8000實現技術、生態、應用、服務標準完成閉環驗證,曙光還將與北京科學智能研究院啟動第二套全國產十萬卡超智融合系統。李斌透露,下一代將更聚焦AI4S,可能減少對部分純AI通用場景的兼顧,以換取對科學任務更有針對性的支持。
正如中國工程院李國杰院士所言,大模型能力的邊界,本質上仍然是語言的邊界。而科學發現需要超越語言。對于AI4S來說,算力的意義不再只是訓練更大的模型,而是幫助人類探索未知規律。
從服務模型到服務科學,這或許才是十萬卡真正的下一步。
雷峰網雷峰網
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.