![]()
芯東西(公眾號:aichip001)
作者 陳駿達
編輯 心緣
芯東西8月5日報道,近日,深圳存算一體AI芯片創企九天睿芯發布了一套面向超大MoE模型的推理部署方案。該方案在“單卡+4 SSD”的配置下,讓DeepSeek-V4在decode階段的速度跑到了約20 TPS,具備了真正可用的吞吐量。
更重要的是,九天睿芯已于去年攜手關鍵存儲合作伙伴,共同研發基于HBF和SRAM存算一體堆疊的萬億參數AI推理芯片,是國內首家布局這一技術路線的企業。
![]()
▲九天睿芯打造的推理方案
一、顯存裝不下萬億模型?把部署變成數據放置和調度問題
如今,大模型的參數規模正迅速膨脹,Kimi K3、DeepSeek V4 Pro這類新一代超大MoE模型,總參數量已經沖到萬億量級,對絕大多數想在本地用上大模型的企業來說,如何低門檻、高效率地用上這些超大模型,成為橫在落地面前的一道現實難題。
行業對上述問題的默認解法是增加計算卡數量,并輔以張量并行、專家并行、高速互聯等技術,打造計算集群。這類方案的性能優異,但也帶來新的問題。
算力集群是一個復雜的系統工程,涉及拓撲、通信、負載均衡、故障域等多個層面,任何一張卡或一條鏈路的異常,都可能放大成整套服務的抖動。對需要自行部署的企業來說,其中的工程挑戰不言而喻。
當前主流的MoE模型架構給業界提供了一個突破口。MoE模型的特征是總參數量較大,但每個token所激活的始終是少數專家。
于是,業界開始思考,既然計算只需要少數專家,就不一定需要讓全部專家都長期存儲在價格昂貴、容量有限的顯存里。
九天睿芯的思路,是把部署問題重新定義為一個數據放置和調度問題。
具體來說,整套系統對存儲做了分層:顯存留給正在計算和高概率即將計算的專家;DRAM和近端緩存負責預取、短期駐留和回退緩沖;SSD作為大容量專家池,存放暫時不活躍、隨時可能被調用的專家權重;一套預測調度系統,則負責把下一批可能用到的專家提前送到計算附近。
九天睿芯強調,這套方案不是“拿SSD替代顯存”,顯存仍然承擔著關鍵計算窗口。同時,專家也不會被永久貼上“熱”或“冷”的標簽。調度系統可以按專家粒度持續跟蹤訪問熱度,動態調整數據位置,跟著路由分布走,而不是一次性靜態切分。
要實現這樣的切分,難點在于對MoE推理時序約束的把控。MoE模型推理時,下一層要哪些專家,通常需要得等上一層算完、路由結果出來才知道。如果每次都等確定了再去讀取,就難免會產生算力空轉的現象。
九天睿芯為此打造了一套專家級預測式調度系統。根據當前狀態和歷史路由信息,系統可以提前生成候選專家集合并發起預取,如果預測落空,系統就就同步取數兜底,保證計算結果正確。
系統中多塊SSD被組織成并行資源池,盡量讓讀取與計算重疊推進。理想狀態下,當前層還在算,下一層的候選專家已經并行讀出,SSD的延遲被計算時間遮蔽。
候選集的選定同樣有取舍。候選集過小,容易漏掉真正需要的專家;候選集過大,又會占用帶寬和緩存,把無效數據提前搬進來。調度器要在命中率、覆蓋率、搬運代價和緩存空間之間動態取舍,面向最終能兌現的token吞吐進行優化。
九天睿芯也與RWKV社區開展了技術交流與協同,在專家預測、推理基礎設施優化等方向共同探索更高效的大模型運行機制。正推動超大參數模型從軟件架構到硬件系統的協同進展。
二、單卡跑出約20 TPS,算力交付單位變了
在這條路徑上,九天睿芯已經把DeepSeek-V4-Flash推進到單卡+4 SSD、decode速度約20 TPS。這套方案的價值在于,它證明了單卡、多盤和專家預測能夠組成一條持續供數的工程路徑,支撐大型MoE實現真正可用的部署。
九天睿芯稱,他們強調decode環節,是因為生成階段具有逐token依賴特點:前一個token產生后,后一個才能推進,任何一次專家缺失或I/O等待都會直接形成氣泡。相比可以并行吞吐的prefill環節,decode最能暴露內存訪問與調度是否穩定。
約20 TPS的速度,說明這套系統能讓專家供給持續跟上生成節奏,具備一定的可用性。
這套方案還改變了算力的交付單位。原本要先籌備一個小集群的模型,現在可以從一臺機器起步。工廠、園區、政務、本地一體機這些看重數據不出域、機房條件有限的場景,開始具備直接部署超大模型的可能,如果需求進一步增加,只需通過增加實例或擴展資源池就可以提高服務能力。
三、九天睿芯在研HBF與SRAM存算一體堆疊,更可幾十倍速度支持單卡跑萬億級別模型
更長遠看,九天睿芯方案中的單卡+多SSD配置,只是當前可交付的工程驗證平臺。行業正在為這條路線準備更好的介質,即HBF(高帶寬閃存)。
![]()
今年2月,閃迪與SK海力士在OCP(開放計算項目)下啟動HBF聯合標準化,閃迪公布的規劃顯示,其第一代HBF路線目標為單個16層堆疊512GB、讀取帶寬1.6TB/s;第二代和第三代的規劃分別超過2TB/s和3.2TB/s,容量提升至1TB和1.5TB。
與此同時,鎧俠、英偉達也在推動閃存靠近計算。鎧俠已驗證5TB、64GB/s、功耗低于40W的高帶寬Flash模塊原型;英偉達的BlueField-4/CMX則把以太網連接的Flash設計成Pod級上下文存儲層,用于承接和復用KV Cache。
在剛剛結束的FMS 2026峰會上,SK海力士與閃迪共同推出了全球首個HBF規范標準,谷歌(Google)與Tenstorrent已作為成員加入HBF聯盟。據悉,九天睿芯在研的芯片將高帶寬閃存作為主要模型權重和KV cache存放介質,是國內第一家走此路徑的AI芯片公司。
這個跨層級推理方案并不等同于HBF,卻共同說明一件事:閃存正在從“存放文件的后端”,進入模型權重、專家數據和上下文數據的推理路徑。
結語:分層存儲成超大模型落地現實路徑
大模型推理的需求正在迅速增長,但HBM價格高企、產能緊張,超大模型的部署成本中,相當一部分實際上是在為“顯存”買單。分層存儲,有望成為超大模型落地的一條現實路徑。
而九天睿芯在多SSD上驗證的專家切分、熱度統計、候選生成、預取回退等調度能力,并不綁定特定介質。未來即便存儲介質升級換代,這套系統積累下的調度能力,依然可以復用。
九天睿芯在研基于HBF和SRAM存算一體AI 計算die 3D堆疊的芯片在這個基于SSD替代HBM做顯存的方案基礎上,把帶寬和TPS提高10倍以上,單卡顯存容量可達4TB,帶寬數TB/s。
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.