![]()
7月18日,云天勵飛在2026 WAIC公布未來兩年多AI推理芯片路線圖。
公司計劃推出DeepVerse100P、DeepVerse100D、DeepVerse100L三款芯片,分別針對AI推理中Prefill、Decode和Decode FFN環節的負載特征進行專用優化。
三款芯片將面向萬卡異構集群進行協同設計與部署,通過對不同推理階段進行解耦,為不同負載配置更加適配的芯片和算力資源,進一步提升系統整體效率,持續降低Token生成成本。
![]()
推理負載持續分化,算力優化走向精細化
從負載特征來看,當前大模型推理應用正在形成不同類型:以對話、知識問答為代表的通用AI助手,以復雜推理、編程為代表的深度推理應用,以及以Agentic Coding、多Agent協同為代表的實時智能體系統。
隨著AI應用不斷深入,單次任務的上下文長度、推理鏈路復雜度以及實時交互要求持續提高,對推理系統的吞吐、延遲和成本提出了更高要求。對于大規模推理部署而言,峰值算力已難以單獨反映系統效率,計算、訪存、互聯和系統調度等因素,共同影響Token生成效率和成本。
大模型推理不同階段的計算特征也存在明顯差異。Prefill需要集中處理輸入上下文,對計算能力要求較高;Decode采用逐Token生成方式,對內存帶寬和數據訪問效率更加敏感。隨著MoE等模型架構發展,Decode階段內部的Attention與FFN在計算、訪存等方面也呈現出不同的資源需求。
針對推理負載的變化,云天勵飛計劃在未來推出DeepVerse100P、DeepVerse100D和DeepVerse100L三款云端大算力推理芯片。
DeepVerse100P面向百萬級上下文Prefill場景打造。在傳統混部架構中,長上下文Prefil與Decode共享算力與帶寬資源,會造成資源搶占,對Decode生成吞吐造成影響。
DeepVerse100D面向Decode環節打造專用Decode推理引擎,擁有數倍于主流芯片的內存帶寬,支持1024卡Scale-up及光互聯系統架構。通過按需建立光路直連,并根據任務動態重構光路,減少傳統多跳電交換和靜態組網中的排隊、擁塞及中間轉發開銷,降低多節點通信阻塞和尾延遲,提高逐Token輸出的穩定性。
DeepVerse100L面向Decode 階段計算密集型的FFN環節,采用3D Memory架構,相比主流HBM,大幅提升內存帶寬,并通過低延遲芯片互聯和激活數據快速傳輸,提高計算與通信的并行效率。
![]()
三款芯片協同面向萬卡異構集群
隨著AI推理進入規模化部署階段,芯片優化也正由單顆性能提升,進一步走向多芯協同和集群級效率優化。
在萬卡規模的推理集群中,系統效率并非單卡性能的簡單疊加。不同推理負載對計算、內存和通信資源的需求存在明顯差異,當Prefill與Decode、Attention與FFN共享同一套通用算力資源時,容易產生資源競爭。與此同時,隨著集群規模擴大,通信阻塞、資源等待和尾延遲等問題也會進一步影響整體推理效率。
因此,提升Token生成效率,除了優化單顆芯片性能,還需要圍繞芯片在集群中的協同,對推理過程中的計算、訪存、互聯和資源配置進行系統級設計。
基于DeepVerse100P、DeepVerse100D和DeepVerse100L,云天勵飛計劃推動三款芯片在萬卡異構集群中的分離式部署與協同運行。按照Prefill、Decode和Decode FFN的不同負載特征,分別配置相應芯片和資源池,并通過高速互聯形成協同運行的異構算力系統。
這一芯片協同方案圍繞Token生成全過程進行系統優化。通過對不同推理階段進行分離,降低不同負載之間的資源干擾,并根據實際需求配置計算、訪存和通信資源,從而提升集群資源利用率和整體推理效率。
從面向特定推理負載進行芯片優化,到不同芯片之間的協同,再到萬卡級集群應用,云天勵飛正在將AI推理芯片的優化范圍由單顆性能延伸至集群級效率。
面向“百億Token一分錢”的長期目標,云天勵飛希望以三款芯片為核心,形成一套服務于大規模Token生成的“推理工廠”,通過芯片、互聯、軟件和系統的協同優化,提高算力產出效率,持續降低單位Token成本。
![]()
IFWA軟件棧:降低國產算力應用門檻
硬件異構程度和集群規模不斷提升,也對軟件棧提出了更高要求。模型能否快速完成適配、算子性能能否得到充分釋放、不同硬件資源能否高效協同,直接影響DeepVerse芯片在大規模集群中的實際運行效率。
圍繞DeepVerse芯片及其集群應用,云天勵飛持續建設IFWA軟件棧,覆蓋AI模型開發、編程及系統等不同層級,為模型適配、算子優化、編譯部署和軟硬件協同提供軟件支撐。
在兼容性方面,IFWA圍繞Transformer主流架構,持續完善PyTorch ATen算子的適配和性能優化,并加強對vLLM、SGLang等主流推理框架的支持。通過兼容主流軟件接口、復用成熟開源組件,降低模型向DeepVerse平臺遷移和部署的成本。
在模型適配和開發效率方面,IFWA構建了覆蓋模型量化、壓縮、編譯和部署的一站式自動化工具鏈,并引入AI Agent參與推理芯片適配和性能優化。
此前,云天勵飛已開源Houmao多Agent異構編程框架,由不同Agent協同完成模型開發、算子開發、性能優化和測試驗證等任務,將部分依賴人工經驗的芯片軟件開發流程轉化為自動執行、自動驗證和持續優化,縮短新模型和新算子的適配周期。
與此同時,云天勵飛還將成熟的Triton算子能力融入FlagOS,通過代碼貢獻、聯合驗證和社區復用,推動相關能力在國產AI軟件生態中進一步共享,減少不同硬件平臺在算子適配上的重復投入。
在云天勵飛的規劃中,IFWA并非一套封閉的軟件體系,而是通過對主流模型、框架和開發工具的兼容,降低開發者的遷移和使用成本,縮短模型在DeepVerse平臺上的部署周期,讓國產算力更加便捷地進入實際應用。
![]()
“1001計劃”,推動Token成本協同優化
降低Token生成成本是一項系統工程。
從芯片架構、IP與EDA,到封裝測試、系統互聯、軟件棧和算力平臺,再到模型及應用,產業鏈不同環節的效率都會影響最終的Token生成成本。實現極致性價比的Token,需要產業鏈上下游共同參與。
今年5月,云天勵飛聯合聯想集團、通鼎集團、財聯社、無問芯穹、生數科技、硅基流動、廣立微、新華電信、魔形智能、龍芯中科、靈睿智芯、上海交大集成電路學院、季豐電子、上海交大集成電路校友會、人工智能產業工委會、新華三半導體、極熵科技、銳成芯微、芯耀輝、上海市人工智能行業協會、通富微電、甬矽電子、合見工軟、芯動科技等單位,共同簽署“1001計劃”倡議。
“1001計劃”將圍繞Token生成效率和成本,推動產業鏈上下游加強協同。通過更加緊密的產業合作,使模型和應用需求更早反饋至芯片及系統設計環節,推動成熟軟件能力加快復用,同時加速芯片在集群和實際場景中的驗證和應用。
![]()
隨著AI走向規模化應用,算力競爭正在進一步轉向對系統效率和單位Token成本的持續優化。芯片、軟件、系統和應用之間的協同程度,也將越來越直接地影響AI算力的實際價值。
以“百億Token一分錢”為長期目標,云天勵飛將持續推進芯片、系統、軟件和產業生態協同創新,與更多生態伙伴共同提高Token性價比,推動國產AI算力從“能用”邁向“好用、易用、用得起”,為人工智能規模化應用提供更加高效、普惠的算力基礎。
歡迎參與:2026第十六屆中國國際納米技術產業博覽會
![]()
歡迎報名:ICDIA 2026 (第六屆中國集成電路創芯大會)
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.