![]()
智東西
作者 ZeR0
編輯 漠影
智東西7月21日報道,7月20日,世界人工智能大會WAIC 2026期間,無問芯穹聯合創始人兼CEO夏立雪提出,從Pre-training(預訓練)到Post-training(后訓練)、從Test-time(推理時擴展)到Agentic scaling(智能體擴展),在四條Scaling Law的作用下,模型訓練和推理的超級市場正在互相孕育,當下的AI基礎設施(AI Infra)“必須以極致的效率服務更大規模”。
![]()
基于規模與效率兩大錨點,夏立雪從無問芯穹的AI生產力公式(AI生產力 = 智能資源規模 × Token轉化效率 × AI生產力轉化效率)出發,首次公布無問芯穹Agentic Infra的“前店后廠一中心”戰略布局,涵蓋三大核心技術能力與產品服務體系:
- “算力集散中心”:Agentic Infra自主式基礎設施平臺
- “Token工廠”:Agentic MaaS大模型服務平臺
- “AI生產力商店”: Agentic Infra行業解決方案
![]()
這套Agentic Infra產品與服務體系立足基礎設施,向下匯聚能源和芯片,向上支撐模型和應用,不僅極致提升底層資源向AI生產力轉化的規模和效率,更有著Agentic AI時代的AI原生能力——用基礎設施智能體蜂群賦能資源規模擴展、提效Token生產,并支持Agentic AI的持續進化。
一、Agentic Infra自主式基礎設施平臺,追求智能資源規模最大化
無問芯穹Agentic Infra自主式基礎設施平臺的核心目標,是實現智能資源規模最大化。它就像一座“算力集散中心”,把散落的、異構的算力資源統一匯聚、彈性調度、按需分發,為模型與應用層筑牢充足、穩定、可擴展的算力底座。
夏立雪認為:“算力的異質化、碎片化問題是全球性的,如何把不同的、跨區域的算力資源,高效聚合協同起來,是擴大智能資源規模的關鍵。”
無問芯穹自成立以來一直致力于通過“多元異構、軟硬協同”技術破解異質算力聚合的難題,打造了面向異構集群的大模型跨域訓練系統,并集成于Agentic Infra自主式基礎設施平臺軟件中,通過計算通信重疊的流水編排、自適應的通信流調度和異構算力調度機制,三位一體全棧協同優化,能夠系統性地破解算力聚合的行業難題。
該系統已經受過三大類跨域算力聚合訓練實踐的生產級考驗:
第一是超遠距離聚合。無問芯穹已聯合中國電信,完成了國內首例超4000公里距離的大模型跨域混訓,在新疆哈密與廣東深圳兩地集群間,實現聯合訓練性能提升165%,驗證了超遠距離跨域集群協同訓練的可行性。
第二是多數據中心聚合。打通4個不同代際、不同型號的GPU集群,聯合訓練近百億參數大模型,四集群協同性能提升41%,有效盤活了不同批次的存量異構算力。
第三是混合云算力聚合。實現本地私有集群與公有云算力的安全互通混訓,整體性能提升68%,幫助眾多企業客戶解決本地算力不足、云上資源卻閑置的錯配痛點。
![]()
目前這套跨域訓練系統已在全國部署觸達超37000P算力、覆蓋16種主流芯片,盤活了廣域分散的異質算力,使之成為Agentic AI時代的堅實底座。
當下,強化學習成為下一代AI進步的重要手段。但相較傳統預訓練,強化學習“多角色協同”的特性使其對硬件的種類需求更加復雜,規模量級也更加龐大,基于異構和超大算力規模的雙重剛需,跨集群強化學習因此成為智能規模化及持續進化的新錨點,這也是無問芯穹Agentic Infra自主式基礎設施平臺重點布局與攻克的核心場景。
![]()
該場景存在兩大重要問題:一是跨集群之后,不同角色之間的等待時間將被拉長;二是當規模擴大到萬卡級后,從顯卡到服務器、網絡、存儲,故障將以小時級的頻率存在,而重新拉起任務耗時長達數十分鐘,任務難以持續穩定運行。
因此,針對跨域強化學習場景,無問芯穹把全棧協同的技術思路貫穿到底——從網絡、平臺到框架做一體式深度優化,打通分散的異構集群,實現全局資源一盤棋調度。
在此之上,無問芯穹進一步將優化滲透進全鏈路的每一個環節,尤其是在跨域通信和容錯這兩個層面:通過優化計算通信重疊技術,讓跨域通信效率直接提升3-4倍,實現通信開銷100%全掩蓋,訓練不再因跨域通信產生額外耗時損耗;同時搭建了故障無感的訓練機制,成功實現了跨域強化學習訓練連續一周0中斷穩定運行。讓大規模跨域強化學習不僅可以“跑得通”,還能“跑得快、跑得穩”。
![]()
“這只是一個起點。”夏立雪談道,伴隨著大規模跨集群強化學習訓練技術的持續成熟突破,無問芯穹還將持續深耕并行策略、通信融合、智能算子、極致容錯等核心技術,“未來,我們能夠將跨域計算資源的支撐規模,持續拓展至十萬卡級以上,支撐下一代Agentic AI的在線進化。”
二、Agentic MaaS大模型服務平臺,Token工廠以“效”搏大
Token經濟時代,無問芯穹早在2023年初就提前布局的Agentic MaaS大模型服務平臺,目前正在迎來高速且持續的增長曲線。該平臺就像一座“Token工廠”,核心目標是用極致效率服務Token的規模化、高質量生產。
發布會現場,夏立雪用千卡至萬卡規模下完整推理服務技術棧揭示了一座Token工廠內部的可優化空間,“從網關、路由,到底層推理實例,Token工廠層層可優化、處處有增量。”
![]()
隨后,夏立雪披露了無問芯穹首創的新一代推理系統優化成果——跨集群異構PD分離架構(Prefill-RelayDecode-MainDecode, PDD)。
智能體推理需求的特征有“三極”:上下文極長、交互輪次極多、緩存命中率極高,對吞吐、時延、緩存復用的要求,遠高于傳統對話場景。
同時,從實測數據中能直觀看到,不同芯片在Prefill、Decode階段的性能差異極大。而眼下,這些散落在不同地區的存量集群幾乎都是同構的,且幾乎每個集群都“偏科”。
因此,該架構首先用高性價比的廣域網以太網把分布在各地的、已經建好的同構數據中心連起來,讓算力強的集群做Prefill任務,讓顯存帶寬高的集群做Decode任務。
這一架構設計相當于讓“偏科”的硬件只刷自己最擅長的題,可以極大提升大模型推理系統效率,是每座Token工廠都必備的“超級管線”。
![]()
然而,基于以太網的KV Cache跨集群傳輸,存在帶寬和延遲瓶頸,這根“超級管線”既要能扛住智能體業務的巨大“流量”,也要能跟得上用戶對“流速”的極致要求。
基于Agentic MaaS線上業務長期的大規模實踐積淀,無問芯穹推理團隊首先把為了Decode實例重復前綴存儲去重而設計的Decode Radix Cache技術,創新性地遷移至跨集群異構PD分離架構之中,實現跨集群KV Cache傳輸數據量降低一個數量級, 讓“流量過載”的難題迎刃而解。
其次,更大的挑戰在于“流速”——智能體的響應速度,是最直觀的產品體驗底線。
PDD將傳統的PD分離鏈路“P-D”創新解構為“P-RLD-MD”的三級分離式推理架構,就像是為這條“超級管線”加裝了一個“精密增壓閥”。
對于高傳輸延遲的請求,RelayDecode先行輸出Token給用戶,從而讓用戶側完全感受不到這一實際上長達數十秒的傳輸延遲;當傳輸完成后,輸Token給用戶的任務被無縫切換給MainDecode來處理,避免了RelayDecode被長期占用。
通過這一設計,僅需極少量機器承擔RelayDecode ,就能掩蓋以太網KV Cache傳輸延遲。
實測顯示,該架構在實現了首Token延遲(TTFT)降低51.5%的同時,單Token成本可降低37.5%。這不僅意味著用戶端速度體驗的顯著提升,更意味著,每一個集群都能被充分利用起來,最大化釋放全域異構算力的產業應用價值。
過去一年里,無問芯穹的Token工廠已通過一系列原始技術創新,推動了推理成本的大降90%。夏立雪判斷,隨著跨集群異構PD分離架構的規模化落地,推理成本依然有10倍的下降空間。
![]()
“目前無問芯穹的Agentic MaaS大模型服務平臺的增長飛輪已經全面轉起來了!”夏立雪說。
技術迭代驅動成本下降,業務規模加速技術創新。通過與Kimi、智譜、Minimax、階躍星辰等頭部大模型企業的密切合作,無問芯穹在真實業務場景中持續打磨、積累了大量優化經驗。
截至7月,其平臺單日Token調用量較去年12月,已實現了40倍的爆發增長,而海量業務經驗又能反哺技術快速迭代,催動平臺性能與可靠性的同步躍升,形成“業務帶技術,技術提效率,效率促增長”的正向循環。
夏立雪總結:“6月的GTC 上,黃仁勛展示了英偉達的 ‘算力即收入’曲線。無問芯穹的Token工廠,則希望用這個‘優化即利潤’的增長飛輪,向推理時代交出Token效率的答卷。”
無問芯穹已攜手上海移動聯合打造了 “滬芯滬產服務滬客”的“天問”模型服務門戶,也與AI原生新世代社區“觀猹”聯合打造了“中國版OpenRouter” TokenDance(詞元跳動) 平臺。
未來,無問芯穹將持續攜手優秀的行業伙伴,以這套高效的“Token工廠”賦能更多產業領域、服務更廣泛客用戶。
三、Agentic Infra行業解決方案,把Token轉化成實際AI生產力
依托“算力集散中心”與“Token工廠”,無問芯穹可以將計算資源高效轉換成高質量Token。
然而相同的業務效果,基于不同的推理路徑、模型規模和芯片,Token的成本天差地別,深度影響其在真實生產環境中的商業化潛力。
為此,無問芯穹正通過Agentic Infra行業解決方案,攜手多行業伙伴把Token高效轉化為產業真正認可的高質量AI生產力,它就像一個“AI生產力商店”,持續賦能千行百業降本提效。
現場,夏立雪帶來了覆蓋文娛游戲、醫療健康、法律終端、能源電力等多個垂直行業的 Agentic Infra 行業解決方案。
在文娛游戲場景,無問芯穹聯手VAST的Tripo 3D大模型聯合打造了AGENTIC 3D GAME GEN解決方案,把分散的創意輸入轉化為可執行、可比較、可細化的3D模型輸出,高效釋放游戲內容生產力。
![]()
在醫療健康場景,無問芯穹服務上海瑞金醫院算力及模型管理,助力醫療大模型及智能應用在運營管理、臨床診療輔助、醫學教育培訓等場景的探索落地。
在法律終端場景,無問芯穹打造律師事務所專屬AI合伙人——”律盾芯人“,與“段和段律師事務所、君合律師事務所、競天公誠律師事務所、通商律師事務所”等行業私有化AI終端合作伙伴,以及“法義經緯、圖靈法思”等生態合作伙伴一起,共同推動法律行業的智能化安全升級。
在能源電力場景,無問芯穹也正與南網能源一起深度探索基于智能體技術的智算中心能耗智能預測與協同調度解決方案。
基礎設施自己本身也是個行業,無問芯穹已經在這個行業深耕多年,既積累了豐富的實踐經驗與技術,也擁有足夠多的應用場景與需求。
因此在支撐千行百業智能升級的另一面,無問芯穹也持續將智能體的能力應用到AI Infra本身,打造了一套基礎設施智能體蜂群。
遵循“用智能體賦能基礎設施,提升計算規模和智能效率”的核心目標,無問芯穹基礎設施智能體蜂群目前已包含三個子集,對應在AI生產力轉化、智能資源規模、Token生產效率的三方面:面向用戶的平臺管家智能體系統、面向集群的運維智能體系統、以及面向芯片的算子生成智能體系統。
![]()
夏立雪提到:“我們不僅用Agent賦能資源規模擴展、提效Token生產,更致力于以Agent能力驅動整套AI Infra形成自主迭代、自我優化的閉環,讓基礎設施越用越強。”
平臺管家智能體系統是整個基礎設施智能體蜂群協同場景下的全局統籌者與用戶入口,它有效降低了用戶駕馭復雜系統的學習成本,通過自然語言交互,就能讓智能體主動幫助用戶操作平臺、統籌AI基座,輕松高效完成復雜的資源運營、管理和答疑排障等工作,能夠獨立解決80%日常問題,剩下20%深度問題再轉交對應垂類Agent。
智算集群運維智能體系統是一個能夠端到端地解決實際生產場景中的運維難題的7×24小時全天候值守的“運維專家團”,系統以運維主智能體為核心大腦,與故障排查智能體、環境部署智能體、故障處理智能體等協作運行,不僅可以完整執行一個集群的告警自動閉環處置任務,還能夠“防患于未然”地規劃周期性巡檢任務,提前識別潛在隱患。讓智算集群的運維從“人找問題”轉變為“問題找人”和“問題自己解決”。
經過大規模生產環境驗證,這套系統的價值正在逐漸凸顯:可實現運維人效提升5倍以上,關鍵故障處理效率提升6倍,不僅為大規模GPU訓練與推理業務提供了更加穩定、高效的基礎設施保障,也讓運維人力能夠被真正解放出來,聚焦更有價值的技術創新。
算子,是釋放AI硬件性能的最后一公里,同時也是拉開基礎設施效率差距的關鍵變量。
目前,大模型已經能夠快速產出算子,但“能跑通”不等于“能用好” —— 要在生產環境中實現性能超越成熟推理引擎、達到工業級落地標準,難度依然極大。
無問芯穹高性能算子生成智能體系統KernelMind,以算子生成主控智能體為調度中樞,聯動多類專用智能體,通過 “需求分析 — 智能調度 — 內核生成 — 沙箱驗證 — 評審沉淀”五步閉環工作流,可在真實編譯試錯與知識沉淀中持續自迭代,穩定交付可直接落地的高質量工業級算子。
![]()
在GLM-5.2模型的實測中,對比行業基線該系統在NVIDIA旗艦卡中實現了端到端7.3%的性能提升,在AMD旗艦卡中更是帶來了39%的整體性能躍升,GEMM、Attention、Router等各類核心算子性能均實現全面超越。
早在2025年,無問芯穹就已經在業內率先提出了Agentic Infra的范式變革。
如今,Agentic Infra支撐智能體規模化運行與持續進化的產業價值正在被不斷驗證。從概念到落地,無問芯穹始終堅持以硬核技術推動Agentic Infra走向真實業務場景。
夏立雪提到:“我們的愿景始終清晰而堅定:通過Agentic Infra,實現 ‘用智能進化智能,用生產力加速生產力’ 。”
四、One More Thing:邁向物理世界
演講最后,夏立雪將視野從云端的數字世界延伸至真實的物理世界。他提出:“在物理世界中,具身智能的Scaling Law同樣需要高效率、大規模的基礎設施支持。”
現場,無問芯穹公布了在具身智能領域的全新探索——首個面向大規模具身任務的云邊端一體化管理與調度平臺。
該平臺首次把云端GPU集群、邊緣算力節點和機器人真機設備統一接入到一個平臺中,支持訓練、數據采集、評測和真機執行等多種具身任務統一編排運行,有效解決了具身訓練中資源分散、跨集群協同困難、任務角色復雜、真機狀態不可見、啟動鏈路長的問題。
同時,針對具身智能的訓練與推理部署兩大核心環節,夏立雪宣布了無問芯穹兩項重磅技術升級:面向具身智能的大規模真機強化學習訓練框架 RLinf V0.3,以及面向機器人與端側AI場景的全棧的推理優化體系 Mizar-Robo。
RLinf在V0.1版本中實現了在仿真環境下渲訓推一體化的強化學習;在 V0.2版本中實現了像管理GPU一樣管理真機設備;而V0.3版本的升級則新增支撐具身智能大規模真機、跨域端云協同的強化學習訓練,支持具身智能的持續進化。
![]()
從實驗室到產業,無問芯穹也與智元、清華大學攜手深度探索了真機強化學習訓練的技術與實踐,攻克阻礙真機強化學習訓練大規模落地的核心痛點與難點。
通過首創的HotSwarm與端云協同訓練模式,RLinf V0.3可以支持真機設備1000+次在線上下線,訓練0中斷,并成功實現近百臺真機規模專線需求降至2Gbps以下,大幅拉低具身智能規模化訓練的成本門檻。
Mizar-Robo則依托流水線調度、算子內核、量化壓縮、計算圖四層協同優化,全方位釋放端側硬件潛力,大幅提升具身模型的部署效率,讓具身智能即便在低功耗硬件上,也能實現連貫流暢、低延遲、長續航的高精動作交互。
![]()
在無問芯穹與自變量機器人WALL-OSS系列模型的聯合優化部署中,在保持WALL-OSS原有任務成功率的前提下,實現了7.14倍的推理性能提升,經Thor平臺實測,端側推理時延從500ms壓縮至70ms,降幅達86%,不僅保障了實時交互的流暢度與穩定性,也有效延長作業續航。
結語:錨定“規模與效率”兩大支點,為AI生產力運行構筑基礎設施
“讓智能無所不能,是AGI,而讓智能無處不在,是AGI Infra。”夏立雪在發布會尾聲中說道,“AI無疑是目前世界上發展變化最快的行業,但我們的初心從未改變,就是做AGI時代最需要的AI Infra。”
從“算力集散中心”做大資源總盤,到“Token工廠”深挖效率紅利,再到“AI生產力商店”循環造血向產業輸出價值,乃至向物理世界AI的探索與實踐,無問芯穹始終錨定“規模與效率” 兩大支點穩步向前。
“前店后廠一中心”的Agentic Infra體系 ,既是無問芯穹積淀多年的戰略藍圖系統性落地,也代表著無問芯穹錨定AGI時代的長期方向:為未來數字與物理世界的所有AI生產力的運行構筑基礎設施。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.