克雷西 發自 上海
量子位 | 公眾號 QbitAI
商湯大裝置這次交出的國產算力成績單,量級已經不一樣了。
WAIC期間,商湯大裝置舉辦了一場AI基礎設施論壇,把這份成績單擺到了臺面上。
成績單顯示,商湯大裝置把國產芯片相關業務的毛利率,做到了正數。
預計到7月末,商湯大裝置的日均Token處理量,將從年初的4000億一路狂奔到2.42萬億,年底還沖著10萬億去,大概是年初的25倍。
國內頭部模型廠商的名字,也有很多都排上了商湯的客戶名單。
商湯大裝置負責人楊帆介紹,過去好幾年,算力圈一直在念叨一句老話——誰買國產芯片,誰認虧。
商湯大裝置交出的這組數字,直接把這句老話懟了回去。
也正是因此,商湯自己把這一年,稱為「國產AI基礎設施規模化商用的元年」。
撐起這個反轉的,是商湯一整套把資源攥在自己手里、靈活拼起來用的操作方法論。
先拼系統,再等芯片追上來
現在的國產模型,跟世界主流已經沒有代際差距。
但搭載它們的國產芯片,跟國際主流高端芯片比,至少落后一代。
這個錯位,在算力產業鏈上幾乎人盡皆知。
商湯大裝置沒有守株待兔,不等這道差距被芯片廠商自己填平,就先跑通了一套系統層面的組合方案。
有了這套方案,這道差距在實際用起來的時候,就能得到一定程度的彌合,不再是天塹。
這套方案的核心,叫異構混合推理。
具體來說,商湯大裝置把主流國產芯片「拼」在了一起。
他們將Prefill和Decode階段分離,把對顯存和帶寬要求最高的Decode環節,交給性能更強的高端資源撐著;對算力要求相對分散的Prefill環節,則交給數量更多的國產芯片扛。
這樣分的道理并不復雜,Decode階段要一個字一個字往外蹦,每蹦一個字都要把之前生成的內容在顯存里翻一遍,吃的是帶寬;
Prefill階段則是一次性把輸入內容整個吞下去,吃的是算力堆疊的吞吐量。
兩種「脾氣不一樣」的任務,本來就不該塞給同一種硬件干。
有了這樣的分工,一塊高端芯片,大概就能帶動約30塊國產芯片一起干活,拿到與單獨用高端資源接近的效果。
這套組合術,也不是只對著一款芯片量身定制的。
商湯大裝置前后適配過20多款不同廠商的國產芯片,其中已經有六七款能夠穩定地商業化盈利。
當然,把硬件拼在一起,只是第一步。
系統層面還有大量定向優化和適配的工作要做。
這些工作瑣碎但繁重,從底層的編譯器適配,到算子重寫,再到上層框架的對接,最后還要落到調度策略的調整,每一層都得單獨去啃。
為此,商湯大裝置在算子層面做了針對性的重寫和調優,又在系統層級調整了資源分配和調度策略,把國產芯片的算力利用率盡可能地壓榨了出來。
通過異構混合推理,主流國產芯片MFU(Model FLOPs Utilization)提升了85%-152%。
換算成商業指標,這套系統組合讓單位成本的Token產出,提升了2.5倍。
具體到業務場景,在AI4S長序列蛋白質預測場景中,通過融合算子優化,整體預測耗時減少75%;在AIGC視頻生成場景中,國產芯片運行DiT模型時,多卡并行視頻生成加速比達到了93%。
這套能力,商湯打包成了一門叫「Token工廠」的生意。
有了這座「工廠」,批量處理Token的需求,都可以直接找商湯來供給。
這些系統層面的工作,就是開頭那組25倍增長曲線背后真正的支撐。
別人分著干,商湯自己包圓
商湯這套用高端資源撐瓶頸、通用國產卡沖量的混合推理方案,之所以能跑通,光靠技術優化還不夠。
這種想法本身并不復雜,同類玩家也不是沒想到過類似的招。
但商湯大裝置的殺手锏,在于把整條鏈條攥在了自己手里,因此才能做端到端的聯合優化。
這個「殺手锏」具體是什么樣子,要從很多行業通用的分工方式說起。
機房、硬件、批發分銷、零售,分給不同公司干,已經是家常便飯。
拆得越細,每一層單獨看起來都更專業,但層與層之間的損耗和摩擦,也跟著多了起來。
一層的浪費,常常要靠另一層的收益去補,一旦這兩層歸屬不同的公司,這筆賬就成了燙手山芋,基本沒人愿意主動算清楚。
但商湯大裝置卻選擇自己建機房,自己采購和運營硬件,自己開發調度系統,最后的服務也是商湯自己直接對接客戶。
這套自己全包的打法,最早是從適配國產芯片這件事上磨出來的。
商湯大裝置從2018年就開始攢這套協作班底,自己的研發團隊、芯片原廠和高校科研機構長期配合,一起解決從底層編譯器到算子、再到框架和服務這幾層技術問題。
這套班底走的是一種松耦合與緊耦合并存的路子,平時各干各的,遇到硬骨頭就并到一起集中啃。
任何一層,都得多方一起才能搞定。
今年,這套體系里多了一個新招——用AI自動生成算子適配代碼。
有了這個方法,過去需要工程師手工做的適配工作,被AI接了過去。
跟上模型迭代速度所需要的人力時間,也因此被壓縮了不少。目前,這套做法已經在商湯的生產環境里跑了不短的時間。
算力之外,商湯把電力也一并攬進了自己手里,算力和電力,被當成一個系統聯合調度。
商湯大裝置在WAIC期間正式發布了「算電協同Agent」,先用模型去預測算力任務的耗電特征,把這個預測結果,跟電力的調度系統打通,再配合峰谷電價和自己的儲能設施,去調節整體的用電節奏。
![]()
這套打法也衍生出了一個新指標,叫TPW(Tokens per Watt),衡量的是單位電量能產出多少Token,用這套方法之后,單位電力成本的Token產出提升了80%左右。
這套端到端自己全包的路數,也延伸到了生態合作上。
商湯大裝置聯合了將近20家生態伙伴,其中有寒武紀、沐曦股份、中科海光、華為昇騰、摩爾線程、曦望Sunrise、壁仞科技這些頭部國產芯片廠商,也有曦智科技這樣的核心零部件伙伴,還有硅基流動、趨境科技這類基礎設施廠商。
這些伙伴一起發起了國產AI基礎設施生態共建計劃,目標是打造一個開放共享、聯合創新的產業生態。
往后,商湯計劃依托「銀河計劃」,跟生態伙伴共同建設1個Token運營中心、5個萬卡級國產智算集群,圍繞10個核心技術方向做聯合創新,還要賦能200家AI初創組織。
![]()
產業伙伴之外,商湯還把科研機構拉進了這套體系里。
WAIC期間,商湯大裝置聯合上海人工智能實驗室、北京中關村學院、深圳河套學院、上海算法創新研究院、上海交通大學人工智能學院這五家國內頂尖科研機構,一起啟動了科學發現平臺的戰略合作。
![]()
這次合作的方向不少,聯合實驗室建設、重大科研項目協同攻關、科研算力底座、科學智能平臺研發、復合型人才培養、科研成果轉化,都在合作范圍里。
這次合作要構建的是一套覆蓋算力基礎、平臺工具、模型能力、科研創新的一體化科研服務體系,面向生命科學、新材料、智能制造這些重點領域,以此提供AI層面的科研支撐。
這套方法論往外延伸的方向,還包括天上。
商湯大裝置簽約了國星宇航,雙方開始共同探索從地面萬卡集群到在軌多星協同的太空算力合作。
![]()
預計到2026年,「商湯號」系列算力衛星將完成首發并組網,驗證星地協同計算能力;到2030年,將建成天地一體化AI算力星座,形成覆蓋全球的空間智能計算網絡。
這套太空算力的合作,瞄準的是應急救災、遠洋船舶、野外機器人這些弱網絡環境下的實時AI推理場景,是地面集群覆蓋不到的地方。
跟太空算力一樣,光計算和量子計算,也是商湯正在同步探索的方向,眼下都還處在探索階段。
這些分布在不同領域的動作,說到底是同一套方法論——把資源收在自己盤子里,再根據場景靈活地重新組合。
窗口會關,方法論不一定
這套方法論是真本事,但眼下這份高毛利、高增長,也出現在一個特殊的市場節點上——
當下的供需結構,正處在極度失衡的狀態。
今年Agent類應用一起來,算力需求的結構徹底變了。
單次任務處理的上下文長度大幅拉長,市場對算力的整體需求,同比去年漲了5到10倍,主流算力的供給卻幾乎沒漲。
大廠需要優先保自己內部的核心業務,導致第三方客戶的溢出需求,沒人承接。
大廠和頭部芯片廠商都顧不上的那部分市場,正是在這個窗口期里被商湯攬了過來。
供給端一旦追上來,這輪紅利大概率會收窄。
雖然紅利會收窄,但商湯大裝置沉淀下來的東西卻留得住。
商湯在AI基礎設施這個領域,已經摸爬滾打了九年,是布局最早、也最懂大模型的服務商之一。
這九年來,他們所沉淀的,是一套端到端整合、能跨場景復用的操作方法論,從推理延伸到電力,延伸到區域布局,也延伸到太空算力,背后都是同一套邏輯在不同場景里的具體適用。
這輪收入曲線,只是這套方法論眼下最容易被看見的一部分。
同時,這套邏輯也在回應一個更長期的判斷。
模型的應用場景還在持續變多,具身智能、世界模型和科學計算這些新方向,對算力提出的要求彼此并不一樣。
單一芯片很難同時滿足所有場景,這給商湯這類擅長「組合調度」的玩家,留出了長期的研究和發展空間。
AI基礎設施這場競賽,拼到最后,芯片多先進,不再是決勝的砝碼;把手里的資源拼成最優組合,才是關鍵的招數。
商湯大裝置賭的,就是這一件事。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.