允中 發自 凹非寺
量子位 | 公眾號 QbitAI
AI基礎設施的競賽規則,正在被改寫。
上半場比的是誰的卡多,下半場比的是誰能把卡用好
7月17日,WAIC 2026上海開幕,智算賽道200多家企業同臺,新品密集發布。
但在一片“曬芯片、秀參數”的聲浪里,是石科技的發布會卻顯得有些不同:
是石科技創始人兼董事長閆博文在臺上,不講芯片,不講模型,只講一個詞:效率
![]()
△WAIC 2026是石科技創始人兼董事長閆博文新品發布現場
因為中國的算力,正在被大量浪費——50多個智算中心,超過1000 EFLOPS的智能算力規模,平均利用效率卻遠遠沒有跑滿。
算不快、長上下文響應下降,是普遍現象。
是石給出的解法,叫拓元(Vectron),一座國產Token優化工廠
效率,才是未來AI基礎設施的關鍵詞
中國已建設50多個智算中心,智能算力總規模已超過1000 EFLOPS。
但平均利用效率仍有巨大提升空間。
“大量算力正在被浪費,算不快、長上下文多模態響應下降,是普遍現象。”閆博文說。
是石科技依托國家級計算中心工程經驗積淀,持續投入大規模集群研發,建設萬卡級國產大集群,持續穩定運營,優化推理效率,構筑了深厚壁壘,率先打通從底層芯片到上層應用的超智融合全鏈路,真正把國產大集群從“點亮”變成“跑滿”,讓龐大國產算力切實轉化為產業可用的Token穩定生產力。
“所以我們在重新思考,算力基礎設施建設提速的同時,如何進一步釋放算力價值?”閆博文認為,“十五五”期間,中國算力產業總投資預計達到7萬億元。
如果算力利用效率能夠提升十到二十個百分點,也將釋放萬億級的算力價值空間,會讓各行各業以更低的成本進入到AI的世界里,激發出更多的應用需求。
這背后的一個潛臺詞是行業共識的轉折:AI基礎設施的競爭,正從“算力規模競賽”轉向“算力效率競賽”。
![]()
未來AI基礎設施的關鍵,不只在于芯片數量,更在于能否將芯片、互聯、內存、散熱、調度與軟件棧整合為穩定可用的大規模系統
拓元,正是是石科技為這場“效率競賽”交出的系統性答卷。
讓每一份算力,轉化為穩定、高效、有價值的Token
目前AI基礎設施面臨的效率難題主要包括:異構算力難以統一調度、大模型推理缺乏深度優化、長上下文導致顯存與成本壓力驟增、國產芯片生態適配成本高昂等。
針對這些痛點,拓元不應只是一個模型,也不只是一個工具。是石科技希望打造的,是一套完整的AI Infra優化體系
具體來說——
在任務自適應優化上:依托請求畫像匹配最優計算鏈路,算力按需分配,減少資源浪費。
不同的推理任務自動匹配最合適的算力資源,而不是“一把抓”。
- 在算子庫優化上:硬件專屬算子融合編譯,充分釋放芯片極限算力。這意味著每顆國產芯片不再只是“能用”,而是被“榨”出了最優性能。
- 在模型與推理框架優化上:兼容主流國產芯片與大模型,異構深度調優,提升業務并發量。
- 在異構集群調度上:破除跨地域、多芯片算力孤島,統一納管調度,盤活閑置算力。
閆博文介紹,拓元全面兼容昇騰、昆侖芯、天數智芯、太初、瀚博半導體、摩爾線程、沐曦、燧原等10余種國產算力芯片,適配20余個主流模型,實現國產異構算力池的統一調度與推理加速,每日Token吞吐量達千億級別。
對于企業客戶而言,這意味著不管你的底層跑的是什么國產芯片,拓元都能讓你的算力資源池被統一管理、優化調度,最終產出更多可用的Token。
用核心技術突破,把算力“榨”到極致
發布會上,閆博文重點介紹了拓元的多項核心技術突破,每一項都指向企業使用大模型過程中的真實痛點。
KV Cache壓縮:讓長文本不再燒錢
企業使用大模型時面臨一個現實的問題,就是模型越來越強,運行成本也越來越高。
尤其當上下文變長時,顯存壓力急劇攀升。
傳統方法更多依賴輸入階段判斷信息價值,但在真實業務中,模型需要關注往往動態變化的是什么。
拓元的結果感知驅動KV Cache壓縮技術,可以在不犧牲模型效果的前提下,顯著壓縮KV Cache、降低顯存壓力,讓長文本、大規模AI應用真正能夠經濟地運行。
全模態推理的Token壓縮:讓AI學會抓重點
在大模型運行過程中,并不是所有信息都具有同等價值。
如何保留關鍵Token、減少無效計算,是效率提升的核心命題。
拓元在全模態場景中提出了基于模態自適應的免訓練Token壓縮方法,針對文本、視頻、語音等不同輸入,實現更加精準的信息篩選。
這意味著未來AI可以用更少計算完成更復雜任務,可以預見的是,在多模態時代,這個能力會越來越重要。
長上下文優化:百萬級信息的高效處理
企業知識庫、智能助手、復雜分析任務,越來越多場景要求模型具備超長記憶能力。
拓元通過混合位置索引合成的長上下文偏好訓練方法,以及記憶引導的重讀機制,在遠小于同類方法的訓練數據量下實現了顯著效果提升。
可靠深度推理:讓AI學會自我優化
傳統的大模型部署后,往往需要大量人工反饋來持續優化輸出質量,這就像養了一個需要不斷投喂、調教的系統。
拓元提出的“基于元獎勵的可擴展獎勵建模方法”突破了這個難題。
閆博文將其比喻成從“養一個需要不斷人工訓練的AI”變成“部署一個能夠持續自我優化的AI系統”。
對于企業來說,這意味著AI落地成本的大幅降低。
系統能夠理解企業標準,在復雜業務場景中持續輸出穩定、可靠、符合要求的結果。
智能體長程任務記憶機制:確保長程agent任務的穩定執行
智能體在執行長程檢索任務時,有時會無法判斷缺失信息或未讀到的,是已經被丟棄還是不存在的,從而產生負面影響。
拓元明確了以目標導向的信息記憶策略,突破稀疏信息難監測、長程建模受限資源限制、注意力機制的二次復雜度開銷大的難題。
閆博文表示,拓元可以幫助模型實現更低訓練成本,更高上下文理解能力,更強復雜推理能力
我們希望AI不只是能夠回答問題,而是能真正理解復雜世界。
![]()
△是石科技國產Token優化工廠“拓元”Vectron產品亮點
從技術到產品的關鍵一躍
是石科技成立于2021年,創始團隊源自清華大學計算機系,具備國家級計算中心工程化經驗。
閆博文本人是清華大學航院博士、計算機系博士后,核心成員主要由高性能計算、人工智能等領域的資深專家,以及清華大學、北京大學、北京航空航天大學等重點高校學者組成。
![]()
過去幾年,公司快速成長,已服務超過200家重點客戶,覆蓋互聯網大廠、頭部大模型公司、航空航天、生物制藥、新能源等行業,在并行優化、算力調度等業務上形成了深厚的技術護城河。
拓元的發布,意味著是石科技將領先的技術能力凝結成了一個商業化和標準化的產品,駛上了規模化發展的快速路。
閆博文在發布會上強調:
技術創新的最終目的,不是停留在實驗室,而是創造產業價值。
不僅如此,拓元也再次明確了是石科技獨特的賽道占位。
國產芯片生態的成熟需要“中間件”,未來中國AI產業必然需要構建自主可控的技術體系。
像拓元這樣能夠統一管理異構資源、屏蔽底層差異的平臺,是國產算力生態走向“好用”的關鍵拼圖。
在算力效率這個命題上,當大多數人還在討論該怎么做的時候,是石科技已經把產品擺到了WAIC的展臺上,也打開了公司從算力服務到Token服務的商業化新空間。
閆博文在本次發布會結尾說:
對于我們這些技術出身的人來講,最希望聽到的聲音就是兩種,第一是每次交付給客戶的大規模集群,滿負荷跑起來發出的萬卡集群的轟鳴聲;
第二就是我們每次幫用戶優化終極效果之后,客戶對我們的高度評價。
這兩種聲音我們認為也是未來中國的AI走得更強、走向世界的最強音。
*本文系量子位獲授權刊載,觀點僅為原作者所有。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.