![]()
智東西
作者 程茜
編輯 云鵬
智東西7月22日報道,昨日,阿里千問最新發布的Qwen3.8預覽版模型在英偉達評估AI進行算子優化的榜單上登頂,排名超過騰訊混元、人類開發者、Cursor。
榜單中SOL得分指的是GPU的峰值算力與HBM帶寬共同決定的理論性能極限。模型這一分數越接近1,代表其生成和優化GPU算子能力越接近理論極限,可以在無需人類標注的情況下,通過與真實硬件環境的交互,自主產生訓練信號、評估自身輸出質量并持續改進算子。
這一榜單中排名第二的是騰訊混元Hyra、排名第四的是人類開發者Amir M. Mir、排名第六的是美國AI創企doubleAI的全自動GPU內核生成智能體系統、排名第十的是AI編程獨角獸Cursor,其他項目暫未找到公開打榜記錄。
![]()
SOL-ExecBench榜單是今年3月,英偉達推出的GPU CUDA Kernel內核優化基準評測套件,面向Blackwell B200架構專門用來評測AI智能體、編譯器、自動內核生成工具寫出的GPU算子性能。Qwen3.8登頂的FlashInfer-Bench子集,就是專門用于測試和優化大語言模型推理系統中的GPU算子。
7月19日,阿里千問大模型團隊宣布將很快發布并開源Qwen3.8。該模型參數2.4T,可能是除了Fable 5外最強大的模型。昨晚,Qwen3.8-Max-Preview更新,前端(WebDev)表現更好。
一、從124個模型中提取,共235項CUDA內核優化任務
隨著AI智能體生成與優化GPU內核的能力持續增強,現有基準評測的一大局限暴露,其只看重相對軟件基線的加速比,而非內核執行方案本身貼近硬件最優效率的程度。而在現代數據中心中,未能充分利用硬件的kernel意味著算力與能源的雙重浪費。
基于此,英偉達提出了SOL-ExecBench基準套件。這一套件共有235項CUDA內核優化任務,提取自124個商用及前沿人工智能模型,覆蓋大語言模型、擴散模型、計算機視覺、音頻、視頻以及混合架構,目標硬件為英偉達Blackwell系列GPU,涵蓋BF16、FP8、NVFP4精度下的前向與反向計算負載。
![]()
與以往基于軟件性能來進行評估標準相比,SOL-ExecBench的評估目標有所不同。其通過“Speed-of-Light(SOL)”界限來評估內核性能,即由GPU的峰值算力與HBM帶寬共同決定的理論性能極限。
英偉達開發的SOLAR工具能夠從FLOP數量、字節數、GPU峰值吞吐量以及帶寬等方面,分析出這些基于硬件的SOL界限,然后將這些界限與預先定義的評分基準相結合,從而得出SOL評分。
具體來說,評分為0.5表示與基準值相當,評分為1.0表示達到了硬件上的SOL界限。因此,這個評分不僅反映了相對于基準值的改進程度,還體現了與最大可實現硬件性能相比所剩余的優化空間。
![]()
為保證評分結果的可靠性和可重復性,SOL-ExecBench還包含一個沙盒評估工具。此外基于其開發的智能優化算法,可以在相同的評估協議下改進提供的PyTorch參考實現,這種優化算法可以識別出那些試圖操縱評估器的行為,即試圖繞過評估機制以獲得更快的運算結果。
此次Qwen3.8拿下第一的是FlashInfer-Bench子集,專門用于測試和優化大語言模型推理系統中的GPU算子。
該子集包含26個來源于Llama-3.1-8B、Qwen3-30B-A3B、DeepSeek-V3/R1的問題。
該子集覆蓋的精度格式為BF16與FP8,每個問題提供7-48個動態形狀的輸入配置,覆蓋真實生產場景,典型任務包括融合注意力(Fused Attention)、FP8 MoE和RMSNorm等推理關鍵算子。
根據官方披露,該測試套件中所有提交內容均在真實NVIDIA B200 GPU上隔離執行,GPU時鐘鎖定在1500 MHz以保證可復現性。
二、榜單排名靠前,意味模型具備閉環自我改進潛力
Kernel優化是少數幾個可以提供清晰、客觀、可量化反饋信號的真實工程任務之一:
- 反饋明確:運行時間、吞吐量、帶寬利用率可以精確測量;
- 標準客觀:距離硬件理論極限還有多遠,沒有歧義;
- 迭代自然:每一輪優化都可以作為下一輪的起點。
這意味著模型可以在無需人類標注的情況下,通過與真實硬件環境的交互,自主產生訓練信號、評估自身輸出質量并持續改進。
在SOL-ExecBench FlashInfer-Bench子集上表現靠前,就意味著模型在下面幾項能力上具有優勢:
- 長程因果推理:優化決策之間存在復雜依賴鏈,局部改動會影響全局性能,模型需要跨越長上下文進行一致性推理。
- 工具使用與環境交互中的策略規劃:現實世界智能體任務面對多輪工具調用,模型需要根據每次執行反饋動態調整策略,而非機械執行預設步驟。
- 稀疏反饋下的探索能力:性能提升往往不是線性的,模型需要在大量“看似合理但實際無效”的方向中識別真正有價值的優化路徑。
- 系統級抽象與具體實現之間的雙向翻譯:從高層算法語義映射到底層硬件指令,再從硬件反饋反推優化方向,這種雙向能力在科學計算、編譯器設計、芯片設計等領域均有直接遷移價值。
這也意味著,能在SOL-ExecBench上持續進化的模型,具備在客觀物理約束下進行閉環自我改進的能力。
三、訓練側搭建真實GPU環境,推理側引入阿里智能體框架 智東西從千問團隊獲悉,在訓練、推理方面,千問團隊均針對Kernel Self-Evolving進行了優化。
首先在訓練側,為了讓模型真正具備kernel優化能力,而非僅僅學習表面的代碼模式,其構建了一套基于真實GPU環境的大規模強化學習體系。
1、研究人員搭建了基于沙盒的真實GPU訓練環境:
為模型提供豐富的硬件文檔與可交互的Workspace,使模型能夠通過真實編譯、執行與性能測量獲取來自硬件的獎勵信號,而非依賴代理指標或模擬器。這可以確保每一個訓練信號都有真實的物理意義。
2、真實Kernel倉庫作為訓練數據
研究人員系統性收集了大規模真實的工程級kernel優化代碼,以這些真實世界的kernel作為訓練query。相比合成數據,真實反饋覆蓋了更廣泛的優化模式、硬件適配策略與工程取舍,為模型提供了更接近生產場景的學習信號。
3、RL基礎設施的針對性優化
Kernel優化任務的一個顯著特點是需要超長的工具調用序列,單次優化過程可能涉及數十乃至數百輪的編譯-執行-分析循環。
為此,研究人員對強化學習訓練基礎設施進行了專項優化,使其能夠高效支持超長多輪工具調用的訓練,從而讓模型真正學會跨越長序列的持續優化策略。
在推理側,研究人員使用阿里巴巴Atrex Kernel Agent框架來承載算子優化的完整分析迭代流程與經驗沉淀機制。
![]()
▲阿里巴巴Atrex Kernel Agent框架和工作流(圖源:GitHub)
在SOL-ExecBench FlashInfer-Bench子集的評測中,該模型完成了平均29354輪工具調用的持續迭代,在每一輪循環中對kernel實現進行編譯、執行、性能分析與策略調整,將性能逐步推向硬件理論極限。
這意味著,模型在數萬輪的迭代過程中可以保持方向一致性、持續產出有效優化、不陷入局部震蕩,正是長程持續優化能力區別于普通代碼生成能力的核心所在。
結語: 從手寫算子到AI生成、調優, Qwen3.8刷新自動化算子生成能力上限
Qwen3.8此次登頂,意味著其有能力承擔底層算力優化的復雜工程任務,并進一步壓縮人工介入算子開發的工作環節,其能直接對接真實硬件環境采集運行反饋,形成從算子生成到性能調優的自動化閉環。
自動化GPU算子生成賽道的長期競爭,未來或取決于大模型理解硬件架構、推演訪存瓶頸、自主迭代調參的綜合智能水平。長遠來看,伴隨大模型能力升級,模型側與編譯層在算力優化方面將形成持續雙向反饋,硬件規格、算子實現、模型架構三者協同演進可能會成為常態。
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.