![]()
你可能已經(jīng)在各種 benchmark 榜單上看過 GUI Agent 的 "大勝" 了。
OSWorld 上 70%+ 的成功率、網(wǎng)頁操作幾乎封神、連寫個郵件發(fā)個文件都不成問題。各家發(fā)布會 PPT 一片飄紅,仿佛 AI 馬上就要接管你的電腦。
但我最近讀到一篇論文,感覺它把這層濾鏡狠狠摘掉了。
當(dāng)有人把賽場從 “Chrome + Office” 搬到 FreeCAD、QGIS、剪映、KiCad、Blender 這些真正干活的軟件里,結(jié)果一下子變得非常誠實:56 款專業(yè)軟件、338 個真實工作流、平均 100 步以上的操作鏈條,就連最強的 Gemini 3.1 Pro 和 Kimi K2.6,pass@3 成功率也只有 41% 左右,單次平均通過率只有 30% 出頭。
這場考試的名字叫Workflow Gym,來自字節(jié)Seed評測團(tuán)隊,于6月上旬公開。
![]()
- 論文標(biāo)題:Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields
- 論文主頁:https://huggingface.co/papers/2606.11042
- 項目鏈接:https://workflow-gym.github.io/
- ArXiv 論文:https://arxiv.org/abs/2606.11042
讀完論文我最大的感受是:這不是又一個 "數(shù)字更大" 的 benchmark ,這是把 GUI Agent 從熱身賽拉到了正賽。
之前的考場,太友好了
我先回顧下目前已有的 GUI Benchmark。
OSWorld 覆蓋 8 款軟件,以 Chrome、VS Code、LibreOffice 為主,任務(wù)平均幾分鐘就能完成;PC-Eval 也是 8 款,集中在 Word、Excel、郵件、計算器這類日常辦公場景;AmbiBench 雖然覆蓋 25 款應(yīng)用,但全部是移動端,更多停留在點外賣、發(fā)微信這類任務(wù)上;GUI-360 則直接鎖定在微軟三件套。
但問題在于,當(dāng)我看到 “成功率 75%” 這種數(shù)字時,很容易產(chǎn)生一種錯覺:好像 AI 已經(jīng)快能替人上班了,好像我們已經(jīng)無限逼近 AGI 時代了。
可真實情況并不是這樣。
真正產(chǎn)生經(jīng)濟(jì)價值的工作,不只是讓 AI 在 Chrome 里填表單,也不只是讓 AI 在 Excel 里做求和。真正的工作往往發(fā)生在復(fù)雜流程里,發(fā)生在工業(yè)級的專業(yè)軟件里。
比如,在 FreeCAD 里畫機械零件,在 QGIS 里疊圖層做地理分析,在 KiCad 里畫電路板,在剪映里剪一段 8 秒的視頻并精確到幀地加三個疊化轉(zhuǎn)場,在 GNU Radio 里搭信號流圖。
這些任務(wù)有一個共同特征:專業(yè)軟件、長鏈條、強約束、硬驗收。對就是對,錯就是錯,沒有 “差不多就行”。
而這些,恰恰是過去大多數(shù) GUI benchmark 沒有充分覆蓋到的地方。
Workflow Gym 到底考什么
Workflow Gym 的設(shè)計思路,用體育類比最容易講清楚。
如果說 OSWorld 更像是在測 100 米短跑,看你起跑反應(yīng)快不快、單個動作準(zhǔn)不準(zhǔn),那 Workflow Gym 更像是在測 110 米欄 + 400 米混合泳 + 10 公里自行車。
你不只是要跑,還要跨欄、換氣、掌握平衡,還要在不同技術(shù)動作之間切換。一次失誤不是只丟掉這一秒,而是會讓后面的整個流程都串掉。
它的任務(wù)設(shè)計有四個核心原則。
![]()
第一,真實。
這些任務(wù)不是出題人拍腦袋編出來的,而是從領(lǐng)域?qū)<业娜粘9ぷ骼?“挖” 出來的。1000 多個候選任務(wù),最后篩到 338 個,篩選標(biāo)準(zhǔn)是:網(wǎng)上搜不到現(xiàn)成解法,必須真的理解這個領(lǐng)域才能做。也就是說,模型不能靠訓(xùn)練數(shù)據(jù)里見過類似教程就蒙混過關(guān)。
第二,專業(yè)。
Workflow Gym 覆蓋 6 個頂級領(lǐng)域、23 個細(xì)分二級領(lǐng)域,包括工程設(shè)計、科學(xué)計算、多媒體創(chuàng)作、地理與環(huán)境、數(shù)據(jù)分析、財務(wù)與管理,甚至還有生物信息、化學(xué)建模、游戲引擎這些冷門但真實存在的工作場景。
里面的軟件包括 FreeCAD、KiCad、Qucs-S、OpenModelica、DWSIM、ParaView、GeoGebra、剪映、Blender、Kdenlive、OBS、Mixxx、QGIS、GRASS GIS、SAGA GIS、JASP、jamovi、Weka、KNIME、GnuCash、HomeBank、OpenLCA、ClustalW、VESTA、Godot 等。
每款軟件都被打包成獨立的虛擬機鏡像,預(yù)裝、預(yù)配置、去除登錄步驟,保證每個模型拿到的 “考場” 是一致的。Windows 和 Ubuntu 雙環(huán)境也都有覆蓋。
第三,長程。
官方按人類專家標(biāo)注的操作步數(shù)劃分難度: 30-44 步是 Easy , 129 題,占 38.2%; 45-60 步是 Medium , 159 題,占 47%; 61 步以上是 Hard , 50 題,占 14.8%,最長的題目達(dá)到 110 步。而模型實際跑起來因為探索、犯錯、重試,交互輪次經(jīng)常沖到 80-400 步。這是真正的馬拉松,不是沖刺。
第四,可驗證。
這是很多長程 benchmark 糊弄過去的地方 —— 任務(wù)太開放,最后靠人眼打分,復(fù)現(xiàn)性一塌糊涂。 Workflow Gym 給每道題都定義了確定性的判分標(biāo)準(zhǔn):要么比對輸出文件的二進(jìn)制內(nèi)容(比如導(dǎo)出的工程文件是否與標(biāo)答一致),要么把最終界面截圖喂給裁判 VLM 按關(guān)鍵點核對(比如剪映時間線上 "00:00:02:29 處是否無縫銜接""00:00:06:06 處是否添加了疊化轉(zhuǎn)場 "),判分邏輯與任務(wù)類型匹配。論文里抽樣 60 道題做人評對照,自動評測和人評一致的有 59 道,人評機評一致率達(dá):98.3%。
這四條放在一起,意思很簡單:分?jǐn)?shù)摻不了水。
更狠的是數(shù)據(jù)質(zhì)檢流程。一道題入庫要過四關(guān) —— 指令質(zhì)檢( PE 自動檢測模糊描述)、領(lǐng)域?qū)<胰斯徍恕?biāo)注員在環(huán)境鏡像里按操作規(guī)范完整復(fù)現(xiàn)、最后再拿 SOTA GUI Agent 跑一遍預(yù)實驗,確保不是任務(wù)本身有歧義。任何一關(guān)不過都要打回重修。
成績單:第一名也才及格線邊緣
然后是最刺激的部分 —— 把當(dāng)前最能打的幾個模型拉進(jìn)來裸考。
實驗設(shè)置很克制:每個任務(wù)一開始只給一段自然語言指令,沒有 step-by-step 提示,沒有中間糾錯,沒有人類兜底,最大 400 輪交互。每個任務(wù)跑 3 次獨立采樣,用 pass@3 和單次通過率兩個指標(biāo)衡量。
結(jié)果是這樣的:
![]()
我盯著這個表看了很久,有三個數(shù)字格外刺眼。
第一個, 30.67%。這是 Gemini 3.1 Pro 的單次平均通過率 —— 在專業(yè) GUI 任務(wù)里,三次里要失敗兩次。它在 OSWorld 上是 70%+ 的選手,到這兒直接腳踝斬。
第二個, 2.67%。 Gemini-3-Flash 在 Hard 題( 60 步以上)上的 pass@3 。這意味著 338 道題里最難的那 50 道,輕量模型基本是全送。 Hard 題不是 "難一點",是 "根本做不動"。
第三個,也是最反直覺的一個: Kimi-K2.6 在 Hard 題上拿了 25.33%,反而比 Gemini-3.1-Pro 的 21.33% 高一點點。長程魯棒性這件事,不一定和模型 "通用智商" 嚴(yán)格掛鉤。
分領(lǐng)域看更有意思。 Kimi 在數(shù)據(jù)分析、多媒體創(chuàng)作上表現(xiàn)最好,和它的 coding + 多模態(tài)能力強吻合; Gemini 在地理信息、工程設(shè)計、科學(xué)仿真上更強,顯示出對復(fù)雜空間界面的理解力優(yōu)勢。每個模型都有自己的 "舒適區(qū)軟件",也有自己的黑洞。
說白了,沒有誰是 "通吃" 的。
模型到底輸在哪里
論文沒有止步于僅曬分?jǐn)?shù),作者做了兩層失敗歸因 —— 結(jié)果層和過程層 —— 結(jié)論比分?jǐn)?shù)本身更值得看。
結(jié)果層把失敗分成兩類:沒跑完( workflow incompletion )和跑完但錯了( execution inaccuracy )。一個鮮明的規(guī)律是:模型越強,"沒跑完" 的比例越低 —— 強模型至少能硬撐著把流程走下來。"跑完但錯了" 的比例并沒有同步下降多少。
這就像一個馬拉松選手,以前是中途退賽,現(xiàn)在是咬著牙沖過終點但成績無效。
過程層歸因,作者歸納出四個模型出現(xiàn)比例都很高的死穴:
![]()
1.長程一致性斷裂。 這是最致命的一個。做到第 20 步時,已經(jīng)忘了第 5 步設(shè)的參數(shù)是什么;明明第 15 步剛點錯了一個按鈕,第 16 步還假裝一切正常繼續(xù)往下走。 Workflow 這種東西,沒有 save point ,錯一步后面全歪。人類專家干活時腦子里有個 "任務(wù)地圖",知道自己走到哪一步、距離目標(biāo)還有多遠(yuǎn),當(dāng)前模型這個 "地圖" 要么畫不全,要么走著走著就糊了。
2.錯誤擴散無法自我修復(fù)。 模型點錯一個按鈕、輸錯一個數(shù)值、拖拽偏了幾個像素,第一反應(yīng)不是 "我是不是錯了",而是在錯誤狀態(tài)下繼續(xù) "合理" 操作,越走越遠(yuǎn)。人類遇到這種情況會 undo 、會回退、會看看哪里不對,當(dāng)前 GUI Agent 的自我糾錯回路基本是殘疾的 —— 一旦偏航,就是 "頭也不回地駛向錯誤終點"。
3.目標(biāo)漂移。 做著做著,把用戶最初要什么忘了。比如任務(wù)是 "剪一段 8 秒的視頻并在三個時間點加疊化轉(zhuǎn)場",模型剪完視頻、加完特效,最后忘了導(dǎo)出;或者導(dǎo)出了,但沒檢查時長對不對。這種 "做了 80% 但漏掉最關(guān)鍵驗收點" 的失敗,在 Hard 題里尤其密集。
4.專業(yè)軟件理解不足。 這一條其實是把前三類問題的根往深挖了一層。 QGIS 的圖層堆棧、 KiCad 的網(wǎng)表層級、 Blender 的模式切換( Object/Edit/Sculpt )、 FreeCAD 的 sketcher 約束 —— 這些 UI 范式是各領(lǐng)域幾十年演化出來的,沒有 "通用常識" 可以覆蓋。模型看到一個陌生的面板和按鈕,既沒有領(lǐng)域知識做預(yù)判,也沒有系統(tǒng)化的探索策略,基本就是瞎點。
更底層的,論文點出了一個結(jié)構(gòu)性矛盾:人類使用 GUI 是連續(xù)的視覺 - 動作回路,而當(dāng)前 Agent 框架幾乎都是 "截圖→推理→輸出坐標(biāo)→點擊" 這種離散的觀察 - 動作循環(huán)。 這個 paradigm 在簡單場景夠用,在專業(yè)軟件的精細(xì)操作(精確拖拽、快捷鍵組合、右鍵菜單、模態(tài)對話框)面前,分辨率不夠。
這不是某家模型的問題,是整個范式的瓶頸。
這張榜為什么重要
每年都有新 benchmark ,為什么要單獨說這一個?
因為它把行業(yè)里一個心照不宣的窗戶紙捅破了:當(dāng)前 GUI Agent 的能力邊界,基本被 "通用軟件 × 短任務(wù)" 鎖死了。 你在演示視頻里看到的那些 "AI 幫你操作電腦",大部分是在舒適區(qū)里表演。只要你丟給它一個需要打開專業(yè)軟件、走完整工作流、產(chǎn)出有硬性驗收標(biāo)準(zhǔn)的任務(wù),神話立刻破功。
這件事對從業(yè)者的信號其實很清晰。
做模型的,長程一致性、錯誤恢復(fù)、專業(yè)領(lǐng)域知識注入,這三個是下一個階段必須正面啃的骨頭。單靠 scaling 看多模態(tài)基座模型能不能自然涌現(xiàn)?我個人持懷疑態(tài)度 —— 論文里 GPT-5.4 和 Gemini-3.1-Pro 的差距并沒有大到質(zhì)變,說明這是個架構(gòu) + 訓(xùn)練范式問題,不只是參數(shù)問題。
做產(chǎn)品的,別再拿 "AI 自動幫你完成一切工作" 當(dāng)宣傳口徑了。目前模型任務(wù)的完成度仍缺乏細(xì)節(jié)、深入性和穩(wěn)定執(zhí)行這三點重要因素,目前最靠譜的產(chǎn)品形態(tài)是人機協(xié)作:人盯框架和流程、 AI 做原子操作,或者 AI 跑一遍人來驗收。這不是單靠產(chǎn)品包裝能解決的問題,而是當(dāng)前模型在長程規(guī)劃、狀態(tài)保持、細(xì)節(jié)執(zhí)行和自我糾錯上的能力邊界。
做 benchmark 的同行, Workflow Gym 立了一個好參照 —— 真實任務(wù)、專業(yè)環(huán)境、確定性判分、 VM 鏡像可批量復(fù)現(xiàn)。這四條應(yīng)該是下一代 GUI benchmark 的入場券,而不是加分項。
比賽剛開始
Workflow Gym 只是一期, 338 題、 56 款軟件。項目 Roadmap 里寫著將會繼續(xù)擴充軟件范圍和指令覆蓋面,還要把評測環(huán)境和訓(xùn)練環(huán)境打通(評訓(xùn)一體,支持 RL 閉環(huán)),以及探索把 GUI 軌跡轉(zhuǎn)化為 MCP 工具接口的可能性。
最后說句私心的。
我讀完這篇論文反而挺興奮。不是因為分?jǐn)?shù)低看好戲,是因為終于有人不拿 "Chrome + Excel 操作成功率" 來定義 AI 的執(zhí)行能力了。專業(yè)軟件里的工作流,才是真正衡量 "AI 能不能替人干活" 的考場。 FreeCAD 、 QGIS 、 KiCad 這些名字,聽著冷門,但它們背后是工程師、地理分析師、硬件設(shè)計師、視頻剪輯師 —— 真正在產(chǎn)出經(jīng)濟(jì)價值的人。
30% 不是一個好看的數(shù)字,但它可能是一個更誠實的數(shù)字。相比那些接近 90% 的榜單成績,它更接近真實工作流里的能力邊界:專業(yè)軟件、長鏈路、硬驗收、不可糊弄。評測的意義不在于讓所有模型刷新紀(jì)錄,而在于把真實差距擺到桌面上。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.