文 | 劃重點KeyPoints,作者|心怡,編輯|重點君
互聯網大廠間的AI入口大戰打到了桌面端。
先說一條剛出爐的消息。據《財經》7月21日報道,阿里即將推出千問辦公,把QoderWork、悟空、MuleRun三款Agent產品合并成,交給釘釘新任CEO陳宇森負責。
不止阿里,騰訊也正把資源集中到WorkBuddy上,字節內部討論把飛書和豆包辦公深度整合。
信號很明確,持續半年的大廠Agent“賽馬”結束,C端的入口大戰剛歇,各家開始把資源集中到新戰場:桌面Agent的入口大戰升級了。
目前戰況如何?數據顯示,WorkBuddy今年7月DAU已突破1300萬,是國內用戶活躍度最高的Agent辦公產品。再看一組訪問量數據,從六月桌面AI原生辦公智能體的訪問量看,騰訊WorkBuddy、阿里QoderWork排在第一梯隊。
![]()
四位選手各有來頭。
WorkBuddy產品底座沿用打磨兩年多的CodeBuddy內核,馬化騰在財報會上直接稱它是“中國使用最廣的效率智能體服務”。
豆包專業版背靠字節自家的Seedream、Seedance,是四家里多模態彈藥比較足的一個,但只跑自家模型、生態也有些封閉。
百度搭子入局較晚但動作密集、持續升級,7月剛甩出個人版升級、企業版和“搭子聯盟”三個更新。
QoderWork是阿里把Agent能力從代碼搬到辦公的產物,招牌是帶下載量排行的技能市場和15套專家套件,即將要升格為“千問辦公”的底座。
一線城市機場和地鐵的廣告位上,大家都說自己是六邊形戰士。但用戶更多只關心一件事:今天要選一款Agent,到底誰能真正干活?
這次,我們挑兩個高頻的真實工作場景,同一臺Mac、同樣的提示詞、注冊即得的免費檔,把四家放在到一起對比。
兩個真實工作場景,看誰最能干活
兩個場景各代表一類辦公剛需,一個是重復操作型,考的是手勤不勤;一個是內容生產型,考的是腦子和手藝。
事情不難,但是人工做起來真的很費事,能偷的懶還是偷一偷。
因此,我們需要檢查桌面Agent能不能自己“坐到電腦前”,把鼠標鍵盤用起來,從頭跑完流程,最后交給我們一份能直接用的本地文件,而不是像問答AI只給到一個“你可以這樣做”的方法。
這樣一來,權限申請順不順、過程看不看得見、耗時穩不穩,也都在觀察范圍內。
場景一
我們給四位選手同一條提示詞:
![]()
不得不說,用工具和測工具難的不是任務本身,整個過程很像做實驗,環境沒理順,出bug總讓人心里堵、想放棄。
WorkBuddy我們前幾次就沒測成功,細看發現它硬啃反爬、卡在無頭瀏覽器安裝上,Agent直接放棄,任務黃了。
下面的成績,都是環境理順之后的正式記錄。
![]()
WorkBuddy老老實實地打開了openai.com/news,最終頁面只渲染出9條,命令行curl又被反爬擋下(403)。但這次它沒一條道走到黑,轉頭找到官方RSS訂閱源作為“最新更新”的權威口徑,按時間倒序取滿10條,在桌面生成了兩張表:最近10條明細+Agent中文速覽獨立頁,還自檢了一遍鏈接可用。
全程花了約4分鐘,但我好像被騙了。任務是33分啟動、37分才真正跑完,但界面上的“完成時間”始終停在33分,有一點掩耳盜鈴的意味。
測下來,騰訊WorkBuddy任務執行先受阻,然后靠RSS兜底把活干完。
![]()
百度搭子在任務開始前一次性申請權限、顯示開始時間,執行時直接跳到默認瀏覽器,你能親眼看著它滾動翻頁取數,全程約4分鐘。產出10條,但摘要整列是英文、沒做中文化,鏈接也被塞進摘要單元格,沒獨立成列。
測下來,百度搭子過程相對透明,速度也較快。
![]()
豆包的過程就比較偏黑箱,任務開始時不提示開始時間、網頁滾動也不顯示。最終產出10條,中文摘要的信息密度在四家里數一數二(帶具體數字),也是唯一把“Agent中文速覽”做進Excel獨立頁的一家。對照官方RSS時間序,它抓的這10條恰恰貼近字面的“最近”。
測下來,豆包摘要比較扎實,抓得也算準。
![]()
QoderWork選擇走軟件內置瀏覽器檢索,約12分鐘,四家里墊底。前期沒有人工驗證會一直空等;后期「真人驗證」反復5次以上才過,交互比較磨人。產出結構還算規范,一共有7列、中英雙標題、帶分類與可點鏈接。比較糟糕的是把一條內容的日期認錯成7-15,連帶漏掉了真正7-15的新聞。
測下來,QoderWork結構規范,但慢、手動卡人機驗證。
![]()
同一句提示,四家抓出的“最近10條”并不重合(?=命中)
有意思的是,這四家抓出的最近10條,只有四條對上了。
我們將四份產出并排一放,只有4條是四家共有的,其余各不相同。
分析原因發現不是誰抓錯了,而在openai.com/news本身有兩套順序:默認卡片視圖是編輯精選序,RSS是純時間倒序。豆包和WorkBuddy落在時間序陣營,貼近字面的“最近”;百度搭子和QoderWork跟著頁面卡片,貼近“人打開頁面第一眼看到的”。兩邊都不算錯,但好的Agent應該主動告訴你,它用的是哪種口徑。
Agent能力測評,真正拉開差距的,不是誰點得漂亮,而是最后到底有沒有把東西交出來。
百度搭子、豆包和QoderWork全程真機點擊,自己一步步跑完;WorkBuddy一條路走不通然后就退回RSS抄道。
但說到底,桌面Agent能不能甩給我們一份打開就能用的文件,比它中間走哪條路重要得多。卡住的時候,肯繞路的往往比硬頂的更管用。
場景二
換個身份代入一下。假設你是個做AI的自媒體博主,或者給博主打工的運營。7月模型圈炸了鍋,這波熱度必須蹭。Agent要先摸清楚這個月發生的時間,挑一個有爆款相的選題,一口氣把公眾號文章、小紅書圖文、數字人口播視頻(還是很有難度的)這三件套全出齊。
這題評的是干活和交付的水準,模型新聞本身真假不核實。四家檢索出來的核心事實高度一致,個別對不上的地方在點評里標出來了。
四款提示詞一樣:
![]()
四位選手,一個個上。
![]()
WorkBuddy一上來先建了個任務追蹤,把活拆成盤點「選題→三件套→配圖」,全程3分16秒,四家里最快。選題定的是《全球最大開源模型誕生——中國開源聯軍改寫AI游戲規則?》鉤子還不錯,自帶開源vs閉源的沖突感。
最亮眼的是公眾號直接給了能渲染的HTML成品,頭圖壓著標題,還甩出金句"美國賣鏟子,中國發鏟子還包郵",全文約900字,符合字數要求;小紅書、口播稿、分鏡表一樣不落,4張配圖風格還挺統一。唯一沒跑完的是數字人成片(本機沒渲染引擎),但它老實交代了,還主動給了個替補方案。
測下來,騰訊WorkBuddy,快,省心,東西拿到手就能用。
![]()
百度搭子動手前先正經做了需求分析,交付前還查了字數、精簡了兩回。它檢索的數據在四家里算細的,跑分、定價、股價波動,全都有出處。選題《七月AI大亂斗》,沖突和情緒拉滿。公眾號走的是深度分析路子,還多合成了一段TTS口播音頻,下載途中代理掛了,它自己用curl繞了過去。
不過也做的差的地方,正文1510字,比1500的硬線多了10個字;成品是.md,不是能直接渲染的HTML。
測下來,流程一板一眼,檢索真的有點實力。
![]()
比賽的四家里就豆包一個命中了專門的自媒體寫作技能,下筆前先把公眾號、小紅書、短視頻分鏡這些平臺規范挨個讀了一遍,干活的路數也像個老練的新媒體編輯。
細看發現檢索面也廣,光國產陣營就盤進來6家以上。
真正拉開差距的是專業度,公眾號約1400字,附4個備選標題,還逐條核對了來源做內容驗真;小紅書連置頂評論怎么寫、怎么連發矩陣、怎么回評都給了。配圖里那張標著真實模型名的陣營對比圖,是四家里最貼題的,另外還有數字人形象圖和TTS語音。交付方式也獨一份:所有成品寫進一份飛書在線文檔,復制就能發。毛病是頭圖有點文字錯亂,思考獨白啰嗦了些。
測下來,豆包算是一個學好規矩再動筆的學生。
![]()
QoderWork本次耗時約10分鐘,屬于比較慢的選手。選題“輪到閉源巨頭睡不著了”,鉤子合格,公眾號約1480字結構挺整,小紅書和口播稿也都有。真正栽跟頭在多媒體:配圖服務出故障,重試6次全敗,圖片生成失敗,音頻視頻也沒影。結尾反問了一句“需要我現在重試出圖嗎”,已經忘記我們“一遍跑通”的要求。
測下來,這位選手屬于是文字過關,配圖有點糟糕。
![]()
圖為:Agent耗時相對速度
配圖和多媒體,這才是這道題真正拉開距離的地方。
三家成功出圖、風格統一、拿來就能用:WorkBuddy出了4張,百度搭子3張配圖外加一段TTS音頻,豆包的圖相對最對題、數字人形象也做得突出;QoderWork呢,顆粒無收。
![]()
圖為:各家生成配圖與多媒體成果對比截圖
文字這關,四家都不錯。真正把高下分出來的,是誰能帶著編輯規范和運營策略,把成品直接交到你手上,能做到這步,Agent才算得上一個靠譜同事。
跑下來最深的一點感受是:東西能不能直接用,遠比文字漂不漂亮值錢。飛書文檔、能渲染的HTML,拿到手就能發;換成只丟給你一堆文字加提示詞的,乍看挺齊全,真要落地,剩下的活還得你自己干。
多媒體是道硬門檻,出了岔子能兜住才算有實力。任務遇阻卡住了但肯繞條路把活交付,比悶頭硬扛強得多,畢竟誰喜歡不能干活給公司憋大雷的同事呢。
價格:這筆賬得單獨算
實測下來,好消息是大家都給了免費額度,多數情況下跑個一兩個任務是夠用的。
我原本也是這么打算的,不充值,就當個普通用戶,拿免費額度老老實實跑一跑,這樣也更貼合大家平時的真實用法。結果誰知道,跑到豆包這兒就提示余額不足了,我只能咬牙充了68塊把第二個任務跑完……
所以話說回來,真打算重度用之前,還是建議先拿免費檔把你天天要干的活跑一遍,看看積分燒得快不快,再決定這錢怎么掏。
誰會終結這場比賽?
兩個場景跑完,沒有全能冠軍,但我們摸清了各位當下擅長什么。
四家廣告打得正兇,真正的勝負手根本還沒露面。
這場比賽的玩法,也正在悄悄改變。
上半年整個行業燒錢燒出一條教訓,Agent能生成,不等于活能交付。生成一快,復核、判斷、擔責這些得人來干的環節反倒成了堵點。
有研究說,自主編程Agent能把代碼提交量拉高120%,可真正上線的只剩三成。就好比后廚切菜快了三倍,餐廳一天還是賣那么多桌。
所以誰贏,現在下結論太早。對用戶來說,想清楚最常干的那件事,拿免費額度把它跑通,再決定掏不掏錢。
我們測的時候,這幾款產品幾乎是一天一個樣,功能天天在變,所以這回只挑了兩個場景跑,不敢說測全了。
而且現在有個大趨勢,各家Agent都在搶入口,Agent正從電腦桌面往手機上挪。一個方向是手機端和桌面的聯動,你人在外面,用手機就能給電腦上的Agent派活,回頭它在電腦那頭默默把事辦了。另一個方向更有意思,是往微信這種IM里鉆,你在微信或者飛書里隨手一句話,活就交出去了,連App都不用專門打開。
這倆場景眼下都挺熱,可惜這次沒趕上測,我們留到下一輪再看。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.