讓AI代理多思考、多嘗試、多驗(yàn)證,答案就會(huì)更準(zhǔn),但賬單也會(huì)更貴——大多數(shù)人以為這是顛撲不破的真理。Databricks用一次400多項(xiàng)真實(shí)任務(wù)的內(nèi)部評(píng)測(cè),把這條“常識(shí)”翻了個(gè)面。他們專門面向數(shù)據(jù)工作打造的前沿代理,不僅在準(zhǔn)確率上壓過三款主流通用編碼代理,成本還不到后者的二分之一。準(zhǔn)和便宜,這次站到了同一邊。
該代理是Databricks為數(shù)據(jù)領(lǐng)域開發(fā)的前沿方案,覆蓋從基礎(chǔ)數(shù)據(jù)分析、全工作空間數(shù)據(jù)探索,到數(shù)據(jù)工程中搭建流水線、調(diào)試故障、交付儀表盤等完整鏈路。在這次評(píng)估里,團(tuán)隊(duì)從內(nèi)部實(shí)際使用場(chǎng)景中抽取出401個(gè)自包含任務(wù),讓它和三款頂尖的通用編碼代理同場(chǎng)較量。任務(wù)不只限于簡(jiǎn)單問答,也包含高級(jí)用戶才會(huì)碰到的硬骨頭:在動(dòng)態(tài)變化的工作空間中定位正確的數(shù)據(jù)資產(chǎn),修改代碼,或者構(gòu)建查詢。400多個(gè)任務(wù)就是400多份真實(shí)的日常工作切片。
![]()
結(jié)果很直接。它在準(zhǔn)確交出正確答案這一項(xiàng)上拿了最高分,同時(shí)還是所有參測(cè)代理里最省錢的。它在給出一個(gè)正確結(jié)果時(shí)所消耗的代幣成本,不到其他代理的一半。換句話說,那些通用代理仍在靠反復(fù)探索、反復(fù)驗(yàn)證來逼近正確答案的時(shí)候,這個(gè)專為數(shù)據(jù)場(chǎng)景優(yōu)化的系統(tǒng)用更少的工具調(diào)用就把答案錨定了。
這種“又快又準(zhǔn)又便宜”的現(xiàn)象,背后是數(shù)據(jù)代理所面對(duì)的獨(dú)特范式和它為此專門構(gòu)建的能力集。數(shù)據(jù)代理的工作環(huán)境不像通用編碼代理那樣,可以依賴可驗(yàn)證的測(cè)試來收斂。它所在的是一片動(dòng)態(tài)的、持續(xù)演化的企業(yè)工作空間:數(shù)十萬張表、無數(shù)筆記本、儀表盤和文檔并存,元數(shù)據(jù)和文檔可能過時(shí)甚至矛盾,而所有數(shù)據(jù)分析的起點(diǎn)都必須先找到當(dāng)前狀態(tài)下真正可信的資產(chǎn)。
通用編碼代理習(xí)慣的“隨機(jī)游走式探索”——遍歷元數(shù)據(jù)、試探性地查詢、遇到錯(cuò)誤再回滾——在這個(gè)環(huán)境里會(huì)大量消耗代幣,也容易陷入錯(cuò)誤路徑出不來。評(píng)估中抓取到的實(shí)際會(huì)話證實(shí)了這個(gè)差異:這個(gè)數(shù)據(jù)代理依靠語義搜索和元數(shù)據(jù)快速鎖定正確的表,用一條SQL查詢、五次工具調(diào)用就拿到正確答案;參與評(píng)測(cè)的三款通用代理,沒有一個(gè)能從探索迷宮里成功脫身。
它之所以能跳過低效的暴力探索,是因?yàn)楸恢踩肓巳M緊扣企業(yè)數(shù)據(jù)語境的能力:第一,對(duì)數(shù)據(jù)目錄和工作空間資產(chǎn)的語義搜索,允許按業(yè)務(wù)含義而非僅按名稱查找表;第二,對(duì)用戶經(jīng)常依賴的表和業(yè)務(wù)邏輯的持久記憶,避免每次新任務(wù)都從零開始重新認(rèn)識(shí)環(huán)境;第三,對(duì)企業(yè)上下文的深層語義理解,讓它在面對(duì)一大堆名字相近、口徑略異的資產(chǎn)時(shí),能判斷哪個(gè)才是當(dāng)前業(yè)務(wù)的真實(shí)源頭。這些能力組合起來,相當(dāng)于給數(shù)據(jù)代理配了一幅企業(yè)數(shù)據(jù)世界的“熱力地圖”,它不需要把每條路都走一遍才知道哪里可能藏著答案。
這種差異不是微小的百分比拉鋸,而是代際路徑的不同。在評(píng)估的一個(gè)典型場(chǎng)景里,用戶的任務(wù)需要從龐大的數(shù)據(jù)目錄中找到正確的表并產(chǎn)出分析。它的語義搜索從元數(shù)據(jù)開始篩選,結(jié)合記憶中的高頻業(yè)務(wù)邏輯,直接定位到最可能的候選表,接著用一次精準(zhǔn)的SQL查詢驗(yàn)證,整個(gè)過程干凈利落。通用代理沒有語義理解能力,只能按照字符串匹配去翻找,或者全量掃描表名再做初步查詢。每次誤中都會(huì)增加一步不需要的工具調(diào)用,而這些無效調(diào)用在成本上完全不打折。積少成多,準(zhǔn)確率和代幣消耗的差距就被拉得越來越大。
持久記憶模塊也構(gòu)成了一層競(jìng)爭(zhēng)對(duì)手難以復(fù)制的護(hù)城河。通用編碼代理處理數(shù)據(jù)任務(wù)時(shí),通常被當(dāng)作“一次性的陌生人”,每次對(duì)話啟動(dòng)都不記得前一次在同一個(gè)工作空間里學(xué)到的表結(jié)構(gòu)、字段含義和常見數(shù)據(jù)質(zhì)量問題。而這個(gè)數(shù)據(jù)代理則會(huì)把用戶頻繁使用的表、業(yè)務(wù)口徑甚至字段級(jí)別的細(xì)節(jié)記錄下來,并在新任務(wù)觸發(fā)時(shí)主動(dòng)檢索。一個(gè)簡(jiǎn)單的例子:如果銷售周報(bào)已經(jīng)沉淀過“有效訂單”的過濾邏輯,下一次需要同類指標(biāo)時(shí)能直接復(fù)用它,而不是重新去文檔和管道里翻定義,最終再憑運(yùn)氣猜。
更深一層的語義理解還解決了一個(gè)數(shù)據(jù)團(tuán)隊(duì)長(zhǎng)期頭痛的問題:當(dāng)數(shù)據(jù)資產(chǎn)膨脹到數(shù)十萬級(jí)別,元數(shù)據(jù)必然出現(xiàn)滯后或彼此矛盾。一份營(yíng)銷儀表盤引用的“客戶表”可能指向三個(gè)月前的快照,而同一命名空間下的查詢腳本已經(jīng)把口徑改成了實(shí)時(shí)更新的視圖。沒有語義能力的代理會(huì)被這兩個(gè)“同名不同質(zhì)”的資產(chǎn)困住,要么返回過時(shí)數(shù)據(jù),要么在矛盾面前反復(fù)報(bào)錯(cuò)。它因?yàn)槟軌蚪Y(jié)合資產(chǎn)用途、近期使用頻率、上下游依賴等信息做出語義級(jí)判斷,選出那個(gè)真正貼合當(dāng)前任務(wù)語境的選擇,顯著減少了錯(cuò)誤決策和追加調(diào)用。
成本側(cè)的收益同樣來自于無效探索的減少。大型語言模型的API調(diào)用普遍按代幣計(jì)費(fèi),通用代理在數(shù)據(jù)工作里習(xí)慣的“遍歷—試探—糾錯(cuò)”循環(huán),本質(zhì)上是在用付費(fèi)代幣換來本來不必要的中間結(jié)果。單次多出的數(shù)據(jù)掃描看起來不起眼,但翻看401個(gè)任務(wù)的剖面時(shí),累計(jì)浪費(fèi)的代幣規(guī)模就相當(dāng)可觀。當(dāng)準(zhǔn)確性提升不再依賴代幣堆砌,省下的成本便直接體現(xiàn)在總賬單上。評(píng)測(cè)團(tuán)隊(duì)最終測(cè)得的結(jié)論干凈利落:一個(gè)正確結(jié)果的成本,不到通用代理平均水平的一半。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.