![]()
如果任務(wù)本身不可行,或在當(dāng)前環(huán)境中無(wú)法完成時(shí),Agent 該在什么時(shí)候“停手”?
我們希望,Agent 能在多輪交互中及時(shí)調(diào)用搜索、網(wǎng)頁(yè)瀏覽和終端工具,從而完成復(fù)雜任務(wù)。但在現(xiàn)實(shí)情況下,用戶的請(qǐng)求不一定清晰,目標(biāo)也不一定能實(shí)現(xiàn)。很多 Agent 并不知道什么時(shí)候該停下來(lái),常常在任務(wù)已經(jīng)不可行時(shí)仍繼續(xù)搜索、點(diǎn)擊和調(diào)用工具。
針對(duì)這個(gè)問題,華盛頓大學(xué)團(tuán)隊(duì)提出了 Agentic Abstention 框架,專門研究 Agent 何時(shí)該停止行動(dòng),并設(shè)計(jì)了一種上下文工程方法 CONVOLVE(Context Evolution)來(lái)提升 Agent 的棄答能力。
![]()
論文鏈接:https://arxiv.org/abs/2606.28733
結(jié)果顯示,大多 Agent 很難做到及時(shí)棄答,也往往不能在證據(jù)已經(jīng)足夠時(shí)立即停止執(zhí)行。更大的模型、更強(qiáng)的推理雖然能在一定程度減少過度棄答,但未必能提升整體棄答表現(xiàn)。模型能力、推理方式和 Agent 框架都會(huì)影響棄答效果。
不過,CONVOLVE 可以顯著改進(jìn)棄答能力,且具有很強(qiáng)的遷移性:小模型總結(jié)的規(guī)則,同樣能幫助大模型提升表現(xiàn)。
這項(xiàng)研究提出了一種無(wú)需更新模型參數(shù)的 Agent 改進(jìn)方法:把交互軌跡提煉成可復(fù)用的停止規(guī)則,幫助 Agent 更早判斷何時(shí)該停下來(lái)。
讓Agent主動(dòng)放棄回答
Agentic Abstention 是一個(gè)研究 Agent 何時(shí)該停止行動(dòng)的框架。與傳統(tǒng)大語(yǔ)言模型(LLM)的單輪回答不同,它關(guān)注的是多輪交互中的棄答問題。
Agent 往往要和環(huán)境交互之后,才知道任務(wù)到底能不能進(jìn)行。圍繞這一框架,研究團(tuán)隊(duì)定義了棄答情形,再構(gòu)建評(píng)測(cè)任務(wù),并提出了改進(jìn)方法,在超過 2.8 萬(wàn)個(gè)任務(wù)上評(píng)估了 13 個(gè) LLM-as-Agent系統(tǒng)和 2 種 Agent 腳手架。
![]()
圖|所選 AbstentionBench 子集在各數(shù)據(jù)集和場(chǎng)景中的構(gòu)成。
具體流程如下:
1.棄答情形:在交互過程中,Agent 需要不斷判斷:是直接回答、停止棄答,還是繼續(xù)搜索、點(diǎn)擊或調(diào)用工具。研究團(tuán)隊(duì)進(jìn)一步將棄答分為兩類:一類是基于請(qǐng)求的棄答,即僅從指令本身就能判斷任務(wù)不可行;另一類是基于環(huán)境的棄答,即任務(wù)起初看似可行,但在交互之后才發(fā)現(xiàn)環(huán)境中缺少目標(biāo)或必要前提。
2.評(píng)測(cè)任務(wù):為了系統(tǒng)評(píng)估 Agent 的棄答能力,研究團(tuán)隊(duì)設(shè)計(jì)了三類任務(wù):網(wǎng)頁(yè)購(gòu)物、終端操作和交互式問答,總共覆蓋超過 2.8 萬(wàn)個(gè)任務(wù)。
網(wǎng)頁(yè)場(chǎng)景: 基 于模擬在線購(gòu)物環(huán)境 WebShop 構(gòu)建 ,用來(lái)測(cè)試 Agent 如何搜索、瀏覽和選擇商品。里既包含正常的購(gòu)物任務(wù),也包含應(yīng)當(dāng)棄答的任務(wù):有些從指令本身就能判斷不可行,有些則需要交互后才發(fā)現(xiàn)目標(biāo)商品并不存在。
終端場(chǎng)景: 基 于 Terminal-Bench 2.0 構(gòu)建, 該基準(zhǔn)用于測(cè)試 Agent 在 Docker 化終端環(huán)境中的長(zhǎng)程任務(wù)執(zhí)行能力。任務(wù)通常涉及系統(tǒng)配置、代碼修改和軟件工程問題求解。研究團(tuán)隊(duì)在原始可解任務(wù)的基礎(chǔ)上 , 同時(shí)加入了一批應(yīng)當(dāng)棄答的任務(wù)。
問答場(chǎng)景 :基于 AbstentionBench 構(gòu)建,該基準(zhǔn)用 于評(píng)估 LLM 在問答任務(wù)中是否應(yīng)該回答還是棄答。研究團(tuán)隊(duì)在此基礎(chǔ)上,將原本的單輪問答任務(wù)改造成了可搜索、可多輪決策的交互式問答任務(wù),覆蓋答案未知、虛假前提、主觀、上下文不明確和意圖不明確等多類應(yīng)當(dāng)棄答的情形。
3.改進(jìn)方法:研究團(tuán)隊(duì)提出了 CONVOLVE,這是一種用于提升 Agent 棄答能力的上下文工程方法。它不直接訓(xùn)練新參數(shù),而是把交互軌跡中的棄答經(jīng)驗(yàn)整理成經(jīng)驗(yàn)手冊(cè),作為后續(xù)任務(wù)的上下文提示,幫助模型更早作出棄答判斷。
實(shí)驗(yàn)結(jié)果如何?
研究團(tuán)隊(duì)發(fā)現(xiàn),大多數(shù) Agent 很難做到及時(shí)棄答,也往往不能在證據(jù)已經(jīng)足夠時(shí)立即棄答。模型能力、推理方式和 Agent 框架會(huì)影響棄答表現(xiàn),CONVOLVE 可以顯著改進(jìn)棄答能力。具體結(jié)果如下:
大多數(shù) Agent 很難做到及時(shí)棄答,及時(shí)棄答率僅為 0-30%,且很少能在第一時(shí)間意識(shí)到任務(wù)不可行,往往要經(jīng)過多輪嘗試后才會(huì)停下來(lái);不過,隨著交互輪次增加,越來(lái)越多的 Agent 還是能意識(shí)到任務(wù)有問題。例如,在問答場(chǎng)景中,搜索輪次變多,確實(shí)能讓更多模型最終棄答,但很難讓它們更早作出判斷;即使給到 10 輪機(jī)會(huì),多數(shù)模型的棄答召回率仍不到一半。
![]()
圖|棄答對(duì) Agent 來(lái)說(shuō)是困難的,尤其是及時(shí)棄答。
1.模型能力和 Agent 框架都會(huì)影響棄答表現(xiàn)
在網(wǎng)頁(yè)場(chǎng)景中,模型之間的差距最明顯,少數(shù)模型已能在交互中逐步發(fā)現(xiàn)任務(wù)不可行并完成棄答,多數(shù)模型的棄答能力仍然偏弱。表現(xiàn)最好的 Llama-3.3-70B 模型最終棄答率接近 85%,但多數(shù)模型即使交互 10 輪,棄答率仍低于 50%;在終端場(chǎng)景中,Agent 框架的影響也很明顯:即使用同一個(gè)模型,換一套框架,棄答效果也可能相差甚遠(yuǎn)。例如,同樣使用 GPT-5.4-mini 模型,Codex CLI 的棄答表現(xiàn)仍明顯優(yōu)于 Terminus2。
![]()
圖|Web 和 Terminal 場(chǎng)景中,可解實(shí)例上的累計(jì)過度棄答率隨回合數(shù)變化的情況。
2.不同類型的任務(wù),棄答難度也不一樣
如果問題出在指令本身,例如條件自相矛盾,Agent 通常更容易識(shí)別并及時(shí)棄答;如果任務(wù)看起來(lái)正常、只有交互后才發(fā)現(xiàn)目標(biāo)不存在,Agent 往往執(zhí)行好幾輪后才會(huì)停下來(lái);如果用戶沒把意圖說(shuō)清楚,幾乎所有模型和腳手架都表現(xiàn)不佳。在終端場(chǎng)景中,一旦用戶意圖不清,Codex CLI 和 Terminus 2 都很難判斷是否需要棄答。
![]()
圖|Web、Terminal 和 QA 場(chǎng)景中不同棄答類別下的 AbsRec@K。自上而下,各行分別展示W(wǎng)eb、Terminal 和 QA 的結(jié)果。
3.更強(qiáng)的推理能在一定程度上減少過度棄答
例如在網(wǎng)頁(yè)場(chǎng)景中,Qwen3-235B 的 Thinking 版本過度棄答率低于 Instruct 版本;在終端場(chǎng)景中,中等和高推理強(qiáng)度下的過度棄答率整體也處于較低水平。
不過,更強(qiáng)的推理能力并不意味著更好的棄答表現(xiàn)。網(wǎng)頁(yè)場(chǎng)景中,Qwen-3-235B 的 Thinking 版本雖然提升了及時(shí)棄答率,但總體棄答率反而下降。更強(qiáng)的推理有助于在 Agent 第一時(shí)間做出判斷,卻未必能提升整體表現(xiàn)。終端場(chǎng)景中,中等推理強(qiáng)度效果最好,繼續(xù)提升到高推理并沒有帶來(lái)額外收益。
![]()
圖|更多推理會(huì)在一定程度上提升 AbsRec@1,但與此同時(shí),在 Web 和 Terminal 兩種場(chǎng)景中,整體棄答召回率(AbsRec@10)反而會(huì)下降。
4.模型規(guī)模擴(kuò)大并不意味著效果更好
研究團(tuán)隊(duì)在 Qwen 系列上測(cè)試發(fā)現(xiàn),模型規(guī)模增大確實(shí)能提升最終棄答率,但對(duì)及時(shí)棄答幾乎沒有幫助。
![]()
圖|規(guī)模擴(kuò)展提升了整體召回率,但并未提升及時(shí)召回率。
那么,CONVOLVE 的效果怎么樣呢?研究團(tuán)隊(duì)給出了以下兩點(diǎn):
1.即使只用少量交互軌跡,CONVOLVE 也能顯著提升模型的棄答能力。
與單純依靠上下文學(xué)習(xí)相比,不同規(guī)模的模型都能從 CONVOLVE 中受益;即便是較小的 8B 模型,在使用 70B模型總結(jié)出的經(jīng)驗(yàn)手冊(cè)后,棄答表現(xiàn)也能穩(wěn)定提升。在網(wǎng)頁(yè)場(chǎng)景,CONVOLVE 只用 20 條交互軌跡,就把 Llama-3.3-70B 的及時(shí)棄答率從26.7 提升到 57.4,最終棄答率從 83.2 提升到 100.0。
2.小模型學(xué)到的經(jīng)驗(yàn)可以遷移到大模型。
8B 模型總結(jié)出的經(jīng)驗(yàn)手冊(cè),也能直接提升70B 模型的棄答表現(xiàn),而且效果接近大模型使用自身經(jīng)驗(yàn)時(shí)的水平。真正發(fā)揮作用的,是 CONVOLVE 從交互軌跡中提煉出的“停止規(guī)則”。
![]()
圖|CONVOLVE 在 WebShop 上提升了棄答表現(xiàn)。訓(xùn)練后的變體使用了 20 條軌跡。
![]()
圖|CONVOLVE 在 AbstentionBench 和 TerminalBench 上提升了棄答表現(xiàn)。
不足與未來(lái)方向
盡管研究團(tuán)隊(duì)圍繞 Agent 何時(shí)該停止行動(dòng)進(jìn)行了系統(tǒng)研究,并在網(wǎng)頁(yè)、終端和問答三類場(chǎng)景中進(jìn)行了較大規(guī)模評(píng)測(cè),研究團(tuán)隊(duì)也指出了目前工作的不足。具體如下:
目前,當(dāng)前評(píng)測(cè)場(chǎng)景仍然有限,尚未覆蓋真實(shí) Agent 可能面對(duì)的更復(fù)雜界面、私有工具、長(zhǎng)期用戶狀態(tài)和多步驟工作流。未來(lái),仍需將 Agentic Abstention 擴(kuò)展到更豐富的真實(shí)部署環(huán)境中。
其次,現(xiàn)有棄答任務(wù)主要覆蓋“目標(biāo)缺失”和“前置條件缺失”等情形,而權(quán)限邊界、外部源失效、工具輸出沖突等更隱蔽的不可行場(chǎng)景尚未充分覆蓋,未來(lái)仍需要更豐富的任務(wù)類型以全面評(píng)估棄答能力。
他們指出,棄答表現(xiàn)不僅取決于模型本身,也受 Agent 框架設(shè)計(jì)的顯著影響,因此本文結(jié)果更多反映的是當(dāng)前系統(tǒng)的階段性表現(xiàn),而非底層模型的固有能力。此外,部分模型仍可能在預(yù)訓(xùn)練或后訓(xùn)練階段接觸過類似樣本,這一風(fēng)險(xiǎn)仍需在更真實(shí)、持續(xù)更新的評(píng)測(cè)環(huán)境中進(jìn)一步檢驗(yàn)。
最后,他們寫道,棄答并非越多越好。過度棄答會(huì)削弱 Agent 的實(shí)用性,因此需要結(jié)合任務(wù)成功率一起評(píng)估;在實(shí)際部署中,棄答也還需要與澄清請(qǐng)求、人工介入等機(jī)制配合。未來(lái),如何把這些機(jī)制更好地整合進(jìn)真實(shí)系統(tǒng),仍是一個(gè)值得繼續(xù)研究的問題。
更多技術(shù)細(xì)節(jié),詳見原論文。
作者:夏千斯
如需轉(zhuǎn)載或投稿,請(qǐng)直接在本文章評(píng)論區(qū)內(nèi)留言
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.