Self-Harness團(tuán)隊(duì) 投稿
量子位 | 公眾號(hào) QbitAI
讓AI自己改自己的Agent Harness,這事已經(jīng)被頂級(jí)Agent社區(qū)注意到了。
上海人工智能實(shí)驗(yàn)室團(tuán)隊(duì)提出的Self-Harness,近期被LangChain CEO、聯(lián)合創(chuàng)始人Harrison Chase轉(zhuǎn)發(fā),也被前OpenAI副總裁Lilian Weng收進(jìn)自進(jìn)化Agent相關(guān)博客。
它盯上的不是換模型,而是Agent外層那套Harness。
做法很直接。模型先檢查自己的運(yùn)行軌跡,從失敗里挖出模式,再提出有邊界的Harness修改,最后交給回歸測(cè)試決定要不要采納。
實(shí)驗(yàn)結(jié)果顯示,在Terminal-Bench-2.0上,底層模型、工具環(huán)境和評(píng)測(cè)協(xié)議都保持不變,只改Harness,三個(gè)模型后端都拿到了held-out提升。
其中Qwen3.5-35B-A3B總提升達(dá)到104%,MiniMax M2.5和GLM-5分別提升28%和24%。
論文和項(xiàng)目已經(jīng)公開(kāi),文末附鏈接。
![]()
△LangChain CEO/co-founder Harrison Chase轉(zhuǎn)發(fā)Self-Harness
讓Harness自己進(jìn)化
Agent Harness可以理解為包在模型外層的一套運(yùn)行裝置,覆蓋系統(tǒng)提示詞、工具使用規(guī)則、驗(yàn)證器、運(yùn)行時(shí)控制策略和輕量middleware。
在多輪工具任務(wù)里,它決定Agent怎么調(diào)用工具,什么時(shí)候停,失敗后怎么恢復(fù),產(chǎn)物又該如何驗(yàn)證。
過(guò)去,這套東西主要靠工程師手調(diào)。要讀大量執(zhí)行軌跡,找失敗原因,改提示詞或工具規(guī)則,再反復(fù)跑benchmark。
模型越多、任務(wù)越雜,Harness就越難繼續(xù)按“一模型一套人工調(diào)參”的方式擴(kuò)展。
![]()
△三種Harness改進(jìn)范式:人工改、強(qiáng)模型外援改,以及Self-Harness讓模型基于自身軌跡改
Self-Harness怎么工作
換到Self-Harness,流程被壓成三步。先挖弱點(diǎn),再提改法,最后跑回歸。
Weakness Mining:從失敗軌跡挖弱點(diǎn)
系統(tǒng)先讓當(dāng)前Harness驅(qū)動(dòng)固定模型完成一批任務(wù),記錄完整執(zhí)行軌跡、工具調(diào)用和評(píng)測(cè)結(jié)果。
失敗樣本不會(huì)被當(dāng)成孤例處理。Self-Harness會(huì)結(jié)合驗(yàn)證器反饋、Agent行為和失敗之間的因果關(guān)系,把可復(fù)用的失敗機(jī)制聚起來(lái)。
這樣,“某個(gè)任務(wù)沒(méi)過(guò)”會(huì)變成“這一類失敗可能來(lái)自同一種Harness缺陷”。比如缺少最終產(chǎn)物、重復(fù)執(zhí)行無(wú)效命令、工具報(bào)錯(cuò)后不恢復(fù),或者探索太久卻遲遲不進(jìn)入實(shí)現(xiàn)。
Harness Proposal:提有邊界的改法
拿到結(jié)構(gòu)化失敗證據(jù)后,同一個(gè)模型會(huì)切換成proposer,針對(duì)已挖出的失敗機(jī)制提出候選Harness edit。
這些edit只能落在預(yù)先聲明的可編輯表面上,不能把整個(gè)Agent控制架構(gòu)推倒重來(lái)。
每個(gè)提案都要說(shuō)明想改變哪種行為,可能帶來(lái)什么回歸風(fēng)險(xiǎn),以及為什么可能修好當(dāng)前失敗模式。
Proposal Validation:用回歸測(cè)試拍板
候選Harness會(huì)在同一評(píng)測(cè)協(xié)議下重跑,并和當(dāng)前Harness對(duì)比。
接受規(guī)則很保守。held-in或held-out至少一個(gè)split要提升,另一個(gè)split不能退化,才會(huì)進(jìn)入下一代Harness。
這也是它和普通“自動(dòng)改prompt”的差別。Self-Harness不讓模型憑感覺(jué)拍板,而是把每一次改動(dòng)都放進(jìn)可記錄、可復(fù)現(xiàn)、可回退的評(píng)測(cè)閉環(huán)里。
![]()
△Self-Harness自改進(jìn)閉環(huán),包括弱點(diǎn)挖掘、修改提案和回歸驗(yàn)證
不換模型,只改外層也能漲
論文在Terminal-Bench-2.0上做了系統(tǒng)評(píng)測(cè)。
Terminal-Bench-2.0是一個(gè)多輪智能體benchmark,任務(wù)運(yùn)行在容器化終端環(huán)境中,覆蓋文件管理、命令執(zhí)行、錯(cuò)誤恢復(fù)、產(chǎn)物驗(yàn)證等真實(shí)工具使用能力。
在固定模型、工具集、任務(wù)環(huán)境和評(píng)測(cè)配置的前提下,Self-Harness只改Harness。結(jié)果三個(gè)模型都出現(xiàn)提升。
MiniMax M2.5總提升28%,Qwen3.5-35B-A3B總提升104%,GLM-5總提升24%。
這組結(jié)果的重點(diǎn)不是又換了一個(gè)更強(qiáng)模型,而是在同一個(gè)模型外面,Harness本身也可以被搜索、驗(yàn)證和迭代。
![]()
△Terminal-Bench-2.0結(jié)果,三個(gè)模型后端在Self-Harness后均獲得held-out提升
更重要的是,每個(gè)候選修改都經(jīng)過(guò)held-in和held-out回歸測(cè)試。
換句話說(shuō),Self-Harness不是堆更長(zhǎng)的提示詞,而是在一次次驗(yàn)證門控后,只留下真的帶來(lái)收益、又沒(méi)有明顯回退的Harness edits。
![]()
△Qwen3.5 Self-Harness進(jìn)化路線,通過(guò)多輪驗(yàn)證門控保留有效edits
不同模型暴露出不同弱點(diǎn)
Self-Harness的另一個(gè)觀察更像工程現(xiàn)場(chǎng)。不同模型不是同一種失敗。
MiniMax M2.5:找到線索后遲遲不交付
在初始Harness下,MiniMax M2.5有時(shí)會(huì)持續(xù)探索數(shù)據(jù)集。即使已經(jīng)找到關(guān)鍵元信息,也遲遲不創(chuàng)建評(píng)測(cè)所需的答案文件,最后因?yàn)槿鄙佼a(chǎn)物或超時(shí)失敗。
Self-Harness保留的修改會(huì)鼓勵(lì)A(yù)gent更早識(shí)別必需輸出,先創(chuàng)建初始產(chǎn)物,并在工具調(diào)用過(guò)長(zhǎng)時(shí)轉(zhuǎn)向具體實(shí)現(xiàn)和驗(yàn)證。
Qwen3.5-35B-A3B:工具失敗后容易陷入循環(huán)
Qwen3.5-35B-A3B的常見(jiàn)問(wèn)題,是工具失敗后進(jìn)入重復(fù)編輯、重復(fù)覆蓋或重復(fù)命令循環(huán),甚至在停止前刪除評(píng)測(cè)必需文件。
Self-Harness為它引入依賴預(yù)檢查、失敗后產(chǎn)物恢復(fù)、避免完全相同命令重試,以及由工具錯(cuò)誤觸發(fā)的artifact-focused提醒。
![]()
△Qwen3.5保留下來(lái)的code-level Harness edits,集中在依賴預(yù)檢查、產(chǎn)物恢復(fù)和重試約束。
GLM-5:更需要管住shell狀態(tài)和節(jié)奏
GLM-5暴露出的弱點(diǎn)更集中在shell會(huì)話狀態(tài),以及從探索切到實(shí)現(xiàn)的時(shí)機(jī)。
改進(jìn)后的Harness會(huì)提醒Agent在修改環(huán)境變量、安裝工具或調(diào)整路徑后,確認(rèn)這些變化能跨命令持續(xù)可用。當(dāng)長(zhǎng)時(shí)間探索還沒(méi)有形成產(chǎn)物時(shí),系統(tǒng)也會(huì)推動(dòng)它轉(zhuǎn)向?qū)崿F(xiàn)與測(cè)試。
這說(shuō)明Self-Harness不只是給所有模型加一段通用提示。它會(huì)根據(jù)每個(gè)模型在真實(shí)軌跡中暴露出的弱點(diǎn),生成并篩選適合它的Harness改動(dòng)。
為什么會(huì)引起關(guān)注
Agent越來(lái)越像跑在工具環(huán)境里的系統(tǒng),而不是只回答單輪問(wèn)題的模型。
在這種設(shè)定里,模型能力只是一部分。外層Harness決定它是否知道何時(shí)調(diào)用工具,如何從錯(cuò)誤中恢復(fù),是否保留正確產(chǎn)物,退出前有沒(méi)有做驗(yàn)證。
過(guò)去,Harness工程更像經(jīng)驗(yàn)活。Self-Harness給出的方向是,讓模型自己參與這套經(jīng)驗(yàn)的挖掘和改寫,但最終仍由評(píng)測(cè)而不是自評(píng)來(lái)拍板。
它沒(méi)有證明“Agent可以完全自己進(jìn)化”,也沒(méi)有繞過(guò)benchmark范圍。論文里的結(jié)果主要來(lái)自Terminal-Bench-2.0和固定模型后端。
但作為一個(gè)自進(jìn)化Agent的組件,它給出了比較清楚的邊界:改什么,怎么改,怎么驗(yàn),什么時(shí)候拒絕。
研究團(tuán)隊(duì)
該工作來(lái)自上海人工智能實(shí)驗(yàn)室團(tuán)隊(duì),論文題為Self-Harness: Harnesses That Improve Themselves。
從現(xiàn)有文檔看,團(tuán)隊(duì)公開(kāi)了論文和項(xiàng)目地址,讀者可以查看具體實(shí)驗(yàn)設(shè)置、Harness edits和代碼。
論文:https://arxiv.org/abs/2606.09498
項(xiàng)目地址:https://github.com/qzzqzzb/Self-Harness
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.