![]()
投稿作者:黎羿江(UC San Diego 二年級(jí)博士生)
過(guò)去兩年,生成式人工智能(AI)的浪潮席卷全球。從 ChatGPT 到 Claude,再到國(guó)內(nèi)的 GLM、通義千問(wèn)、文心等,大語(yǔ)言模型(LLM)已成為推動(dòng) AI 發(fā)展的核心引擎。
它們能寫(xiě)論文、寫(xiě)代碼、生成故事,甚至參與科研。但與此同時(shí),研究者逐漸發(fā)現(xiàn)了一個(gè)根本性問(wèn)題:
這些模型雖然能生成高質(zhì)量語(yǔ)言,卻并不具備真實(shí)的行動(dòng)能力。當(dāng)模型面對(duì)需要計(jì)劃、工具使用或環(huán)境交互的任務(wù)時(shí),它們往往顯得無(wú)能為力。
如何讓語(yǔ)言模型不只是“回答問(wèn)題”,而是能夠“自主執(zhí)行任務(wù)”?這是當(dāng)前人工智能研究中最具挑戰(zhàn)性的問(wèn)題之一。
近期,由來(lái)自 Oxford、UCSD、NUS、ICL、UIUC、UCL、上海人工智能實(shí)驗(yàn)室等十六家頂尖機(jī)構(gòu)的學(xué)者聯(lián)合完成的一篇綜述論文給出了系統(tǒng)性的答案。
![]()
論文鏈接:https://arxiv.org/abs/2509.02547
開(kāi)源項(xiàng)目:https://github.com/xhyumiracle/Awesome-AgenticLLM-RL-Papers
這篇長(zhǎng)達(dá)百頁(yè)的綜述整合了超過(guò) 500 篇相關(guān)研究,首次對(duì) Agentic Reinforcement Learning(具身智能體強(qiáng)化學(xué)習(xí))的概念、框架和應(yīng)用進(jìn)行了系統(tǒng)梳理。
從被動(dòng)響應(yīng)到主動(dòng)決策:Agentic RL 的核心思想
在傳統(tǒng)的強(qiáng)化學(xué)習(xí)(RLHF、DPO 等)中,語(yǔ)言模型被設(shè)計(jì)為“單步響應(yīng)系統(tǒng)”。它接收輸入,生成輸出,并根據(jù)人類反饋或偏好調(diào)整參數(shù)。這種范式的代表就是 ChatGPT 的訓(xùn)練方式。
然而,這一機(jī)制只適用于單輪優(yōu)化,無(wú)法處理需要長(zhǎng)期規(guī)劃和環(huán)境交互的任務(wù)。
Agentic RL 則提供了一種全新的視角。該框架將大語(yǔ)言模型視為嵌入在動(dòng)態(tài)環(huán)境中的智能體(Agent),通過(guò)強(qiáng)化學(xué)習(xí)機(jī)制,讓模型具備持續(xù)感知、連續(xù)決策、工具使用與自我優(yōu)化的能力。
研究者將這一過(guò)程形式化為部分可觀測(cè)馬爾可夫決策過(guò)程(POMDP):模型可以在不完全了解環(huán)境的情況下,基于當(dāng)前信息進(jìn)行決策、執(zhí)行行動(dòng),并通過(guò)反饋信號(hào)持續(xù)更新策略。
換言之,Agentic RL 的目標(biāo)不是讓模型“生成更好的答案”,而是讓它“學(xué)習(xí)如何行動(dòng)以實(shí)現(xiàn)目標(biāo)”。
![]()
六大關(guān)鍵能力:從語(yǔ)言到智能的躍遷
論文中提出,真正的智能體必須具備六項(xiàng)核心能力,這也是 Agentic RL 的構(gòu)成基礎(chǔ)。
![]()
規(guī)劃(Planning)
模型能夠拆解復(fù)雜任務(wù),制定多步行動(dòng)計(jì)劃,并根據(jù)反饋動(dòng)態(tài)調(diào)整路徑。 例如,科研助理可以自動(dòng)規(guī)劃文獻(xiàn)檢索、數(shù)據(jù)分析和論文撰寫(xiě)步驟。
工具使用(Tool Use)
傳統(tǒng)方法依賴人工提示調(diào)用外部工具,而通過(guò) RL,模型可以自主判斷何時(shí)調(diào)用搜索引擎、代碼執(zhí)行器或數(shù)據(jù)庫(kù)查詢接口。
記憶(Memory)
Agentic RL 讓模型在長(zhǎng)期交互中保留關(guān)鍵信息,并學(xué)會(huì)“什么值得記住”。 這類記憶機(jī)制不僅包括顯式文本記憶,還包括隱式向量表征與語(yǔ)義檢索。
推理(Reasoning)
模型可以根據(jù)任務(wù)需求在“快速直覺(jué)推理”與“深度鏈?zhǔn)酵评怼敝g切換。 強(qiáng)化學(xué)習(xí)通過(guò)獎(jiǎng)勵(lì)信號(hào)引導(dǎo)模型生成更穩(wěn)定、更具邏輯一致性的推理路徑。
自我改進(jìn)(Self-Improvement)
智能體能夠通過(guò)經(jīng)驗(yàn)積累進(jìn)行反思、自我修正,形成閉環(huán)學(xué)習(xí)機(jī)制。 例如,通過(guò)對(duì)錯(cuò)誤輸出的反思訓(xùn)練(Reflexion),模型的長(zhǎng)期性能顯著提升。
感知(Perception)
語(yǔ)言模型不再局限于文本輸入,而是能夠理解圖像、音頻、視頻等多模態(tài)信息,并與外部世界建立聯(lián)系。
這六個(gè)能力的結(jié)合,使得 LLM 從“被動(dòng)語(yǔ)言生成器”邁向“主動(dòng)學(xué)習(xí)與行動(dòng)的認(rèn)知系統(tǒng)”。
七類核心任務(wù):Agentic RL 的應(yīng)用版圖
除了理論框架,論文還總結(jié)了 Agentic RL 在實(shí)踐中的七大主要任務(wù)場(chǎng)景。
![]()
信息檢索與研究智能體:自動(dòng)檢索、閱讀和整合信息,用于學(xué)術(shù)或新聞研究。
代碼智能體:實(shí)現(xiàn)自動(dòng)代碼生成、調(diào)試與測(cè)試(如 SWE-Bench、AgentCoder)。
數(shù)學(xué)與邏輯推理:解決復(fù)雜的計(jì)算、證明和公式生成問(wèn)題。
GUI 操作智能體:在圖形界面中執(zhí)行操作,實(shí)現(xiàn)人機(jī)交互任務(wù)。
視覺(jué)與多模態(tài)智能體:將圖像感知與語(yǔ)言推理結(jié)合,支持跨模態(tài)任務(wù)。
具身智能體(Embodied Agents):在虛擬或物理環(huán)境中完成多步任務(wù)。
多智能體系統(tǒng)(Multi-Agent Systems):多個(gè)模型協(xié)同完成復(fù)雜目標(biāo),如自動(dòng)科研或群體協(xié)作任務(wù)。
這些任務(wù)展示了一個(gè)清晰的趨勢(shì): Agentic RL 正在推動(dòng)語(yǔ)言模型從“文字世界”走向“行動(dòng)世界”, 讓 AI 真正具備與現(xiàn)實(shí)環(huán)境交互的能力。
生態(tài)構(gòu)建:開(kāi)放環(huán)境與基礎(chǔ)框架
論文還系統(tǒng)地整理了 Agentic RL 研究所依賴的開(kāi)放環(huán)境、評(píng)測(cè)基準(zhǔn)和訓(xùn)練框架。
環(huán)境(Environments):如 AlfWorld、GAIA、BrowseComp、SWE-Bench 等,支持多模態(tài)和多任務(wù)訓(xùn)練。
評(píng)測(cè)基準(zhǔn)(Benchmarks):覆蓋搜索、推理、工具使用、交互操作等任務(wù)維度。
訓(xùn)練框架(RL Frameworks):包括 PPO、DPO、GRPO 等多種強(qiáng)化學(xué)習(xí)算法及其改進(jìn)版本。
作者團(tuán)隊(duì)還開(kāi)源了一個(gè)綜合資源清單:Awesome-AgenticLLM-RL-Papers,其中匯總了論文、環(huán)境、基準(zhǔn)測(cè)試與開(kāi)源實(shí)現(xiàn), 為研究人員提供了從理論到實(shí)驗(yàn)的系統(tǒng)參考。
未來(lái)挑戰(zhàn)與研究方向
盡管 Agentic RL 展現(xiàn)出巨大潛力,但仍面臨若干挑戰(zhàn)。
可信性(Trustworthiness):如何保證智能體在復(fù)雜環(huán)境下的行為安全、可解釋、可控?
訓(xùn)練擴(kuò)展性(Training Scalability):長(zhǎng)期交互任務(wù)往往需要大量計(jì)算資源,如何在效率與性能間取得平衡?
環(huán)境擴(kuò)展性(Environment Scalability):當(dāng)前的仿真環(huán)境仍然有限,如何構(gòu)建更貼近真實(shí)世界的交互空間?
此外,智能體的倫理、安全與社會(huì)影響也成為研究的重要議題。Agentic RL 的發(fā)展不僅是算法創(chuàng)新,更是人類如何與智能系統(tǒng)共生的探索過(guò)程。
邁向智能體時(shí)代
Agentic RL 標(biāo)志著語(yǔ)言模型研究從“生成”邁向“行動(dòng)”的重大轉(zhuǎn)折。它讓模型不再依賴預(yù)設(shè)腳本,而是在環(huán)境中自主探索、持續(xù)學(xué)習(xí),并根據(jù)反饋不斷優(yōu)化。
對(duì)于研究者,這一框架提供了新的理論基礎(chǔ)與系統(tǒng)視角;對(duì)于開(kāi)發(fā)者,它是構(gòu)建具備決策與操作能力的 AI 系統(tǒng)的關(guān)鍵路徑;對(duì)于整個(gè) AI 生態(tài)而言,它意味著從“語(yǔ)言智能”走向“通用智能”的新階段。
未來(lái)的 AI,不僅能對(duì)話、寫(xiě)作,更能觀察、思考、執(zhí)行與反思。Agentic RL 為這種真正意義上的“具身智能”打開(kāi)了大門。
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.