![]()
在日常生活中,人類(lèi)解決寫(xiě)郵件、擬提綱、制定膳食計(jì)劃等開(kāi)放式任務(wù)時(shí),總會(huì)先在腦中梳理思路,再著手完成任務(wù)。這種“深度推理”能力,被諾貝爾經(jīng)濟(jì)學(xué)獎(jiǎng)得主、心理學(xué)家 Daniel Kahneman 稱(chēng)為“系統(tǒng) 2 思維”(system 2 thinking),是人類(lèi)智能的核心特征。
通過(guò)在數(shù)學(xué)、代碼等可驗(yàn)證領(lǐng)域使用基于規(guī)則的獎(jiǎng)勵(lì),盡管可驗(yàn)證獎(jiǎng)勵(lì)強(qiáng)化學(xué)習(xí)(RLVR)提高了大語(yǔ)言模型(LLM)的推理能力,但在開(kāi)放式任務(wù)上的泛化能力依然有限。
在一項(xiàng)最新研究中,普林斯頓大學(xué)陳丹琦副教授團(tuán)隊(duì)實(shí)現(xiàn)突破,將可驗(yàn)證領(lǐng)域的推理能力遷移到了通用聊天場(chǎng)景中。
在方法實(shí)現(xiàn)上,他們提出了“基于模型獎(jiǎng)勵(lì)思維的強(qiáng)化學(xué)習(xí)”(RLMT)框架,這讓 LLM 在回復(fù)之前先生成一段長(zhǎng)思維鏈(CoT),并通過(guò)基于偏好的獎(jiǎng)勵(lì)模型進(jìn)行在線(xiàn) RL 優(yōu)化。
據(jù)論文描述,經(jīng) RLMT 訓(xùn)練的 8B 模型在聊天和創(chuàng)意寫(xiě)作方面超越了 GPT-4o,并與 Claude-3.7-Sonnet (Thinking) 相當(dāng)。同時(shí),僅使用 7K 個(gè)提示,基于 RLMT 訓(xùn)練的 Llama-3.1-8B 基礎(chǔ)模型就超過(guò)了經(jīng)過(guò)復(fù)雜多階段流程、使用 25M+ 示例后訓(xùn)練的 Llama-3.1-8B-Instruct。
![]()
論文鏈接:https://arxiv.org/abs/2509.20357
研究團(tuán)隊(duì)表示,研究結(jié)果將促使人們重新審視后訓(xùn)練流水線(xiàn),并呼吁未來(lái)的研究應(yīng)更全面地理解并應(yīng)用思考能力。
RLMT:融合兩種范式的訓(xùn)練框架
要理解 RLMT 框架的創(chuàng)新,需先看清現(xiàn)有語(yǔ)言模型訓(xùn)練的兩大痛點(diǎn):
一方面,基于人類(lèi)反饋的強(qiáng)化學(xué)習(xí)(RLHF)雖能對(duì)齊人類(lèi)偏好,但將模型輸出視為單一實(shí)體,缺乏顯式推理引導(dǎo);
另一方面,可驗(yàn)證獎(jiǎng)勵(lì)強(qiáng)化學(xué)習(xí)(RLVR)雖能通過(guò)數(shù)學(xué)、代碼等領(lǐng)域的規(guī)則化獎(jiǎng)勵(lì),讓模型生成長(zhǎng) CoT,但它們?cè)诟鼜V泛的推理問(wèn)題和聊天基準(zhǔn)測(cè)試中表現(xiàn)出的泛化能力仍顯不足,難以泛化到無(wú)明確“標(biāo)準(zhǔn)答案”的通用聊天場(chǎng)景。
RLMT 框架既保留了 RLVR 先生成推理軌跡,再輸出結(jié)果的模式,又沿用了 RLHF 基于人類(lèi)偏好的獎(jiǎng)勵(lì)模型,讓模型在開(kāi)放式任務(wù)中也能學(xué)會(huì)“思考”。
具體來(lái)說(shuō),RLMT 框架要求語(yǔ)言模型在生成最終響應(yīng)前,必須先產(chǎn)出一段詳細(xì)的推理軌跡,再通過(guò)在線(xiàn)強(qiáng)化學(xué)習(xí)如 GRPO 算法,用偏好獎(jiǎng)勵(lì)模型對(duì)整個(gè)“推理 + 響應(yīng)”過(guò)程評(píng)分優(yōu)化。
![]()
圖|通過(guò)強(qiáng)化學(xué)習(xí)與獎(jiǎng)勵(lì)模型,訓(xùn)練基于長(zhǎng)思維鏈的語(yǔ)言模型,能夠處理多樣化的通用用戶(hù)提示。相較于 RLHF,RLMT 允許模型進(jìn)行思考,并將 RLVR 擴(kuò)展到更廣泛、開(kāi)放性的任務(wù)中。
![]()
圖|通過(guò) RLMT 訓(xùn)練的 LM 為開(kāi)放式查詢(xún)生成的示例推理軌跡。
為實(shí)現(xiàn)這一目標(biāo),團(tuán)隊(duì)對(duì)三個(gè)關(guān)鍵環(huán)節(jié)做了精心設(shè)計(jì):
在訓(xùn)練算法選擇環(huán)節(jié),團(tuán)隊(duì)分別測(cè)試了同策略深度強(qiáng)化學(xué)習(xí) DPO、PPO、GRPO 三種主流算法,發(fā)現(xiàn)雖然最佳模型是通過(guò) GRPO 算法訓(xùn)練的,但即便用 DPO 或 PPO 等算法,RLMT 仍能超越傳統(tǒng) RLHF,所有設(shè)置下的模型表現(xiàn)都優(yōu)于基準(zhǔn)模型;
在獎(jiǎng)勵(lì)模型環(huán)節(jié),團(tuán)隊(duì)選用在獎(jiǎng)勵(lì)基準(zhǔn)測(cè)試和下游應(yīng)用中均展現(xiàn)出優(yōu)異性能的 Skywork-v1-Llama-3.1-8B-v0.2,后續(xù)實(shí)驗(yàn)證明,強(qiáng)大的獎(jiǎng)勵(lì)模型對(duì) RLMT 至關(guān)重要。獎(jiǎng)勵(lì)模型的強(qiáng)度會(huì)影響性能上限,但 RLMT 在不同強(qiáng)度獎(jiǎng)勵(lì)模型下均優(yōu)于 RLHF;
在提示庫(kù)構(gòu)建環(huán)節(jié),團(tuán)隊(duì)摒棄了含大量數(shù)學(xué)題和越獄 prompt 的數(shù)據(jù)集,選擇 Tülu 3 的 WildChat-IF 子集,這是從 WildChat 平臺(tái)篩選的 7.5k 真實(shí)用戶(hù)對(duì)話(huà)提示,覆蓋日常聊天、創(chuàng)意寫(xiě)作等通用場(chǎng)景,更貼合實(shí)際使用需求。
同時(shí),RLMT 還支持兩種靈活的訓(xùn)練模式。既可以先通過(guò)監(jiān)督微調(diào)(SFT)熱啟動(dòng)訓(xùn)練,用 Gemini 2.5 Flash 或 GPT-4.1-mini 生成帶推理軌跡的提示-響應(yīng)對(duì)“熱啟動(dòng)”;也能直接應(yīng)用于未經(jīng)過(guò)任何后訓(xùn)練的基礎(chǔ)模型,即零訓(xùn)練模式,僅通過(guò)固定指令前綴引導(dǎo)推理行為。
實(shí)驗(yàn)驗(yàn)證:以小勝大,零訓(xùn)練也能行
為驗(yàn)證 RLMT 的有效性,團(tuán)隊(duì)分別在 Llama-3.1-8B 和 Qwen-2.5-7B 兩個(gè)模型家族的基礎(chǔ)版與指令版上進(jìn)行了 40 次訓(xùn)練,覆蓋聊天、創(chuàng)意寫(xiě)作、知識(shí)問(wèn)答等 7 類(lèi)基準(zhǔn)測(cè)試,并用相同設(shè)置下“無(wú)推理過(guò)程”的 RLHF 模型作為對(duì)照。
結(jié)果令研究人員震驚,RLMT 模型在所有任務(wù)中均大幅領(lǐng)先。通過(guò) RLMT 訓(xùn)練的思維型模型在所有基準(zhǔn)測(cè)試中平均表現(xiàn)始終領(lǐng)先非思維型模型 1.5-4 分。在核心的聊天基準(zhǔn)測(cè)試中,優(yōu)勢(shì)最為顯著,模型與基線(xiàn)模型的平均分差達(dá) 3-8 分,并且這些模型通常在創(chuàng)意寫(xiě)作和事實(shí)問(wèn)答任務(wù)上表現(xiàn)更優(yōu)。
![]()
表|基于 Llama-3.1-8B 和 Qwen2.5-7B 訓(xùn)練的 GRPO 模型在熱啟動(dòng)和零訓(xùn)練設(shè)置下的測(cè)試結(jié)果。
更值得關(guān)注的是,小模型展現(xiàn)出了比大模型更為強(qiáng)大的實(shí)力。Llama-3.1-8B-Instruct-RLMT 在 WildBench 上得 50.4 分,不僅超越了近 10 倍參數(shù)的模型 Llama-3.1-70B-Instruct、Qwen2.5-72B-Instruct,甚至超過(guò)了 GPT-4o。
![]()
表|Llama-3.1-8B-Instruct RLMT 與強(qiáng)開(kāi)源和封閉模型的比較,包括 GPT-4o 和Claude -3。
即便跳過(guò)復(fù)雜的 SFT 階段,RLMT 對(duì)基礎(chǔ)模型的提升依然顯著。以 Llama-3.1-8B 為例,零訓(xùn)練的 RLMT 模型 Llama-3.1-8B-RLMT-Zero 聊天平均分達(dá) 15.6,比經(jīng)過(guò)多階段微調(diào)、用 2500 萬(wàn) + 樣本訓(xùn)練的 Llama-3.1-8B-Instruct 高 5.5 分;Qwen2.5-7B-RLMT-Zero 更是直接超越了 Qwen2.5-7B-Instruct。
![]()
表|熱啟動(dòng)和零訓(xùn)練的 DPO/PPO 結(jié)果
消融實(shí)驗(yàn)進(jìn)一步揭示了RLMT 的關(guān)鍵成功因素:提示質(zhì)量、獎(jiǎng)勵(lì)模型強(qiáng)度、推理過(guò)程三者缺一不可。用真實(shí)對(duì)話(huà)提示訓(xùn)練的模型,比用簡(jiǎn)單提示或含大量數(shù)學(xué)題的提示高 5-7 分;強(qiáng)獎(jiǎng)勵(lì)模型能讓模型在保持非聊天任務(wù)性能的同時(shí)提升聊天能力,而弱獎(jiǎng)勵(lì)模型雖會(huì)導(dǎo)致整體下降,但 RLMT 仍能在該設(shè)置下優(yōu)于 RLHF,這證明了“讓模型思考”的價(jià)值不依賴(lài)于特定的獎(jiǎng)勵(lì)模型。
![]()
表|GRPO 即時(shí)混合模型、SFT 數(shù)據(jù)源及獎(jiǎng)勵(lì)模型的消融實(shí)驗(yàn)
讓模型學(xué)會(huì)更聰明地思考
通過(guò)定性與定量分析,團(tuán)隊(duì)發(fā)現(xiàn) RLMT 不僅提升了模型性能,更從根本上改變了其“思考”的方式。
![]()
圖|左:SFT 和 GRPO 模型的特征層面直接對(duì)戰(zhàn)勝率對(duì)比;右:示例推理行為
從推理風(fēng)格來(lái)看,SFT 模型的規(guī)劃更像“線(xiàn)性清單”。拿到任務(wù)后先劃分章節(jié)、子章節(jié),按部就班推進(jìn);而 RLMT 模型則展現(xiàn)出更接近人類(lèi)的復(fù)雜推理模式:先仔細(xì)枚舉任務(wù)約束與核心子主題,再將零散想法按主題分組,最后迭代優(yōu)化細(xì)節(jié)。更特別的是,RLMT 模型還會(huì)“回頭反思”。在規(guī)劃后期回溯調(diào)整早期內(nèi)容,比如交叉引用之前提到的要點(diǎn),讓整體邏輯更連貫。
![]()
圖|隨著訓(xùn)練的進(jìn)行,Llama-3.1-8B-RLMT-Zero 思考和回答的時(shí)間更長(zhǎng)。
這種思維模式的轉(zhuǎn)變,也體現(xiàn)在推理長(zhǎng)度上。訓(xùn)練過(guò)程中,RLMT 模型生成的推理軌跡和最終響應(yīng)長(zhǎng)度均持續(xù)增加。以 Llama-3.1-8B-RLMT-Zero 為例,隨著訓(xùn)練步驟推進(jìn),其推理部分的 token 從初始階段的不足 200,逐步增長(zhǎng)到 600 以上,響應(yīng)長(zhǎng)度也同步提升,這意味著模型學(xué)會(huì)了用更長(zhǎng)時(shí)間梳理思路,而非倉(cāng)促輸出。
為更精準(zhǔn)地捕捉差異,團(tuán)隊(duì)還通過(guò) GPT-4.1-mini 對(duì) 1024 個(gè) WildBench 示例的推理特征進(jìn)行提取。結(jié)果顯示,RLMT 模型在“權(quán)衡不同觀(guān)點(diǎn)”“將想法歸類(lèi)為主題”“整合約束到計(jì)劃中”等特征上的勝率遠(yuǎn)超 SFT 模型,而“嚴(yán)格的分步結(jié)構(gòu)”特征則明顯減弱。這表明模型的推理從“機(jī)械分步”轉(zhuǎn)向了“靈活優(yōu)化”,更貼近人類(lèi)解決復(fù)雜任務(wù)的思路。
過(guò)去,語(yǔ)言模型的后訓(xùn)練往往依賴(lài)“海量數(shù)據(jù) + 多階段微調(diào)”的訓(xùn)練方式。例如,Llama-3.1-8B-Instruct 需經(jīng)過(guò)監(jiān)督微調(diào)、拒絕采樣、迭代偏好優(yōu)化等復(fù)雜流程,用到 2500 萬(wàn) + 樣本。但 RLMT 的出現(xiàn)打破了這一范式,僅用 7K 個(gè)真實(shí)對(duì)話(huà) prompt,就能讓 Llama-3.1-8B 基礎(chǔ)模型超越上述復(fù)雜優(yōu)化的指令模型。
這一成果的意義遠(yuǎn)超技術(shù)突破本身。它證明,語(yǔ)言模型的通用能力提升,未必需要大量數(shù)據(jù)的堆積,而是可以通過(guò)激發(fā)模型的“思考能力”來(lái)實(shí)現(xiàn)。RLMT 框架不僅為通用聊天任務(wù)提供了新方案,更重新定義了語(yǔ)言模型的后訓(xùn)練流程。未來(lái),讓模型學(xué)會(huì)“思考”或許會(huì)成為與“預(yù)訓(xùn)練”“監(jiān)督微調(diào)”等同等重要的核心環(huán)節(jié)。
當(dāng)然,研究也存在局限性。團(tuán)隊(duì)坦言,目前尚未明確性能提升究竟源于模型原有特征的強(qiáng)化,還是對(duì)于新特征的學(xué)習(xí),且未對(duì)推理軌跡格式、訓(xùn)練超參數(shù)等進(jìn)行深度優(yōu)化。但這也為后續(xù)研究留下了廣闊空間,比如探索更優(yōu)的 CoT 格式、將 RLMT 擴(kuò)展到邏輯推理、長(zhǎng)文本生成等領(lǐng)域,甚至將“思考能力”融入多模態(tài)模型。
從讓模型“能說(shuō)話(huà)”到讓模型“會(huì)思考”,RLMT 邁出了關(guān)鍵一步。當(dāng)語(yǔ)言模型不僅能生成流暢文本,還能像人類(lèi)一樣梳理思路、權(quán)衡利弊,或許我們距離真正理解人類(lèi)需求的通用人工智能(AGI),又近了一步。
整理:小瑜
如需轉(zhuǎn)載或投稿,請(qǐng)直接在公眾號(hào)內(nèi)留言
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶(hù)上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.