![]()
基于可驗證獎勵的強化學(xué)習(xí)(Reinforcement Learning with Verifiable Rewards,RLVR)正在成為大模型后訓(xùn)練的關(guān)鍵技術(shù)。數(shù)學(xué)題能判對錯,代碼能跑測試,可驗證獎勵讓大模型可以通過強化學(xué)習(xí)持續(xù)提升推理能力。
不過,在 RLVR 訓(xùn)練過程中,一個值得關(guān)注的問題是:模型并不總是越訓(xùn)練越會探索。隨著策略熵(policy entropy)快速下降,模型輸出可能逐漸同質(zhì)化,采樣路徑變窄,訓(xùn)練也可能提前停滯。
近日,浙江大學(xué)、騰訊等機構(gòu)的論文《Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective》在剛剛結(jié)束的ACL 2026會議中獲評Outstanding Paper Award。這項工作從 token-level 熵變出發(fā),重新解釋 RLVR 中的熵坍縮(entropy collapse),通過理論和實驗分析對于熵動態(tài)的干預(yù)機制,并提出熵穩(wěn)定方法 STEER,在數(shù)學(xué)推理和代碼任務(wù)上都取得了穩(wěn)定提升。
![]()
- 論文標題:Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective
- 論文地址:https://arxiv.org/abs/2510.10150
- 代碼地址:https://github.com/zz-haooo/STEER
RLVR 訓(xùn)練中的熵坍縮:探索空間為何過早收縮?
RLVR 的訓(xùn)練過程看起來很直接:模型生成答案,環(huán)境給出可驗證獎勵,算法再根據(jù)獎勵更新策略。對于數(shù)學(xué)和代碼任務(wù)來說,這個范式尤其自然,因為答案是否正確、代碼是否通過測試,都可以作為明確的反饋信號。
然而,在實際訓(xùn)練中,一個常見的訓(xùn)練現(xiàn)象是策略熵會快速下降,這就是熵坍縮。
熵坍縮會讓模型輸出逐漸同質(zhì)化,采樣路徑變窄。對于 GRPO 這類 group-based 算法,問題會更嚴重:當(dāng)同一個問題采樣出的回答越來越相似,組內(nèi) advantage 信號會變得不再有區(qū)分度,訓(xùn)練也可能隨之停滯。
下圖展示了不同模型和不同訓(xùn)練數(shù)據(jù)下的策略熵變化。雖然下降速度不同,但共同趨勢很明顯:隨著訓(xùn)練推進,模型的探索空間持續(xù)收縮。
![]()
要理解策略熵的下降過程,可以把 RLVR 訓(xùn)練看成對一棵推理樹的動態(tài)調(diào)整。
具體來說,大模型的一段推理不是一次性生成出來的,而是由許多步 token 選擇串起來的。站在某一步,模型會對所有可能的下一個 token 給出一個概率分布;把這些可能性繼續(xù)展開,就像一棵不斷分叉的推理樹。
這里的 “分叉” 并不是簡單數(shù)有多少個候選 token,而是看模型真正給多少條路徑分配了足夠的概率。因此,token 熵反映的是某個節(jié)點處的 “有效分叉數(shù)”:有效分叉越多,模型保留的可能推理方向越多;有效分叉越少,推理樹就越容易收縮到少數(shù)路徑上。
從這個角度看,RLVR 本質(zhì)上是在已有推理分支上做動態(tài)調(diào)整:有價值的分支被繼續(xù)延展,錯誤或低價值的分支被壓制、剪掉。
下面這組示意圖中,前兩張分別說明低熵和高熵的直觀含義;第三張則把訓(xùn)練過程模擬成了一棵不斷被擴展和修剪的推理樹。岔路口對應(yīng)模型在某一步推理中面對的多個可能方向。左側(cè)工人繼續(xù)開路,代表訓(xùn)練在獎勵信號支持的軌跡上鼓勵新的推理分支生長;右側(cè)的禁止標志,則代表低獎勵或錯誤軌跡中的推理分支被壓制和剪枝。
![]()
在這個視角下,RLVR 訓(xùn)練同時包含兩種力量:增枝和剪枝。增枝會讓模型保留更多可能性,推動熵上升;剪枝會讓概率質(zhì)量集中到少數(shù)路徑上,推動熵下降。健康的訓(xùn)練需要二者保持動態(tài)平衡;當(dāng)剪枝長期壓過增枝,探索空間就會被過早收縮,形成熵坍縮。
進一步看,整棵推理樹的形態(tài)變化是由每個 token 訓(xùn)練對局部分支的調(diào)整累積而來。也正因為如此,理解熵坍縮,需要回到 token-level 熵變:通過分析每個 token 在每一次參數(shù)更新中會讓熵如何變化,來理解整體策略熵的變化。
定量分析:看清每個 token 的訓(xùn)練如何改變策略熵
作者首先推導(dǎo)了 token-level 熵變的近似表達式,用來刻畫一次更新如何改變當(dāng)前狀態(tài)下的策略熵:
![]()
拋開學(xué)習(xí)率、長度歸一化這些主要影響整體尺度與平均方式的項后,決定不同 token 熵變方向和幅度的,可以拆解為下面四個因素:
- 裁剪機制(clipping strategy):這個 token 的更新是否被重要性采樣比率的 clipping 截斷;
- 優(yōu)勢信號(advantage):它來自正樣本還是負樣本,當(dāng)前更新是在獎勵它還是懲罰它;
- token 生成概率(token probability):它原本是模型很容易生成的高概率 token,還是較少生成的低概率 token;
- 條件熵(conditional entropy):在當(dāng)前上下文下,模型整體上還有多不確定。
在明確這些影響因素之后,文章進一步發(fā)現(xiàn),token-level 熵變的方向主要由優(yōu)勢信號和token 生成概率共同決定。沿著這兩個維度,token 更新可以分成四類。
![]()
左圖給出了 token 更新的四種基本情形:優(yōu)勢信號決定當(dāng)前 token 是被獎勵還是被懲罰;而它原本被模型生成的概率,則決定這次更新是在打開新的分支,還是進一步強化已有分支。
右圖則把這四種情形放回推理樹中:一次 RL 更新會提高或降低某條分支的概率,但局部熵是升還是降,取決于這條分支原本的概率高低。高概率正確分支被繼續(xù)推高,會讓分布更集中、局部熵下降;低概率正確分支被推高,則是在保留罕見但有效的路徑、局部熵上升。對負樣本也是類似:壓低高概率錯誤分支會釋放概率空間、局部熵上升;壓低低概率錯誤分支則是在剪枝、局部熵下降。這幾種情形共同決定了更新更傾向于熵增還是熵減。
重新理解現(xiàn)有熵干預(yù)方法的機制:為何有效,又為何受限?
從上面的 token-level 熵變視角,很多已有熵干預(yù)方法就能被重新理解:它們并不是偶然有效,而是在不同程度上改變了某些 token 的熵變貢獻。
- DAPO / Clip-Higher:放開 “稀有但正確” 的分支。DAPO 提高了 clip-high,讓更多低概率但正確的 token 參與更新。這類 token 往往對應(yīng) “稀有但正確” 的推理路徑,因此能幫助模型保留探索,緩解熵坍縮。
- 然而,它的調(diào)節(jié)仍然是粗粒度的:它改變的是 clipping 閾值,而不是直接判斷每個 token 在當(dāng)前更新中會帶來多大的熵變化。
- Positive-Reweighting:削弱對已有路徑的過度強化。這類方法降低高概率正樣本 token 的權(quán)重,減少模型對熟悉正確路徑的繼續(xù)加碼;同時強化低概率正樣本,讓稀有但正確的路徑有機會被保留下來。
- 這解釋了為什么 positive reweighting 常常有效。但問題在于,這類方法主要圍繞正樣本設(shè)計,而負樣本里同樣存在升熵和降熵的力量,條件熵也會影響更新幅度。只盯住一部分 token,很難完整控制訓(xùn)練中的熵動態(tài)。
- Entropy-Aware Advantage:一個自然直覺是:高熵 token 代表模型還不確定,因此應(yīng)該給它更大的 advantage,讓模型多探索。
- 然而本文指出,更新高熵 token 只意味著它可能帶來更大的熵變化,并不保證變化方向。如果這些 token 正處在降熵方向,放大它們反而可能加速熵坍縮。
這些機制分析也均得到了實驗證據(jù)的支持。整體來看,現(xiàn)有熵干預(yù)方法并非無效;它們確實觸及了熵動態(tài)中的某些局部機制,因此能夠在一定程度上緩解熵坍縮。
然而,它們大多只是啟發(fā)式地、間接地改變部分 token 的更新強度,缺少對每個 token 熵變方向和幅度的直接刻畫。因此,它們對訓(xùn)練中熵動態(tài)的控制仍然是粗粒度的,難以直接穩(wěn)定每個 token 更新帶來的熵變化。
STEER:給劇烈熵變化的 token 踩下剎車
既然熵坍縮來自 token 更新帶來的熵變化失控,一個自然思路就是:不要只在全局上調(diào)熵,而是直接控制每個 token 的熵變幅度。
基于這一思路,作者提出了 STEER(Stabilizing Token-level Entropy-changE via Reweighting)。它的核心實現(xiàn)很簡單:既然已經(jīng)可以估計每個 token 在當(dāng)前更新中會帶來怎樣的熵變,那么就可以反過來用這個估計值來調(diào)節(jié)訓(xùn)練權(quán)重。如果某個 token 會帶來過大的熵變化,STEER 就降低它的權(quán)重;如果熵變化較小,則基本保留原有學(xué)習(xí)信號。這樣一來,訓(xùn)練不會因為過早降熵而失去探索,也不會因為盲目增熵而變得不穩(wěn)定。
這和常見的熵獎勵(entropy bonus)或熵正則(entropy regularization)不同。STEER 并不是粗暴地 “把熵拉高”,因為過大的熵增加同樣可能讓訓(xùn)練發(fā)散。它可以作為一個 token-level 的 “限速器”:不是簡單把熵推高,而是讓每一步訓(xùn)練中的熵變化保持可控。
論文中的實驗也印證了這一點。大多數(shù) token 的權(quán)重仍然接近 1,說明 STEER 不會大面積削弱學(xué)習(xí)信號;只有那些會帶來劇烈熵變化的 token,才會被明顯降權(quán)。換句話說,它不是讓模型停止學(xué)習(xí),而是讓模型不要被少數(shù)劇烈更新帶偏。
![]()
即使在幾乎不施加 clipping 約束的極端設(shè)置下,STEER 仍能將策略熵維持在相對穩(wěn)定的區(qū)間,既避免快速坍縮,也避免過度升熵。
從熵動態(tài)到任務(wù)表現(xiàn),數(shù)學(xué)代碼任務(wù)穩(wěn)定提升
STEER 的作用不僅體現(xiàn)在熵動態(tài)更穩(wěn)定,也體現(xiàn)在最終任務(wù)表現(xiàn)上。
在數(shù)學(xué)推理任務(wù)中,STEER 在六個基準上都取得了穩(wěn)定提升。以 Qwen2.5-Math-7B 為例,其平均分達到 48.6,超過標準 GRPO 的 44.2,也超過 OPO、Clip-Cov 等強基線。
![]()
在代碼任務(wù)中,STEER 同樣帶來穩(wěn)定收益。例如在 Qwen2.5-Coder-14B 上,代碼編輯性能從 42.6 提升到 45.1,LiveCodeBench v5 從 29.3 提升到 31.8。
![]()
除了主實驗,論文還在不同模型規(guī)模、模型家族和 RLVR 算法上進行了驗證。從 Qwen 到 Llama、Mistral,從 GRPO 到 RLOO、OPO,STEER 都表現(xiàn)出穩(wěn)定收益,說明它并不依賴某個特定 benchmark、模型或訓(xùn)練算法。
![]()
這一結(jié)果也與前文的機制分析一致:STEER 不是簡單追求更高的熵,而是穩(wěn)定每一步訓(xùn)練中的 token-level 熵變。這樣,模型既能繼續(xù)強化已有的有效推理路徑,也能避免探索空間被過早收縮。
總結(jié)
這項工作的核心價值,在于把 RLVR 中的熵坍縮拆解到 token 更新這一粒度:每一次更新如何改變局部分支,最終如何影響整棵推理樹的展開或收縮。沿著這一視角,熵坍縮不再只是訓(xùn)練曲線上的現(xiàn)象,而成為可以被分析、解釋和調(diào)控的訓(xùn)練動態(tài)。
本文的第一作者為郝哲正,現(xiàn)為浙江大學(xué)計算機學(xué)院博士研究生,研究方向聚焦于 Coding Agent 及其后訓(xùn)練。本文的共同第一作者為王泓,現(xiàn)為騰訊 CodeBuddy 團隊青云計劃研究員,研究方向聚焦于 Agent Harness 與 Auto-research。
本文的指導(dǎo)老師為董漢德和陳佳偉。董漢德,騰訊技術(shù)專家,騰訊 CodeBuddy 大模型研發(fā)負責(zé)人。在大模型領(lǐng)域具有豐富的研究和落地經(jīng)驗,包括大模型訓(xùn)練、智能體等細分領(lǐng)域。陳佳偉,浙江大學(xué)計算機學(xué)院 “百人計劃” 研究員,博士生導(dǎo)師,于 2020 年獲得浙江大學(xué)計算機科學(xué)與技術(shù)博士學(xué)位,曾師從陳純院士、何向南教授,主要致力于推薦系統(tǒng)、大語言模型、智能體等領(lǐng)域的研究,谷歌學(xué)術(shù)引用超 6000 次,特別是在用戶行為分析與建模方面取得了一系列成果,曾獲 SIGIR 2023 最佳論文提名獎(CCF-A 類)、WSDM 2025 最佳論文獎(清華 A 類),多項成果也在快手、抖音、螞蟻、省公安等企事業(yè)單位落地應(yīng)用,服務(wù)于上億用戶。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.