一篇剛剛掛在arXiv上的論文,正在悄悄戳破大模型對齊領域一個心照不宣的痛點。
這篇論文來自斯坦福大學,題為《General Preference Reinforcement Learning》(通用偏好強化學習,簡稱GPRL),作者包括斯坦福大學的多位研究者以及來自俄克拉荷馬大學和獨立研究者的聯合團隊。論文于2026年5月18日上傳,直指當前大模型后訓練(post-training)領域的一個核心矛盾:在線強化學習訓練得越久,模型反而越差。
![]()
這不是危言聳聽。實驗數據清晰地顯示,當使用傳統標量獎勵模型做強化學習時,GRPO+BT的方案在訓練到一定程度后就開始走下坡路,AlpacaEval 2.0分數從峰值一路滑落,最終停在41.92分。而GPRL在同樣的訓練周期內持續提升,第三個epoch達到56.51分,領先超過14個百分點。
差距的根源,不在算力,不在數據量,在于獎勵信號本身的"形狀"。
一個標量分數,裝不下人類對質量的期待故事要從獎勵黑客(reward hacking)說起。
這是強化學習對齊領域公認的頑疾。訓練一個策略模型時,研究者先訓練一個獎勵模型(Reward Model,RM),用來打分,再讓策略模型不斷優化以拿高分。問題在于,真正的"好回答"是多維度的——事實準確、對用戶有幫助、表達安全、行文流暢……把這些維度壓縮進一個數字,信息必然丟失。
![]()
代理指標一旦被優化,就會背叛它本來代表的東西——這叫古德哈特定律(Goodhart's Law)。對于LLM對齊來說,最常見的表現是"越說越長":獎勵模型發現長回答往往更受人類評估員青睞,于是模型學會拼命堆砌字數,內容未必變好,評分卻不斷攀升。
更深層的問題是:標量獎勵模型在數學結構上就無法表達"非傳遞偏好"(intransitive preferences)。所謂非傳遞偏好,是指A比B好、B比C好,但C又比A好——這種循環偏好在人類真實判斷中普遍存在,卻被標量模型直接忽略,因為標量必須施加全序關系,不允許這種循環。
論文指出,既有的兩條技術路線都沒有真正解決這個問題。一條路線是DPO、SimPO、SPPO等偏好優化方法,處理開放性任務效果不錯,但依賴靜態或迭代刷新的偏好數據,沒有在線強化學習的持續探索能力;另一條路線是以GRPO為代表的在線RL方法,需要一個可編程驗證器(比如數學題的對錯判斷),在數學、代碼任務上表現出色,但無法擴展到開放性生成任務,一旦換成學習型標量RM,獎勵黑客問題就卷土重來。
GPRL的目標,就是用一個結構上更誠實的獎勵信號,把兩條路線連接起來。
把偏好嵌進向量空間,而不是壓縮成一個數
GPRL的核心依賴是通用偏好模型(General Preference Model,GPM),這是Zhang et al.此前提出的工作。
GPM的基本思路是:與其給每個回答打一個分數,不如把每個回答映射成一個向量,再用向量之間的關系來表達偏好。具體來說,GPM把每個回答嵌入到2k維空間,分成k個獨立的二維子空間,每個子空間捕捉質量的一個不同維度。
以k=3為例(論文在Skywork-Reward語料庫上驗證,k=3時性能飽和),三個子空間大致對應:有用性對比冗長性、事實準確性對比語言流暢性、安全性對比直接性。每對回答在每個子空間的得分,是兩個向量構成的平行四邊形有向面積——幾何上意味著,相對相位越接近得分越低,差異越大得分越高。
這種表示方式有兩個關鍵優勢。第一,它可以天然表達非傳遞偏好:三個子空間組合的循環偏好,在數學上是合法的,不需要像標量那樣強行施加全序;第二,每個子空間的得分被單位范數約束限制在[-1, 1]之間,不會隨訓練過程漂移,給后續的"漂移監控器"提供了穩定的參照。
但GPM本身的配套優化器GPO是迭代式的——固定策略、收集數據、訓練至收斂、刷新策略……這本質上和DPO系方法一樣,沒有真正的在線探索。GPRL做的,是保留GPM作為獎勵源,把GPO的迭代回歸替換成GRPO風格的在線策略梯度更新。
多維優勢函數:讓每個維度都有發言權
GPRL最核心的技術設計,在于如何把GPM的k維輸出轉化為策略梯度可以用的優勢函數(advantage)。
標準GRPO的做法是:對同一個提示采樣G個回答,用獎勵模型打分,組內歸一化得到優勢分數。GPRL沿用這個框架,但把"一個分數"擴展成"k個維度的分數",并引入了三步處理:
第一步,逐維度計算群體相對得分。 對于每個回答,計算它在k個子空間中分別與組內其他回答比較的平均得分。這相當于在每個質量維度上分別問:這個回答比組內平均水平好多少?
第二步,逐維度獨立歸一化。 每個維度的得分,只用該維度自己的均值和標準差來歸一化。這一步是防止獎勵黑客的關鍵機制。如果用全局歸一化,某個量級最大的子空間會淹沒其他子空間;逐維度歸一化后,每個子空間的貢獻都被拉到單位方差尺度,任何一個維度都無法僅憑"長得更大"來主導梯度方向。
第三步,用上下文相關的特征值加權聚合。 GPM本身會為每個提示輸出k個特征值(eigenvalues),反映該提示在各維度上的相對重要性。這些特征值作為權重,把k個歸一化后的維度優勢加權相加,得到最終的聚合優勢分數。
這個聚合分數直接代入標準GRPO的截斷代理目標函數(clipped surrogate objective),形式上和GRPO完全一致,只是優勢函數的計算方式變了。這意味著GPRL可以無縫接入現有的大規模RL訓練基礎設施,額外成本只是GPM的一次前向傳播,和普通獎勵模型的推理成本相當。
論文還證明了一個重要性質(命題1):對于任意提示和任意維度,組內所有回答的優勢之和為零。這是群體相對方法保持低方差的核心條件,在k維情況下依然成立,說明多維度聚合不會破壞GRPO本來的統計性質。
漂移監控器:訓練過程中的實時糾偏
但光有多維獎勵還不夠。論文設計了一個閉環漂移監控系統,在訓練過程中實時檢測和糾正獎勵黑客的萌芽。
機制的出發點很直觀:當策略開始獎勵黑客某個維度l時,組內回答在l上的方差會異常擴大,而在其他維度上的方差會萎縮——因為策略把"聰明才智"都集中在優化那一個維度了。
定義每個維度的方差占比為α_l,用當前時刻的α與初始分布α(0)之間的KL散度D(t)作為漂移指標。健康訓練時,D(t)接近零;發生獎勵黑客時,D(t)會快速攀升。
控制器的響應邏輯是:一旦D(t)超過閾值τ,就對每個維度施加一個乘數m_l,過度增長的維度乘以小于1的系數被壓低,被忽視的維度乘以大于1的系數被拉高,同時收緊KL散度的正則化系數β,防止策略繼續大步偏移。D(t)回落后,控制器逐漸松弛,恢復到基準狀態。
圖3展示了典型的漂移軌跡對比:健康運行時,各維度方差占比保持穩定;發生黑客時,某一維度方差份額猛增;控制器介入后,方差分布被拉回平衡,而使用標量BT獎勵模型時,代理分數單調攀升,完全看不到這個信號。
論文特別指出,把τ設得過小會適得其反。閾值太低,控制器會在策略還沒來得及在某個維度上積累真正有效信號之前就開始干預,強行把方差拉回初始分布,實際上損失了有用的信號。實驗表明τ=0.2是默認最優選擇。
數字說話:比GRPO+BT領先14個百分點
實驗從Llama-3-8B-Instruct出發,獎勵模型在Skywork-Reward上訓練,策略模型在UltraFeedback的提示上做在線rollout,每個提示采樣8個回答,完成長度512 token,訓練3個epoch。
AlpacaEval 2.0的長度控制勝率(LC WR)是這項工作最核心的指標,因為它顯式去除了答案長度偏差。結果:
GPRL(8B GPM):56.51%GRPO+BT(8B BT):41.92%,差距14.59個百分點最強迭代式基線SPPO(8B BT):42.55%,差距13.96個百分點DPO:40.30%SimPO:44.70%
![]()
在Arena-Hard v2、MT-Bench、WildBench三個基準上,GPRL同樣全面領先,且優勢持續到訓練第5個epoch,而其他方法普遍在第3個epoch附近開始退步。
回答長度的數據同樣有意思。迭代式GPM方法(SPPO+GPM、GPO+GPM)到第3輪時回答膨脹到2400到3300 token,LC勝率卻停滯不前。GPRL的平均回答長度只有1600 token,是所有有獎勵模型的方法里最短的,LC勝率卻是最高的——二者同步改善,而不是此消彼長。
分類別來看,GPRL在結構性任務上的增益格外突出:MT-Bench代碼類別比最強迭代式基線高出1.00分,WildBench數學/數據類別比GRPO+BT高出2.84分。論文認為,這與在線RL結合豐富獎勵信號能夠涌現出鏈式推理能力的規律一致,GPM的k個子空間為這些任務提供了足夠的判別信號,防止策略在這些提示上退化為風格模仿。
![]()
k值消融實驗印證了這一切:k=1時,GPRL退化為標量GRPO,LC WR為44.21;k=3時達到56.51;k=6時開始微跌,說明在當前的監督語料庫上,三個維度已經覆蓋了大部分有效信號,超出的維度只會放大噪聲。
一個方法論意義上更大的斷言
論文的結論部分提出了一個超出技術細節的判斷:獎勵的"形狀",而不僅僅是獎勵的"強度",才是解決在線RL與開放性對齊之間裂縫的關鍵變量。
"監督結構是第一類設計變量,而不是損失函數的固定屬性。"這句話是對當前后訓練思路的一次方法論修正。過去的共識大體是:給足數據、調好超參、RLHF就能work。但這篇論文的結論是:標量獎勵在結構層面就錯了,把k維輸出壓成一個數的那一刻,任何在線RL都注定找到單軸捷徑。
這個邏輯在更大范圍內也成立。任何"用學習的代理指標替代真實目標"的場景,只要目標是多維的,代理指標是一維的,就會面臨同樣的獎勵黑客問題。GPRL給出的思路——保留獎勵的結構、在優化過程中監控結構是否被破壞、以結構失衡作為干預信號——不只是LLM對齊的局部技巧,可能是一個更通用的框架。
當然,GPRL也有它承認的邊界。它依賴GPM本身的校準質量,如果某個質量維度壓根沒有被GPM表征為一個子空間,GPRL的逐維度歸一化會忠實地放大這個空白。當前實驗局限在單一基礎模型、單一獎勵語料庫、單一rollout語料庫上,k=3的飽和點是Skywork-Reward的屬性,不是GPRL或GPM本身的屬性。漂移控制器的閉環動力學也沒有收斂性保證,參數選擇不當可能導致D(t)振蕩。
Q&AQ1:GPRL為什么比GRPO+BT強這么多,核心機制是什么?
GRPO+BT使用標量獎勵模型,策略的梯度只受一個數影響。一旦模型找到某個捷徑(比如拼命堆字數)能讓這個數變大,梯度就會一直往那個方向推,其他質量維度的退化完全不可見。GPRL把獎勵換成k維向量,每個維度獨立歸一化,任何一個維度都不能靠"量級大"來壟斷梯度,同時漂移監控器實時檢測哪個維度的方差份額異常擴大,一旦發現就壓低那個維度的權重,把梯度拉回平衡。
Q2:逐維度歸一化和全局歸一化有什么實質區別?
如果用全局歸一化,三個子空間共用一套均值和標準差,量級最大的那個子空間的得分會在歸一化后主導其他子空間,等于變相退化成一維。實驗驗證了這一點:換成全局歸一化后LC WR下跌約4個點,回答長度重新膨脹到2104 token,復現了迭代式GPM方法的冗長模式。逐維度歸一化把每個子空間都拉到單位方差,誰也無法靠"更大"來碾壓其他維度。
Q3:漂移監控器的閾值τ設得越小越好嗎?
不是,過小的τ反而有害。閾值太低,控制器會在策略剛開始集中優化某個維度時就介入,但策略在該維度的集中可能是合理的(比如當前提示批次恰好在考察事實準確性),強行把方差拉平等于丟掉了有用信號,結果比不開控制器還差。τ=0.2是論文測試后確定的默認值,在"允許策略積累真實信號"和"阻止單軸奔跑"之間取得了平衡。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.