![]()
這項由康奈爾大學(xué)、微軟、哈佛大學(xué)與Databricks AI Research聯(lián)合開展的研究,以預(yù)印本形式于2026年4月發(fā)表,論文編號為arXiv:2604.08801,有興趣深入了解的讀者可通過該編號查詢完整論文。研究的核心發(fā)現(xiàn)頗為反直覺:在訓(xùn)練AI寫出更好的"指令"時,用更少的練習(xí)題,效果反而比用更多題目要好得多。
要理解這項研究在做什么,可以先從一個場景說起。假設(shè)你是一位廚師,手下有一位徒弟,你想教會他如何調(diào)配一種萬能調(diào)味料,讓每道菜都變得好吃。每道菜就是一道"用戶題目",調(diào)味料的配方就是"系統(tǒng)提示詞",而徒弟學(xué)習(xí)調(diào)配配方的過程,就是"提示詞優(yōu)化"。聽起來很合理,對吧?理論上,給徒弟看的菜越多,他調(diào)出來的配方應(yīng)該越好。
然而,研究團隊發(fā)現(xiàn),現(xiàn)實并非如此。當(dāng)徒弟同時面對大量風(fēng)格迥異、口味千差萬別的菜肴時,調(diào)出來的萬能配方反而越來越平庸——不咸不淡,什么特色都沒有。原因在于,每道菜對調(diào)味料的偏好不一樣,有的菜喜歡辣,有的菜需要清淡,平均下來,配方反而失去了辨別"好"與"差"的能力。
這個研究用嚴(yán)謹(jǐn)?shù)臄?shù)學(xué)語言描述了這一現(xiàn)象,并提出了一個名為"p1"的方法來解決它。p1的核心思路就是:不用所有菜來訓(xùn)練,只挑那些能最清楚區(qū)分好配方和壞配方的菜來練習(xí)。這項研究對AI領(lǐng)域具有相當(dāng)重要的實際意義,因為"系統(tǒng)提示詞"如今已成為控制AI行為的關(guān)鍵工具,而如何高效地優(yōu)化這些提示詞,直接影響著AI的實際表現(xiàn)。
一、什么是"系統(tǒng)提示詞",它為什么這么重要
要徹底理解這項研究,首先得搞清楚什么叫"系統(tǒng)提示詞"。當(dāng)你打開一個AI助手,比如某個客服機器人或數(shù)學(xué)輔導(dǎo)工具,在你提問之前,系統(tǒng)其實已經(jīng)偷偷地給AI傳達(dá)了一段"幕后指令",告訴它要表現(xiàn)得像個什么樣的角色、用什么風(fēng)格回答、遇到什么情況該怎么處理。這段幕后指令,就是系統(tǒng)提示詞。
系統(tǒng)提示詞的神奇之處在于,它能在不改變AI內(nèi)部參數(shù)的前提下,大幅改變AI的行為。好比同一位演員,給他不同的劇本,他就能演出截然不同的角色。如果系統(tǒng)提示詞寫得好,AI回答問題的準(zhǔn)確率可以大幅提升;寫得差,AI可能會答非所問甚至犯錯連連。
正因如此,"提示詞優(yōu)化"這一研究方向近年來受到了廣泛關(guān)注。研究人員希望讓AI自動去尋找最好的系統(tǒng)提示詞,而不是依靠人工反復(fù)試驗。這個過程有點像自動化地調(diào)整調(diào)味料配方,用的是"強化學(xué)習(xí)"的方法——讓一個負(fù)責(zé)"出提示詞"的AI不斷嘗試不同的寫法,另一個"做題"的AI來檢驗?zāi)姆N提示詞效果更好,然后根據(jù)結(jié)果反復(fù)改進(jìn)。
然而,研究團隊發(fā)現(xiàn),這套方法在某些任務(wù)上效果顯著,在另一些任務(wù)上卻幾乎沒有任何改善。就像同一套教學(xué)方法,教語文課很管用,教數(shù)學(xué)競賽卻毫無進(jìn)展。研究的起點,正是這個令人困惑的現(xiàn)象。
二、發(fā)現(xiàn)問題:為什么有些任務(wù)根本學(xué)不動
研究團隊選取了兩類典型任務(wù)進(jìn)行對比實驗。第一類是"指令遵循"任務(wù),也就是讓AI按照嚴(yán)格的格式要求來回答問題,比如"用不超過三個詞回答"或"回答必須以某個詞開頭"。第二類是"競賽數(shù)學(xué)"任務(wù),也就是讓AI解答高難度的數(shù)學(xué)競賽題,例如AIME(美國數(shù)學(xué)邀請賽)的題目。
實驗結(jié)果非常鮮明。在指令遵循任務(wù)上,提示詞優(yōu)化非常成功,隨著訓(xùn)練的進(jìn)行,AI的表現(xiàn)持續(xù)穩(wěn)步提升。而在數(shù)學(xué)競賽任務(wù)上,提示詞優(yōu)化幾乎完全失敗——無論訓(xùn)練多少步,AI的成績幾乎紋絲不動,就好像在原地踏步。
為了理解這種差異,研究團隊引入了一個關(guān)鍵分析工具:方差分解。這個概念聽起來復(fù)雜,但其實就像區(qū)分"骰子本身的不確定性"和"不同骰子之間的差異"。
具體來說,當(dāng)你用不同的系統(tǒng)提示詞讓AI解題,每次得到的成績會有波動。這種波動來自兩個來源:一是AI在同一個提示詞下,每次回答的隨機性(就像骰子每次搖出的數(shù)字不同);二是不同提示詞之間真正的質(zhì)量差距(就像一個六面骰和一個十面骰的本質(zhì)區(qū)別)。
在指令遵循任務(wù)中,不同提示詞之間的真實質(zhì)量差距很大——好的提示詞和差的提示詞,導(dǎo)致AI答對的概率相差懸殊。這就像用不同的調(diào)音工具彈同一首曲子,好樂器和壞樂器的差距一聽便知。而在數(shù)學(xué)競賽任務(wù)中,提示詞之間的差距極小,但AI每次回答的隨機性卻很大——同一道題,用同一個提示詞,有時AI能解出來,有時又解不出來。這時候,區(qū)分好提示詞和壞提示詞就變得極為困難,就像在嘈雜的工廠里試圖分辨兩種音叉的音高——背景噪音太大,你根本聽不出來哪個更準(zhǔn)。
研究團隊還做了一組更精細(xì)的實驗:他們把AIME 2024的30道題拆開,每次只用一道題來訓(xùn)練,觀察不同題目的學(xué)習(xí)效果。結(jié)果發(fā)現(xiàn),有些單獨的題目確實能產(chǎn)生足夠大的提示詞差異,用這些題單獨訓(xùn)練時,AI的提示詞質(zhì)量真的得到了提升。這個發(fā)現(xiàn)引出了下一個關(guān)鍵謎題。
三、反常識的發(fā)現(xiàn):更多練習(xí)題,反而學(xué)得更差
既然單獨用某幾道題訓(xùn)練是有效的,那為什么把所有30道題放在一起反而不行?研究團隊深入分析后,揭示了一個頗為反直覺的機制。
隨著訓(xùn)練數(shù)據(jù)中題目數(shù)量增加,不同提示詞之間的真實差距會系統(tǒng)性地縮小。原因在于,不同題目對"好的系統(tǒng)提示詞"各有偏好——對題目A有效的提示詞,未必對題目B也有效,甚至可能反而讓B的表現(xiàn)變差。當(dāng)這些題目混在一起取平均時,各種偏好相互抵消,所有提示詞的平均表現(xiàn)開始趨于相同,原本的優(yōu)劣差距被"稀釋"掉了。
這就好比你在調(diào)配一種萬能調(diào)味料,但鍋里同時有一道需要辣的川菜、一道需要甜的粵菜、一道需要酸的湘菜和一道需要清淡的素菜。你調(diào)出來的配方必然是四不像,哪道菜都不能特別突出。而如果你單獨為川菜調(diào)配,辣味就能被充分放大。
研究團隊用數(shù)學(xué)公式精確地描述了這一現(xiàn)象。當(dāng)題目數(shù)量增加時,不同提示詞的平均獎勵差距會以一定的速率下降,而背景隨機噪音的衰減速度卻跟不上,導(dǎo)致信噪比(即有效信號相對于噪音的比例)持續(xù)惡化。如果想維持原來的信噪比,就必須以超過題目數(shù)量增長速度的比例來增加每題的采樣次數(shù),這在計算上是極其昂貴的。
相比之下,指令遵循任務(wù)的表現(xiàn)則大相徑庭。增加題目數(shù)量時,信噪比幾乎保持不變,說明這類任務(wù)中好的提示詞對大多數(shù)題目都是一致地有幫助的——調(diào)味料對這些菜的偏好是高度一致的,無論加多少道菜,"好配方"始終鶴立雞群。研究團隊將這類任務(wù)稱為"同質(zhì)性"任務(wù),而將像數(shù)學(xué)競賽這樣每道題偏好不同的任務(wù)稱為"異質(zhì)性"任務(wù)。
四、p1方法:只挑最能說明問題的題目來練習(xí)
正是基于上述分析,研究團隊提出了"p1"方法。p1的名字來源于其核心思想——用極少量、但極具代表性的用戶題目來進(jìn)行提示詞優(yōu)化。
p1的工作流程分為兩個階段,可以用"選材"和"烹飪"來類比。在選材階段,研究團隊首先從提示詞生成模型中隨機采樣一批候選系統(tǒng)提示詞,然后把每個候選提示詞分別應(yīng)用于數(shù)據(jù)集中的每一道題,收集大量答題結(jié)果。這一步的目的是估算每道題在不同提示詞下的答對率,以及這些答對率之間的差距。關(guān)鍵在于,他們要找出那些在不同提示詞之間答對率差異最大的題目。換句話說,就是找出那些最能"區(qū)分好提示詞和壞提示詞"的題目——這些題目,就是選材時的"高區(qū)分度"食材。
在選材時,研究團隊特別注意一個細(xì)節(jié):他們不是直接計算不同提示詞答對率的方差,而是要減去因隨機性帶來的那部分"假方差",只保留真正反映提示詞質(zhì)量差異的那部分。這就像在評比廚師手藝時,要把廚房溫度波動造成的菜品差異扣除掉,只看廚師本身技術(shù)水平帶來的差異。
完成選材之后,就進(jìn)入"烹飪"階段:只用選出來的少數(shù)題目來訓(xùn)練提示詞生成模型,訓(xùn)練方式和常規(guī)的強化學(xué)習(xí)方法完全一樣,但因為題目少了,每道題可以分配更多次的采樣,從而讓每一步訓(xùn)練都有更清晰的學(xué)習(xí)信號。
p1方法的默認(rèn)設(shè)置非常激進(jìn):Ktop(保留的題目數(shù)量)默認(rèn)為2,也就是說,從30道AIME題中只保留2道來訓(xùn)練。這個數(shù)字在直覺上很難接受,但實驗結(jié)果證明它是有效的。
五、實驗結(jié)果:兩道題打敗了三十道題
研究團隊在多個基準(zhǔn)測試上對p1方法進(jìn)行了系統(tǒng)評估,對比的基線方法包括全數(shù)據(jù)集強化學(xué)習(xí)(RL)和一種叫做GEPA的進(jìn)化式提示詞優(yōu)化方法。
在數(shù)學(xué)競賽任務(wù)上,結(jié)果非常清晰。用全部30道AIME 2024題目訓(xùn)練的強化學(xué)習(xí)方法,最終在AIME 2025測試集上的準(zhǔn)確率約為47%,幾乎與未經(jīng)任何訓(xùn)練的基礎(chǔ)模型相當(dāng),說明優(yōu)化幾乎沒有產(chǎn)生效果。GEPA方法的表現(xiàn)同樣如此,不管用什么數(shù)據(jù)分配方式,準(zhǔn)確率都在47%上下徘徊。
而p1方法,僅僅用AIME 2024中的第1題和第23題(兩道被識別為高區(qū)分度的題目)來訓(xùn)練,在AIME 2025上的準(zhǔn)確率達(dá)到了54%,比基礎(chǔ)模型提升了約7個百分點,是所有方法中最高的。不僅如此,這一提升還跨越了多個測試集:在AIME 2026上從54%上升到62%,在HMMT(哈佛-MIT數(shù)學(xué)錦標(biāo)賽)2025和2026上也分別取得了明顯的進(jìn)步。
更令人印象深刻的是,研究團隊還把用Qwen3-4B模型優(yōu)化出來的系統(tǒng)提示詞,直接拿去用在體量更大的Qwen3-30B模型上,發(fā)現(xiàn)同樣能帶來性能提升。這意味著p1找到的提示詞并不是針對特定模型的"作弊技巧",而是能夠泛化的、真正有效的思維引導(dǎo)策略。
相比之下,GEPA方法生成的系統(tǒng)提示詞內(nèi)容非常具體,充滿了針對特定題目類型的詳細(xì)數(shù)學(xué)知識點,比如專門針對某類幾何問題的解法步驟,甚至包含了具體的計算結(jié)果。這種提示詞明顯是對訓(xùn)練數(shù)據(jù)的"記憶"而非"理解",自然無法推廣到新題目上。而p1生成的提示詞內(nèi)容則更為普適,主要是關(guān)于如何組織思路、如何展開推理過程的一般性引導(dǎo),更像是教會AI一種思維方式,而非背誦具體答案。
在指令遵循任務(wù)上,情況則完全相反。全數(shù)據(jù)集強化學(xué)習(xí)方法和GEPA方法都取得了明顯的提升,將IFBench測試集的準(zhǔn)確率從35%提升到了約39%。而p1方法在這一任務(wù)上表現(xiàn)欠佳,當(dāng)題目減少到極少時,模型容易過擬合到那幾道題上,在更廣泛的測試集上的表現(xiàn)反而下降。這一結(jié)果恰好印證了研究團隊的理論分析:對于同質(zhì)性任務(wù),用更多數(shù)據(jù)訓(xùn)練是有益的,因為學(xué)習(xí)信號本來就強且一致。
六、為什么p1找到的提示詞能推廣,而GEPA找到的不能
這個問題的答案其實藏在兩種方法的優(yōu)化目標(biāo)差異里。GEPA是一種進(jìn)化式方法,它通過反復(fù)修改和篩選提示詞來改進(jìn),這個過程天然傾向于把訓(xùn)練集的特征"編碼"進(jìn)提示詞里——就像考前背題,背的內(nèi)容越具體,考場上遇到原題就越有把握,但遇到新題就越束手無策。
而p1通過強化學(xué)習(xí)來優(yōu)化提示詞生成策略,由于訓(xùn)練信號更清晰、更純粹(因為排除了會稀釋信號的題目),模型能更順暢地向"真正好的提示詞"方向移動,而不是被噪音拉著原地轉(zhuǎn)圈。這就好比在寂靜的環(huán)境里練習(xí)辨音,比在嘈雜環(huán)境里更容易找準(zhǔn)音調(diào)。
從生成的提示詞內(nèi)容來看,p1優(yōu)化出的最佳提示詞(AIME 2025準(zhǔn)確率54%)主要要求AI以"流水賬式的原始思維"展開推理過程——不用格式化的段落,不用數(shù)學(xué)符號,就像人在腦子里自言自語一樣,把每個想法、每個試錯、每個疑問都寫下來,最后才給出答案。這種風(fēng)格讓AI能充分探索解題路徑,而不是過早收斂到某個可能錯誤的方向上。另一個p1找到的有效提示詞(準(zhǔn)確率50%)則反其道而行之,要求AI表現(xiàn)得像一個混亂、緩慢、犯錯連連的人類思維過程,充滿錯誤猜測和死胡同。盡管這個風(fēng)格聽起來匪夷所思,但它同樣讓AI在推理時更加"放松",減少了過于自信的快速跳步。
這兩種風(fēng)格表面上看起來截然相反,但背后的邏輯是一致的:它們都在引導(dǎo)AI進(jìn)行更充分、更深入的思維展開,而不是走捷徑。
七、數(shù)學(xué)背后的邏輯:信號與噪聲的博弈
對于希望深入理解這項研究的讀者,研究團隊在論文中提供了完整的數(shù)學(xué)推導(dǎo),這里用直覺性的語言加以解釋。
當(dāng)我們用N個候選提示詞去評估,每個提示詞用K道題、每題采樣M次來估算其表現(xiàn)時,觀察到的總體波動(方差)可以被分解為兩部分:來自隨機采樣的"噪音方差"和來自提示詞本身質(zhì)量差異的"信號方差"。
噪音方差與1/(KM)成反比——即題目數(shù)量和采樣次數(shù)的乘積越大,噪音越小。信號方差則是各提示詞真實表現(xiàn)之間的差距,與K和M無關(guān),但在異質(zhì)性數(shù)據(jù)集上,隨著K增大,信號本身會系統(tǒng)性地縮小(因為偏好相互抵消)。
這就產(chǎn)生了一個根本性的矛盾:在異質(zhì)性數(shù)據(jù)集上,增加題目數(shù)量K雖然能降低噪音,但同時也在壓縮信號,導(dǎo)致信噪比并不能改善,甚至可能惡化。而p1通過主動篩選高信號題目,在不犧牲信號的前提下保持了足夠低的噪音,從根本上破解了這個困境。
研究團隊還通過實驗驗證了這一理論:他們單獨對AIME 2024的10道不同題目進(jìn)行訓(xùn)練,測量每道題的提示詞差異度(信號方差),結(jié)果發(fā)現(xiàn)訓(xùn)練獎勵的改善程度與這個差異度之間呈現(xiàn)清晰的線性正相關(guān)關(guān)系——差異度越高的題目,訓(xùn)練越有效。這一結(jié)果完美地支持了理論預(yù)測。
八、這項研究的局限與未來方向
研究團隊在論文中也誠實地指出了幾個值得關(guān)注的局限性。首先,整個理論分析建立在"獎勵是0或1的二元值"這一假設(shè)上,而現(xiàn)實中的很多任務(wù)會給出連續(xù)的評分,這類情況下的方差分解和最優(yōu)題目選擇策略還需要進(jìn)一步研究。其次,雖然實驗結(jié)果表明用少數(shù)高區(qū)分度題目訓(xùn)練出的提示詞能夠泛化到更廣泛的測試集,但研究團隊坦言,目前還沒有完整的理論來解釋什么條件下這種泛化能夠成立——這是一個留給未來研究的重要開放問題。
此外,p1方法在選題階段需要對所有候選題目進(jìn)行大量采樣,這本身也是有計算成本的。當(dāng)數(shù)據(jù)集非常大時,如何高效地找到高區(qū)分度題目,可能需要更巧妙的近似方法。
說到底,這項研究傳達(dá)了一個非常樸素的道理:學(xué)習(xí)的效率不在于做了多少題,而在于做了什么題。在AI提示詞優(yōu)化這個具體問題上,盲目堆砌訓(xùn)練數(shù)據(jù)不僅無益,甚至有害;真正有價值的是找到那些能最清楚地揭示質(zhì)量差異的例子,專注地從它們身上學(xué)習(xí)。這個道理或許對人類學(xué)習(xí)同樣適用——與其漫無目的地刷題,不如精準(zhǔn)地找到最能檢驗薄弱點的題目來練習(xí)。
對于使用大型語言模型的從業(yè)者而言,這項研究提供了一個實用的思路:當(dāng)提示詞優(yōu)化效果不佳時,問題很可能不在于算法本身,而在于訓(xùn)練數(shù)據(jù)的選擇。通過評估哪些樣本對不同提示詞最敏感,可以用極少的計算資源獲得顯著的優(yōu)化效果。有興趣復(fù)現(xiàn)或擴展這一方法的讀者,可以通過arXiv:2604.08801獲取完整論文和技術(shù)細(xì)節(jié)。
Q&A
Q1:提示詞優(yōu)化為什么在數(shù)學(xué)競賽題上效果差,在指令遵循任務(wù)上效果好?
A:核心原因是兩類任務(wù)的"異質(zhì)性"不同。在數(shù)學(xué)競賽中,不同題目對系統(tǒng)提示詞的偏好差異很大,有的題喜歡A提示詞,有的題喜歡B提示詞,混在一起平均后,各提示詞的表現(xiàn)趨于相同,優(yōu)化算法就無從辨別好壞,學(xué)習(xí)信號被"稀釋"掉了。而指令遵循任務(wù)中,好的提示詞對大多數(shù)題都一致地有幫助,信號清晰,優(yōu)化自然有效。
Q2:p1方法是如何挑選"高區(qū)分度題目"的?
A:p1首先隨機采樣一批候選系統(tǒng)提示詞,然后讓每個提示詞在所有候選題目上大量作答,估算出每道題在不同提示詞下的答對率差異。關(guān)鍵是要減去純粹由隨機性造成的"假差異",只保留真正反映提示詞質(zhì)量差距的部分。差異最大的題目就是最能區(qū)分好壞提示詞的題目,p1會選出這些題目用于正式訓(xùn)練。
Q3:p1訓(xùn)練出的系統(tǒng)提示詞為什么能遷移到?jīng)]見過的題目和更大的模型?
A:因為p1找到的是能激發(fā)模型充分展開推理過程的通用引導(dǎo)策略,而不是針對特定題型的具體知識。實驗表明,p1生成的提示詞主要引導(dǎo)模型以更自然、更充分的方式思考,這種思維方式對新題目和體量更大的模型同樣有效,而不像GEPA那樣把訓(xùn)練集的具體內(nèi)容"記憶"進(jìn)提示詞里。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.