![]()
開源人工智能(AI)的價值正獲得更廣泛的認可。
剛剛,DeepSeek-R1 論文以封面文章的形式登上了權(quán)威科學(xué)期刊Nature,DeepSeek 創(chuàng)始人兼 CEO 梁文峰為該論文的通訊作者。
![]()
論文鏈接:
https://www.nature.com/articles/s41586-025-09422-z
研究團隊假設(shè),人類定義的推理模式可能會限制模型的探索,而無限制的強化學(xué)習(xí)(RL)訓(xùn)練可以更好地激勵大語言模型(LLM)中新推理能力的涌現(xiàn)。
他們通過實驗證明,LLM 的推理能力可以通過純 RL 來提升,從而減少增強性能所需的人類輸入工作量,且在數(shù)學(xué)、編程競賽和 STEM 領(lǐng)域研究生水平問題等任務(wù)上,比經(jīng)傳統(tǒng)方法訓(xùn)練的 LLM 表現(xiàn)更好。
DeepSeek-R1 推出后,得到了全球開發(fā)者的廣泛好評,截至發(fā)文前,其在 GitHub 上的 star 數(shù)已經(jīng)達到了 91.1k。
在一篇同期發(fā)表的觀點與評論文章中,卡內(nèi)基梅隆大學(xué)助理教授Daphne Ippolito和他的博士生張益銘(現(xiàn)為 Anthropic 的 LLM 安全和對齊研究員)評價道:
“DeepSeek-R1 已從一個強大但不透明的解決方案尋找者,發(fā)展成一個能夠進行類人對話的系統(tǒng)。這一歷程反映了(人類)對 AI 系統(tǒng)的需求,這些系統(tǒng)不僅要準(zhǔn)確地解決問題,還要成為人類可以理解、信任并能進行有意義協(xié)作的工具。”
![]()
文章鏈接:
https://www.nature.com/articles/d41586-025-02703-7
此外,
Nature也在 Editorial 文章中肯定了這項工作,“DeepSeek-R1 是第一個在經(jīng)過同行評審后發(fā)表的主流 LLM,這是朝著透明化邁出的可喜一步”。
![]()
文章鏈接:
https://www.nature.com/articles/d41586-025-02979-9
他們一針見血地指出,經(jīng)同行評審的論文發(fā)表有助于澄清 LLM 的工作原理,并幫助評估它們是否“貨真價實”(whether they do what they purport to do)。
![]()
DeepSeek-R1 背后的科學(xué)
人類定義的推理模式可能會限制模型的探索,而無限制的 RL 訓(xùn)練可以更好地激勵 LLM 中新推理能力的涌現(xiàn)。
讓機器像人類一樣進行通用推理,一直是 AI 領(lǐng)域的核心難題。
盡管思維鏈(CoT)等方法能夠有效提升 LLM 的推理表現(xiàn),但嚴重依賴人工標(biāo)注,不僅擴展性差,還可能因人類的認知偏差而限制模型自身的潛能,使其無法探索更優(yōu)的、非人類的推理路徑。
DeepSeek-R1 的重要意義在于,它證明了通過純粹的 RL 即可激發(fā) LLM 的推理能力,而無需依賴人工標(biāo)注的推理過程(數(shù)據(jù))。
不同于基于提示的方法和監(jiān)督學(xué)習(xí)等早期方法,研究團隊提出了一種新范式——在 RL 框架中,以最小化對人工標(biāo)注的依賴,探索 LLM 通過自我演化來發(fā)展推理能力的潛力。
基于提示的方法 vs. 監(jiān)督學(xué)習(xí) vs. RL 正如 Ippolito 等人所比喻的,RL 算法的工作方式類似于人類玩家學(xué)習(xí)玩電子游戲的過程:玩家在游戲世界中操作角色,通過不斷試錯發(fā)現(xiàn)哪些行為會帶來獎勵——例如“收集金幣”可以增加分數(shù),而“撞到敵人”則會讓分數(shù)歸零。 相比之下,基于提示的方法更像是讓他們通過閱讀說明書來學(xué)會玩游戲,而監(jiān)督學(xué)習(xí)則像讓他們觀察其他玩家玩游戲數(shù)百次,試圖通過模仿掌握游戲技巧。
他們發(fā)現(xiàn),當(dāng) LLM 通過 RL 的試錯過程被訓(xùn)練以產(chǎn)生正確答案時,它會自然而然地學(xué)會輸出其推理過程。
考慮到數(shù)學(xué)和編程問題通常有可驗證的答案,他們通過創(chuàng)建一個評分系統(tǒng)來幫助 DeepSeek-R1 在訓(xùn)練過程中進行改進——回答正確得高分,反之得低分。
在具體實現(xiàn)上,他們提出了一個名為“群體相對策略優(yōu)化”(GRPO)的 RL 算法,并基于基礎(chǔ)模型 DeepSeek-V3 Base 訓(xùn)練了 DeepSeek-R1-Zero、DeepSeek-R1 等模型。
![]()
圖|RL 框架
從 DeepSeek-V3 Base 開始,通過涉及拒絕采樣、RL和監(jiān)督微調(diào)(SFT)的多階段 pipeline,研究團隊先后訓(xùn)練了 DeepSeek-R1-Zero、DeepSeek-R1 Dev1、DeepSeek-R1 Dev2、DeepSeek-R1 Dev3 和最終的 DeepSeek-R1。
![]()
圖|DeepSeek-R1 的多階段 pipeline
據(jù)論文描述,DeepSeek-R1-Zero自然演化出了多樣且復(fù)雜的推理行為。在解決推理問題時,模型傾向于生成更長的響應(yīng),其中包含驗證、反思和替代方案的探索。這表明,模型通過 RL 能夠成功地學(xué)會更優(yōu)的推理策略。
然而,DeepSeek-R1-Zero依然存在一些局限,比如“輸出可讀性差”和“語言混用”等。而且,由于其基于規(guī)則的 RL 訓(xùn)練階段僅聚焦于推理任務(wù),在寫作和開放域問答等更廣泛場景中的表現(xiàn)較差。
為此,研究團隊通過隨后的多個訓(xùn)練階段進一步強化了 DeepSeek-R1 系列模型的綜合能力。具體而言:
DeepSeek-R1 Dev1:相較于 DeepSeek-R1-Zero,指令遵循能力提升;
DeepSeek-R1 Dev2:在代碼、數(shù)學(xué)和 STEM 等領(lǐng)域,高級推理能力進一步增強;
DeepSeek-R1 Dev3:引入大規(guī)模非推理語料和代碼工程數(shù)據(jù),推理與通用語言生成能力得到提升;
DeepSeek-R1:推理能力強,且行為與人類偏好對齊。
最后,他們在 MMLU、MMLU-Pro、C-Eval、GPQA Diamond、SimpleQA、SWE-bench Verified、LiveCodeBench 和 AIME 2024 等 21 個主流 benchmark 上分別對 DeepSeek-R1 等模型進行了評估。
如下表,DeepSeek-R1 幾乎在所有 benchmark 上均取得了更好的成績。這些結(jié)果驗證了這一 RL 框架的有效性。
![]()
圖|DeepSeek-R1 每個訓(xùn)練階段的評測結(jié)果
此外,研究團隊還表示,這一 RL 框架有助于形成一些高級的、涌現(xiàn)的推理模式,如自我反思、驗證和動態(tài)策略適應(yīng)。而且,這些涌現(xiàn)出的推理模式還可以被系統(tǒng)地用于指導(dǎo)和增強小型模型的推理能力。
啟示:亟需遏制 AI 行業(yè)的過度炒作
考慮到這項技術(shù)已無處不在,未經(jīng)證實的言論對社會而言是切實的風(fēng)險。
除了 DeepSeek-R1 的在科學(xué)層面的研究意義,
Nature在 Editorial 文章中著重探討 了一個業(yè)內(nèi)討論不夠多的問題 :
絕大多數(shù)被廣泛使用并正在迅速顛覆人類獲取知識方式的 LLM,都尚未經(jīng)過獨立同行評審,這是一個值得注意的「缺失」。
他們稱,DeepSeek-R1 論文的發(fā)表“是朝著透明化邁出的可喜一步。”
據(jù)介紹,DeepSeek-R1 的原創(chuàng)性、方法論和魯棒性,已接受八位人類專家的評審。論文將與評審報告及作者回復(fù)一同發(fā)表。“在一個常常充斥未經(jīng)驗證主張和炒作的行業(yè)中,這無疑是邁向透明性與可重復(fù)性的重要一步。”
Nature方面認為,與在預(yù)印本 arXiv 發(fā)表論文不同,參與同行評審的外部專家不再是單向接收信息,而是在一個由獨立第三方監(jiān)督和管理的協(xié)作過程中提問并請求更多信息。“雖然這不總能帶來重大改變,但可以增加研究的信任度。對于 AI 開發(fā)者而言,這意味著他們的工作得到了‘權(quán)威背書’,從而在不同社區(qū)中更具公信力。”
同時,同行評審還起到了制衡作用,避免 AI 開發(fā)者通過挑選最有利于自己模型的基準(zhǔn)測試而“自我打分”。這是因為,基準(zhǔn)測試是可以被操控的。例如,如果訓(xùn)練數(shù)據(jù)中包含測試題目和答案,模型就可能提前學(xué)會正確回答,從而導(dǎo)致其能力被高估。
此外,同行評審還可以促成論文的其他重要修改,其中之一是確保作者對模型的安全性有所回應(yīng)。AI 的安全性意味著要避免意料之外的有害后果,包括緩解輸出中的固有偏見,以及增加防護措施以避免 AI 被用于網(wǎng)絡(luò)攻擊。
一些人認為開源模型比專有模型更不安全,因為一旦用戶下載,它們就脫離了開發(fā)者的控制。不過,開源模型也讓更廣泛的社區(qū)能夠理解并修復(fù)缺陷。
例如,DeepSeek-R1 的審稿人指出,論文缺少關(guān)于安全性測試的信息——并未評估基于 R1 構(gòu)建一個不安全模型的難易程度。作為回應(yīng),研究團隊在論文中添加了重要細節(jié),包括一個專門的章節(jié),介紹了他們?nèi)绾卧u估模型的安全性并將其與競爭模型進行比較。
鑒于 DeepSeek-R1 是一個開放權(quán)重模型,任何研究人員和公眾都可以不受限制地自由下載、使用、測試和在其基礎(chǔ)上進行開發(fā),因此其安全問題不容忽視。
在 Editorial 文章的最后,
Nature呼吁道,希望更多的 AI 公司將其模型提交給出版物評審。“評審并不意味著讓外界接觸公司的秘密,而是要準(zhǔn)備好用證據(jù)支持你的言論,并確保相關(guān)主張得到驗證和澄清。”
如今,伴隨著國內(nèi)外 AI 行業(yè)的白熱化競爭,一些模型廠商在投入巨大資金的同時,忽視了數(shù)據(jù)偏見、模型安全等問題,甚至存在主動刷榜、夸大模型能力的行為,“對社會而言是切實的風(fēng)險”(a real risk for society)。
或許正如
Nature所言,依賴獨立研究者的同行評審,是緩解 AI 行業(yè)炒作的一種方式。
對此,你怎么看?
作者:學(xué)術(shù)君
如需轉(zhuǎn)載或投稿,請直接在公眾號內(nèi)留言
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.