Ali Behrouz 在 X 上拋出的那句話,讓不少搞大模型的人愣了一下。他來(lái)自 Google 研究團(tuán)隊(duì),貼出的論文標(biāo)題直白得有點(diǎn)反常識(shí)——《Language Models Need Sleep》。AI 不是不用合眼、7×24 小時(shí)待命的嗎?現(xiàn)在居然有人正經(jīng)八百地論證,模型也需要“睡覺(jué)”。
不過(guò)別誤會(huì),這里的“睡覺(jué)”不是關(guān)服務(wù)器,更不是讓 GPU 趴窩休息。它指向的是大模型持續(xù)學(xué)習(xí)里一個(gè)拖了很久的坑:模型隨時(shí)都在回答問(wèn)題,卻很難從這些回答里攢下真正的經(jīng)驗(yàn)。這一輪的對(duì)話里你指出的錯(cuò)誤,下一輪它照樣犯;剛學(xué)會(huì)的一條規(guī)則,換個(gè)上下文就煙消云散。看似聊得熱火朝天,其實(shí)只是在對(duì)話的便簽紙上涂涂改改,根本沒(méi)寫(xiě)進(jìn)大腦硬盤(pán)。
![]()
所以研究團(tuán)隊(duì)給出的方案并不是讓模型躺平,而是設(shè)計(jì)一條從“短期上下文”通向“長(zhǎng)期參數(shù)”的通道。清醒的時(shí)候,模型快速適應(yīng)眼前任務(wù);轉(zhuǎn)入“睡眠”后,它不再急著生成內(nèi)容,而是把最近攢下的經(jīng)驗(yàn)篩選、整理,再安全地整合到自己的參數(shù)里。這樣一來(lái),每次交互不再隨用隨丟,而真有可能變成模型持續(xù)進(jìn)化的燃料。
大模型不睡覺(jué),到底卡在哪兒?
想明白這事,先得拆開(kāi)大模型現(xiàn)在的“記憶”到底是怎么工作的。模型面前的記憶可以分成好幾層:最淺的一層是上下文窗口,就像一張臨時(shí)的便利貼,貼上去的內(nèi)容模型立馬能用,但只要超出窗口或被清掉,剛剛表現(xiàn)出的靈活性馬上歸零。再往下一層是外部記憶,把便利貼存進(jìn)數(shù)據(jù)庫(kù)或搜索系統(tǒng)里,下次需要時(shí)再掏出來(lái),本質(zhì)上還是“需要時(shí)才看”,并沒(méi)有內(nèi)化成模型自己的能力。
真正算得上“學(xué)到位”的知識(shí),是那些刻在模型參數(shù)里的東西。預(yù)訓(xùn)練階段煉出來(lái)的語(yǔ)言理解、推理套路、事實(shí)記憶,全都以參數(shù)的形式沉淀下來(lái)。問(wèn)題是,這層參數(shù)不能像上下文那樣實(shí)時(shí)改寫(xiě)。每次往里塞新知識(shí),都需要新的數(shù)據(jù)和訓(xùn)練,而且稍不留意就會(huì)掀翻原來(lái)已經(jīng)學(xué)會(huì)的東西——這就是眾所周知的“災(zāi)難性遺忘”。
為什么會(huì)災(zāi)難性遺忘?因?yàn)閰?shù)并不是各管各的,而是一張高度耦合的網(wǎng)。學(xué)新任務(wù)要調(diào)參數(shù),而這些參數(shù)往往還兼著別的工作。新能力一上去,舊能力就可能往下跌。模型不是在白紙上畫(huà)新東西,而是在一本已經(jīng)寫(xiě)得密密麻麻的冊(cè)子上繼續(xù)涂抹。所以大模型真正缺的,不是更長(zhǎng)的上下文,也不是更大的外掛數(shù)據(jù)庫(kù),而是一條把短期經(jīng)驗(yàn)沉淀為長(zhǎng)期知識(shí),又不把舊帳全翻亂的通道。
“清醒-睡眠”循環(huán),到底怎么設(shè)計(jì)的?
團(tuán)隊(duì)把它拆成了兩個(gè)大階段。清醒階段,模型只管快速適應(yīng),不急著改自己的參數(shù);等到任務(wù)告一段落,再轉(zhuǎn)入睡眠階段集中整理。睡眠的第一件事不是生成更多內(nèi)容,而是把已經(jīng)掌握的新信息挪到一個(gè)更安全的地方存放,這就是他們提出的 Knowledge Seeding,直譯過(guò)來(lái)叫“知識(shí)播種”。
這個(gè)方法有意思的地方在于,它沒(méi)有直接在現(xiàn)有參數(shù)上反復(fù)覆蓋。傳統(tǒng)微調(diào)就像在同一頁(yè)紙上反復(fù)擦寫(xiě),寫(xiě)得越多,舊痕跡越模糊。知識(shí)播種則是給模型增加新的參數(shù)頁(yè),讓新知識(shí)擁有相對(duì)獨(dú)立的空間。已經(jīng)掌握近期信息的模型狀態(tài)充當(dāng)教師,負(fù)責(zé)把新知識(shí)遷移到容量更大的模型狀態(tài)中;原有參數(shù)盡量保持不動(dòng),新參數(shù)專(zhuān)門(mén)接住新知識(shí)。
這么做的好處,是把持續(xù)學(xué)習(xí)里最難調(diào)和的兩個(gè)要求——穩(wěn)定和可塑——分到不同時(shí)間處理。太穩(wěn)定,學(xué)不動(dòng)新東西;太容易變,又會(huì)不斷忘掉舊的。清醒時(shí)就讓它變得足夠可塑,快速應(yīng)對(duì)當(dāng)前任務(wù);睡眠時(shí)把更新速度放慢,把短期知識(shí)安安穩(wěn)穩(wěn)地搬到長(zhǎng)期空間里。遷移完成后,負(fù)責(zé)快速學(xué)習(xí)的部分又能被清空釋放,給下一批信息留出位置。
說(shuō)到底,持續(xù)學(xué)習(xí)不等于要把每一條信息都永久存檔。真正聰明的記憶,應(yīng)該分清楚哪些內(nèi)容只在當(dāng)下有用,哪些經(jīng)驗(yàn)值得留一段時(shí)間,哪些知識(shí)必須寫(xiě)進(jìn)長(zhǎng)期參數(shù)。模型需要判斷的,不只是“記不記得”,還要算清“該記多久”“存在哪里”以及“會(huì)不會(huì)跟已有能力打架”。從這個(gè)角度看,睡眠更像一次內(nèi)部復(fù)盤(pán)與重新歸檔,而不是一次輕率的更新。
模型不光要睡覺(jué),還得會(huì)“做夢(mèng)”
把知識(shí)存下來(lái)了,不等于模型真的會(huì)用了。團(tuán)隊(duì)在睡眠階段還加了一個(gè)環(huán)節(jié),直接管它叫 Dreaming——“做夢(mèng)”。這里的“做夢(mèng)”一點(diǎn)都不神秘,就是讓模型圍繞自己剛學(xué)到的知識(shí),自己給自己出題。比如,剛掌握了一種新的推理方法,它可以自動(dòng)生成一組難度不同的任務(wù),檢查自己能不能在新場(chǎng)景里繼續(xù)用這套方法。如果發(fā)現(xiàn)某類(lèi)題目答得磕磕絆絆,它就再多生成一批相關(guān)樣本,專(zhuān)門(mén)補(bǔ)這塊短板。
這種自我出題、自我訓(xùn)練的思路,對(duì)于 AI Agent 尤其關(guān)鍵。想象一個(gè)編程 Agent,連續(xù)好幾次在同類(lèi)依賴(lài)沖突上報(bào)錯(cuò)。傳統(tǒng)系統(tǒng)最多把失敗日志存下來(lái),下次再遇到時(shí),模型還得重新讀日志、重新分析,根本談不上“長(zhǎng)記性”。但有了做夢(mèng)能力,Agent 就能?chē)@這些失敗,生成一整套變體任務(wù),練習(xí)怎么識(shí)別陷阱、怎么選擇方案、怎么提前繞開(kāi)錯(cuò)誤。一次真實(shí)任務(wù)不再只產(chǎn)出一個(gè)答案,還可能變成下一輪自我訓(xùn)練的起點(diǎn)。
這其實(shí)慢慢模糊了“使用”和“訓(xùn)練”之間的邊界。過(guò)去開(kāi)發(fā)者的數(shù)據(jù)集搞完,模型的能力基本就封頂了。現(xiàn)在模型在工作中攢下的經(jīng)驗(yàn),經(jīng)過(guò)整理之后可以重新灌進(jìn)訓(xùn)練流程。但同時(shí),讓模型自己給自己出題也有一個(gè)大隱患:如果它最開(kāi)始的認(rèn)知就是歪的,后續(xù)生成的數(shù)據(jù)很可能在錯(cuò)誤的基礎(chǔ)上繼續(xù)搭積木。反復(fù)訓(xùn)練不會(huì)自動(dòng)糾偏,反而可能把錯(cuò)誤越練越扎實(shí)。
所以“做夢(mèng)”不能只是狂生成數(shù)據(jù),還得有一套質(zhì)檢機(jī)制:哪些樣本真有用?哪些只是重復(fù)?哪些帶著系統(tǒng)性錯(cuò)誤?外部驗(yàn)證、獎(jiǎng)勵(lì)評(píng)估、能力測(cè)試和版本回滾都缺一不可。一個(gè)真正會(huì)學(xué)習(xí)的模型,不光是能給自己出卷子,還得知道自己哪里薄弱、練習(xí)到底有沒(méi)有效果,以及更新完會(huì)不會(huì)把其他能力帶崩。
持續(xù)學(xué)習(xí),會(huì)把大模型變成什么樣子?
現(xiàn)在主流的模式,是把大模型當(dāng)成一件集中生產(chǎn)的產(chǎn)品:預(yù)訓(xùn)練、微調(diào)、安全對(duì)齊,搞完就發(fā)布一個(gè)相對(duì)固定的版本。上線后負(fù)責(zé)回答問(wèn)題,能力更新全靠下一次重新訓(xùn)練。但“清醒-睡眠”循環(huán)一旦跑通,這套邏輯就變了。模型在工作中不斷接觸新任務(wù),在睡眠中消化并更新自己,再以新?tīng)顟B(tài)繼續(xù)工作。發(fā)布時(shí)的能力不再是全部上限,部署后的經(jīng)歷會(huì)實(shí)實(shí)在在地影響它的成長(zhǎng)曲線。
這也會(huì)改變行業(yè)評(píng)價(jià)模型的方式。過(guò)去衡量模型好不好,主要看參數(shù)規(guī)模、上下文長(zhǎng)度、推理速度和各種基準(zhǔn)分?jǐn)?shù),測(cè)的都是發(fā)布那一瞬間的爆發(fā)力。而持續(xù)學(xué)習(xí)模型還需要接住另一組拷問(wèn):上線半年究竟學(xué)到了什么?吸收新知識(shí)的時(shí)候有沒(méi)有忘掉舊能力?錯(cuò)誤更新能不能被安全回滾?成長(zhǎng)的穩(wěn)定性與可糾錯(cuò)性,可能會(huì)變得和初始性能一樣重要。
從這個(gè)意義上看,Google 這篇論文戳中的,不只是技術(shù)上的一個(gè)漏洞,更是在提醒所有人:如果模型只能不停干活卻從不整理經(jīng)驗(yàn),那么跑得再快也只是在原地打轉(zhuǎn)。給模型加一個(gè)“睡覺(jué)”階段,或許正是讓大模型從“聰明但健忘”走向“真正會(huì)學(xué)習(xí)”的關(guān)鍵一步。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.