![]()
新智元報道
![]()
最尷尬的一刻,往往不是AI PPT生成失敗。
而是它明明已經(jīng)生成了一套還不錯的slides,你只是說:「把第 8 頁右下角那塊改得更像流程圖。」
下一秒,第8頁可能確實改了,但第3頁標(biāo)題層級變了,第12頁配色也漂了,前面反復(fù)調(diào)好的風(fēng)格又被打散。
這才是真實PPT工作流里更常見的痛點。
第一版只是草稿,改稿才是主戰(zhàn)場。
從「生成一套」到「生成得像這個用戶」
過去幾年,自動幻燈片生成進(jìn)步很快。很多系統(tǒng)已經(jīng)可以從論文、產(chǎn)品說明或一句主題出發(fā),生成結(jié)構(gòu)完整、視覺上也不算粗糙的初稿。
但在真實使用里,第一版slides的關(guān)鍵不只是「有沒有生成出來」,而是它是不是已經(jīng)貼近某個用戶的表達(dá)習(xí)慣。
同一篇Transformer論文,可以被講成基礎(chǔ)教學(xué)課,也可以被組織成組會匯報、論文精讀或技術(shù)培訓(xùn)。不同用戶關(guān)心的頁面角色、內(nèi)容密度、證據(jù)邊界和機(jī)制展開方式都不一樣。有人希望先給結(jié)論和takeaways,有人更希望把定義、機(jī)制、邊界條件拆清楚。
這正是用戶畫像記憶在round-0階段的作用。
由北京郵電大學(xué)、清華大學(xué)、上海交通大學(xué)合作完成MemSlides 不是等到用戶反復(fù)修改之后才開始「記住」,而是在首輪生成時就會根據(jù)當(dāng)前任務(wù)意圖檢索用戶畫像,將兼容的長期偏好路由到當(dāng)前工作記憶里,用來影響頁面組織和表達(dá)方式。
![]()
論文鏈接: https://arxiv.org/abs/2606.17162
項目主頁: https://memslides.github.io/
演示鏈接: https://memslides.com/
代碼鏈接: https://github.com/huohua325/Memslides
HF鏈接: https://huggingface.co/papers/2606.17162
該工作登頂Hugging Face Daily Papers #1 Paper of the Day,GitHub已獲400+ stars;Demo website上線后也已吸引 100+ verified users試用。
圖1展示的不是一個泛泛的「生成效果圖」。它更像是在說明:系統(tǒng)如何把論文材料拆成定義、核心機(jī)制、實驗依據(jù)、常見誤區(qū)和邊界條件等頁面。這些選擇背后,對應(yīng)的就是用戶畫像中關(guān)于內(nèi)容結(jié)構(gòu)、信息密度和證據(jù)導(dǎo)向表達(dá)的偏好。
![]()
圖1:首輪生成不僅體現(xiàn)完整性,也體現(xiàn)用戶畫像記憶對頁面組織、內(nèi)容密度和證據(jù)邊界的影響。
項目也提供了在線Demo。用戶可以上傳材料、選擇memory profile或模板,生成初稿后繼續(xù)進(jìn)入revision,并下載當(dāng)前版本的PPTX、HTML或PDF。
也就是說,MemSlides面向的是從個性化初稿到后續(xù)持續(xù)修改的完整流程。
而一旦第一版已經(jīng)開始貼近用戶,后續(xù)問題就變得更尖銳:系統(tǒng)能否在多輪修改中繼續(xù)保留這些偏好?當(dāng)前會話里臨時提出的要求,會不會過幾輪就失效?用戶只想改一個局部區(qū)域時,系統(tǒng)能不能避免把已經(jīng)對齊的頁面重新打散?
讓記憶分工
很多人一聽到「Agent memory」,會自然想到:那就把歷史對話放進(jìn)更長的上下文里。
MemSlides 沒這么做。
原因很簡單:歷史越長,里面的沖突也越多。今天用戶說「這套報告用藍(lán)色標(biāo)題」,不代表他以后所有 PPT 都要藍(lán)色標(biāo)題;用戶在某次編輯里遇到的工具錯誤,也不應(yīng)該和「他喜歡什么風(fēng)格」混在一起。
因此,MemSlides 把個性化幻燈片生成建模成一個有狀態(tài)的 authoring process:系統(tǒng)先根據(jù)源材料、用戶畫像記憶和可選模板生成 round-0 初稿;之后每一輪反饋都會更新當(dāng)前 session state,再圍繞當(dāng)前 deck 做局部編輯。
它的記憶組織有兩個視角。
從生命周期看,有長期記憶和工作記憶。長期記憶保存跨任務(wù)穩(wěn)定存在的信息,工作記憶保存當(dāng)前 deck 中仍然有效的臨時約束、修改目標(biāo)和執(zhí)行狀態(tài)。
從功能角色看,有用戶畫像記憶和工具記憶。前者回答「這套 slides 應(yīng)該體現(xiàn)什么偏好」,后者回答「Agent 應(yīng)該怎么改得更穩(wěn)」。
換句話說,MemSlides 不是讓 Agent 記住更多廢話,而是讓它知道哪些信息該長期保留,哪些只在當(dāng)前任務(wù)里生效,哪些屬于用戶偏好,哪些屬于工具經(jīng)驗。
![]()
圖2:MemSlides 將長期記憶、工作記憶、用戶畫像記憶和工具記憶組織到同一個多輪改稿流程中。
用戶畫像
真正的個性化,通常不是一句 role prompt 能解決的。
同樣是學(xué)術(shù)匯報,有人喜歡每頁只放一個核心結(jié)論,有人會保留公式和實驗細(xì)節(jié);同樣是商業(yè)路演,有人偏好高密度表格,有人更依賴趨勢圖和對比圖。
這些差異不是一次 prompt 里的標(biāo)簽,而是用戶在長期寫作和修改中慢慢暴露出來的習(xí)慣。
MemSlides 用用戶畫像記憶來保存這類跨任務(wù)偏好。它不是把 profile 整塊貼到 prompt 前面,而是在任務(wù)開始時根據(jù)當(dāng)前 intent 檢索相關(guān)偏好,再與本輪請求做協(xié)調(diào)。
如果長期偏好和當(dāng)前明確指令兼容,它們會一起進(jìn)入工作記憶;如果發(fā)生沖突,當(dāng)前這套 slides 的明確要求優(yōu)先。
這一步很重要。否則,系統(tǒng)很容易把「這次臨時想要藍(lán)色標(biāo)題」誤當(dāng)成「用戶永遠(yuǎn)喜歡藍(lán)色標(biāo)題」。
任務(wù)結(jié)束后,MemSlides 也不會把每一句反饋都寫回長期畫像。它只沉淀穩(wěn)定、可遷移的交互信號,讓下一次生成更貼近用戶,而不是更混亂。
![]()
圖3:用戶畫像記憶會經(jīng)歷檢索、路由、當(dāng)前任務(wù)使用和任務(wù)結(jié)束后的穩(wěn)定信號沉淀。
工作記憶
多輪改稿里,還有一類信息更微妙。
它不是長期偏好,卻必須在當(dāng)前 deck 里持續(xù)有效。
比如用戶在第2輪說:「后面如果新增 summary/tip box,就用淺灰背景。」當(dāng)時系統(tǒng)還沒有新增這類元素,所以這條要求沒有立刻執(zhí)行對象。幾輪之后,如果用戶要求插入帶 summary box 的頁面,這條規(guī)則就應(yīng)該被觸發(fā)。
如果Agent只看當(dāng)前輪輸入,就很容易把這類延遲生效的約束忘掉。
MemSlides的工作記憶就是當(dāng)前寫作任務(wù)的狀態(tài)板:active temporary preferences、carryover instructions、resolved targets、coverage status 都放在這里。Plan 階段讀取這些狀態(tài)來確定修改范圍,Act 階段據(jù)此執(zhí)行受限編輯,Guard 階段再更新檢查結(jié)果。
這讓多輪修改不再是彼此孤立的一次次 prompt,而是圍繞同一套 slides 持續(xù)推進(jìn)的編輯過程。
![]()
圖4:工作記憶讓早先提出、后續(xù)才觸發(fā)的臨時樣式偏好繼續(xù)生效。
只改該改的地方
對人類編輯來說,「只改這一處」是一句很自然的話。
對生成式系統(tǒng)來說,這句話卻很難。
因為很多系統(tǒng)在處理反饋時,會重新讀取或重寫大范圍內(nèi)容。結(jié)果就是目標(biāo)區(qū)域改對了,但非目標(biāo)頁面也發(fā)生變化。用戶看上去只提了一個小要求,系統(tǒng)卻把整套 PPT 的狀態(tài)重新打散。
MemSlides用scoped slide-local revision來約束這個問題。
每次反饋先被映射到最小有效修改區(qū)域,然后進(jìn)入Plan-Act-Guard流程。
Plan階段把自然語言請求轉(zhuǎn)成execution contract,明確目標(biāo)slide、作用范圍、selector hints 和覆蓋要求。
Act階段根據(jù)頁面結(jié)構(gòu)選擇編輯工具,并在受限范圍內(nèi)執(zhí)行最小有效操作。Guard 階段把「完成」變成一個需要檢查的狀態(tài):目標(biāo)沒覆蓋不能草率finalize,snapshot 過期需要重新綁定,局部請求也不應(yīng)被擴(kuò)展成整套deck的重寫。
這一步把「模型覺得自己改完了」,變成「系統(tǒng)能檢查這次修改是否真的覆蓋目標(biāo)、是否越界」。
![]()
圖5:Plan-Act-Guard 將局部修改拆成范圍規(guī)劃、受控執(zhí)行和結(jié)果檢查。
工具記憶
Slides編輯不是純文本改寫。
一個局部修改可能涉及頁面結(jié)構(gòu)、選擇器、樣式規(guī)則、布局快照和驗證邏輯。Agent 即使理解了用戶想要什么,也可能在工具調(diào)用時讀錯區(qū)域、重復(fù)試錯、擴(kuò)大修改范圍,或者在目標(biāo)尚未覆蓋時提前結(jié)束。
所以,MemSlides 還引入了工具記憶。
工具記憶不記錄「用戶喜歡什么」,而是記錄「類似編輯任務(wù)里,什么執(zhí)行路徑有效,什么錯誤應(yīng)該避免」。
論文將其組織成兩種粒度:round-scope task experience 記錄一輪修改中的經(jīng)驗、錯誤總結(jié)和可遷移模式;operation-scope tool-chain experience 保存更細(xì)粒度的 reasoning-tool-observation 片段,在相似工具調(diào)用前被檢索出來作為參考。
這種設(shè)計把目標(biāo)和執(zhí)行分開了。
用戶畫像決定 slides 應(yīng)該往什么方向變,工具記憶則讓 Agent 少走彎路,減少無效探索和執(zhí)行不確定性。
![]()
圖6:工具記憶關(guān)注的是工具調(diào)用經(jīng)驗,而不是用戶審美偏好。
實驗結(jié)果
MemSlides 的評估沒有只給一個總體生成分?jǐn)?shù),而是把不同記憶組件對應(yīng)的能力拆開驗證:用戶畫像記憶對應(yīng) round-0 persona alignment,工作記憶對應(yīng)多輪會話中的 delayed preference carryover,工具記憶則在 diagnostic matched-pair modify setting 中隔離驗證。
在個性化生成上,用戶畫像記憶提升了多 persona、多 intent 設(shè)置下的 persona alignment。論文進(jìn)一步指出,這種提升不僅體現(xiàn)在「更像某個模板」,也體現(xiàn)在內(nèi)容重點、頁面角色、證據(jù)組織和 persona 區(qū)分等規(guī)劃層面的選擇。
在局部修改的配對診斷中,工具記憶帶來的變化更直接:
![]()
同時,core tool time ratio降至0.327x。
需要注意的是,這些數(shù)字來自診斷性matched-pair modify setting,不能被解讀為所有場景下單調(diào)領(lǐng)先。更準(zhǔn)確地說,它們支持的是一個過程性結(jié)論:當(dāng)工具記憶提供可復(fù)用執(zhí)行經(jīng)驗時,Agent在閉環(huán)完成、嚴(yán)格驗證和找到首次正確編輯路徑上更容易收斂。
![]()
圖7:局部編輯對比是論文中的定性案例,用來展示工具記憶注入前后編輯過程的差異。
PPT Agent的下一步
是長期協(xié)作
MemSlides討論的是PPT,但它背后的問題不只屬于PPT。
當(dāng) Agent 進(jìn)入文檔生成、代碼修改、數(shù)據(jù)分析、企業(yè)知識系統(tǒng)等長周期任務(wù)時,都會遇到類似挑戰(zhàn):哪些信息應(yīng)該長期保留,哪些狀態(tài)只屬于當(dāng)前任務(wù),哪些執(zhí)行經(jīng)驗可以復(fù)用,哪些內(nèi)容在局部修改時必須保持不變。
如果說一鍵生成解決的是從0到1,那么多輪修改考驗的是從1到可用。
未來的Slides Agent,不只要會生成更漂亮的第一頁,還要能在反復(fù)改稿中持續(xù)理解用戶、保持編輯邊界,并讓一套slides穩(wěn)定地向用戶真正想要的版本靠近。
參考資料:
https://arxiv.org/abs/2606.17162
編輯:LRST
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.