![]()
投稿作者:MemSlides 團隊
AI 生成 PPT,已經不再只是演示型功能。
現在,很多系統都可以根據一篇論文、一份報告或一句主題說明生成完整 slides。問題在于,真實寫作很少停在第一版。用戶會繼續調整頁面順序、內容密度、視覺風格和局部元素;更麻煩的是,有些偏好不是一開始就完整說清楚,而是在后續修改中逐漸暴露出來。
這就帶來一個更具體的問題:Slides Agent 不僅要理解當前 prompt,還要知道哪些偏好屬于用戶長期習慣,哪些約束只在當前任務內有效,以及當用戶要求修改某個區域時,哪些內容不應該被牽動。對于 AI PPT 來說,記憶不再只是聊天記錄的附屬品,而是決定多輪協作能否穩定進行的基礎能力。
針對這一問題,北京郵電大學、清華大學、上海交通大學合作提出 MemSlides,一個面向個性化幻燈片生成與多輪局部修改的層次化記憶驅動 Agent 框架。它把 PPT 創作看成一個帶狀態的持續編輯過程:先利用用戶畫像記憶生成個性化初稿,再在多輪反饋中維護工作記憶,并借助工具記憶提升局部修改的可靠性。
![]()
論文鏈接:https://arxiv.org/pdf/2606.17162
GitHub 地址:https://github.com/huohua325/Memslides
項目網站:https://memslides.github.io/
MemSlides 的研究意義在于,它沒有把 AI PPT 生成簡單看作一次 source-to-slides 轉換,而是把“生成后的持續修改”納入系統設計。換句話說,論文關注的不是讓模型多記一點歷史對話,而是讓 Slides Agent 學會區分、維護和調用不同類型的記憶。
MemSlides 是如何設計記憶的?
MemSlides 的方法可以概括為兩條主線:一條是記憶如何組織,另一條是修改如何執行。前者回答“系統應該記住什么”,后者回答“系統應該怎樣在不破壞已有內容的情況下完成編輯”。
![]()
圖|MemSlides 將長期記憶與工作記憶結合,用于個性化生成和多輪局部修改。
在記憶組織上,MemSlides 從生命周期和功能角色兩個視角進行建模。生命周期上,長期記憶保存跨任務穩定存在的信息,工作記憶維護當前 deck 內仍然有效的臨時約束、反饋狀態和修改進度。功能角色上,用戶畫像記憶關注 slides 應該體現什么樣的偏好,工具記憶則關注 agent 應該如何更穩定地執行編輯。
這個區分很關鍵。用戶畫像記憶并不是一個固定貼在 prompt 前面的 profile,而是按照任務意圖被檢索、篩選和路由。比如,同一個用戶在學術匯報和商業路演中可能偏好完全不同的頁面結構;系統需要根據當前 intent 選擇相關偏好,并與本輪請求進行協調。如果當前請求和長期偏好沖突,當前請求應該在這套 deck 中優先。
![]()
圖|用戶畫像記憶會經歷檢索、路由、當前任務使用和任務結束后的穩定信號沉淀。
任務結束后,MemSlides 也不會把所有反饋直接寫入長期記憶。論文采用 consolidation 的思路,只將穩定、可遷移的交互信號更新到用戶畫像中。這避免了一個常見問題:用戶在某次任務中臨時提出的要求,被系統誤當作長期偏好,在后續任務中反復出現。
工作記憶則處理另一類問題:有些約束不屬于長期偏好,卻必須在當前會話中跨輪延續。例如用戶說“后面新增頁面的標題都用藍色”,這條指令在當前輪可能沒有立即執行對象,但幾輪之后新增 slides 時仍然應該生效。MemSlides 將這類 active temporary preferences、carryover instructions、resolved targets 和 coverage status 保存在工作記憶中,使多輪修改成為同一個任務狀態上的連續編輯。
![]()
圖|工作記憶負責保存當前 deck 內仍然有效的臨時偏好和修改狀態。
與偏好記憶不同,工具記憶記錄的是執行經驗。Slides 編輯通常涉及頁面結構、選擇器、樣式規則、布局快照和工具調用;即使模型知道用戶想要什么,也可能因為讀錯區域、擴大修改范圍或提前結束驗證而造成錯誤。MemSlides 因此把工具執行經驗分為任務級和操作級兩類:前者沉淀一輪修改中的錯誤總結與可遷移經驗,后者保存更細粒度的 reasoning-tool-observation 片段,用于相似工具調用前的參考。
![]()
圖|工具記憶不決定 slides 的偏好方向,而是幫助 agent 在編輯過程中減少重復試錯。
在局部修改上,MemSlides 引入 scoped slide-local revision。系統不會在每次反饋后重新讀取或重寫整套 PPT,而是先將自然語言請求映射到最小有效修改區域,再通過 Plan-Act-Guard 流程完成編輯。Plan 階段形成 execution contract,明確目標頁面、作用范圍和覆蓋要求;Act 階段根據頁面結構執行受約束的編輯操作;Guard 階段檢查目標是否被正確覆蓋,并避免過早 finalize。
![]()
圖|Plan-Act-Guard 將局部修改拆解為范圍規劃、受控執行和結果檢查三個階段。
這一設計的出發點很樸素:當用戶只想修改一個局部區域時,系統應該盡量只動這個區域。對于已經對齊的頁面內容,保持穩定本身就是一種能力。
個性化與局部修改效果如何?
論文從個性化初稿生成、會話內偏好延續和局部修改可靠性三個角度評估 MemSlides。
在個性化生成方面,論文構建了多 persona、多 intent 的用戶畫像評估設置,并使用 persona-alignment judgments 衡量生成結果是否符合用戶角色與任務意圖。結果顯示,用戶畫像記憶能夠提升 round-0 初始生成階段的 persona alignment。進一步分析表明,這種提升不只是模板匹配或視覺潤色帶來的,而是體現在內容重點、頁面結構、證據組織和角色區分等更接近規劃層面的維度。
在一般 PPT 質量上,論文還進行了 DeepPresenter-style quality check,用于觀察 persona alignment 的提升是否以犧牲普通生成質量為代價。結果顯示,MemSlides 在增強個性化對齊的同時,仍保持了有競爭力的整體 deck 質量。這一點對于實際應用很重要:個性化不應只是更“像某個人”,還要生成一套基本可用、結構完整的 slides。
在工作記憶方面,論文通過定性案例展示了 delayed preference carryover。也就是說,某些用戶偏好在提出時未必立刻可執行,但當后續操作觸發相關條件時,系統仍然可以將其應用到當前 deck 中。這類能力說明,工作記憶承擔的是會話級狀態維護,而不是長期用戶畫像的簡單替代。
局部修改的實驗采用 diagnostic matched-pair modify setting,隔離是否注入工具記憶這一變量。結果顯示,在該診斷設置中,工具記憶將 closed-loop completion 從 0.815 提升到 0.963,將 strict verification 從 0.310 提升到 0.534,并將首次正確編輯時間從 609.5s 降低到 242.5s。這些指標并不只是看“最終有沒有改對”,而是進一步關注修改閉環、驗證嚴格性和找到正確編輯路徑的效率。
![]()
圖|在局部修改示例中,MemSlides 更集中地修改目標元素,并減少非目標區域變化。
需要注意的是,論文并沒有把結果解釋為所有場景下的單調領先。工具記憶在不同配對任務中的收益仍存在差異,部分指標也會受到任務難度和模型行為影響。更準確地說,這些結果支持了一個診斷性結論:當編輯過程被限定在局部范圍內,并引入可復用工具經驗時,Slides Agent 更容易形成可驗證、可收斂的修改路徑。
不足與未來方向
MemSlides 當前主要在受控實驗和診斷性設置中驗證記憶機制的作用。與此同時,Demo website 的實際使用用戶已超過 100 位,并且每天仍有新增用戶。
未來,團隊也計劃結合更多真實使用反饋,進一步研究長期用戶交互下的記憶治理問題,包括用戶如何查看、編輯和刪除已保存偏好,系統如何避免保存敏感或過時信息,以及當長期畫像與當前任務沖突時如何給出可解釋的處理。
局部修改的評估也仍有擴展空間。對于 PPT 創作來說,任務成功并不是唯一指標;修改范圍、非目標內容漂移、用戶滿意度、跨輪編輯成本和可恢復性,都可能影響真實體驗。未來的 Slides Agent 評測需要更細地刻畫“改對了什么”和“沒有誤改什么”。
從更大的方向看,MemSlides 提示了一個值得繼續研究的問題:當生成式 Agent 從單輪產出走向長期協作,記憶應當成為系統結構的一部分,而不是簡單堆疊在上下文中的歷史文本。對 AI PPT 而言,下一步競爭也許不只是誰能生成更漂亮的第一頁,而是誰能在反復修改中持續理解用戶、保持邊界,并讓一套 slides 穩定地向用戶真正想要的版本靠近。
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.