現在AI圈有個誤會流傳得挺廣——上下文窗口越大,模型“記性”就越好。這個說法聽起來順理成章,但差了一個關鍵維度。上下文窗口決定的是模型在一次推理中能同時參考多少信息,它不管之前發生過什么,也不管什么信息將來值得被記住。它管的只是眼前這一步。
如果把AI的整個記憶架構攤開來看,更容易把這件事說清楚。這里有一個現成的參照系,做系統工程的人每天都打交道:存儲層級。每一層存在的目的截然不同,把它們混在一起,就是絕大多數“記憶”概念混亂的起點。
![]()
CPU緩存速度極快,但天生就是臨時的。數據不斷流過緩存,因為處理器干活時需要立刻拿到這些東西,沒打算讓它們長住。上下文窗口扮演的角色非常相似。它裝載當前推理步驟需要的信息,推理一結束,那個工作狀態就沒了——除非有別的組件特意把其中某些東西保留下來。所以更準確的理解是,上下文窗口是一塊“執行工作面”,而不是一套記憶系統。思考在這里發生,但知識不在這里定居。上下文是借來的,記憶是篩選積累下來的。一個只存在于推理進行期間,另一個的存在意義,就是讓推理不必每次都從頭再來。
緩存類比要成立,底下的層級必須是真實可辨識的,值得一個一個說清楚。
第一層是“活躍工作記憶”,相當于系統內存。檢索到的文檔、工具返回的結果、為當前任務拼裝好的中間狀態,都在這一層。它比單條緩存活得久,但熬不過整個會話。
第二層是“持久記憶”,相當于文件系統。那些被有意寫下來的決策、證據和領域知識,存放在這里,以便在生成它們的提示詞早已消失之后仍然能被調取。不是所有模型輸出都有資格進入這一層,只有被判斷值得長期保留的才行。
第三層是“推理賬本”,相當于Git提交歷史。它記錄的不僅是系統知道了什么,更重要的是它是怎么知道的——包括隨版本迭代累積下來的修訂和糾正。這一層的反面是所謂的“數字閣樓”,就是把原始日志一股腦存進倉庫,指望哪天靠搜索把推理過程拼回來。那是一種反模式。推理賬本要求結構清晰、可追溯。
第四層是“寫入側保管鏈”,對進入持久記憶的每一條信息提出歸屬可查、可驗證、事后難以篡改的硬約束。沒有這一層,持久記憶的可信度無從談起。
上下文窗口在推理時與所有這些層級發生交互,但它本身不能替代其中任何一個。把這些層級搞混,在架構上就像指望CPU緩存去承擔文件系統的職責。只要進程一退出,這個幻想就結束了。
現在的模型確實把上下文窗口推到了數十萬、甚至數百萬token的量級,這個進展值得正視,但它消除不了一個老問題——散文稅。
散文稅,指的是從冗長、模糊、組織糟糕的信息里把真實意圖重新提取出來的成本。窗口變大,只是把你可以揮霍的預算額度調高了,完全不涉及你花得值不值。超過某個臨界點之后,多出來的空間反而會拖你的后腿。窗口被弱相關材料填滿時,信號密度會持續走低,模型從中間位置準確召回信息的能力也會跟著下降。窗口越大,越考驗你往里面放什么。放得不好,大窗口不是資產,是噪聲放大器。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.