![]()
擴(kuò)散語(yǔ)言模型展現(xiàn)出較高的發(fā)展?jié)摿Γ诖a等形式語(yǔ)言生成任務(wù)中,仍難以穩(wěn)定滿(mǎn)足語(yǔ)法約束。
針對(duì)這一問(wèn)題,本文提出了針對(duì)擴(kuò)散語(yǔ)言模型約束解碼方法 —— LAVE,通過(guò)對(duì)擴(kuò)散語(yǔ)言模型的中間輸出進(jìn)行前瞻補(bǔ)全與語(yǔ)法驗(yàn)證,為模型生成過(guò)程提供了可靠的語(yǔ)法保障。
實(shí)驗(yàn)表明,LAVE 能夠顯著提升多種擴(kuò)散語(yǔ)言模型生成形式化語(yǔ)言(例如源代碼、JSON、化學(xué)表達(dá)式)的語(yǔ)法正確率,同時(shí)改善功能正確率,并保持較低的推理開(kāi)銷(xiāo)。相關(guān)論文已被軟件工程頂會(huì) ISSTA 2026 接收,代碼已開(kāi)源。
本研究由清華大學(xué)人工智能學(xué)院 AI Agent 課題組完成。通訊作者為清華大學(xué)人工智能學(xué)院李佳助理教授,主要研究方向包括 AI Agent、AI Safety、Software Engineering 等。第一作者張奕彤為清華大學(xué)人工智能學(xué)院 2026 級(jí)直博生,主要研究方向?yàn)?AI Safety。
![]()
- 論文標(biāo)題:Lookahead-then-Verify: Reliable Constrained Decoding for Diffusion LLMs under Context-Free Grammars
- 論文鏈接:https://arxiv.org/pdf/2602.00612
- 代碼鏈接:https://github.com/THU-Agent/LAVE
研究背景
擴(kuò)散語(yǔ)言模型正在成為自回歸語(yǔ)言模型之外一條具有發(fā)展?jié)摿Φ募夹g(shù)路線。自回歸語(yǔ)言模型按照從左到右的順序逐個(gè)生成 token;擴(kuò)散語(yǔ)言模型則從一段由 [MASK] 構(gòu)成的序列出發(fā)以非順序的方式生成 token。由于一次前向傳播可以同時(shí)預(yù)測(cè)所有位置的 token 概率分布,擴(kuò)散語(yǔ)言模型天然地具有并行解碼和高效推理的潛力,催生了 LLaDA、Dream 和 Gemini Diffusion 等擴(kuò)散語(yǔ)言模型的出現(xiàn)。
![]()
隨著擴(kuò)散語(yǔ)言模型逐漸被用于代碼、JSON 和 SMILES 等形式語(yǔ)言生成任務(wù),其輸出能否符合語(yǔ)法約束成為影響其實(shí)際應(yīng)用的重要因素。對(duì)于這些形式語(yǔ)言,任何語(yǔ)法錯(cuò)誤都會(huì)導(dǎo)致輸出無(wú)法使用。論文的初步實(shí)驗(yàn)顯示,流行的擴(kuò)散語(yǔ)言模型 Dream-7B 在 HumanEval-CPP 上的語(yǔ)法錯(cuò)誤率高達(dá) 23.8%,說(shuō)明現(xiàn)有擴(kuò)散語(yǔ)言模型仍難以穩(wěn)定生成符合語(yǔ)法約束的輸出。
約束解碼是提高形式語(yǔ)言生成語(yǔ)法正確性的常用方法,被廣泛用于提高自回歸語(yǔ)言模型的生成結(jié)果可靠性。它在推理過(guò)程中引入目標(biāo)語(yǔ)法,并根據(jù)當(dāng)前生成狀態(tài)實(shí)時(shí)地限制下一步允許生成的 token 集合,使中間輸出始終保留擴(kuò)展為合法輸出的可能。對(duì)于代碼、JSON、SMILES 等多數(shù)形式語(yǔ)言,上下文無(wú)關(guān)文法(Context-Free Grammar)可以基本描述其語(yǔ)法,上下文無(wú)關(guān)文法的語(yǔ)法解析器(如 Earley Parser)則可以判定一個(gè)中間輸出是否仍能擴(kuò)展為符合語(yǔ)法約束的完整輸出。
在自回歸語(yǔ)言模型中,約束解碼實(shí)現(xiàn)起來(lái)較為直接。模型始終從左向右生成,因此任意時(shí)刻的中間輸出都是一個(gè)不含空缺的完整前綴。語(yǔ)法解析器可以直接判斷該前綴是否可擴(kuò)展,并據(jù)此確定下一步允許生成的 token。擴(kuò)散語(yǔ)言模型的中間輸出則常常是包含空缺的不完整前綴。例如:
![]()
此時(shí),已經(jīng)生成的中間輸出中仍保留若干 [MASK]。現(xiàn)有語(yǔ)法解析器通常只能處理不含 [MASK] 的完整前綴,因而無(wú)法直接判定這類(lèi)不完整前綴是否仍能補(bǔ)全為符合語(yǔ)法約束的完整輸出。
解決了什么問(wèn)題?
論文研究的核心問(wèn)題是:
給定一個(gè)含有 [MASK] 的不完整前綴,如何判斷是否存在一種補(bǔ)全,使補(bǔ)全后的完整前綴仍可擴(kuò)展為符合語(yǔ)法約束的完整輸出?
例如,對(duì)于下面的不完整前綴:
![]()
一種合法的補(bǔ)全是:
![]()
由于 return a > b ? a : b 可以被擴(kuò)展為符合語(yǔ)法約束的完整輸出,因此自然地 return a [MASK] b ? [MASK] : b 也可以擴(kuò)展為符合語(yǔ)法約束的完整輸出。
然而,直接枚舉所有補(bǔ)全并不可行。前綴中的每個(gè) [MASK] 都可能對(duì)應(yīng)詞表中的大量 token (如 100000 規(guī)模的詞表),多個(gè)位置組合后會(huì)形成指數(shù)規(guī)模的候選空間,在實(shí)踐中不可行。因此,實(shí)際挑戰(zhàn)在于:如何利用有限的計(jì)算開(kāi)銷(xiāo),找到一個(gè)能夠證明當(dāng)前前綴仍然可擴(kuò)展的補(bǔ)全。
提出了什么方法?
針對(duì)上述問(wèn)題,論文提出了LAVE。其核心思想是Lookahead-then-Verify即 "先前瞻,再驗(yàn)證"
擴(kuò)散語(yǔ)言模型在一次前向傳播中,會(huì)同時(shí)給出所有位置的 token 概率分布。LAVE 利用這些概率分布,為當(dāng)前不完整前綴生成若干高概率的候選補(bǔ)全,再使用語(yǔ)法解析器驗(yàn)證補(bǔ)全后的完整前綴是否可擴(kuò)展。
![]()
具體而言,當(dāng)模型在某個(gè) [MASK] 位置生成一個(gè)新 token 后,LAVE 首先將該 token 暫時(shí)寫(xiě)入當(dāng)前輸出。隨后,算法找到最右側(cè)的已生成 token,并截取從輸出開(kāi)頭到該位置的內(nèi)容,作為當(dāng)前需要驗(yàn)證的不完整前綴。
對(duì)于其中剩余的 [MASK],LAVE 根據(jù)模型預(yù)測(cè)的概率分布進(jìn)行采樣。例如:
![]()
可能被補(bǔ)全為:
![]()
這些候選已經(jīng)不含 [MASK],可以直接交給語(yǔ)法解析器。語(yǔ)法解析器并行地檢查每個(gè)候選是否仍能擴(kuò)展為符合語(yǔ)法約束的完整輸出。
只要存在任意一個(gè)候選通過(guò)驗(yàn)證,當(dāng)前新提出的 token 就會(huì)被接受;如果所有候選都不可擴(kuò)展,該 token 將被拒絕,模型將會(huì)重新生成新的 token。
實(shí)驗(yàn)結(jié)果與分析
研究團(tuán)隊(duì)在 LLaDA-8B、LLaDA-1.5、Dream-7B 和 DiffuCoder-7B 四個(gè)有代表性的擴(kuò)散語(yǔ)言模型上進(jìn)行了評(píng)測(cè),實(shí)驗(yàn)覆蓋 C++、JAVA、GO、JSON 和 SMILES 等形式語(yǔ)言的生成任務(wù)。
![]()
- 結(jié)果顯示,LAVE 在不同模型和任務(wù)上均顯著提高了語(yǔ)法正確率。四個(gè)模型在五項(xiàng)任務(wù)上的平均語(yǔ)法正確率均接近 100%。
![]()
- 語(yǔ)法正確率的提高也帶來(lái)了功能正確率的提升。例如,在 Dream-7B 的 C++ 任務(wù)上,功能正確率從 25.6% 提高到 33.5%。
![]()
- 在推理效率方面,LAVE 引入的額外開(kāi)銷(xiāo)總體有限。例如,與無(wú)約束生成相比,其平均推理時(shí)間在 JSON 任務(wù)上僅增加約 3%。在 SMILES 任務(wù)中,我們的方法減少了無(wú)關(guān)自然語(yǔ)言的生成,平均推理時(shí)間反而有所下降。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶(hù)上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.