![]()
文生圖模型一直在擴展模型、數據和算力,但訓練圖像所配 Caption 的信息量,卻很少被作為一個獨立變量系統研究。ByteDance Seed 團隊發現:自然語言 Caption 變長,并不意味著模型獲得了更多可用的視覺監督;相比長度,Caption 中與圖像綁定的信息量更能預測擴散模型最終達到的訓練損失。
基于這一發現,團隊提出 Structured Prompt,并從 Diffusability 與 Promptability 兩側共同提升文本條件,最終在復雜組合、推理和世界知識生成任務上取得顯著提升。
![]()
論文 Figure 1|自然語言長度很快飽和;結構化條件持續增加圖像信息,并沿統一關系降低擴散訓練損失。
過去幾年,文生圖模型的進步幾乎沿著一條熟悉的路線展開:更大的模型、更多的數據,以及更高的訓練算力。
但文生圖與語言模型之間存在一個容易被忽略的差異。語言模型可以直接從文本序列中進行自監督學習;文生圖模型則依賴圖像與 Caption 的配對,學習 “什么樣的文字對應什么樣的視覺內容”。圖像中可能包含大量物體、屬性、位置、動作和關系,但只有被 Caption 準確描述并清晰綁定的部分,才能作為文本條件監督傳遞給模型。
于是,一個基礎問題出現了:除了繼續擴大模型、數據和算力,我們能否通過增加 Caption 所攜帶的圖像信息,讓生成模型學得更好?
在這項新工作中,ByteDance Seed 團隊研究了這一問題。核心結論可以概括為一句話:
真正隨文本條件擴展的,不是 Caption 的 token 數量,而是其中可被模型利用的圖像信息。
![]()
- 論文標題: Scaling Properties of Text Conditioning in Visual Generation
- 作者: Zilong Chen, Chaorui Deng, Kunchang Li, Hongyi Yuan, Haoqi Fan 機構: ByteDance Seed
- 論文:https://arxiv.org/abs/2607.29679
- 項目主頁:https://heheyas.github.io/context-scaling
- 代碼:https://github.com/heheyas/context-scaling
- 模型:https://huggingface.co/collections/heheyas/context-scaling
- 在線 Demo:https://heheyas-context-scaling.hf.space/
- Hugging Face Paper:https://huggingface.co/papers/2607.29679
Prompt 變長了,
為什么模型沒有變強?
一個直覺做法,是把訓練 Caption 或用戶 Prompt 寫得更長、更詳細。更多 token 看起來應該意味著更多監督,也應該幫助模型生成更復雜的圖像。
實驗卻給出了不同答案。在多種現有開源文生圖系統上,自然語言 Prompt 隨長度增加很快飽和,最終輸出甚至低于各自最短 Prompt 的表現。即使專門在同一套長文本 Caption 上訓練擴散模型,收益也十分有限。
為了把這個現象看得更清楚,團隊設計了一個固定骨干網絡的圖像重建實驗。對于同一張參考圖像,團隊從同一份完整標注出發,生成四個詳細程度逐漸增加的自然語言 Caption,再使用相同的 Qwen-Image 模型和隨機種子嘗試還原該圖像。這些 Caption 描述相同的實體和關系,后續版本主要通過補充和展開自然語言表達來增加長度。
令人意外的是,Caption 雖然顯著變長,圖像重建質量卻幾乎不再提高。新增的 prose 更多是在解釋、改寫或連接已經出現的內容,并沒有持續增加新的、可穩定使用的視覺變量。
![]()
論文 Figure 3|固定骨干重建實驗:NL Caption 繼續變長后重建趨于飽和,逐步恢復 SP 字段則持續改善。
這說明,Caption 長度只是一個很弱的代理變量。一個文本可以寫得很長,卻仍然沒有清楚說明:某個屬性屬于哪個物體、兩個物體是什么關系、各自位于哪里,以及它們在畫面中的前后層次。
如何衡量 Caption 里真正的圖像信息?
如果 token 數量不足以衡量監督強弱,就需要直接測量 Caption 中與圖像綁定的信息。為此,團隊從已有工作中改造了兩個互補指標:Grounded Perplexity Gain(GPG)和 Effective Detailness(ED)。
GPG:圖像讓 Caption 變得 “更可預測” 多少。
GPG 是一個需要讀取模型 token 概率的白盒指標。對于同一句 Caption,團隊分別讓一個凍結的視覺語言模型看到和看不到配對圖像,并計算圖像出現后 Caption 內容 token 的對數似然提升。若 Caption 中包含大量與該圖像緊密綁定的信息,看到圖像應當顯著提高模型對這些 token 的預測能力。
ED:Caption 覆蓋了多少可靠的圖像屬性。
ED 是一個不依賴 token 概率的黑盒語義指標。它分別從圖像和 Caption 中提取帶有實體上下文的屬性,再計算 Caption 屬性的準確率與圖像屬性的召回率。最終采用更重視準確率的 F0.5,對 Caption 中沒有圖像依據的描述施加更強懲罰。
兩個指標從不同角度刻畫同一個問題:GPG 關注圖像與文本之間的統計依賴,ED 關注 Caption 是否準確覆蓋了可驗證的視覺內容。
![]()
論文 Figure 6|GPG 與 ED 的定義及測量趨勢。
Caption 信息量可以預測擴散模型的訓練損失
接下來,團隊固定圖像、模型架構、初始化方式、優化配置和訓練預算,只改變訓練 Caption。整個實驗包含 15 種 Caption 配置:三個不同長度的自然語言版本、六個逐步恢復字段的 Structured Prompt 版本,以及六個空間表達或字段遮蔽變體。每種配置都從同一個 BAGEL continued-training checkpoint 出發,獨立訓練一個擴散模型。
結果顯示,自然語言 Caption 的 token 數與訓練結果并不存在統一關系;但當橫軸換成 Caption 信息量后,不同格式和詳細程度的配置落在了高度規律的曲線上:
- 收斂后的 diffusion loss 與 GPG 近似呈線性關系,Pearson r = -0.984;
- 收斂后的 diffusion loss 與 ED 呈冪律趨勢,log-log 空間中的 Pearson r = -0.971;
- GPG 與 ED 對不同 Caption 配置的排序也高度一致,Spearman ρ = 0.96。
團隊將其稱為 text conditioning 的 scaling properties。它不是一個對所有模型都成立的理論定律,而是在固定架構與訓練 recipe 下得到的經驗標定。但它帶來了兩個直接價值。
第一,它把 Caption 信息量從一個模糊的 “數據質量” 概念,變成了可以控制和測量的訓練變量:在模型、圖像和算力不變時,信息量能夠預測模型最終達到的訓練損失。
第二,完成一次標定后,可以在同一訓練 recipe 下先用 GPG 或 ED 比較候選 Caption 方案,再決定是否投入昂貴的擴散模型訓練。對未參與擬合的六個 Caption 變體,兩個指標仍能較準確地預測其收斂損失。
![]()
論文 Figure 7|在固定訓練 recipe 下,收斂損失隨 Caption 信息量呈現穩定關系。
Structured Prompt:
讓信息不僅更多,而且更容易被模型使用
前面的實驗揭示了一個關鍵點:僅僅增加自然語言 prose 并不夠,新增信息還需要以穩定、明確的方式組織起來。
因此,團隊提出 Structured Prompt(SP),用結構化 JSON 表示一張圖像中的視覺變量。它包含三個層次:
- 全局層:畫面意圖、場景、氛圍、風格、光照和攝影信息;
- 元素層:每個主體的身份、屬性、動作、位置、可選深度和局部攝影信息;
- 關系層:不同元素之間的位置、遮擋、交互和語義關系。
與自由文本相比,SP 的關鍵不只是 “JSON” 這一外觀,而是讓不同視覺變量進入穩定的命名字段,減少屬性歸屬、空間關系和對象綁定上的歧義。在固定骨干重建實驗中,隨著 SP 字段逐步恢復,重建質量持續提高;在完整訓練 sweep 中,字段覆蓋增加也同步提高 GPG、ED,并降低收斂后的 diffusion loss。
![]()
論文 Figure 5|Structured Prompt 將全局、元素級和跨元素視覺變量組織到命名字段中。
為了在大規模訓練數據上生成完整 SP,團隊構建了一套 image-to-SP 標注流水線。通用 VLM 負責全局語義和局部內容,Sapiens 補充人體姿態證據,DepthAnything V2 提供相對深度,SAM 2.1 提供掩碼與遮擋線索,最后再由 VLM 將這些信息統一整理為一致的完整 SP。
![]()
論文 Figure 8|VLM 與姿態、深度、分割專家共同構建完整 Structured Prompt。
團隊將一個 Caption 表示能夠向擴散模型暴露并組織圖像監督的能力稱為 Diffusability。SP 提升的正是這一側:在不改變擴散模型架構的情況下,讓模型從文本條件中學到更多、更明確的視覺變量。
Promptability:
有了好的結構,還需要 LLM 把它填好
訓練時可以從配對圖像中提取完整 SP,但實際生成時只有用戶的一句話,沒有參考圖像或 oracle 標注。系統還需要一個 LLM prompter,把用戶請求擴展成詳細、連貫、且不違反原始約束的 SP。
團隊把這種從用戶請求實例化結構化條件的能力稱為 Promptability。端到端生成質量取決于兩側共同作用:
Generation Quality = Diffusability × Promptability
這里的乘號是一種組織視角,而不是擬合得到的數學乘法公式:Diffusability 描述擴散模型能夠從 Caption 表示中學到什么,Promptability 描述 LLM 在推理時能否真正填出高質量的 Caption 實例。
![]()
論文 Figure 4|Structured Prompt 連接標注、測量、diffuser 訓練、prompter 訓練與最終生成。
首先,團隊固定 SP schema 和 Qwen-Image diffuser,只替換零樣本 LLM prompter。隨著 Qwen3.5 從 0.8B 擴展到 397B,thinking 模式下的 GenEval++ 從 46.4% 提升到 86.8%。除最小模型容易在思考過程中重復并無法輸出有效 JSON 外,chain-of-thought 在其他尺度上都帶來進一步提升。這說明,通用 LLM 的模型能力和推理能力,可以通過 Caption 接口直接轉化為更好的圖像生成結果。
但零樣本 LLM 仍然傾向于生成信息不足、構圖較簡單的 SP。為進一步提高 Promptability,團隊采用三階段訓練:
- SFT 學習擴散模型所期望的 SP 內容分布,而不只是 JSON 格式;
- Cold-start 從帶有配對圖像的 privileged reasoning traces 中蒸餾 “如何僅根據用戶請求推導 SP”;
- RFT 在 prompter 自己生成并渲染的 rollout 上繼續優化,由 verifier 篩選高置信軌跡,再通過 image-conditioned teacher 的 on-policy self-distillation 提供稠密 token 監督。
消融實驗表明,三階段承擔不同作用:SFT 帶來最大的單階段結構提升,cold-start 加強從用戶請求到 SP 的推導,而 verifier-gated OPSD 在 prompter 自身分布上取得最強結果。
![]()
論文 Figure 9|固定 schema 與 diffuser 后,生成質量隨 LLM prompter 尺度和 reasoning mode 提升。
![]()
論文 Figure 10|SFT、cold-start 與 verifier-gated RFT 三階段 prompter 訓練。
結構化表示,
也讓生成過程更容易迭代修正
SP 的字段化表示還有一個自然優勢:當生成圖像出現錯誤時,系統可以定位并修改相應的對象、屬性、關系或布局字段,而不是重新改寫整段自然語言 Prompt。
基于此,團隊構建了 refine-render-judge 循環。每一輪中,prompter 根據用戶請求和歷史反饋生成或修訂 SP,固定 diffuser 渲染圖像,在線 judge 再針對 Prompt 遵循、結構和視覺質量給出 PASS/FAIL 與具體問題。若失敗,下一輪只需圍繞相關字段進行調整。
實驗顯示,增加迭代預算能夠繼續提高結構、對齊和 GSB 表現;但有效推理長度并不長。對于訓練后的 prompter,即使允許最多 8 輪,平均也只使用 2.31 輪;從 Tmax = 4 增加到 8,收益已經很小。這表明,文生圖確實受益于迭代糾錯,但在當前設置下并不需要很長的 prompt-side reasoning trajectory:修復主要規格錯誤后,額外輪次會迅速飽和。
![]()
論文 Figure 14|Refine-render-judge 的 agentic 推理循環。
![]()
論文 Figure 15|循環能夠修正對象拆分、關系和整體布局問題。
同一套 Qwen-Image,
結構化接口帶來了多大提升?
最終系統由 SP-trained diffuser 與訓練后的 LLM prompter 組成。它在幾乎所有報告指標上領先所比較的開源權重模型,并在大多數評測上達到或超過所比較的閉源系統,優勢在組合、推理和世界知識任務上尤其明顯。
更關鍵的是 matched control。為了排除 “只是多訓練了一些” 的解釋,團隊使用完全相同的 Qwen-Image 架構、訓練圖像、訓練階段和預算,額外訓練了一套始終使用自由自然語言 Caption 的系統。結果如下:
![]()
論文 Table 2|與代表性文生圖系統的完整對比。截圖保留論文中的評測定義、加粗與腳注。
Matched NL 的額外訓練確實帶來了一些提升,但遠不足以復現 SP 系統的結果。這說明,收益不能簡單歸因于更大的 backbone 或更多訓練,而與 prompter 和 diffuser 之間所使用的結構化 Caption 接口密切相關。
![]()
論文 Figure 11|復雜空間關系、數量和屬性綁定的定性對比。
下一步不只是 scale 模型,
也要 scale 條件本身
這項工作的出發點很簡單:對于文生圖模型,Caption 不是無關緊要的元數據,而是圖像內容進入文本條件學習的主要接口。
當 Caption 只是變長時,新增 token 可能只是改寫和鋪陳;當圖像信息被準確提取、清晰綁定并穩定組織時,同一個生成模型才能從中學習更多。GPG 和 ED 讓這種信息成為可測量的變量,Structured Prompt 提高 Diffusability,LLM scaling、post-training 和短程 agentic refinement 則提高 Promptability。
因此,文生圖的下一步 scaling 不應只關注 “負責渲染的模型有多大”,還應關注:
傳遞給模型的文本條件,究竟攜帶了多少它真正能夠學習和使用的圖像信息?
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.