![]()
給定一張截圖,AI 就可以幫你生成代碼,這早就不是什么新鮮事了。
真正的難點,是讓生成結果經得起執行和交互驗證。
傳統的“文生代碼”(text-to-code)主要依賴文本描述生成代碼,但文字并不擅長表達空間層次和復雜結構,一張圖片能傳達的信息,往往需要大段文字才能說清。相比之下,在前端界面、可視化圖表和 CAD 圖形等任務中,視覺輸入往往更直接、更完整。隨著多模態大語言模型(MLLM)的發展,能夠理解圖像、界面和圖表的“多模態代碼智能”(Multimodal Code Intelligence)也由此興起。
圍繞這一前景,美團、香港大學、香港中文大學團隊及其合作者發布了最新綜述論文,系統梳理了多模態代碼智能的主要任務與瓶頸,并提出 4 個未來研究的主要方向。
![]()
論文鏈接:https://arxiv.org/abs/2606.15932
他們指出,以 IWR-Bench 基準為例,當前模型視覺保真度可達 64.25%,但交互功能正確率僅 24.39%。而且,多模態代碼智能的評估不能只看視覺相似度,還要考察語義、結構、執行和交互層面的正確性。
相關項目與資源已在 GitHub 上公開。
![]()
當前進展
在任務定義部分,研究團隊將多模態代碼智能相關任務概括為兩大類:
一類是多模態代碼合成,關注在視覺信息參與下生成、編輯和精煉代碼。
另一類是“代碼中心的推理與行動”,強調代碼不只是最終結果,也可以作為推理、工具調用和 Agent 執行任務的中間接口。
他們將現有研究歸納為如下四個主要方向:
![]()
圖|多模態代碼智能領域概覽。
GUI 方向:網頁代碼生成驗證閉環最清晰,但現有評測仍偏重靜態視覺相似度。在IWR-Bench上的結果顯示,模型視覺保真度可達64.25%,交互功能正確率僅為24.39%。相比之下,移動端由于缺少統一的執行與交互環境,評測更難標準化。
![]()
圖|網站和移動應用中的 GUI 代碼生成任務示例。
科學可視化:核心要求在于,生成的代碼不僅要能夠正確渲染結果,還要準確表達數據語義、文檔結構或相關科學過程/機制。
![]()
圖|科學可視化代碼生成任務示例,包括圖表、文檔、演示文稿和示范內容。
結構化圖形:強調從像素相似轉向結構正確性,SVG 要保持可編輯性,流程圖要保留邏輯拓撲與關系類型,CAD 則要恢復參數化構造邏輯、約束和特征依賴。
![]()
圖|結構化圖形生成任務示例。
前沿任務:進一步將代碼從“產物”擴展為“推理與行動接口”,涵蓋程序化視覺操作、視頻代碼生成、具身控制、視覺驅動的編程,以及統一多模態代碼生成框架。
![]()
圖|前沿任務與框架部分的任務,包括程序化視覺操作、視頻代碼生成、具身控制、視覺驅動的編程以及統一框架。
未來方向
隨著前沿任務將代碼進一步推向交互、執行與控制過程,現有評估體系的短板也變得更加明顯。
基于此,研究團隊提出了四個值得關注的未來方向。
1.多信號驗證(Multi-Signal Validation)
研究團隊指出,單一指標無法全面刻畫多模態代碼智能的正確性。視覺相似度高,不代表結構正確;參考代碼更接近,也不意味著程序一定可執行;偏好式評估則往往只反映局部屬性。
因此,未來的評估體系不應只給出一個總分,而應形成一份更細化的“診斷畫像”,分別報告視覺保真度、執行成功率、文本正確性、數據或語義保真度、結構有效性、可編輯性和交互正確性。同時,評估設計還應明確系統究竟在優化什么屬性、采用了哪些驗證器,并區分訓練階段的獎勵信號與最終的可靠性檢查。
2. 多狀態驗證(Multi-State Verification)
研究團隊認為,涉及狀態變化的視覺-代碼任務,不能再按孤立的靜態結果來評估,而應放到完整執行過程中考察。GUI 任務最能說明這一點:一個頁面也許在視覺上復現了截圖,但在點擊、路由跳轉、窗口縮放或狀態更新時仍可能暴露問題。
這一挑戰并不只存在于 GUI。科學演示代碼可能可以執行,卻傳達了錯誤的機制;視頻腳本可能寫對了關鍵幀,卻丟失了事件時序;具身程序可能最終達到目標,卻在接觸、遮擋或控制器限制下失效。
因此,未來的基準測試不應只看單個結果,而應覆蓋完整執行鏈條,包括初始狀態、生成的代碼或動作、中間觀測、預期狀態轉換、驗證器輸出以及恢復案例。具體來說,網頁任務需要檢查 DOM 和狀態斷言,移動任務需要結合設計操作軌跡或模擬器手勢等檢查,視頻任務需要進行時序同步驗證,具身任務則需要結合模擬器或控制器診斷。
3. 跨任務遷移測試(Cross-Task Transfer Testing)
研究團隊指出,評估統一模型時,不能只看它是否支持更多任務格式,更要看它學到的能力能否跨任務遷移。關鍵不在于覆蓋面更廣,而在于模型是否真正獲得了可復用的視覺-代碼能力,例如布局推理、符號關系建模和交互理解,而不只是分別提升了若干單項任務表現。
為此,未來需要設計專門的遷移測試協議,對比基礎模型、在源任務上增強過的模型,以及面向目標任務單獨優化的對照模型,同時報告正向遷移和負向遷移。比如,可以測試圖表訓練是否提升了布局推理能力,文檔結構學習是否有助于遷移到其他視覺-代碼任務,交互監督是否能夠改善生成產物的修復能力。
4. 可驗證的 Agent 軌跡(Verifiable Agent Traces)
對于面向 Agent 的視覺-代碼系統,研究團隊認為,未來需要保留更完整的過程證據,把視覺依據、工具調用、代碼修改與最終結果串聯成一條可檢查的鏈條。只看任務最終是否成功,并不足以判斷中間軌跡是否真正受視覺證據支撐,也難以說明這條軌跡是否對結果具有因果作用。
研究團隊提到,未來需要建立“Agent 證據日志”。每條記錄至少應包括:所依據的觀測、引用的視覺區域或工具輸出、修改過的代碼或動作、預期會改進的驗證器結果、回放結果,以及在證據不足時觸發的回退或回滾決策。
這樣的日志不僅有助于回放、消融測試、反事實輸入、權限控制、沙盒保護和人工審查,更重要的是,它能把失敗定位到更具體的環節,例如視覺理解、代碼生成、環境執行、驗證器設計,或動作選擇本身是否存在安全問題。這樣一來,Agent 驅動的多模態代碼系統就不再只是一個依賴最終成功率衡量的黑盒,而會更接近一個可驗證、可審查、可歸因的過程。
一些問題
研究團隊指出,當前多模態代碼智能的核心瓶頸,不只是生成能力本身,而是缺少足夠可靠的驗證機制。現有評測往往依賴單一視覺信號,難以覆蓋交互、狀態變化、結構約束和時序過程:
- 網頁任務中,單張截圖無法判斷點擊、路由與狀態切換是否正確;
- 圖表任務中,渲染相似不等于數據恢復準確;
- SVG、流程圖和 CAD 任務中,視覺接近也可能掩蓋結構、邏輯或參數約束錯誤;
- 視頻與機器人任務中,任務完成同樣不意味著時序過程或物理行為真實可靠。
與此同時,現有研究在數據集選擇、評測指標和任務設定上缺乏統一標準,導致不同方法的結果難以直接橫向比較;而數據泄露、基準飽和以及評測敏感性等問題,進一步削弱了相關結論的魯棒性與可靠性。
最后,他們提醒,多模態代碼智能雖然有望降低視覺編程門檻,但如果驗證不足,也可能帶來網頁交互失效、圖表數據錯誤、結構信息丟失、科學機制表達失真以及物理動作不安全等實際風險。此外,截圖和設計文件可能包含私有信息,生成的代碼也可能在專有環境中泄露或被誤用。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.