![]()
視頻是描述物理世界的重要數據形態,更是人類與物理世界交互的重要載體,視頻理解大模型是讓 AI 從數字世界走向物理世界最基礎、最原生的組成部分。面向物理世界的視頻智能,難點早已不只是 “看懂一段短片”,而是需要看清細微的動作,處理小時級的長程信息,還能應對持續到來的實時視頻流;它不僅要回答 “發生了什么”,還要判斷 “證據出現在哪里” 與 “什么時候應該回應”。
與此同時,海量視頻幀帶來的視覺 token 會隨時長快速增長,模型的訓練與推理成本也隨之攀升。有沒有可能用一個高效模型,同時兼顧短視頻、長視頻和在線視頻理解?
近日,南京大學、上海人工智能實驗室、南洋理工大學和北京大學的研究團隊發布 了VideoChat3。這是一個面向通用視頻理解的 4B 參數多模態大模型。圍繞 “全面、高效、開源” 三個目標,研究團隊從視覺編碼器架構、流式感知機制和訓練數據體系三個層面進行系統設計。
實驗結果表明,VideoChat3 在時序感知、長視頻理解、視頻推理、時序定位和在線流式理解等多類任務上取得了具有競爭力的結果,并在長視頻推理中顯著降低了視覺 token 數量與計算成本。更重要地,VideoChat3 進行了全棧開源(數據、代碼、模型權重全部開源),旨在促進視頻理解大模型開源生態建設。
![]()
- 論文題目:VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
- 論文鏈接:https://arxiv.org/pdf/2607.14935
- 項目主頁:https://mcg-nju.github.io/VideoChat3
- 代碼倉庫:https://github.com/MCG-NJU/VideoChat3
- 模型與數據:https://huggingface.co/collections/MCG-NJU/videochat3
![]()
視頻鏈接:https://mp.weixin.qq.com/s/1eq7KseWtxpdbnWJ8tLFSQ
從 “逐幀看圖” 邁向原生時空建模
許多視頻多模態模型沿用圖像理解的處理方式:先對視頻進行稀疏采樣,再把每一幀近似當作獨立圖像編碼,最后將大量視覺 token 交給大語言模型完成推理。這一范式實現簡單,但存在兩方面限制:采樣過稀可能丟失短時動作與細微變化;相鄰幀中大量重復信息又會推高語言模型的上下文長度和計算開銷。
VideoChat3 提出的Inflated 3D Vision Transformer(I3D-ViT),將時序建模前移到視覺編碼階段,讓視覺編碼器具有原生的時空建模能力。其基本思路是把連續幀劃分為短時片段,在片段內部進行聯合時空注意力建模,再沿時間維進行池化。這樣,相鄰幀之間的運動線索與冗余信息可以在進入大語言模型之前得到整合,而不是等到語言模型階段再處理一長串相互重復的逐幀表示。
在默認設置下,I3D-ViT 可實現約16 倍的時空壓縮。這里的 “壓縮” 并不等同于簡單丟幀:模型先在片段內部建立時空聯系,再對已經融合了局部運動信息的特征進行時間池化,目標是在有限上下文預算下保留更密集的視頻證據。
![]()
不必時刻 “全神貫注”:讓視覺預算隨視頻流動態分配
離線視頻問答通常默認模型已經看完整段視頻,但真實的視頻流不會等待模型準備完畢。面對駕駛記錄、持續監控畫面或第一人稱記錄視頻,模型需要一邊接收新內容,一邊決定是否已經掌握足夠證據。若每個時刻都以高分辨率處理,不僅代價高,也沒有必要。
VideoChat3 為此設計了自適應幀分辨率機制,并用三個狀態組織流式感知過程:
- :當前窗口沒有與問題相關的證據,模型保持靜默并以較低成本繼續觀察;
- :已經出現潛在線索,但證據尚不充分,模型暫不回答,并提高下一個窗口的視覺分辨率;
- :證據已經充分,模型生成回答,之后回到低成本監測狀態。
這種機制形成了一個由模型狀態驅動的閉環:常規片段采用低分辨率預算編碼,檢測到潛在線索后,下一個窗口提升至高分辨率觀察。模型由此可以把更多視覺計算用于真正影響回答的線索片段,而不是對整段視頻平均分配資源。
消融實驗進一步表明,這一設計的收益并非單純來自 “使用更多像素”。在 OVO-Timing 上,自適應策略的平均 F1 為 35.5,高于固定低分辨率的 33.5 和固定高分辨率的 30.5;其視覺預算約為始終使用高分辨率方案的 30.2%。這說明,在合適的時刻提高感知精度,比始終維持高分辨率更有效。
![]()
三類數據,覆蓋短視頻、長視頻、流視頻場景
架構決定模型如何處理視頻,數據則決定模型能夠學會哪些能力。在社區原有的開源數據以外,VideoChat3 構建并整理了三套全新高質量開源數據資源,助力模型全方面提升細粒度理解,長視頻理解和流式視頻理解能力。
VideoChat3-Academic2M:把簡短標簽轉寫為有證據的回答
VideoChat3-Academic2M包含約 227 萬條來自公開學術數據集的視頻描述與問答樣本。原始學術數據通常具有明確的任務定義和較可靠的標注,但答案可能只是選項字母、單個短語或簡短事實。團隊在不改變原始語義標簽的前提下,將這些稀疏答案改寫為包含可觀察證據和時間線索的自然語言回答,并增加一致性驗證與錯誤過濾,以降低改寫過程引入無依據細節的風險。
這樣既保留了原始標注的語義可靠性,又為模型提供了更充分的視覺證據與時序監督,有助于提升其視頻理解、證據定位和回答生成能力。
![]()
VideoChat3-LV116K:為長視頻建立可核驗的事件賬本
VideoChat3-LV116K包含約 11.62 萬條長視頻數據。長視頻的困難并非只是幀數更多,而在于關鍵證據可能稀疏地分布在數分鐘甚至更長時間范圍內。為此,團隊先過濾低質量、重復或語義貧乏的視頻,再結合鏡頭邊界與時長約束進行分段;隨后生成并核驗片段級描述,最終將帶時間戳的局部證據組合為完整視頻標注,用于時序定位、長視頻問答和摘要等任務。
這一流程相當于先為長視頻建立一份可檢查的 “事件賬本”,再據此構造需要跨片段聚合與推理的訓練樣本,從而減少直接對整段長視頻生成標注時可能產生的遺漏和噪聲。
![]()
VideoChat3-OL617K:把離線問答改造成 “知道何時回答” 的訓練信號
VideoChat3-OL617K包含 61.72 萬條在線流式樣本。團隊首先定位回答問題所需的關鍵視覺片段,再通過裁剪片段復核證據是否充分,最后將視頻轉換為由多個窗口和狀態 token 交錯組成的因果序列:無關窗口標記為 ,出現線索的窗口標記為 ,證據完整后標記為 并生成答案。
這一設計把傳統問答數據的 “看完再答”,轉化為 “持續觀察、積累證據、適時回答”,為模型學習主動響應提供了明確監督。加入 VideoChat3-OL617K 后,消融實驗中的 OVO-Timing 平均 F1 從 4.0 提升至 35.5,同時多項離線視頻問答指標基本保持穩定。
![]()
四階段訓練:從視覺表征到長視頻與流式交互
VideoChat3 采用漸進式的四階段訓練流程:
- 視頻視覺編碼器預訓練:從圖像預訓練的 MoonViT 初始化 I3D-ViT,使視覺表示能夠被語言模型有效接收;
- 視頻 - 語言對齊:進一步建立緊湊視頻 token 與語言空間之間的對應關系;
- 視頻指令微調:在多類圖像與視頻描述、問答數據上獲得通用指令遵循能力;
- 長視頻與流式指令微調:重點學習長程檢索、時序定位、證據聚合、狀態判斷和主動響應。
這一漸進式訓練策略使視覺表征、跨模態對齊、通用理解和復雜時序交互能力逐步銜接,降低了不同訓練目標同時優化帶來的難度。
四個階段累計使用僅 25M 條訓練樣本,便在多類視頻理解任務上取得了具有競爭力的表現,體現出了高效的數據利用效率
![]()
4B 參數模型,在多個維度上表現全面
論文從通用離線視頻理解、在線視頻理解兩個方面進行了系統評測。
在通用離線視頻理解評測中,VideoChat3-4B 展現出較為全面的能力,在時序感知、長視頻理解、復雜視頻推理和時序定位等多個維度均取得了具有競爭力的結果。與同為 4B 規模的開放權重模型 Qwen3-VL-4B 相比,VideoChat3 在 19 個可直接比較的指標中有 18 個實現提升。其在長視頻理解與時序定位任務上的優勢尤為突出:在 Video-MME 基準上取得 70.1 分;在 TimeLens 的三個評測分項中全面領先同規模開源模型,并超過 GPT-5 等閉源模型。
![]()
在線視頻理解評測中,VideoChat3 在六項感知與記憶匯總指標中的四項取得最佳結果,體現了模型在流式輸入場景下的處理能力,其 ODVBench 得分為 72.3,StreamingBench 指標為 83.0,River 平均得分為 42.8。與此同時,模型還真正做到了主動響應視頻內容,在強調響應時機的 OVO-Timing 上,VideoChat3 的平均 F1 達到 35.5,高于帶有額外 2B 模塊的專用模型 Em-Garde。在 ProactiveVQA 的多個子集上,VideoChat3 相較于 Qwen3-VL-4B 均取得了提升。
![]()
從評測結果可以看出,與 Qwen3VL-4B 和 Molmo2-4B 等之前的開源模型相比,VideoChat3 不僅取得了性能上的提升,還真正的將離線通用能力與在線處理能力合二為一,成為視頻理解處理的 “多面手”。
長視頻越長,前置壓縮的價值越明顯
I3D-ViT 在視覺編碼階段進行顯式時空建模,并且具有更高的視覺 token 壓縮比。因此,雖然視覺編碼器本身比逐幀編碼方案更耗時,但將顯著減少交給語言模型的視覺 token。
由于語言模型對長序列的計算成本增長很快,這種 “視覺端多做一些、語言端少處理一些” 的權衡會隨著輸入視頻變長和后續語言模型尺寸的增加而更有優勢。
在 NVIDIA H200、Hugging Face Pipeline 和 FlashAttention-2 的測試條件下:
- 輸入 512 幀時,VideoChat3 的總延遲為 3.596 秒,Qwen3-VL 為 3.838 秒;
- 輸入 1024 幀時,兩者總延遲分別為 8.099 秒和 12.251 秒;
- 輸入 2048 幀時,VideoChat3 將總延遲從 44.449 秒降至 20.412 秒,將 FLOPs 從 15.150×101? 降至 5.738×101?,并將顯存占用從 106.913 GB 降至 80.775 GB。
![]()
VideoChat3:全面,高效,開源的視頻理解大模型
全面,體現在其對多類視頻任務的統一覆蓋。VideoChat3 不僅能夠識別細粒度動作、理解長視頻和定位事件發生區間,還能夠持續感知視頻流,并判斷何時保持靜默、何時作出回應。圍繞這些能力,團隊從模型架構、訓練數據和訓練策略三個層面進行協同設計,使通用視頻理解、長程時序推理與在線主動響應能夠在同一模型中兼顧。
,是 VideoChat3 在模型設計上的核心目標。I3D-ViT 將時空建模與冗余壓縮前移至視覺編碼階段,自適應分辨率機制則根據事件重要性動態調整感知預算,使模型能夠以更少的視覺 token 處理長視頻與流式輸入,在保持理解能力的同時降低計算開銷。在模型推理高效之外,VideoChat3 整體的訓練過程也體現出了高效的數據利用效率。
開源,則是 VideoChat3 區別于許多視頻多模態模型的重要特征。團隊全面開放模型權重、代碼、數據,為研究者復現、分析和開展后續研究提供了較為完整的基礎。
總體而言,VideoChat3 以 4B 參數規模,在效率、能力覆蓋與開放性之間取得了良好平衡。當然,面向更強、更可靠的通用視頻智能助手,其在復雜時序推理、主動響應精度和真實場景部署效率等方面仍有進一步提升空間。VideoChat3 提供的并非這一問題的最終答案,而是一個高效、全面且可復現的開放起點。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.