出品 | 網(wǎng)易智能
作者 | 小爪
編輯 | 王鳳枝
7月31日,字節(jié)跳動Seed團(tuán)隊(duì)正式發(fā)布Seedance 2.5,把單次視頻生成時(shí)長從15秒拉到了30秒。 模型剛開放,創(chuàng)作者們便開始拿多出來的15秒講故事:有人用一個(gè)提示詞完成六個(gè)動作鏡頭,有人拿它嘗試長對話和完整腳本;也有人很快發(fā)現(xiàn),視頻變長以后,漏動作和重新生成的成本也跟著上來了。
Seed團(tuán)隊(duì)稱,Seedance 2.5正陸續(xù)上線即夢AI和豆包專業(yè)版,火山方舟API也將在近期上線。
官方介紹:時(shí)長、素材、控制
這次升級最直接的變化是時(shí)長。按照官方介紹,Seedance 2.5可以在30秒內(nèi)組織多個(gè)相互關(guān)聯(lián)的鏡頭,讓一段內(nèi)容容納鋪墊、推進(jìn)、轉(zhuǎn)折和收尾。 生成結(jié)束后,用戶還可以繼續(xù)延長視頻,并讓后續(xù)鏡頭沿用原來的人物、場景、畫面風(fēng)格和聲音。
![]()
在參考素材方面,Seedance 2.5單次最多可以輸入30張圖片、10段視頻和10段音頻。 用戶還可以用時(shí)間戳安排某一秒發(fā)生的故事、動作和運(yùn)鏡,生成后也能定向修改指定片段中的角色、聲音或劇情,不必重新生成整條視頻。Seed團(tuán)隊(duì)稱,這項(xiàng)能力可以減少反復(fù)生成的成本。
![]()
官方此次還重點(diǎn)介紹了白模、綠幕和視角編輯。用戶可以用無紋理3D模型預(yù)先搭出空間結(jié)構(gòu)、人物姿態(tài)、運(yùn)動軌跡和鏡頭機(jī)位,再讓模型按照這套結(jié)構(gòu)生成畫面; 綠幕編輯則可以在保留主體的情況下更換場景。
Seedance系列此前一直沿著時(shí)長、音畫和控制能力迭代。2025年6月發(fā)布的1.0可以在10秒內(nèi)完成2至3次鏡頭切換;同年12月,1.5 Pro加入原生音畫聯(lián)合生成;今年2月發(fā)布的2.0把單次多鏡頭音視頻時(shí)長提高到15秒,并支持文字、圖片、視頻和音頻作為參考。當(dāng)時(shí)公開的參考上限為9張圖片、3段視頻和3段音頻,2.5進(jìn)一步把三類素材合計(jì)提高到50項(xiàng)。
Seed團(tuán)隊(duì)在發(fā)布稿中稱,30秒與多輪延長可以減少拆分鏡頭、反復(fù)拼接和處理銜接的成本。不過,官方同時(shí)承認(rèn),Seedance 2.5在復(fù)雜運(yùn)動的物理合理性,以及多主體交互場景的穩(wěn)定性方面仍有提升空間。
創(chuàng)作者實(shí)測:成片率、積分消耗與實(shí)際表現(xiàn)
到了實(shí)際制作環(huán)節(jié),創(chuàng)作者們更關(guān)心的是成片率和積分消耗。
AI電影創(chuàng)作者杰伊·恩瓦布澤(Jay Nwabueze)測試一天后認(rèn)為,2.5生成的30秒片段銜接自然,人物和光照保持穩(wěn)定,音頻也少了此前常見的音頻偽影。他估計(jì),提示詞遵循度大約達(dá)到90%,30秒片段約1分鐘就能生成。不過,在他使用的Dreamina賬戶中,2.5生成15秒需要630積分,2.0只要230積分。 他最后采用的辦法是先用2.0打草稿、確定方案,再把2.5留給最終鏡頭。
![]()
塔魯馬·薩克蒂(taruma sakti)的12組同條件對比也指向類似選擇:超過15秒的對話和完整腳本更適合2.5,多數(shù)普通場景使用2.0已經(jīng)足夠。 對創(chuàng)作者來說,30秒減少了拆段和續(xù)接,但每次重抽的代價(jià)也隨之增加。
同樣是復(fù)雜動作,不同測試得到的結(jié)果差別很大。拉法·西蒙(RafaSimon)用一個(gè)提示詞生成了30秒、六個(gè)鏡頭的視頻,里面包含摩托追逐、導(dǎo)彈爆炸、后空翻和召喚魔法,全程沒有后期剪輯。他認(rèn)為時(shí)間戳、人物與載具身份和鏡頭切換都執(zhí)行到位,后空翻也保留了重量感。
另一位創(chuàng)作者亞歷克斯·伊謝(Alex Iché,@hedo_ist)得到的結(jié)果沒有這么整齊。他在30秒提示詞中加入八個(gè)參考元素,成片沒有全部捕捉。畫面的分辨率、真實(shí)感和聲音有所改善,但他提醒,時(shí)間變長以后,如果繼續(xù)往提示詞里塞入大量具體動作和元素,出錯(cuò)概率也會提高。
![]()
創(chuàng)作者"多肉"的《燈滅之前》同樣保住了主要人物、道具和空間,卻漏掉了"斷電波追逐",中間出現(xiàn)1.375秒純黑,燈光也沒有沿原路徑恢復(fù)。
音頻與連續(xù)性:改善與不足并存
音頻方面,不同測試者的感受也不太一樣。Larus Canus用深度視頻、多視角人物圖、九宮格素材、場景圖和參考音樂制作了一段30秒人物小傳。他發(fā)現(xiàn),動作、鏡頭和音樂能夠沿同一條時(shí)間軸推進(jìn),切鏡基本踩著背景音樂。
![]()
另一位測試者"財(cái)經(jīng)老王"認(rèn)為,2.5的人物表演、臺詞節(jié)奏和情緒過渡較2.0自然,但方言處理反而退步,粵語的準(zhǔn)確度和自然度仍不理想。
當(dāng)片段從30秒繼續(xù)延長到3分鐘,連續(xù)性問題開始變得更明顯。克里斯蒂安·盧奧馬(Christian Luoma)只用兩張參考圖和一段簡單提示詞,生成了一段3分鐘、480p的視頻,消耗約4100積分。他認(rèn)為結(jié)果可以用來構(gòu)思場景和剪輯,但連續(xù)性和音頻仍有問題。
畫質(zhì)升級有多大?看法不一
畫質(zhì)本身是否明顯升級,也有人持保留意見。Jason W用同一條"炒鍋廣告"提示詞測試,2.0一直把焦點(diǎn)放在炒鍋上,2.5卻轉(zhuǎn)向了米飯;他的另一組30秒720p測試消耗1440積分,兩次結(jié)果都沒有達(dá)到預(yù)期。
Zentrix則發(fā)現(xiàn),同提示詞下,兩代模型的光照、細(xì)節(jié)和整體觀感十分接近,2.5更明顯的變化仍是時(shí)長、控制和工作流。
![]()
小結(jié)
看下來,2.5帶來的變化主要落在時(shí)長和制作流程上:它減少了拆段和拼接,也讓時(shí)間戳、參考素材和音畫關(guān)系更容易放進(jìn)同一條時(shí)間軸。 代價(jià)是每次重抽更貴,復(fù)雜提示中的漏項(xiàng)也會直接放大成本。
因此,幾位涉及成本的創(chuàng)作者已經(jīng)采用了相似辦法:先用2.0試提示詞、定方案,再把2.5留給關(guān)鍵鏡頭。
