IT之家 7 月 31 日消息,稀宇科技今天宣布推出 MiniMax H3 全模態(tài)生成模型,支持對文本、圖像、視頻、聲音組成的多模態(tài)上下文的統(tǒng)一理解能力、能夠輸出具備原生雙聲道的音視頻,最高可支持 15s 2K 分辨率。
![]()
據(jù)前期邀測反饋,MiniMax H3 具備商用級多場景內(nèi)容生成能力,在指令遵循、文字與品牌信息呈現(xiàn)、V2V Motion Transfer(視頻到視頻動作遷移)等方面表現(xiàn)出色,號稱可精準、可控實現(xiàn)多模態(tài)內(nèi)容編輯與生成,適用于廣告、電商、品牌、產(chǎn)品設計、UI / UX 和游戲等場景。
核心技術方面,MiniMax H3 增加了 Caption 能力,定制了專屬模型和全模態(tài)理解管線,大部分素材需要消耗 100K Token 的推理,最終得到平均約 4K 的 Token。
同時,MiniMax H3 的 2K 視頻輸出能力并沒有使用常規(guī)超分模塊,而是使用 H3 基礎模型對自己的低分辨率結果進行 in-context 的重新生成,可最大程度地復用 H3 基模已經(jīng)具備的生成能力,還擁有傳統(tǒng)超分方案無法靠“猜”還原的信息。
此外,MiniMax H3 將在未來幾天內(nèi)開放模型權重。IT之家將持續(xù)關注,第一時間帶來最新消息。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.