IT之家 8 月 3 日消息,英特爾今日宣布,為新一代開源多模態視頻模型 MiniMax H3 提供 Day 0 首發支持。
據介紹,英特爾銳炫 Pro B70 第一時間完成對 MiniMax H3 的適配,英特爾團隊實現了一種基于多卡 GPU 的部署方案。該方案采用 Encoder 8 卡張量并行(8TP)、DiT 8 卡 USP(Ulysses Sequence Parallel,并結合 Layer-wise Offloading),以及 VAE 部署于 B70 GPU 的整體架構,實現了視頻生成全流程的 GPU 加速。
其中,Encoder 采用 8 卡張量并行完成文本編碼;作為推理過程中計算量最大的模塊,DiT 采用 8 卡 USP 并結合 Layer-wise Offloading 技術,使模型參數按層動態加載到 GPU,在突破單卡顯存限制、降低模型常駐顯存需求的同時,支持更大規模 DiT 模型的部署;VAE 則部署于 B70 GPU 上完成最終的視頻解碼。該方案兼顧了模型容量與計算效率,為大規模視頻生成模型提供了更具擴展性的部署方式。
在此基礎上,團隊進一步結合張量并行(Tensor Parallel,TP)與 USP 的優勢,開發了 2TP×4USP 的混合并行方案。相較于純 8 卡 USP,該方案將 USP 并行度由 8 降至 4,并引入 2 路張量并行對計算進行協同加速,在保持模型擴展能力的同時,減少 USP 帶來的通信開銷,實現計算負載與通信開銷之間更優的平衡,從而進一步提升整體推理性能。
IT之家獲悉,團隊還結合 llm-scaler-omni 項目的 XPU Kernel 優化,對矩陣乘法、注意力等關鍵算子進行了持續優化,進一步提升 GPU 的計算效率,持續降低端到端推理時延,取得了良好的優化效果。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.