在 2026 世界人工智能大會(WAIC)現場,商湯科技正式發布日日新 SenseNova 系列旗艦大模型 SenseNova U1 Pro。不同于行業普遍聚焦的 “內容生成效果” 升級,這款新品將核心定位放在了 “長程任務的交付級原生多模態智能體基座”,也標志著多模態 AI 的競爭,正在從單點能力比拼,轉向系統級任務交付的全新階段。
在商湯的技術路徑里,多模態產品正沿著與代碼大模型相似的軌跡演進:從第一階段解決 “真實感生成”,到第二階段實現 “自然語言交互 + 持續修改”,再到第三階段達成真實場景下的 “交付級創作”—— 兼顧專業設計美感與內容精準度,終結行業反復 “抽卡調圖” 的低效模式。
![]()
作為瞄準第三階段打造的旗艦產品,SenseNova U1 Pro 圍繞 “復雜目標下的持續理解、規劃、執行、檢查、修正”,構建了四項核心交付能力。
其一為專業級設計質感,圖像生成跳出 “細節逼真” 的單一維度,在構圖邏輯、色彩表達、版式排版上達到專業設計水準,大幅弱化 “AI 感”,可直接用于正式交付場景;其二是原生 8K 超清輸出能力,最高支持 8K 原生分辨率,即便在超長、超大畫幅創作中,文字、線條、圖標及模塊關系依然清晰穩定,可滿足印刷、展覽級的細節檢驗標準;其三是高密度圖文細節控制,大幅強化圖文信息整合能力,在高信息負載場景下依然能維持版式完整性與內容準確性,文字渲染出錯率處于極低水平;其四是長程智能體閉環思維,基于統一基座內生的理解、生成與行動能力,可圍繞復雜目標執行數十輪智能體生成循環,同時實現整體風格與局部文本的同步精準編輯,支持交付成果的持續迭代復用。
支撐這套交付能力的底層核心,是商湯 NEO-unify 內核架構實現的語言與視覺統一表征,從根源上打破了傳統多模態模型理解與生成割裂的壁壘。
事實上,商湯在今年 4 月已開源基礎版 SenseNova U1,兩個多月的真實高強度工作流實踐,為旗艦版的落地積累了充足的驗證數據。官方數據顯示,今年 6 月 U1 用戶人均日生圖量較 5 月提升近 3 倍,模型已深度融入真實生產流程;截至 7 月中旬,SenseNova U1 及配套 SenseNova-Skills 代碼庫在 GitHub 的總 Star 數已突破 8000。
與此同時,商湯開源的 SenseNova-Vision 統一視覺大模型,讓實例分割、目標檢測等經典視覺任務成為通用大模型的原生能力,擺脫了傳統 “多專家模型拼湊” 的架構局限。商湯在視覺 AI 領域十余年的技術沉淀,也為多模態長程智能體構建了扎實的物理世界理解底座。
![]()
為了驗證 “系統級交付” 的真實實力,U1 Pro 在三類高難度場景中完成了實戰檢驗。
高信息密度視覺敘事方面,模型交付了一幅 4:1 超寬畫幅的宣紙水墨風長卷《智會世圖》,以東方山水為載體串聯 2018-2026 年 WAIC 九年發展歷程,整體視覺敘事統一,放大后高密度的文字、圖標等細節完整準確,實現了美學表達與信息傳遞的平衡。
![]()
可控視頻創作方面,模型不再零散生成單張鏡頭,而是自主完成了《沙影之刃》的世界觀設定、角色與怪物人設、服裝武器、環境色調等整體視覺規劃,一次性輸出 22 個邏輯連貫的連續分鏡,配合商湯視頻工具可實現人物、劇情與視覺語言的高度可控交付。
![]()
硬核數據推理方面,商湯 “小浣熊” 依托專屬技能持續分析,在 2026 年世界杯開賽前一個月成功預測最大黑馬佛得角出線,在 12 家參與預測的大模型中位列第二;同時 U1 Pro 將決賽雙方的晉級路徑、核心球員對位、戰術體系、傳球網絡、觸球熱力圖等復雜推理結果,轉化為完整的高清可視化圖表,閉環了 “信息搜集 - 分析推理 - 復雜視覺交付” 的全鏈路。
作為通用型多模態基座,SenseNova U1 Pro 的能力可覆蓋多元生產場景:商業辦公領域可實現企業信息圖、高品質演示文稿的自動化精準交付;品牌電商領域可輸出專業級商業海報與產品宣傳視覺;教育出版領域可繪制無錯漏的高精度科學圖解與教學素材;影視創意領域則可用于電影概念設計、動漫分鏡腳本創作,大幅縮短創意到專業制作的距離。
目前相關能力已在商湯旗下 “小浣熊” AI 產品及視頻創作工具 “Seko” 中完成深度驗證,服務著數以千萬計的個人用戶、近萬家企業用戶及大批 AI 原生組織。
據了解,SenseNova U1 Pro 預覽版已正式開啟邀請測試,后續將隨推理服務資源擴容逐步放開邀測范圍;正式版本將于 2026 年 8 月面向公眾開放,同步推出對應定價方案與 API 服務。
從行業發展的維度看,過去幾年多模態 AI 的迭代始終圍繞 “生成得更像、更準” 展開,但當 AI 逐步滲透進真實生產鏈路,“能不能穩定交付可用成果” 正成為新的行業標尺。商湯 SenseNova U1 Pro 的出現,本質上是將多模態 AI 的價值從 “內容生成工具” 推向了 “系統級交付單元”—— 它不再只是提供靈感素材的輔助角色,而是能獨立閉環復雜長程任務的生產主體。隨著原生統一架構的持續演進,視覺與語言的聯合涌現將進一步加速,這種 “理解、生成、行動” 深度統一的多模態智能體,也終將成為通用人工智能落地物理世界的核心底座。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.