【2026年7月18日】今日,在2026世界人工智能大會(WAIC)上,商湯科技正式發(fā)布了大模型家族的重量級旗艦新品——SenseNova U1 Pro(以下簡稱U1 Pro)。
作為“日日新 SenseNova U”系列的旗艦版本,U1 Pro 定位為面向長程任務(wù)的交付級原生多模態(tài)智能體基座,實現(xiàn)理解、生成和行動的深度統(tǒng)一。在原生統(tǒng)一架構(gòu)的基礎(chǔ)上,通過在視覺創(chuàng)作領(lǐng)域的深度迭代,U1 Pro 具備了媲美全球頂尖模型的“交付級”復(fù)雜圖片創(chuàng)作能力,擁有廣闊的應(yīng)用空間
U1 Pro的問世,標志著多模態(tài) AI 正在迎來一場深刻的“長程演進”:行業(yè)正式告別傳統(tǒng)的“單點式內(nèi)容生成(Generation)”,全面邁向能夠閉環(huán)完成復(fù)雜、長程任務(wù)的“系統(tǒng)級內(nèi)容交付(Delivery)”新時代。
多模態(tài)演進第三階段:攻克“抽卡”痛點,定義“交付級”新標準
正如代碼產(chǎn)品已率先走通了“從 Copilot 工具輔助,到 Vibe Coding 意圖驅(qū)動,再到 Agentic Coding 系統(tǒng)級任務(wù)交付”的路徑,多模態(tài)產(chǎn)品也正在經(jīng)歷相同的長程演進:第一階段解決“真實感生成”的問題,到第二階段能夠以自然語言交互,并持續(xù)修改,實現(xiàn)多模態(tài)創(chuàng)作進階,再到第三階段能在真實場景中,直接完成“交付級”創(chuàng)作,完美兼顧設(shè)計美感和內(nèi)容精準,解決反復(fù)抽卡的困境。
然而能交互,不等于能交付。旗艦版SenseNova U1 Pro圍繞“一個復(fù)雜目標,持續(xù)理解、規(guī)劃、執(zhí)行、檢查和修正”,帶來了四大核心交付能力:
- 巔峰設(shè)計美感,告別“AI味”:圖像生成從“細節(jié)逼真”推進到“專業(yè)設(shè)計美感”的全新階段,作品具備極強的構(gòu)圖、色彩與排版美學(xué),直接實現(xiàn)專業(yè)交付品質(zhì)
- 原生 8K 超清輸出:最高可支持8K 原生分辨率輸出,輕松駕馭高信息密度的超長、超大圖創(chuàng)作。畫幅放大后,文字、線條、圖標和模塊關(guān)系仍然清晰穩(wěn)定,經(jīng)得起印刷、展覽級細節(jié)檢驗。
- 極致的圖文與細節(jié)控制:大幅加強了圖文信息整合分析能力。在極高信息密度下,U1 Pro 仍能維持整體版式與內(nèi)容表達,文字渲染出錯率極低。
- 長程 Agentic 閉環(huán)思維:基于統(tǒng)一基座內(nèi)生的理解、生成和行動能力,支持長程圖文交錯思維,能夠圍繞復(fù)雜目標進行數(shù)十輪的Agentic Generation Loop(智能體生成循環(huán))。并在最新版本中,進一步實現(xiàn)了整體風格與局部文本的同步精準可控編輯,讓交付結(jié)果可被持續(xù)修改與使用。
技術(shù)基石:NEO-unify 架構(gòu)與原生視覺底座的深度融合
SenseNova U1 Pro 之所以能夠突破“生成”邊界、走向“穩(wěn)定交付”,其底層核心得益于NEO-unify 內(nèi)核架構(gòu)在原生多模態(tài)體系中實現(xiàn)語言和視覺的統(tǒng)一表征,打破了理解與生成的割裂壁壘。
商湯今年4月開源了基礎(chǔ)模型 SenseNova U1。開源兩個多月以來,在真實高強度工作流實踐中,U1 迎來了爆發(fā)式增長。今年6月,U1的用戶人均日生圖量相比5月提升近3倍,表明模型已深度切入真實應(yīng)用工作流。截至7月中旬,SenseNova U1以及集成了U1能力的SenseNova-Skills代碼庫在GitHub的總Star 數(shù)突破8000。
同時,商湯開源的SenseNova-Vision 統(tǒng)一視覺大模型,基于原生統(tǒng)一架構(gòu),讓經(jīng)典視覺任務(wù)如實例分割、目標檢測等,直接成為通用大模型的原生能力,告別了傳統(tǒng)“多專家模型拼湊”的局限。商湯在視覺 AI 領(lǐng)域十余年的技術(shù)沉淀,也為多模態(tài)長程智能體提供了堅實的世界理解底座。
真實物理世界大考:高難度場景實戰(zhàn)檢驗
在考驗其面向復(fù)雜多模態(tài)任務(wù)的“系統(tǒng)級交付”實力中,SenseNova U1 Pro 在美學(xué)敘事、邏輯控制以及硬核數(shù)據(jù)推理三大高難度場景,交出了驚艷的答卷:
高信息密度視覺敘事:WAIC九周年《智會世圖》東方山水長卷
U1 Pro 最終交付了一幅4:1 超寬畫幅的宣紙水墨風東方美學(xué)長卷,圖中包含豐富的河流、山脈、城市地標與高密度小字信息,遠看具備“統(tǒng)一視覺敘事”,放大后看大量文字、圖標等設(shè)計細節(jié)完美支撐,自然連接起2018 至 2026 年跨越九年的世界人工智能大會發(fā)展歷程。
可控視頻創(chuàng)作:《沙影之刃》世界觀設(shè)定與 22 鏡分鏡
在復(fù)雜視頻創(chuàng)作任務(wù)中,模型不再只是依靠隨機抽卡拼湊鏡頭,而是率先自主規(guī)劃并生成了包含劇情世界觀、主角與敵人人設(shè)、服裝武器、沙漠環(huán)境色調(diào)在內(nèi)的整體視覺藍圖,并一次性輸出多達22 個邏輯一致的連續(xù)分鏡。在此基礎(chǔ)上,配合商湯視頻工具,實現(xiàn)了人物、劇情和視覺語言的高度可控交付。
硬核邏輯推理與復(fù)雜交付:世界杯黑馬預(yù)測與決賽全景復(fù)盤
商湯“小浣熊”依托專屬 Skills 進行持續(xù)分析,在2026年世界杯開賽前一個月,成功預(yù)測本屆最大黑馬——佛得角出線,在 12 家參與預(yù)測的大模型中高居第二。
同時,U1 Pro 展現(xiàn)了極強的“數(shù)據(jù)向視覺轉(zhuǎn)化”能力。它能將復(fù)雜的體育戰(zhàn)術(shù)及數(shù)據(jù)——如世界杯決賽雙方的晉級路徑、核心球員對位、戰(zhàn)術(shù)體系、傳球網(wǎng)絡(luò)及觸球熱力圖等高密度推理結(jié)果融會貫通,自主生成一張高清的可視化圖表報告,完整閉環(huán)了“信息搜集-分析推理-復(fù)雜視覺交付”的全流程。
賦能生產(chǎn)力底座:重塑個人、組織與企業(yè)單元
作為一個極具通用性的多模態(tài)基座,SenseNova U1 Pro 正在重塑辦公、電商、教育等每一個生產(chǎn)單元:
- 商業(yè)與辦公:企業(yè)信息圖、高品質(zhì)商業(yè)演示文稿(PPT)的自動化與精準交付。
- 品牌與電商:商業(yè)海報、產(chǎn)品宣傳視覺的專業(yè)級美學(xué)輸出。
- 教育與出版:高精度科學(xué)圖解、教學(xué)用圖像的無錯漏繪制。
- 創(chuàng)意內(nèi)容創(chuàng)作:電影影視概念設(shè)計、動漫分鏡腳本等數(shù)字藝術(shù)創(chuàng)作,大幅縮短創(chuàng)意與專業(yè)制作之間的距離。
同時,該能力在商湯旗下的產(chǎn)業(yè)級AI “小浣熊” 及視頻創(chuàng)作工具 “Seko” 中已得到深度驗證,幫助數(shù)以千萬計的個人用戶、接近一萬家企業(yè)用戶以及大批AI原生組織,將自身經(jīng)驗、興趣和創(chuàng)意轉(zhuǎn)化為可規(guī)模化復(fù)用的真實交付成果。
即日起,商湯科技 SenseNova U1 Pro 的預(yù)覽版本已正式邀請測試,并將隨著推理服務(wù)資源擴大逐步放開邀測范圍。模型的正式版本將在今年 8 月份正式上線對公眾開放服務(wù),屆時相應(yīng)的定價和 API 服務(wù)也將同步推出。
我們相信在“理解、生成、行動”原生統(tǒng)一架構(gòu)下,“視覺和語言的聯(lián)合涌現(xiàn)”將加速實現(xiàn),最終為物理世界的 AGI 構(gòu)建全新的通用智能底座。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.