![]()
能交付商用才是真生產力
作者丨高允毅
編輯丨馬曉寧
7月18日,在2026年WAIC大會上,商湯科技承辦的“基座大模型架構創新與生態合作論壇”如期舉行。大會之前,在喧囂的會場之外,《AI科技評論》拜訪了商湯科技首席科學家林達華。
當被問到“大語言模型已經發展到如今高度后,下一個決勝負戰場在哪”時,林達華沒有羅列復雜的Benchmark,他指向辦公室內的一盆矮腳綠植說“你能用語言向我描述清楚這盆盆景每一片葉子的精確位置嗎?”
接著他說:“這對我來說很困難,大量的感知細節是無法用語言窮盡的。人眼能一瞬看清的感知,語言卻往往無法說清楚。”
這記“盆景之問”,恰恰擊中了當下大語言模型面對真實物理世界時的那道隱形的邊界。
從設計中的高級審美,到城市空間的三維布局,再到自動駕駛、具身智能與現實世界的交互——凡是需要理解物理空間的場景,都離不開真正的“視覺”能力。
人類的大腦本就是語言與視覺的深度融合的產物。從這一第一性原理出發,商湯押注的下一個戰場,正是多模態。
過去一年,從 OpenAI 等國際巨頭到國內的Kimi、DeepSeek、字節、阿里,重金砸向多模態的玩家不在少數。然而,在視覺領域深耕多年的商湯,選擇了一條更難、也更接近本質的“硬核”道路:從底層融合語言和視覺基座。并在今年3月推出原生統一多模態架構 NEO-unify。
4 月,商湯正式發布并開源了基于原生統一架構的多模態模型SenseNova U1(簡稱U1),切入設計賽道。而在大會當天,商湯選擇邁入商用的深水區,推出可交付級別的旗艦模型——SenseNova U1 Pro(簡稱U1 Pro)。作為全球首個以“理解、生成、行動”原生統一為內核的多模態工具,它具備內生的“圖文交錯思維”,能直接輸出高達原生 8K 頂級畫質成片,在設計領域正面對標全球頂尖的如 GPT-Image-2等模型。
借此契機,我們與林達華進行了一場關于多模態的終極形態與商湯技術底牌的深度對話。
![]()
01
為什么多模態是Coding之后的下一個戰場
當前,AI Coding 是頭部 AI 廠商瘋狂內卷的行業高地,Anthropic等公司也因此實現飛升。外界疑惑的是,商湯為何在此時不急于跟風搶奪紅利,反而大談特談多模態?
在林達華看來,AI Coding 確實是目前商業化最成熟的賽道,但純文本語言的天花板也已經清晰顯現。
“你用任何一款代碼模型寫前端網頁,一眼就能看出來是 AI 生成的。它和具備‘蘋果級’質感的現代產品界面,有著非常明顯的差距。” 林達華指出,高級的設計感與空間美學,純靠代碼邏輯根本實現不了,這是純文本 Coding 天然的盲區。
行業中最敏銳的巨頭早已開始悄悄轉向。以編程能力見長的 Anthropic,在Opus 4.8 版本中重點強化多模態元素。
這意味著,當后端邏輯代碼的能力逐步趨同、價格戰愈演愈烈,前端體驗、視覺交互自然成了下一階段的競爭高地。這也正是商湯切入AI Coding戰場的機會,與其在純文本領域硬卷,不如發揮自身在視覺上的積累和絕對優勢。
在業內有一種觀點認為:未來的 AI Agent 都會以純文本命令行(CLI)交互,多模態的價值沒有想象中那么高。 林達華并不認同,他認為只要人和 AI 持續共存,在人機交互上,視覺交互就是不可替代的核心載體,“因為CLI是面向機器的,而視覺才是面向人類體驗的。”
無論是寫辦公匯報、海報設計,還是游戲開發、影視制作,這些更高頻的大眾場景,其本質都離不開視覺。
"想要打造能在物理世界中思考、行動的‘全能智能’,就必須打破壁壘,讓視覺與語言在底層大腦中融為一體。"林達華強調,這正是商湯自研 NEO-unify 原生統一架構的核心初衷。
但這并非易事。語音和文本屬于同構模態,語音可以直接映射為文字,僅多了語氣、停頓等少量維度;但視覺與語言是完全異構模態,像素無法簡單對應文字詞元,攻克異構模態融合,一直是多模態領域長期發展的核心難點。
![]()
02
U1 Pro的打怪升級路徑
長期以來,多模態大模型領域的主流技術路線是“拼接式架構”,即在成熟的語言大模型之外,外掛一個獨立的視覺編碼器(VE)等模塊。這種方式的本質,是先將圖像“翻譯”成文本,再交由語言模型去處理。
拼接方案的工程門檻低、訓練速度快,但其技術上天花板也相對較低。因為這種翻譯的過程,會損耗大量精細化空間和感知細節信息,導致視覺與語言的融合效率很低,并非"真正看見"。
林達華帶領的商湯團隊很早就看到了拼接架構的局限,并一直在尋找一種原生統一模型架構的可能性。 他們認為,多模態的終極形態應當是讓不同的AI模態擁有共同的語言和表征,從而能夠像人類大腦一樣,順暢無阻地深度溝。
“我們很早就看到了拼接架構的局限性。多模態的終極形態,應當是讓不同的模態擁有共同的內核語言和統一表征,能夠像人類大腦一樣,順暢無阻地深度溝通。”林達華透露,OpenAI和谷歌同樣意識到了這一點并秘而不宣,而商湯選擇走得更公開、更徹底。
這是一場堅守長期主義的漫長探索:
2025年中,林達華團隊聯合南洋理工大學S-Lab,率先在小規模數據上驗證了原生融合的設想。同年9月,團隊發表論文Towards Native Vision-Language Primitives at Scale,在學術界首次系統闡述了徹底移除視覺編碼器、建立深層融合的原生多模態NEO架構。
2026年3月,商湯進一步發布升級框架版——原生統一架構NEO-unify和論文NEO-unify: Building Native Multimodal Unified Models End to End系統闡述了打造端到端原生統一模型的宏大設想。
在NEO-unify架構中,商湯徹底移除了主流大模型普遍依賴的視覺編碼器和變分自編碼器,讓模型不再需要"翻譯器",而是直接從像素和文字中學習。
支撐其運轉的是一套自研的 Mixture-of-Transformers(MoT) 架構。該架構的獨特之處在于,它讓語言和視覺信息在模型的每一層計算中完成深度交融。對于多模態領域,這種從架構層面的重構,意義堪比Transformer之于大語言模型。
那這套架構效果好不好呢?其實效率驚人,NEO-unify架構僅需3.9億圖像文本示例(僅為業界同等性能模型約1/10的數據量),就涌現出了頂尖的視覺感知和推理能力。
開源版本的SenseNova U1正是這套架構的結果,它擁有真正的“圖文交錯思維鏈”,可以在同一個上下文里邊寫字邊插圖,確保圖像和文字在風格與內在邏輯上具備極高的一致性。值得一提的是,在同量級開源模型中,僅以 8B 體量起步的 U1 直接斬獲 SOTA 性能,部分表現甚至跨代直逼主流大型閉源模型。
隨后,研發團隊敏銳地鎖定了 “信息圖”(infographic)賽道,并且針對這一極具商業價值的場景,該系列正以驚人的速度高頻迭代:
infographic-V1:在底層算力架構上進行了全面重構,讓信息圖生成的信息密度與排版質感迎來了顯著跨越;
infographic-V2:徹底攻克了行業頑疾,針對以往“字數一多畫面就糊、甚至連字錯字”的痛點,大幅提升了小字清晰度與排版精度,視覺表現直接向專業設計師看齊。
infographic-V3:重磅引入“可編輯功能”,讓用戶可以隨時點選、直接修改畫面。
圖注:U1 Pro設計的關于“背包”的信息圖,可以看到圖中文字清晰準確,整體設計高級美觀
這套持續進化的技術范式,最終在U1 Pro上迎來了全面爆發,宣告了 AI 設計進入“交付級”時代。
![]()
03
為什么這是一款做設計的好模型
在當前的AI熱潮中,能畫出漂亮圖片的AI比比皆是。但當我們把這些AI拉進真實的商業設計場景時,往往會發現它們成了“花架子,一到復雜排版、密集信息、長需求描述的實際任務中就露了怯。
因為“畫畫”靠的是審美概率,而“設計”靠的是精準的邏輯與控制。
林達華將U1 Pro定位為一款在審美和設計能力上都達到一定高度的產品。這背后不是運氣,而是一場漫長且嚴苛的專業化淬煉。整個模型的訓練過程,就像一位“頂尖設計師”的成長史。
“想要讓AI具備真正的專業設計能力,就必須用上億道‘魔鬼級’的設計題去喂養它。”
林達華指出,天然的現實世界中,極少存在自帶密集信息和復雜排版的完美數據,這些“養料”必須依靠人工與算法精準創造。為此,商湯構建了一個規模過億、甚至逼近數十億級別的超大型“多模態題庫”。在這類高階數據中,僅單張設計圖對應的文字描述和需求說明,往往就長達上千字。
這種對數據極端嚴苛的需求,直接映射在U1 Pro的階段性訓練流中。
在預訓練階段,模型吞吐數十億級的圖文原生交錯數據,打下深厚的認知地基;進入持續預訓練階段,高比例的“合成數據”成為絕對主力,團隊在數億量級的數據海中,高強度拉升模型的專業設計能力;到了最終的后訓練階段,團隊則百里挑一,精選出千萬量級的黃金數據進行精雕細琢,讓模型的審美沉淀出成品級的交付質感。
而支撐這套龐大“合成數據”,正是商湯內部一套極其復雜的、由超級Agent驅動的自動化數據合成管線。
“核心技術的突破從來不是一場追逐風口的短跑,而是一場堅守長期主義的馬拉松”。在林達華看來,只要團隊認準了某個方向具備巨大的長遠潛力,即使它在某個階段并未處于社會輿論的絕對C位,商湯也會摒棄外界的雜音,以堅定的戰略定力進行長期主義的飽和投入。“因為我們深知,那些能真正改變行業底層范式的長期價值,遠比一時的流量熱點更為巨大。”
![]()
04
先打穿信息圖,講好商業故事
商湯為多模態戰略選擇的一個核心賽道是設計方向,尤其是信息圖,這是一個可商業化性極強的場景,尤其是B端,特別是電商、廣告、游戲、出海貿易等領域,有大量設計需求。
根據Precedence Research 等的最新報告:2026年全球設計領域的生成式AI市場規模約為 13.3 億美元。大型企業和企業級客戶貢獻了超過 47% 的市場份額,是AI設計工具最大的買單方。
然而長期以來,AI 生圖要真正走向高端商業化,始終面臨著難以逾越的瓶頸:
比如,AI無法準確理解需求,從而圖不達意。市面上有不少模板拼接方案,但這種方案又存在無法消除的割裂感,整體版式、色彩、比例無法形成統一審美邏輯,肉眼能直觀看出拼湊痕跡。
更麻煩的是,模型無法建立元素間的設計因果,只是簡單堆砌圖形文字,完全不理解版式排布、元素搭配與品牌表達之間的內在關聯。
一旦客戶提出局部微調需求,又往往會牽一發而動全身,導致修改成本甚至超越重新原創,這些都是AI設計難以直接走向高端商業化的核心瓶頸。
“學術界生成一張圖,100 個字錯 1 個,論文里可以打 99 分。但真實商業世界里,一張客戶的海報錯一個字,這張圖就是廢紙,只能打 0 分。” 商湯首席科學家林達華直接指出行業痛點。
面對這些挑戰,U1 Pro依托原生統一多模態架構,從底層理解到圖像生成,系統性解決了上述難題。
在評判模型優劣時,林達華評判模型好壞的標尺只有一個:交付率,即生成內容無需大幅修改,可直接交付商用,達到付費專業設計師的出品標準。
他公布了 U1 Pro 最新交付率數據穩定在70%。
這個數字乍一聽似乎不高,但放在真實的商業場景,這足以真正改變設計賽道的供需關系。60%是商業可交付基準線,放眼全球,只有兩個多模態模型超越這一基準,一個是商湯U1 Pro,另一個是來自OpenAI的GPT-Image-2,后者被稱為多模態行業御用標尺。
70% 交付率背后是嚴苛的全維度品控,這意味著,文字錯誤率控制在千分級,整張圖上千文字僅極低概率出現錯字;圖形元素、空間布局、色彩搭配等細節錯誤同步控制在千分級。
換句話說,AI 真正具備了人類主觀的“高級審美”,能夠做出讓客戶心甘情愿買單的設計。
![]()
圖注:從U1 Pro設計的泉州主題海報,可以看到豐富的內容和細膩的設計
![]()
圖注:U1 Pro設計的二十四節氣海報,支持8K分辨率及特殊長寬比
U1 Pro 是怎么做到有如此高的交付率?林達華向我們透露,其核心在于商湯設計了一種叫“視覺拆解思維鏈”的學習模式,將模型訓練成了“會思考的設計師”。
在訓練過程中,當模型拿到一個高質量海報后,先會自動拆解圖像全部視覺組件,再逆向推理設計師版式布局邏輯、色彩搭配思路,生成完整設計思維鏈進行學習,不只是學形似,而是抓思路,抓神韻。
這種設計思維內化進了模型本身,在生成圖片時,U1 Pro 不像傳統模型那樣“一次性盲盒出圖”,而是采用多輪智能體生成閉環:
第一步先基于文本需求拆解信息、規劃版式,形成完整的設計方案;第二步依靠內生能力完成全圖生成;第三步啟動全局自檢,識別文字錯誤、布局瑕疵與審美問題,不斷反向迭代修改。直到完全符合交付標準才會輸出最終成品。
為了打磨"審美的最后一公里",商湯還組建了一支由200名美院學生和專業設計師組成的"人類審美團"。這些人每天的工作就是對著U1 Pro生成的的作品瘋狂"找茬"和打分。
就像設計公司的新人,被老板和甲方反復“毒打”了千百遍后,自然就知道什么是真正的高級感了。
![]()
05
世界模型是其中一個故事
采訪中,林達華透露一個有趣的細節,U1 Pro其實已經具有一些空間推演能力,能玩魔方了。這意味著,這款被定位為“設計師”的模型,已經開始隱隱觸摸到三維世界的邊緣。
在商湯的版圖上,世界模型并非是與多模態底座平行的另一條線,而是視覺與語言深度融合基座上的一個自然分支,就像Transformer是底座,上面可以長出各種LLM一樣。
而當下大熱的具身智能,也可以理解為同一個底座上的又一成熟分支。
以商湯“1+X”戰略下孵化的生態企業大曉機器人為例,其最新推出了“開悟”世界模型,它講的是理解、生成、預測的統一。解構其底層技術會發現,其背后依然是那個視覺與語言結合的多模態底座,只是在具體訓練中具身數據占了更高的比例。
看似萬流涌動,實則九流歸宗。這些分賽道的探索,數據和方法最終都會在下一代模型里合流。
值得一提的是,就在7月13日,商湯還發布了另一個理解與生成統一的視覺大模型SenseNova-Vision。它的核心戰略在于讓視覺成為通用基礎模型的原生能力,而這種原生視覺能力已在多個維度上超越了專用視覺模型。過去目標檢測、圖像分割、深度預測、3D重建等需要大量定制化的經典視覺任務,現在一個模型就能完成。
有了這些前沿探索的養分注入,商湯多模態的未來圖景已呼之欲出。
林達華透露,下一代的U2將真正走向三維。如果說U1還是在二維平面上的設計,那么U2將融入視頻的理解和生成,把感知、理解、生成、行動全部一體化。“也許再下一個版本,你給它一張設計草圖,它能把整個建筑造出來。”
而更遠處的終極形態,是模態從視覺、語言擴展到幾十種傳感器信號。“那個時候,才是大家認為的最完整的世界模型。”
然而,通往終極世界模型的道路并非一片坦途,物理規則的復雜性超乎想象。在林達華看來,未來在物理規則之外,還會納入人類社會學等更多維度。“今天機器人能準確拿起一杯水,明天它可能會區分一杯沸水和一杯溫水,并做出不同的動作反應。”
到那時,每新增一個物理屬性維度,數據組合的量級就會指數級暴漲,算力和存儲會成為無法突破的瓶頸。林達華對此給出了獨到的解題思路:或許未來的解法是對世界屬性進行解耦,拆分出不同屬性的專用子模型,讓它們有機組合、協同推理,而不是窮盡所有數據組合。
在這場充滿未知與瓶頸的科學馬拉松里,我們在林達華眼中看到的不是疲憊,是拓荒者的興奮。 采訪臨近尾聲,雷峰網向林達華發出最后的終極一問:
"你最想帶團隊攻克的下一個技術山頭是什么?"
"物理世界的AGI。"林達華沒有任何猶豫。
或許,在AI與人類之間,那些說不出的東西,恰恰是智能最堅硬的部分。
![]()
圖注:雷峰網拍到商湯上海辦公室,在迎客廳的醒目書架上放的一個碑
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.