今天,阿里通義團隊發(fā)布了他們第三代圖像生成模型:Qwen-Image-3.0 。
![]()
官方博客用了一個字來概括這一代的核心進步,「實」。
不是好看,不是炫技,是「實」。內(nèi)容豐實、細節(jié)真實、知識厚實。
![]()
具體來說:支持最大4.5k token的超長指令輸入,可以在同一張圖里塞進九宮格級別的復(fù)雜信息量,每個格子都是一張獨立的信息圖,而且是一次性生成,不是多張拼接。文字渲染精度做到了10px小字依然清晰可辨,LaTeX公式、學(xué)術(shù)論文排版無障礙。覆蓋12國語言的原生渲染,支持100多種藝術(shù)風(fēng)格,甚至能聯(lián)網(wǎng)搜索實時信息直接生成天氣預(yù)報圖。
![]()
如果你看過我們之前對AI圖像模型的報道,會知道這種「官方宣布重大突破」我們已經(jīng)聽了不少次。每一次新模型發(fā)布都在講自己的新高度,但真正用起來怎么樣,往往需要親自上手才知道。
尤其是,對面的GPT-Image-2今年4月剛把Image Arena排行榜的第一名甩開第二名242分,這是該榜單有史以來最大的領(lǐng)先差距 。99%字符準確率、原生4K輸出、3秒內(nèi)出圖、Thinking Mode自檢機制,這些數(shù)字讓Qwen-Image-3.0一出生就直接面對著一個幾乎滿級的對手。
所以我們決定做一件直接的事:用完全相同的Prompt,在Qwen-Image-3.0和GPT-Image-2上各跑一次,把結(jié)果并排擺出來看。
下面是我們實測的5個維度(所有測試案例均是Qwen生成在前)。
復(fù)雜排版:科學(xué)海報
先上最難的,Qwen-Image-3.0官方博客中重點展示了它的「內(nèi)容可橫展」能力,一次性生成包含九個獨立信息圖的復(fù)雜九宮格。我們設(shè)計了一張?zhí)栂悼破蘸笞鳛闇y試題:8個星球信息塊圍繞中心的太陽系插圖排列,底部一條橫跨全寬的banner列出了六個行星與太陽的平均距離。
先說結(jié)論:GPT-Image-2贏了這一局,而且贏得很干脆。
Qwen這邊的問題不在于排版,排版本身沒問題,文字沒有重疊、格子排列整齊。問題出在了更根本的地方:它畫錯了太陽系。這幅本該是「太陽系示意圖」的插圖,生成的結(jié)果反而更像某種漫畫風(fēng)格的太空插畫,行星的相對位置、大小關(guān)系、甚至連最基本的空間結(jié)構(gòu)都不對。作為一個科普海報的核心信息載體,這種錯誤是不能接受的。
![]()
GPT-Image-2的版本則規(guī)規(guī)矩矩:8個信息塊的文字全部正確,網(wǎng)格線清晰分隔了每個區(qū)域,底部長banner的超長文字完整渲染,整體排版規(guī)則、均衡,沒有炫技但也沒有出錯。畫風(fēng)是專業(yè)科學(xué)插圖的風(fēng)格,不是漫畫。
![]()
坦白說,這個結(jié)果挺讓人意外的。Qwen-Image-3.0的「內(nèi)容豐實」賣點里,首當(dāng)其沖的就是復(fù)雜版面一次生成。但一張?zhí)栂岛髤s把太陽系畫錯了,不是文字錯了,是物理錯了。這比單純的文字排版出錯更核心,因為它考驗的不是「能不能渲染」,而是「知不知道自己在渲染什么」。
五種語言,一塊屏
第二個測試是多語言文字渲染,Qwen宣稱支持12國語言,GPT-Image-2宣稱99%字符準確率。我們設(shè)計了一個國際機場場景,航班信息板同時包含中文、日文、韓文、英文、阿拉伯文五種文字。
結(jié)果:GPT-Image-2五種語言全部正確,Qwen-Image-3.0在阿拉伯文上出了問題。
具體來說,Qwen的日文、韓文、英文、中文都準確渲染,沒有亂碼也沒有方塊字,但阿拉伯文部分寫錯了。
![]()
而且從整體畫面來看,GPT-Image-2的告示板有明顯的顏色區(qū)塊區(qū)分(不同行用了不同底色),更接近真正的航班信息屏;Qwen這塊板子從頭到尾一個顏色,視覺效果顯得扁平。
![]()
一個有意思的細節(jié):Qwen在機場場景本身的寫實度上沒有輸,航站樓、人群、光影都在線。但文字的部分,GPT-Image-2這邊確實更像一塊真正掛在機場天花板下的出發(fā)屏。
誰更像真人?
第三個測試是寫實人像,Qwen官方宣稱「毛孔與發(fā)絲纖毫畢現(xiàn),肌膚質(zhì)感逼近攝影級真實」,GPT-Image-2在第三方評測中寫實度拿下了97%的分數(shù)(ZDNET測試)。Prompt設(shè)定了一位70歲老人坐在窗邊的陰天光影場景,點名要了85mm f/1.4的淺景深效果。
結(jié)果出人意料地接近。
兩個模型都沒有出現(xiàn)明顯的AI感,沒有塑料皮膚,沒有過度光滑的年輕化美化,皺紋、曬斑、銀色的胡茬都還原到位。光影的柔和過渡也符合「陰天窗光」的描述。
![]()
唯一的區(qū)別是面孔的種族特征:Qwen生成了一張亞洲面孔,GPT-Image-2生成了歐洲面孔。Prompt中沒有指定種族,兩個模型各自走了自己訓(xùn)練數(shù)據(jù)中「老年人肖像」的默認路徑。
![]()
這一局我們判平手。如果要挑刺,兩家都在同一個問題上沒有犯錯,這本身已經(jīng)說明了這一代圖像模型的寫實功底。
會做UI的AI
第四個測試有意思了,Qwen官方博客用了一個非常炫的演示:一張圖里從外到內(nèi)依次嵌套了VSCode編程界面、千問聊天界面、微信聊天界面、手沖咖啡海報,四層「畫中畫」,UI仿真是他們重點展示的能力。
![]()
我們設(shè)計了一個更接地氣的測試:一個帶中文內(nèi)容的暗黑模式社交App截圖。底部導(dǎo)航欄、用戶頭像、點贊評論數(shù)據(jù)、emoji和話題標簽、三條中文評論,這些元素缺一不可。
中文文字渲染上,兩個模型都沒有出錯。評論區(qū)的中文、話題標簽、emoji全部正常顯示。
但Qwen犯了一個更低級的錯誤:邏輯錯了。
在這張「截圖」里,評論區(qū)每條評論的昵稱出現(xiàn)在了評論內(nèi)容的下面,而不是上面。用過任何一個社交App的人都知道,昵稱在內(nèi)容上面是基本的信息層級,你先看到是誰說的,再看到他說了什么,Qwen把這個層級搞反了。
![]()
GPT-Image-2沒有犯這個錯誤,而且整體來看,GPT-Image-2的版本更接近一張真實的手機截圖,按鈕比例、卡片間距、文字大小都更自然。Qwen的UI元素雖然都在,但組合在一起的時候,缺少一種「這是一個真正被設(shè)計和上線過的App」的整體感。
![]()
有時候不是能力問題,是對交互常識的理解問題。
拉到極限,誰先崩?
最后一個測試是純壓力的,一個超寬畫幅的未來生態(tài)城市:左側(cè)是覆蓋垂直花園的摩天樓群,中間是太陽能船穿行的河流,右側(cè)是巨大的公園里有至少20個可見的人物,天空中有送貨無人機和透明飛艇。Prompt明確要求了「8K quality」「ultra detailed」「wide panoramic aspect ratio」。
先比分辨率,GPT-Image-2直接輸出了原生4K(3840×2160),Qwen的輸出是2K級別,這一點上GPT-Image-2的硬件上限更高。
![]()
再比細節(jié)崩壞,兩個模型在人臉上都沒有翻車,20個人物的面部沒有出現(xiàn)明顯的扭曲或變形。但Qwen在個別人物的腿部出現(xiàn)了輕微的變形,GPT-Image-2因為生成的視角更遠,一些遠景人物的臉上多少有點不太自然。
![]()
![]()
速度方面,Qwen整體更快一些。
這一局的結(jié)論是:兩個模型在極限復(fù)雜場景下都沒有崩盤,但GPT-Image-2贏在了分辨率上限,Qwen贏在了速度。如果你需要一張能直接放進印刷品的高分辨率全景圖,GPT-Image-2目前沒有對手。如果你是快速迭代、批量出圖的工作流,Qwen的速度優(yōu)勢會更明顯。
五輪下來,誰更「實」?
我們把五個維度的結(jié)果拉通來看:
文字準確率:GPT-Image-2領(lǐng)先。測試01和02中,GPT在英文和五種語言混合渲染中保持全對,Qwen在阿拉伯文和科學(xué)知識的準確性上丟了分。
排版與信息密度:打平。兩個模型在復(fù)雜排版的基礎(chǔ)能力上都在線,Qwen的九宮格級信息承載能力確實存在,只是內(nèi)容本身出了問題,不是排版的問題。
寫實度:打平。人像測試中兩者都到了「看不出AI感」的水平,面孔的種族差異是訓(xùn)練數(shù)據(jù)偏好問題,不是能力問題。
UI與交互邏輯:GPT-Image-2領(lǐng)先。Qwen的中文UI在文字層面沒問題,但評論區(qū)昵稱和內(nèi)容的上下層級搞反了,這是一個交互常識問題,不是渲染精度問題。
極限輸出:各有所長。GPT-Image-2原生4K分辨率上限更高,Qwen生成速度更快。
回到官方那個字,「實」。
![]()
來源:Qwen官方博客
內(nèi)容豐實?Qwen-Image-3.0確實能裝下4.5k token的信息量,排版層面過關(guān)了。但「裝得下」不等于「裝得對」,太陽系海報的翻車說明模型對知識內(nèi)容的理解還沒跟上它的排版能力。
細節(jié)真實?過了。人像測試證明了這一點,跟GPT-Image-2正面硬剛沒落下風(fēng)。
知識厚實?12國語言覆蓋面確實廣,但阿拉伯文出錯說明覆蓋的深度還不夠均勻。UI評論區(qū)邏輯顛倒說明「世界知識」不只是知道一件東西長什么樣,還包括知道它應(yīng)該怎么用。
![]()
「實」這個字的承諾還沒有完全兌現(xiàn),它需要在對內(nèi)容的「理解」而非僅僅是「渲染」上,再往前走一步。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.