![]()
![]()
2025年9月,28歲的姚順雨從OpenAI離職,加入騰訊擔(dān)任首席AI科學(xué)家,直接向總裁劉熾平匯報(bào)。九個(gè)月后,他的一位前同事可能也踏上了同一條路。
據(jù)雷鋒網(wǎng)報(bào)道,OpenAI研究科學(xué)家田永龍或?qū)⒓尤腧v訊混元團(tuán)隊(duì)。
根據(jù)最新了解的情況,田永龍將成為混元多模態(tài)模型方向的負(fù)責(zé)人,并向姚順雨匯報(bào)。但這筆人事變動(dòng)尚未最終落槌,田永龍目前尚未正式入職。如果順利,這是繼姚順雨之后,又一位從OpenAI核心研究團(tuán)隊(duì)轉(zhuǎn)投騰訊混元的研究人員。
對(duì)騰訊而言,這筆引援的指向非常明確。在字節(jié)豆包憑借視頻生成和圖像理解強(qiáng)勢(shì)占領(lǐng)多模態(tài)心智、阿里通義萬(wàn)相持續(xù)迭代的當(dāng)下,混元的多模態(tài)能力始終是外界眼中的短板。而田永龍的履歷,幾乎是為這一崗位量身定制的。
![]()
從清華到MIT:一條標(biāo)準(zhǔn)的頂尖AI人才路徑
田永龍的學(xué)術(shù)背景,是中國(guó)計(jì)算機(jī)視覺(jué)領(lǐng)域"黃金一代"的典型模板。
本科在清華大學(xué)完成,隨后赴香港中文大學(xué)攻讀碩士,導(dǎo)師是湯曉鷗和王曉剛。這是計(jì)算機(jī)視覺(jué)領(lǐng)域最具影響力的華人學(xué)者組合之一——湯曉鷗是商湯科技的創(chuàng)始人,王曉剛則是商湯首席科學(xué)家。在港中文期間,田永龍?jiān)?MMLab 打下了扎實(shí)的視覺(jué)識(shí)別與深度學(xué)習(xí)基礎(chǔ)。
之后,他進(jìn)入MIT EECS系,在Phillip Isola指導(dǎo)下攻讀博士學(xué)位,2022年畢業(yè)。Phillip Isola是生成模型領(lǐng)域的權(quán)威學(xué)者,以CycleGAN和對(duì)比學(xué)習(xí)相關(guān)研究聞名。在MIT的幾年,田永龍的研究重心逐漸從傳統(tǒng)的視覺(jué)識(shí)別轉(zhuǎn)向生成模型和表征學(xué)習(xí)。
這條路徑的每一步都踩在了中國(guó)AI人才梯隊(duì)的關(guān)鍵節(jié)點(diǎn)上:清華的本科篩選、港中文MMLab的視覺(jué)啟蒙、MIT的生成模型深造。他的Google Scholar引用數(shù)已達(dá)28,778次,h-index 35,僅2026年就有3,436次引用。
![]()
博士畢業(yè)后,田永龍先加入Google DeepMind位于劍橋的研究團(tuán)隊(duì)。在DeepMind期間,他專注于視覺(jué)感知與生成的基礎(chǔ)研究,親歷了這家實(shí)驗(yàn)室從AlphaGo時(shí)代向生成式AI轉(zhuǎn)型的過(guò)程。
隨后,他轉(zhuǎn)投OpenAI擔(dān)任研究科學(xué)家。在OpenAI,他的研究方向進(jìn)一步聚焦于機(jī)器感知、生成模型和表征學(xué)習(xí),且主要從視覺(jué)視角切入,而這正是當(dāng)前多模態(tài)大模型最核心的技術(shù)戰(zhàn)場(chǎng)。
在OpenAI期間,他與姚順雨成為同事。雖然兩人具體合作的項(xiàng)目未對(duì)外公開(kāi),但他們?cè)谕粫r(shí)期效力于OpenAI的研究團(tuán)隊(duì),親歷了GPT系列與多模態(tài)技術(shù)的快速迭代。
這段共事經(jīng)歷,很可能是田永龍最終選擇追隨姚順雨加入騰訊的重要伏筆。
![]()
Supervised Contrastive Learning與Fluid
田永龍?jiān)趯W(xué)術(shù)界的成名作,是Supervised Contrastive Learning(有監(jiān)督對(duì)比學(xué)習(xí))。這項(xiàng)工作將對(duì)比學(xué)習(xí)框架推廣到監(jiān)督場(chǎng)景,通過(guò)將同類樣本在表示空間中聚集在一起,顯著提升了視覺(jué)表示的質(zhì)量。論文發(fā)表后被廣泛引用,影響了后續(xù)大量視覺(jué)預(yù)訓(xùn)練模型的設(shè)計(jì)思路,包括SimCLR、MoCo等系列的演進(jìn)。
![]()
更近的一項(xiàng)重要貢獻(xiàn),是2024年10月發(fā)表的Fluid,一項(xiàng)關(guān)于自回歸文本到圖像生成模型的規(guī)模化研究。這項(xiàng)工作由田永龍與Lijie Fan、Tianhong Li等人合作完成,核心發(fā)現(xiàn)是:在視覺(jué)領(lǐng)域,使用連續(xù)token(continuous tokens)而非離散token(discrete tokens)的自回歸模型,在視覺(jué)質(zhì)量上顯著優(yōu)于離散token方案;同時(shí),隨機(jī)生成順序(random-order)相比固定光柵順序(raster-order)能獲得更好生成效果。基于這些發(fā)現(xiàn),團(tuán)隊(duì)訓(xùn)練了Fluid 10.5B模型,成為當(dāng)時(shí)的新標(biāo)桿。
這項(xiàng)工作的重要性在于,它試圖回答一個(gè)關(guān)鍵問(wèn)題:為什么自回歸模型在語(yǔ)言領(lǐng)域(GPT)取得了巨大成功,但在視覺(jué)領(lǐng)域的規(guī)模化卻一直不如擴(kuò)散模型?田永龍的答案是——token的連續(xù)性和生成順序可能是被忽視的關(guān)鍵變量。這對(duì)多模態(tài)大模型有直接的啟發(fā)意義:如果視覺(jué)生成和語(yǔ)言理解要在同一個(gè)模型中統(tǒng)一,自回歸架構(gòu)可能仍是值得押注的方向。
此外,他還參與了Autoregressive Image Generation without Vector Quantization(與何愷明、Tianhong Li合作,arXiv 2024),提出無(wú)需向量量化的自回歸圖像生成方法,將圖像建模為連續(xù)序列而非離散token;Learning Vision from Models Rivals Learning Vision from Data(CVPR 2024),探討合成數(shù)據(jù)在視覺(jué)學(xué)習(xí)中的潛力;以及Scaling Laws of Synthetic Images for Model Training(CVPR 2024),研究合成圖像的縮放規(guī)律。
這些工作的共同線索是:不滿足于簡(jiǎn)單的視覺(jué)識(shí)別,而是探索視覺(jué)的生成、理解與表征學(xué)習(xí)的統(tǒng)一框架。這正是多模態(tài)大模型想要實(shí)現(xiàn)的目標(biāo)——讓模型不僅能"看懂"圖像,還能"生成"圖像,并在兩種能力之間建立深層聯(lián)系。
![]()
混元多模態(tài)的換血
田永龍的加入,是騰訊混元多模態(tài)團(tuán)隊(duì)近一年來(lái)一系列人事變動(dòng)的最新一環(huán)。
在此之前,混元多模態(tài)方向經(jīng)歷了劇烈的組織震蕩。2024年底,原負(fù)責(zé)多模態(tài)統(tǒng)籌的劉威從騰訊離職,創(chuàng)辦了一家名為ReBirth的公司,主攻視頻生成。劉威是計(jì)算機(jī)視覺(jué)背景,在騰訊期間曾短暫管理過(guò)混元大模型團(tuán)隊(duì)。
劉威離開(kāi)后,多模態(tài)方向一度由蔣杰直接負(fù)責(zé)。2025年4月,騰訊在TEG體系內(nèi)正式成立獨(dú)立的大語(yǔ)言模型部與多模態(tài)模型部,試圖從組織架構(gòu)上解決過(guò)去"虛擬團(tuán)隊(duì)、資源分散"的問(wèn)題。
此后,騰訊在多模態(tài)方向持續(xù)引援:2025年中,微軟亞洲研究院的胡瀚空降騰訊,負(fù)責(zé)多模態(tài)大模型;同年,原阿里通義實(shí)驗(yàn)室應(yīng)用視覺(jué)團(tuán)隊(duì)負(fù)責(zé)人薄列峰加入混元團(tuán)隊(duì);2026年1月,清華大學(xué)計(jì)算機(jī)系博士龐天宇加盟,負(fù)責(zé)多模態(tài)強(qiáng)化學(xué)習(xí)前沿算法探索。
但這些引援似乎仍未完全解決混元多模態(tài)的底層問(wèn)題。一位接近騰訊的人士此前對(duì)媒體表示,字節(jié)豆包在多模態(tài)和內(nèi)容創(chuàng)作生態(tài)上最強(qiáng),阿里通義千問(wèn)在長(zhǎng)文本處理和辦公場(chǎng)景中更專業(yè),而騰訊混元雖然深度綁定微信/QQ生態(tài),但在多模態(tài)技術(shù)的領(lǐng)先性上仍有差距。
田永龍的到來(lái),可能意味著騰訊想在多模態(tài)的基礎(chǔ)研究層面補(bǔ)課。他的背景——從對(duì)比學(xué)習(xí)到自回歸圖像生成,從視覺(jué)表示到合成數(shù)據(jù)縮放律——恰好對(duì)應(yīng)了多模態(tài)模型當(dāng)前最前沿的技術(shù)議題。
對(duì)姚順雨而言,田永龍的加入幫他補(bǔ)齊了混元團(tuán)隊(duì)最關(guān)鍵的一塊拼圖。姚順雨本人的背景更偏向語(yǔ)言模型的后訓(xùn)練和推理,而田永龍則是視覺(jué)生成與表征學(xué)習(xí)的專家。兩人的組合,恰好覆蓋了大語(yǔ)言模型和多模態(tài)模型兩個(gè)核心方向。
![]()
尾聲
大模型競(jìng)賽進(jìn)入2026年,單模態(tài)的文本能力已逐漸同質(zhì)化,多模態(tài)成為新的技術(shù)分水嶺。對(duì)騰訊而言,能否在多模態(tài)上建立真正的技術(shù)壁壘,將決定混元是僅僅服務(wù)于微信、QQ等內(nèi)部生態(tài)的"工具箱",還是能成為與字節(jié)、阿里正面抗衡的通用智能平臺(tái)。
田永龍的加入,是騰訊提升"人才密度"的又一注碼。但多模態(tài)的戰(zhàn)場(chǎng),從來(lái)不缺頂尖選手。他能否在混元復(fù)制甚至超越其在OpenAI的研究成果,將是接下來(lái)值得持續(xù)觀察的變量。
![]()
![]()
![]()
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.