![]()
2025年5月,一款名為BAGEL的開源多模態(tài)模型在Hugging Face上登頂趨勢榜第一。它在標準多模態(tài)理解測試中超過了當時熱門的Qwen2.5-VL,被社區(qū)視為GPT-4o和Gemini 2.0最強有力的開源替代方案。但最讓發(fā)布團隊意外的不是榜單排名,而是他們在訓練中發(fā)現(xiàn):隨著交錯多模態(tài)數(shù)據(jù)的規(guī)模持續(xù)擴大,模型自己涌現(xiàn)出了推理能力。這不是刻意設(shè)計的結(jié)果,而是龐大的數(shù)據(jù)庫自發(fā)創(chuàng)造的驚喜。
這個項目背后的人叫范浩奇,谷歌學術(shù)總引用量超過四萬次,與何愷明共同創(chuàng)作的MoCo論文改變了計算機視覺領(lǐng)域?qū)ψ员O(jiān)督學習的認知。幾乎在過去十年計算機視覺領(lǐng)域的每一次范式轉(zhuǎn)移中都有它的參與:CNN時代的SlowFast,Transformer時代的MViT和MAE-ST,多模態(tài)時代的BAGEL。
2026年春節(jié)剛過,字節(jié)跳動Seed團隊就把新成立的世界模型研究組交給了范浩奇。這一次,他的任務(wù)是:2026年底之前,拿出一款性能對標Google Genie 3的世界模型。字節(jié)為此批下了數(shù)千萬元的訓練數(shù)據(jù)預算,是其他廠商的三到四倍,招聘開出的薪酬比市場平均水平高出百分之三十到五十。一個在FAIR(Facebook AI Research)待了七年的研究員,回國不到兩年,就被推到了一場全球競爭的最前沿。而敢于直面挑戰(zhàn),也正是范浩奇數(shù)十年來的工作準則。
![]()
圖片來源:Linkedin
冷門方向的起點
2013年,范浩奇遠渡重洋,進入卡內(nèi)基梅隆大學機器人研究所。這所學院在全球機器人學領(lǐng)域排名第一,以機器人控制、SLAM、機械設(shè)計等硬核方向著稱。大多數(shù)畢業(yè)生去了波士頓動力和NASA,或者自己創(chuàng)辦機器人公司。范浩奇在這里選擇的研究方向,對于當時的計算機視覺領(lǐng)域而言,屬于冷門中的冷門:第一人稱視覺活動識別。
后來與他長期合作的Christoph Feichtenhofer在一次訪談中提到:“好的研究者不是追逐熱點的人,而是找到重要問題并持續(xù)投入的人。”范浩奇在CMU的選擇,也許是這句話最早的注腳。
范浩奇的導師是Kris Kitani教授,專注于第一視角視覺、行為預測和人機交互的研究。在Kitani的指導下,范浩奇參與了第一人稱活動識別的研究,相關(guān)成果以第二作者身份發(fā)表于CVPR 2016。碩士畢業(yè)后,在CVPR 2018上,他以第一作者發(fā)表了關(guān)于多模態(tài)推理的論文《Stacked Latent Attention for Multimodal Reasoning》。對于一個碩士畢業(yè)生來說,兩篇CVPR已經(jīng)是相當漂亮的成績單。
在CMU的幾年里,他收獲了底層訓練的思維能力:從系統(tǒng)層面理解問題,而不是從某個具體的benchmark出發(fā)。機器人研究所的思維方式讓他學會不能只關(guān)心“這個視覺信號是什么”,還必須注意“這個信號對應(yīng)著怎樣的物理世界、應(yīng)該做出什么反應(yīng)”。這種看問題的角度,讓他在后來轉(zhuǎn)向多模態(tài)、世界模型等領(lǐng)域的時候,變成了一種獨特的先發(fā)優(yōu)勢。
碩士畢業(yè)后,他沒有繼續(xù)讀博,而是直接進入了工業(yè)界。當時正值深度學習浪潮席卷全球,F(xiàn)acebook AI Research正處于最激進的擴張期,大批頂尖研究者從學術(shù)界涌入。范浩奇選擇了FAIR,一待就是七年。
![]()
圖片來源:范浩奇的GitHub
在FAIR站穩(wěn)腳跟
2016年,范浩奇加入Facebook AI Research。那時的FAIR是全球AI研究員最向往的實驗室之一——Yann LeCun坐鎮(zhèn),Ross Girshick的Faster R-CNN統(tǒng)治著目標檢測,何愷明剛剛用ResNet刷新了人們對深度學習深度的認知。
在FAIR的頭幾年,他并不是最引人注目的那個名字。但如果你翻閱2016到2020年間FAIR產(chǎn)出的視頻理解方向論文,他的名字幾乎無處不在。視頻理解,也是范浩奇加入FAIR立穩(wěn)腳跟的第一張牌。當時,何愷明和Christoph Feichtenhofer提出了一個想法:設(shè)計兩條并行的網(wǎng)絡(luò)路徑,一條處理慢速的語義信息,一條捕捉快速的時間動態(tài)。這個想法后來被命名為SlowFast。SlowFast是FAIR視頻理解團隊共同完成的工作,范浩奇是核心作者之一,負責大規(guī)模實驗驗證與系統(tǒng)落地,與Feichtenhofer、何愷明等人深度協(xié)作完成了這一工作。2019年,SlowFast被ICCV接收為Oral論文,成為視頻理解領(lǐng)域的標桿工作之一。范浩奇通過這個項目證明了,他能把頂級的想法變成頂級的執(zhí)行。
同期,他主導開發(fā)了PySlowFast代碼庫,這個開源工具后來成為全球視頻理解研究者的標準工具箱,在GitHub上獲得高星。2019年6月,他帶領(lǐng)團隊在AVA視頻活動檢測挑戰(zhàn)賽中獲得第一名。同年11月,他開始在ICCV合辦視覺識別教程,隨后又在CVPR 2020和ECCV 2020延續(xù)了這一工作——在學術(shù)界,教程組織者通常是領(lǐng)域內(nèi)公認的專家才被邀請擔任的角色。在三十歲之前,范浩奇已經(jīng)是視頻理解領(lǐng)域被同行認可的重要人物。
但真正讓他從實驗室的年輕人中站出來的,是2020年的MoCo。在2019年底,計算機視覺領(lǐng)域的主流觀點仍然是:沒有標簽的視覺模型不可能達到監(jiān)督學習的水平。但何愷明認為:可以用動量對比的方式構(gòu)建一個動態(tài)字典,讓模型從大量無標簽數(shù)據(jù)中學習有用的視覺表征。在MoCo的研發(fā)過程中,范浩奇承擔了核心的系統(tǒng)實現(xiàn)與實驗驗證工作,與何愷明緊密協(xié)作——這也是兩人長期合作模式的起點。
2020年6月,MoCo被CVPR接收為Oral論文,獲得最佳論文提名。消息公布后,整個自監(jiān)督學習領(lǐng)域開始快速轉(zhuǎn)向——研究者們突然意識到,無監(jiān)督學習確實可以做到和監(jiān)督學習接近甚至更好的效果。MoCo的代碼被開源,成為該領(lǐng)域使用最廣泛的基準工作之一。范浩奇的谷歌學術(shù)在2020年迎來了第一次陡峭的攀升,年度引用從上一年的224躍升到1120。
MoCo之后,范浩奇與何愷明的合作就保持了長期且穩(wěn)定的關(guān)系。2020年的MoCo v2,2022年的MAE-ST……在FAIR的華人研究員群體中,范浩奇是少數(shù)幾個能與何愷明持續(xù)合作多篇重磅論文的年輕人。他們的工作模式是:何愷明擅長提出概念性和方向性的想法,范浩奇擅長把這些想法快速落地為實驗結(jié)果,并用實驗反饋來修正和優(yōu)化原始思路。這是一個高效的閉環(huán)。
在FAIR的七年里,范浩奇從何愷明和其他資深研究員身上學到的最重要的東西,可能不是具體的技術(shù),而是一種判斷力——什么樣的問題是真正值得花時間去解決的,什么樣的方向在長期來看更重要。這種判斷力,后來成為他在每一次范式轉(zhuǎn)移前都能提前轉(zhuǎn)身的核心支撐。
在熱點轉(zhuǎn)移之前提前出發(fā)
“如果你在一個研究領(lǐng)域中停留太久,你很可能會在下一個浪潮到來時喪失競爭力。與其被動地被技術(shù)演進淘汰,不如主動淘汰自己已有的存量優(yōu)勢。”這似乎是范浩明一以貫之的判斷邏輯。而這個邏輯在2023年得到了驗證。
2020年到2022年,計算機視覺領(lǐng)域經(jīng)歷了劇烈的范式轉(zhuǎn)移。CNN的統(tǒng)治地位開始松動,Transformer從自然語言處理“跨界”到視覺領(lǐng)域,自監(jiān)督學習從邊緣走向主流,多模態(tài)模型開始展現(xiàn)出超越純視覺模型的能力。很多在CNN時代積累了豐富經(jīng)驗的研究者在這波浪潮中措手不及,因為過去賴以成名的工具和框架突然變得不再適用。
范浩奇的應(yīng)對方式是:在每一個拐點到來之前,主動換道。2021年,他參與了多尺度視覺Transformer的研究。當時Vision Transformer剛剛出現(xiàn),大多數(shù)研究者還在摸索如何將Transformer有效地應(yīng)用到視覺任務(wù)上。而范浩奇已經(jīng)開始針對視頻數(shù)據(jù)的時空特性設(shè)計多尺度的Transformer結(jié)構(gòu),讓模型能夠同時捕捉精細的空間細節(jié)和長程的時間依賴。
2022年,他與何愷明再次聯(lián)手,將掩碼自編碼器從圖像擴展到視頻時空域,提出了MAE-ST。何愷明的MAE在圖像領(lǐng)域已經(jīng)證明了掩碼策略的有效性,但如何將其遷移到視頻——這個具有時間維度的數(shù)據(jù)形態(tài)——是一個關(guān)鍵的技術(shù)難題。同一年,他還參與了FLIP的研究,開始涉足視覺與語言結(jié)合的方向。這個轉(zhuǎn)向在當時看來并不顯眼,但它標志著范浩奇的研究邊界正在從“讓機器看懂圖像”拓展到“讓機器同時理解圖像和語言”。這個轉(zhuǎn)向為他日后進入多模態(tài)領(lǐng)域積累了方法論基礎(chǔ)。
這三項工作放在一起看,可以捕捉到范浩奇身上一個不太被提及的特質(zhì):他愿意主動放棄已有的優(yōu)勢。MoCo已經(jīng)讓他站在了自監(jiān)督學習的前沿,如果愿意,他完全可以在那個方向上持續(xù)深耕,每年穩(wěn)定產(chǎn)出,積累更高的引用量。但他沒有這么做。他先后從自監(jiān)督轉(zhuǎn)向了Transformer架構(gòu),又從純視覺轉(zhuǎn)向了視覺-語言結(jié)合。每一次轉(zhuǎn)向都意味著離開熟悉的領(lǐng)域,進入一個需要重新學習、重新證明自己的新戰(zhàn)場。
![]()
圖片來源:范浩奇的Twitter(左一)
Hugging Face第一的背后
2023年末,范浩奇選擇離開Meta FAIR,加入字節(jié)跳動Seed團隊。從外部看,這是一個放棄了很多確定性的決定。
彼時的他,參與的多項工作已經(jīng)成為計算機視覺領(lǐng)域的標桿——自監(jiān)督學習的MoCo、視頻理解的SlowFast、時空掩碼自編碼器MAE-ST。留下來的劇本清晰可見:升職,帶更大的團隊,安穩(wěn)地成為這個領(lǐng)域的權(quán)威。
彼時,DeepSeek、月之暗面已經(jīng)憑借語言模型完成了第一輪聲量積累;字節(jié)的Seed團隊卻成立還不到一年,視覺基礎(chǔ)模型方向還在從零搭建。
加入字節(jié)后,范浩奇啟動了一個名為BAGEL的項目。當時的開源多模態(tài)模型有一個普遍問題:要么只做理解,要么只做生成,很少有把兩者統(tǒng)一起來且效果足夠好的。于是,范浩奇團隊希望做一款統(tǒng)一的、開源的多模態(tài)理解和生成模型。他們采取了一個相對激進的策略——大規(guī)模收集和清洗交錯多模態(tài)數(shù)據(jù),然后把數(shù)據(jù)喂給模型,賭的是數(shù)據(jù)規(guī)模本身能帶來質(zhì)變。
這個策略執(zhí)行了將近一年。2025年5月,BAGEL正式發(fā)布。結(jié)果超出預期:發(fā)布后不到24小時,在Hugging Face趨勢榜上登頂?shù)谝弧T诙嗄B(tài)理解的標準測試中,BAGEL超過了當時同樣備受關(guān)注的Qwen2.5-VL。
![]()
圖片來源:范浩奇的Twitter
但讓團隊最興奮的不是榜單排名,而是一個沒有預設(shè)過的發(fā)現(xiàn)。在BAGEL的技術(shù)報告中寫道:"令我們最驚訝的是,當交錯多模態(tài)數(shù)據(jù)的規(guī)模擴大到一定程度時,模型涌現(xiàn)出了推理能力。"團隊在設(shè)計BAGEL時沒有專門針對推理能力做過優(yōu)化,他們只是不斷增大數(shù)據(jù)規(guī)模,然后發(fā)現(xiàn)模型開始能夠回答需要多步推理的復雜問題了。這并不是固有的設(shè)計,而是大量數(shù)據(jù)堆出來的突然涌現(xiàn)。范浩奇本人在推特上提到這個發(fā)現(xiàn)時用了一個詞——"surprised"。
數(shù)千萬元的賭注
2026年初,字節(jié)跳動Seed團隊把新成立的世界模型研究組交給了范浩奇。他研究3D仿真路線,主攻娛樂和游戲場景;字節(jié)的另一團隊李航和王文千走VLA路線,主攻具身智能。他們的目標是一致的——讓AI從只能生成文字和圖片,進化到能理解物理世界的運行邏輯。
這個方向在學術(shù)界被稱為"世界模型",核心是讓AI學會理解物理世界中的因果關(guān)系、空間關(guān)系和時間演化規(guī)律。2025年8月,Google DeepMind發(fā)布了Genie 3,成為全球在這個方向上表現(xiàn)最突出的模型。字節(jié)為范浩奇設(shè)置了極有挑戰(zhàn)性的目標:2026年底之前,拿出性能對標Genie 3的產(chǎn)品。
字節(jié)為這個目標配置的資源令人側(cè)目。據(jù)行業(yè)媒體報道,訓練數(shù)據(jù)預算高達數(shù)千萬元,是其他廠商的三到四倍。在招聘方面,字節(jié)向DeepSeek、OpenAI、DeepMind、Meta的研究員發(fā)起定向挖獵,范浩奇團隊開出的薪酬比市場平均水平高出30%到50%,研究員的年薪范圍在180萬到250萬之間。字節(jié)愿意下這個注,是因為他們判斷世界模型可能是繼大語言模型之后AI行業(yè)最重要的戰(zhàn)場,誰能先做出足夠好的世界模型,誰就有可能在下一代技術(shù)范式中占據(jù)主動。
從被任命到年底,不到十二個月。范浩奇的團隊需要在這段時間里拿出對標Google最強模型的產(chǎn)品。這個目標能不能實現(xiàn),現(xiàn)在還沒有答案。數(shù)據(jù)標注團隊50人在春節(jié)期間沒有休息,在為這個目標竭盡全力地努力著。但在整個中國AI行業(yè)里,能被委以這樣的責任、拿到這樣的資源、被寄予這樣的期望的人,委實不算多。
從第一人稱視頻到世界模型,范浩奇的研究對象從“人在做什么”變成了“物理世界如何運行”。雖然他從未解釋過為什么總是選擇這些邊界模糊的問題來研究,但事后回看,他的每一次轉(zhuǎn)向,方向都對了。而這一次的結(jié)果,會在2026年底給出他的答卷。
作者:Yanlin Hang
參考文獻:
[1]來源:范浩奇?zhèn)€人主頁
鏈接:https://haoqifan.github.io
[2]來源:Google Scholar - Haoqi Fan
鏈接:https://scholar.google.com/citations?user=76B8lrgAAAAJ&hl=en
[3]來源:X/Twitter @HaoqiFan
鏈接:https://x.com/HaoqiFan
[4]來源:LinkedIn - Haoqi Fan
鏈接:https://www.linkedin.com/in/haoqi-fan-a190a3189
[5]來源:OpenReview - Haoqi Fan
鏈接:https://openreview.net/profile?id=~Haoqi_Fan2
[6]來源:CMU Robotics Institute - Haoqi Fan (MSCV 2016)
鏈接:https://www.ri.cmu.edu/robotics-education/computer-vision-mscv/ (校友名錄)
[7]來源:Kris Kitani - CMU Faculty Page
鏈接:https://www.ri.cmu.edu/ri-faculty/kris-kitani/
[8]來源:Going Deeper into First-Person Activity Recognition (CVPR 2016)
鏈接:https://openaccess.thecvf.com/content_cvpr_2016/html/Ma_Going_Deeper_Into_CVPR_2016_paper.html
[9]來源:Stacked Latent Attention for Multimodal Reasoning (CVPR 2018)
鏈接:https://openaccess.thecvf.com/content_cvpr_2018/html/Fan_Stacked_Latent_Attention_CVPR_2018_paper.html
[10]來源:SlowFast Networks for Video Recognition (ICCV 2019 Oral)
鏈接:https://openaccess.thecvf.com/content_ICCV_2019/html/Feichtenhofer_SlowFast_Networks_for_Video_Recognition_ICCV_2019_paper.html
[11]來源:Momentum Contrast for Unsupervised Visual Representation Learning, MoCo (CVPR 2020 Oral, Best Paper Nomination)
鏈接:https://openaccess.thecvf.com/content_CVPR_2020/html/He_Momentum_Contrast_for_Unsupervised_Visual_Representation_Learning_CVPR_2020_paper.html
[12]來源:Multiscale Vision Transformers, MViT (ICCV 2021)
鏈接:https://openaccess.thecvf.com/content/ICCV2021/html/Fan_Multiscale_Vision_Transformers_ICCV_2021_paper.html
[13]來源:Masked Autoencoders As Spatiotemporal Learners, MAE-ST (NeurIPS 2022)
鏈接:https://proceedings.neurips.cc/paper_files/paper/2022/hash/4087ea5bbde308b0effa396a6be9451e-Abstract-Conference.html
[14]來源:Scaling Language-Image Pre-training via Masking, FLIP (2022)
鏈接:https://arxiv.org/abs/2212.00794
[15]來源:BAGEL: Emerging Properties in Unified Multimodal Pretraining (2025)
鏈接:https://arxiv.org/abs/2505.14683
[16]來源:GitHub - BAGEL by ByteDance Seed
鏈接:https://github.com/bytedance-seed/BAGEL
[17]來源:ByteDance Seed - BAGEL Official Page
鏈接:https://seed.bytedance.com/zh/bagel
[18]來源:PySlowFast GitHub Repository
鏈接:https://github.com/facebookresearch/SlowFast
[19]來源:PyTorchVideo GitHub Repository
鏈接:https://github.com/facebookresearch/pytorchvideo
[20]來源:36氪《智能涌現(xiàn)》獨家報道 - 字節(jié)世界模型人事變動與戰(zhàn)略布局
鏈接:https://t.cj.sina.cn/articles/view/1750070171/684ff39b02001euma
[21]來源:贏仕獵頭行業(yè)分析 - 字節(jié)世界模型團隊薪酬與招聘信息
鏈接:https://www.winheadhunter.com/news/global_industrynews/296.html
加入ZF討論群,請先添加小助手微信
我們相信認知能夠跨越階層,
致力于為年輕人提供高質(zhì)量的科技和財經(jīng)內(nèi)容。
稿件經(jīng)采用可獲邀進入Z Finance內(nèi)部社群,優(yōu)秀者將成為簽約作者,00后更有機會成為Z Finance的早期共創(chuàng)成員。
我們正在招募新一期的實習生
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.