GPT Image2以1512分出色成績登頂Arena榜單,領先第二名241分,呈現出歷史最大分差生成速度提升6倍,3秒出圖,4K分辨率。英文、中文、韓文、孟加拉語的文字渲染準確率超過99%。這些數字的背后,是一位中國學者帶領一支僅13人的團隊,和一張從無錫到伯克利再到MIT的華人學術傳幫帶網絡。他的名字叫做——陳博遠。
這位年僅二十六歲、MIT博士畢業不到一年的年輕人,已然成為負責訓練GPT圖像生成模型的核心五個人成員之一,同時還是Sora視頻生成團隊的成員。他從高中夏令營里連Python語法都不懂的編程小白,到站在全球最強圖像生成模型最前方的Research Lead——只用了十年。
![]()
圖片來源: Boyuan Chen個人主頁
高中時代16歲玩機器人,17歲遇上引路人
陳博遠,2000年左右出生,他的高中時代在江蘇省天一中學度過。2015年起,由于自身對智能機器人領域的無盡熱愛,他選擇去擔任天一中學人工智能社的社長。在他的帶領下,天一中學的機器人小隊在全國乃至各類賽事中獲得優異成績,成為了一名在人工智能領域擁有深厚學術背景、堅定科研信念和抱負的青年學者。
2016年前后,16歲的他參加了FIRST Robotics Competition(FRC)。學校資源有限,但他每天花數小時設計機器人,帶隊完成比賽。同年5月,作為高二學生的他參加江蘇省青少年科技創新大賽,憑借圖像識別追蹤無人機項目入圍決賽。那時候他對AI還沒有概念。連Python的基本語法都不熟悉,NumPy是什么更是聞所未聞。
真正改變他軌跡的,是高二那年參加的一個科研夏令營。在那里,他結識了后來成為Google DeepMind資深研究員的華人學者夏斐(Fei Xia)。對一個高中生來說,這種出色的動手能力和鉆研勁頭是藏不住的。夏斐作為已經在Google DeepMind工作的資深研究員,愿意花時間向一個高中生解釋什么是深度學習,大概率是因為他看到了這個年輕人身上的好奇心和執行力——這是做研究最核心的兩個素質。正因如此,一個當時連編程都不會的高中生,就這樣被推入了AI世界的大門。
![]()
圖片來源:新智元(中間陳博遠,右一夏斐)
從夏令營里的偶然相識,促成了學術圈里最原始、最純粹的師徒關系,而這段關系的起點,只是一個前輩愿意花時間去引導一個后輩觀察,發現深度學習的世界。夏斐本身就是一個既做前沿研究、又愿意帶學生的學者。夏令營對他來說可能只是一個短期的mentoring機會,但對陳博遠來說,這是整個職業生涯的入口。
本科階段18歲進伯克利,19歲創業,20歲進頂級實驗室
2017年,陳博遠從天一中學國際部畢業,進入加州大學伯克利分校(UC Berkeley)。他選擇了計算機科學與應用數學雙專業,進入競爭激烈的EECS榮譽班(EECS Honors),最終以3.96的GPA完成本科學業。
入學三個月后,18歲的他做了一件大多數新生不會嘗試的事,他創辦了機器人教育公司(Robot Locomotion Group Lab),為中小學生開發機器人競賽相關的軟硬件產品。這家公司從2017年11月一直經營到2020年3月,跨越了他本科的大部分時間。從想法到代碼、從代碼到用戶、從用戶到收入,他完整走了一遍。一個18歲的大學生,一邊應付EECS榮譽班的雙學位課程,一邊經營一家面向中小學生的機器人教育公司——這種同時駕馭多件事的能力,后來在他同時操盤GPT圖像訓練和Sora視頻兩大項目時,幾乎以更大的規模重演。
![]()
圖片來源:MIT CSAIL Alliances
2019年1月,20歲的他進入伯克利人工智能實驗室(BAIR),師從美國機器人學習領域的先驅Pieter Abbeel,從事深度強化學習和無監督學習研究。這段經歷一直持續到2021年8月,幾乎覆蓋了他本科的后兩年半。2021年,22歲的陳博遠以雙學位榮譽畢業,隨后進入麻省理工學院(MIT)計算機科學與人工智能實驗室(CSAIL)攻讀博士學位。
至暗時刻
陳博遠的博士生涯比絕大多數人都要緊湊——2021年9月入學,2025年完成答辯,不到四年,同時還輔修了哲學。但光鮮背后,他也經歷過真實的低谷。讀博第一年,22至23歲的他因論文產出陷入瓶頸,這是他整個學術生涯最艱難的階段。
關鍵時刻,夏斐再次提供了決定性的幫助:協助陳博遠發表了第一篇有影響力的研究NLMap,并邀請他到Google X與Google DeepMind參與兩次實習。第一次實習在2022年5月至8月,23歲的他在Google X實習,表現出色到拿到了谷歌L4級別的return offer——但他選擇了decline,繼續深耕學術。第二次實習在2023年5月至8月,24歲的他來到Google DeepMind,在夏斐指導下主導搭建了基于大規模合成數據的多模態大語言模型(MLLM)數據合成管線,其總結的指令微調技術后來被Gemini2.0直接采用。
在MIT期間,他發表了多篇在學術界和工業界均獲得認可的研究。其中博士代表作“Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion”入選NeurIPS 2024,提出了一種全新的序列生成訓練范式,將逐token獨立噪聲級擴散與因果下一個token預測結合。他還以共同一作身份發表了“SpatialVLM”,通過自動構建互聯網規模的3D空間推理VQA數據集(1000萬圖像、20億QA對),為視覺語言模型賦予定量空間推理能力,可從單張2D圖像輸出米制距離、尺寸、方位等精確數值,將思維鏈空間推理應用到了具身智能領域。
![]()
圖片來源:Google scholar
值得一提的是,在此期間,陳博遠遇到了兩位出色的學者作為他的導師,他們分別是:1)Vincent Sitzmann,作為MIT EECS助理教授,領導Scene Representation Group(場景表示研究組),2)Russ Tedrake,作為MIT Toyota講席教授(橫跨EECS、航空航天、機械工程三個系),領導Robot Locomotion Group(機器人運動研究組)。這兩位導師對他的影響十分深遠。Vincent Sitzmann的“世界模型”研究思路——讓AI通過心理模擬器預判物理世界的變化,而不只是單純模仿像素——直接影響了陳博遠后續在OpenAI的技術方向。在陳博遠的讀博期間,Sitzmann幫助他探索把擴散模型和序列生成結合起來的方法,讓模型理解并分析時序和空間上的因果邏輯,從而更好的生成更高質量的內容。兩人聯合發表了《History-Guided Video Diffusion》和《Large Video Planner》兩篇論文。
![]()
圖片來源:arXiv
Russ Tedrake則教會了他研究的“延遲滿足”:陳博遠曾回憶,自己最初總想盡快投稿,但Tedrake會告訴他,“我知道你能把這篇論文投中,但我們應該再打磨一下,推遲提交。”那些被推遲提交的作品,后來都收到了前所未有的好評。Tedrake還教會他欣賞他人的工作、強調自己算法的優勢而非別人的局限——這種心態幫助他建立了真正有影響力的研究基礎。
2025年,不到26歲的陳博遠完成MIT博士答辯。輔修哲學的他,在研究之外也保持著對技術與人類關系的深層思考。他在個人博客中寫道:“我可以負責任地告訴大家,具身智能一定是下一個一百年最令人激動的技術,并且我們在有生之年很有希望見證通用機器人的誕生。”
OpenAI時代—從Sora到GPT Image 2的架構重構
2025年6月,博士剛畢業的陳博遠加入OpenAI,迅速成為GPT圖像生成核心五人研究團隊之一,負責GPT圖像生成模型的所有訓練,同時也是Sora視頻生成團隊的一員。在演示中,他給家鄉無錫做了一張海報。然后為來自首爾的隊友做韓文海報,為來自Bangladesh的隊友做孟加拉語海報。每一張中的文字渲染都精準無誤。
十個月后,2026年4月,GPT Image2發布。發布會現場,陳博遠和Sam Altman同臺主持,演示了文字渲染能力。但他在知乎博客里自嘲了一句:“多語言能力是直播后半節,國內媒體好像并沒有發現只有我才是國人QwQ。”這句帶表情符號的自嘲背后,是一個值得玩味的細節——在那支13人、華人過半的團隊里,真正站到前臺承擔訓練和能力展示核心角色的,是他。
![]()
圖片來源:陳博遠的知乎博客
發布后不久,陳博遠在知乎發了一篇博客,標題非常直接:“我在OpenAI修中文。”開頭更直接:“大家好,我是GPT Image團隊的研究科學家陳博遠。上周發布的GPT生圖模型就是我主力訓練的!”這篇博客不是技術論文,更像一個幕后花絮。但他透露的信息量足夠讓外界理解,GPT Image2為什么能做到99%的字符準確率。
解題思路發生了改變,舊方法是把文字當圖形畫,隨機噪聲還原成像素,“看起來像字”就行。GPT Image2把文字當語言生成,一個token接一個token,圖像和文字共用同一個生成流程。對語言模型來說,輸出“好”和輸出任何語言的字符一樣可靠。這個思路,和陳博遠2024年在NeurIPS發表的論文《Diffusion Forcing》高度呼應。那篇論文的標題就很直白:Next-token Prediction Meets Full-Sequence Diffusion。翻成大白話,就是讓“一個token接一個token的結構能力”和“擴散模型處理連續細節的能力”接上。他的學術工作,直接影響了他主力訓練的這個產品。
陳博遠在博客里還解釋了一個更有趣的細節:整個官網blog的所有圖片,都是用模型生成的,完全沒有普通文本。而他親手做了其中大部分。那張中文彩蛋漫畫,是他想做一個“很搞笑的漫畫”,用到了“接住梗”和“香蕉梗”。為了展示文字能力,他特意讓模型在圖里加入多國語言文字,又在家鄉海報的右下角生成特別特別小的中文,用來測試模型到底能處理多細的細節。更關鍵的是,這張圖不是拼接出來的——整張圖,包括畫中畫和畫中畫中畫,都是一次性生成的。他擔心大家以為這是拼接圖,還特意在圖底加了備注。
![]()
圖片來源:陳博遠的知乎博客
還有這張米粒刻字圖。4K分辨率,畫面里是一堆米粒,其中一顆米粒上刻著字。這測試的是模型在極小尺度里的文字控制能力。以及黑板視覺證明——用視覺方式證明數學定理。每一張看似宣傳物料的圖片,其實都是一次次有設計目的的能力測試。
![]()
圖片來源:陳博遠的知乎博客
在博客最后,他特別感謝了整個團隊。他說,每個人都做了很多很多的事情。在發布前的尾聲,他除了修一些小東西,就是和市場部門的同事、做藝術的同事一起準備發布會和網站。GPT Image2是一次研究、產品、審美和傳播的共同完成。
布基膠帶
GPT Image2在正式發布前,用代號“duct-tape”在LMArena上進行了雙盲測試。這個代號是陳博遠自己起的。“至于為啥起名叫布基膠帶嘛,”他在知乎博客里寫,“當然是因為你可以用布基膠帶把香蕉貼在墻上啦!”——指的是那幅世界聞名的藝術品,一根香蕉用布基膠帶貼在墻上。
![]()
圖片來源:陳博遠的知乎博客
結果是:布基膠帶以ELO+242分斷崖領先第二名,代號為“小香蕉”(nano banana)。+241分是LMArena圖像競技場有史以來最大的領先差距,沒有模型曾經以這個幅度超過第二名。這不是小幅迭代,是架構級別的跳躍。陳博遠自己在博客里也確認,從去年12月底的GPT Image1.5算起,只用了四個月就有如此大的改進。但是底層架構已經徹底重構,核心團隊只有13人。
![]()
圖片來源:Gabriel Goh的Twitter
團隊負責人Gabriel Goh在社交媒體上曬出了一張團隊成員AI全家福。全員亞裔,華人過半。評論區有網友感嘆:怎么全是亞洲人?這個問題本身可能比任何技術論文都更能說明當下的AI權力格局正在發生的變化。陳博遠身后那張由夏斐、Pieter Abbeel、Russ Tedrake、Vincent Sitzmann等一代代學者搭建起來的華人學術傳幫帶網絡,不是血緣關系,是知識關系——是無數個“他就像我的吳恩達”的鏈條疊加在一起,最終把一批二十多歲的年輕華人研究者,推到了全球AI創新的最中央。
從16歲在FRC賽場上設計機器人的高中生,到26歲帶隊重構全球最強圖像生成模型的Research Lead,陳博遠用十年時間走完了這條路徑。而視覺世界模型對于具身智能至關重要——這是他反復強調的信念。當AI不僅能生成逼真的畫面,還能理解物理世界的運行規律時,通用機器人的誕生才真正有了時間表。
從16歲在FRC賽場上設計機器人,到26歲站上OpenAI最核心的圖像生成團隊,陳博遠只用了十年。但他最特別的地方,或許并不是“天才”——而是一種很少見的、始終愿意從零開始的研究者氣質。高中時不會Python,讀博第一年經歷低谷,進入OpenAI后又重新“修中文”、重新思考圖像與語言的關系。
他不像那種鋒芒畢露的明星科學家,反而更像一個對世界始終保持好奇的人:認真到會在一粒米上測試模型能不能刻字,也會為了一個香蕉梗給模型取名“duct-tape”。而這種近乎執拗的好奇心,也許正是他一路走到今天的原因——真正推動AI向前的人,很多時候并不是最會講故事的人,而是那些愿意反復追問“機器到底有沒有真正理解世界?”的人。
[1] 新智元,來自MIT最強AI實驗室:OpenAI天才華人研究員博士畢業了,https://www.36kr.com/p/3470460912801156
[2] 量子位,半壁華人!GPT Image 2團隊曝光:無錫才俊帶隊,https://www.qbitai.com/2026/04/405391.html
[3] 愛范兒,起底GPT Image 2 團隊后,我扒出了一張華人師徒網,https://www.ifanr.com/1663499
[4] MIT CSAIL,Boyuan Chen Spotlight,https://cap.csail.mit.edu/engage/spotlights/boyuan-chen
[5] 虎嗅,實測ChatGPT最新生圖模型三大發現,https://www.huxiu.com/article/4853320.html
[6] 江蘇省天一中學,天一校友風采| 陳博遠:OpenAI天才華人研究員,https://www.tyzx.com.cn/gjjy/jsfc2
[7] Boyuan Chen個人主頁,https://www.boyuan.space/
[8] Boyuan Chen個人主頁Resume,https://www.boyuan.space/resume
加入ZF討論群,請先添加小助手微信
我們相信認知能夠跨越階層,
致力于為年輕人提供高質量的科技和財經內容。
稿件經采用可獲邀進入Z Finance內部社群,優秀者將成為簽約作者,00后更有機會成為Z Finance的早期共創成員。
我們正在招募新一期的實習生
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.