![]()
蘇煒杰獲頒考普斯獎(jiǎng)
撰文 | 張?zhí)炱?/strong>
波士頓當(dāng)?shù)貢r(shí)間8月5日下午,在美國(guó)統(tǒng)計(jì)協(xié)會(huì)聯(lián)合統(tǒng)計(jì)會(huì)議上,蘇煒杰獲頒考普斯獎(jiǎng)(COPSS Presidents' Award)。考普斯獎(jiǎng)由美國(guó)統(tǒng)計(jì)協(xié)會(huì)、國(guó)際數(shù)理統(tǒng)計(jì)學(xué)會(huì)、加拿大統(tǒng)計(jì)學(xué)會(huì)等五大統(tǒng)計(jì)學(xué)會(huì)聯(lián)合設(shè)立,自1976年起每年授予一位在統(tǒng)計(jì)學(xué)領(lǐng)域作出杰出貢獻(xiàn)的青年學(xué)者,是統(tǒng)計(jì)學(xué)領(lǐng)域最高榮譽(yù)之一。國(guó)際數(shù)理統(tǒng)計(jì)研究所、多倫多大學(xué)等都曾在官網(wǎng)報(bào)道中提到,考普斯獎(jiǎng)也被譽(yù)為“統(tǒng)計(jì)學(xué)的諾貝爾獎(jiǎng)”。
![]()
蘇煒杰是賓夕法尼亞大學(xué)沃頓商學(xué)院統(tǒng)計(jì)與數(shù)據(jù)科學(xué)終身教授。他和2026四位菲爾茲獎(jiǎng)得主都有淵源:與王虹、鄧煜一樣是北京大學(xué)數(shù)學(xué)學(xué)院2007級(jí)本科校友,與John Pardon(白杰文)是同級(jí)斯坦福校友,與Jacob Tsimerman在共同學(xué)術(shù)休假的公司是同事。
在獲獎(jiǎng)致辭中,蘇煒杰感謝了一路走來給予他指導(dǎo)和支持的師友,以及北京大學(xué)和斯坦福大學(xué)兩所母校。“感謝我在北京大學(xué)和斯坦福大學(xué)的老師們,他們把知識(shí)和智慧傳授給了我,還有我的導(dǎo)師 Emmanuel Candès。”他同時(shí)感謝求學(xué)期間學(xué)校提供的獎(jiǎng)學(xué)金讓他專注學(xué)業(yè)。
蘇煒杰還在獲獎(jiǎng)致辭中展望了AI時(shí)代統(tǒng)計(jì)學(xué)科的前景。他表示,只要存在數(shù)據(jù)、不確定性以及解決問題的需求,統(tǒng)計(jì)學(xué)就會(huì)持續(xù)發(fā)展。AI不會(huì)削弱這一點(diǎn),恰恰相反,它只會(huì)放大這一點(diǎn)。隨著數(shù)據(jù)規(guī)模不斷擴(kuò)大,統(tǒng)計(jì)學(xué)將在未來變得“比以往任何時(shí)候都更加重要、更加核心......現(xiàn)在真的是成為一名統(tǒng)計(jì)學(xué)家的最好時(shí)代”。
2026考普斯獎(jiǎng)獲獎(jiǎng)名單是2月揭曉的。三個(gè)月后,蘇煒杰宣布在沃頓商學(xué)院學(xué)術(shù)休假加入OpenAI,將回到闊別十年的舊金山灣區(qū)。2016年,他在Emmanuel Candès指導(dǎo)下獲斯坦福大學(xué)博士學(xué)位。
此前獲得這一獎(jiǎng)項(xiàng)的華人統(tǒng)計(jì)學(xué)家包括黎子良、范劍青、孟曉犁、劉軍、林希虹、蔡天文和寇星昌等。其中,劉軍2025年從哈佛大學(xué)全職回國(guó)出任清華大學(xué)統(tǒng)計(jì)與數(shù)據(jù)科學(xué)系主任,范劍青現(xiàn)任普林斯頓大學(xué)教授,孟曉犁、林希虹和寇星昌均長(zhǎng)期任教于哈佛大學(xué),蔡天文則任教于賓夕法尼亞大學(xué)。蘇煒杰也成為繼2012年寇星昌之后,時(shí)隔14年再次獲得這一獎(jiǎng)項(xiàng)的華人統(tǒng)計(jì)學(xué)家。
評(píng)委會(huì)認(rèn)可了蘇煒杰在統(tǒng)計(jì)學(xué)與機(jī)器學(xué)習(xí)多個(gè)方向的貢獻(xiàn),包括生成式人工智能的統(tǒng)計(jì)基礎(chǔ)、隱私保護(hù)數(shù)據(jù)分析、機(jī)器學(xué)習(xí)理論、高維統(tǒng)計(jì)推斷以及優(yōu)化理論等。其中,他近年來圍繞大語言模型的統(tǒng)計(jì)分析、水印、對(duì)齊與排序機(jī)制開展的研究,探索了如何用統(tǒng)計(jì)學(xué)方法理解和改進(jìn)人工智能系統(tǒng);在差分隱私領(lǐng)域,他提出的新方法被用于分析2020年美國(guó)人口普查數(shù)據(jù)發(fā)布機(jī)制,研究顯示,在保持隱私保證的情況下,噪聲注入量有望降低約15%至24%,從而提高數(shù)據(jù)可用性。
過去十年間,蘇煒杰先后獲得美國(guó)國(guó)家科學(xué)基金會(huì)CAREER獎(jiǎng)、斯隆研究獎(jiǎng)學(xué)金、工業(yè)與應(yīng)用數(shù)學(xué)學(xué)會(huì)數(shù)據(jù)科學(xué)青年獎(jiǎng)、數(shù)理統(tǒng)計(jì)研究所彼得·霍爾青年學(xué)者獎(jiǎng)、美國(guó)統(tǒng)計(jì)協(xié)會(huì)諾特青年學(xué)者獎(jiǎng)等獎(jiǎng)項(xiàng)。
除了統(tǒng)計(jì)學(xué)研究,蘇煒杰近年來也越來越多參與人工智能AI領(lǐng)域的制度建設(shè)。2025年他被任命為機(jī)器學(xué)習(xí)頂會(huì)ICML 2026科研誠(chéng)信主席,2027年將出任ICML程序主席。此前,他與合作者提出基于博弈論思想的作者自評(píng)審排序機(jī)制“保序機(jī)制”(Isotonic Mechanism):要求作者對(duì)自己的多篇投稿排序,并將這一信息作為輔助信號(hào)校準(zhǔn)同行評(píng)審結(jié)果。該機(jī)制試圖緩解AI頂會(huì)投稿數(shù)量激增背景下,評(píng)審資源不足和評(píng)分噪聲帶來的問題,并于2026年被ICML納入正式評(píng)審流程。
《知識(shí)分子》與蘇煒杰對(duì)話,話題從他在北京大學(xué)的求學(xué)經(jīng)歷,到統(tǒng)計(jì)學(xué)與人工智能的交匯,再到加入OpenAI后的研究方向,以及應(yīng)用數(shù)學(xué)在AI時(shí)代的前景。
01 從追求“深刻與優(yōu)美”,到尋找現(xiàn)實(shí)中的數(shù)學(xué)問題
《知識(shí)分子》:您本科在北大數(shù)院學(xué)的是純數(shù)學(xué),后來轉(zhuǎn)向了統(tǒng)計(jì)和應(yīng)用方向。這段早期的數(shù)學(xué)訓(xùn)練,對(duì)您后來研究方向有什么影響?
蘇煒杰:影響非常大。我們那一級(jí)里有很多從事純數(shù)學(xué)研究的同學(xué)。我當(dāng)時(shí)學(xué)的也是純數(shù)學(xué),后來轉(zhuǎn)向應(yīng)用,一個(gè)很大的原因可能是每個(gè)人個(gè)性不一樣,我比較關(guān)注社會(huì)現(xiàn)實(shí)和一些前沿進(jìn)展,當(dāng)時(shí)數(shù)據(jù)科學(xué)、壓縮感知這些方向新聞媒體報(bào)道比較多,我覺得這方面數(shù)學(xué)能用得上,又能對(duì)科技、對(duì)社會(huì)產(chǎn)生很大影響力,興趣就多一些,后來就轉(zhuǎn)向了應(yīng)用。
![]()
來源:北京大學(xué)數(shù)學(xué)科學(xué)學(xué)院
北大數(shù)院2007級(jí)本科校友合影(左起:趙子慧、唐云清、王虹、鄧煜、孫鑫、蘇煒杰)。
盡管轉(zhuǎn)了應(yīng)用方向,我們數(shù)學(xué)出身的研究者跟其他背景的研究者,在特質(zhì)上還是有些不一樣,看待問題往往會(huì)從數(shù)學(xué)原理出發(fā)。表面上一個(gè)雜亂無章、堆滿數(shù)據(jù)的問題,我們會(huì)特別想理解清楚它背后的機(jī)制,這個(gè)機(jī)制往往是可以用數(shù)學(xué)來刻畫的。這個(gè)風(fēng)格一直貫穿在我科研的各個(gè)方面。
《知識(shí)分子》:像您這樣從純數(shù)學(xué)轉(zhuǎn)向應(yīng)用數(shù)學(xué)研究,在您那一級(jí)多嗎?當(dāng)時(shí)您為什么選擇這個(gè)方向?
蘇煒杰:不多。我們那一級(jí),大部分留在學(xué)術(shù)界的都偏純數(shù)學(xué)。北大數(shù)院每個(gè)年級(jí)從事學(xué)術(shù)的總?cè)藬?shù)比例,每年差別不大,但應(yīng)用和純數(shù)學(xué)之間的分布波動(dòng)挺大。我們這一年純數(shù)學(xué)特別多,但比我們低兩三年的,做應(yīng)用數(shù)學(xué)的就多很多了,這跟每年任課老師等各方面因素都有關(guān)系。
做純數(shù)學(xué),除了數(shù)學(xué)能力之外,更重要的是一種長(zhǎng)期專注的品質(zhì)。能夠不為外界潮流所動(dòng),堅(jiān)持一個(gè)問題多年。
我比較關(guān)注自己做的問題對(duì)實(shí)際、對(duì)社會(huì)有沒有影響。雖然我的專業(yè)方向是純數(shù)學(xué),但跟很多做應(yīng)用數(shù)學(xué)的同學(xué)一起上課,也參加了很多數(shù)學(xué)建模競(jìng)賽,用兩三天時(shí)間,通過統(tǒng)計(jì)、優(yōu)化、編程等方法解決一個(gè)完全實(shí)際的問題。我參加了很多次,也得過幾次獎(jiǎng)。
還有一點(diǎn),我在北大輔修了經(jīng)濟(jì)學(xué)雙學(xué)位,是林毅夫老師創(chuàng)辦的中國(guó)經(jīng)濟(jì)研究中心面向全校開設(shè)的項(xiàng)目,從大二讀到大四。學(xué)經(jīng)濟(jì)學(xué)的過程讓我在理論數(shù)學(xué)的世界觀之外多了一個(gè)角度,更了解真實(shí)世界的復(fù)雜度非常高,很多方面需要通過實(shí)證的方式去理解。這些決定當(dāng)時(shí)也沒多想什么理由,是后知后覺,可能確實(shí)是這段經(jīng)歷讓我對(duì)應(yīng)用有了更切身的體會(huì)。
《知識(shí)分子》:這是不是純數(shù)學(xué)和應(yīng)用數(shù)學(xué)在思維方式上的一個(gè)差異?
蘇煒杰:它們有很多共同點(diǎn),本科階段都要把數(shù)學(xué)基礎(chǔ)打牢,數(shù)學(xué)是我們的一個(gè)基本工具,是看到一個(gè)問題時(shí)第一個(gè)想到的工具箱。
純數(shù)學(xué)和應(yīng)用數(shù)學(xué)共享同一個(gè)數(shù)學(xué)工具箱,但關(guān)注的重點(diǎn)不同。純數(shù)學(xué)更追求從內(nèi)在上理解問題的本質(zhì),追求深刻與優(yōu)美。應(yīng)用數(shù)學(xué),包括統(tǒng)計(jì)、計(jì)算數(shù)學(xué)、優(yōu)化,也包括作為AI基礎(chǔ)的機(jī)器學(xué)習(xí),強(qiáng)調(diào)問題的來源要跟實(shí)際結(jié)合,以及理論能否反哺真實(shí)系統(tǒng)。想做的事情是通過數(shù)學(xué)建模,把觀測(cè)到的數(shù)據(jù)、觀察到的現(xiàn)象和理論結(jié)合起來。
現(xiàn)象和理論這兩者之間是有差距的,理論建模總要做簡(jiǎn)化,跟真實(shí)問題會(huì)有一些差距。這個(gè)差距能不能縮小,中間需要一些直覺和技巧,盡可能讓理論和實(shí)際連貫起來。應(yīng)用數(shù)學(xué)一般不太可能做到完美,因?yàn)槭軐?shí)際條件所限,數(shù)據(jù)會(huì)缺失,我們盡可能在已有條件下達(dá)到局部最優(yōu),這往往是我們追求的目標(biāo)。
我前幾天正好在費(fèi)城參加國(guó)際數(shù)學(xué)家大會(huì),跟做純數(shù)學(xué)研究的同學(xué)聚了聚,我相信"優(yōu)美、深刻、本質(zhì)"這三個(gè)詞他們都會(huì)認(rèn)同,描述純數(shù)學(xué)比較合適。而應(yīng)用數(shù)學(xué)除了數(shù)學(xué)本身,還需要體現(xiàn)兩點(diǎn):一是數(shù)學(xué)理論能指導(dǎo)實(shí)際能用的東西。二是能提高實(shí)際的生產(chǎn)力:比如大模型訓(xùn)練方式的改進(jìn)能把成本降下來,產(chǎn)生實(shí)際的經(jīng)濟(jì)效益。
《知識(shí)分子》:您獲獎(jiǎng)時(shí)感謝了北大的培養(yǎng)。當(dāng)時(shí)的氛圍對(duì)您有什么影響?
蘇煒杰:影響非常大。首先非常感謝北大給予我的一切。一方面是知識(shí)上的收獲,有這么好的平臺(tái)可以學(xué)到很多東西。另一方面是有非常好的同輩共同體:大一剛?cè)雽W(xué),就能感覺到同學(xué)們對(duì)知識(shí)、對(duì)學(xué)術(shù)的那種渴求非常明顯,是發(fā)自內(nèi)心的好奇心驅(qū)使,而不只是為了考一個(gè)好成績(jī)。還有一點(diǎn),我大學(xué)期間一直拿助學(xué)金,再加上獎(jiǎng)學(xué)金,兩者結(jié)合經(jīng)濟(jì)上就消除了我的后顧之憂。
《知識(shí)分子》:考普斯獎(jiǎng)獲獎(jiǎng)介紹里把您的研究分成了幾個(gè)方向,如果只選一項(xiàng),您覺得哪個(gè)比較有代表性?
蘇煒杰:我自己覺得比較有意義、又有實(shí)際價(jià)值的,大概有四項(xiàng)。
第一項(xiàng),是通過連續(xù)的微分方程,來解釋優(yōu)化中的加速現(xiàn)象,這可以幫助我們更好地理解和設(shè)計(jì)機(jī)器學(xué)習(xí)中的優(yōu)化算法。
第二項(xiàng),是差分隱私,尤其是從統(tǒng)計(jì)視角研究差分隱私機(jī)制,希望在保護(hù)用戶隱私的同時(shí)提高統(tǒng)計(jì)效率。
第三項(xiàng),是高維統(tǒng)計(jì)推斷中的錯(cuò)誤發(fā)現(xiàn)率(false discovery rate, FDR)控制問題,我們?cè)O(shè)計(jì)了一些新的方法,在保證估計(jì)準(zhǔn)確性的同時(shí)控制假陽性率。
第四項(xiàng),是針對(duì)機(jī)器學(xué)習(xí)會(huì)議同行評(píng)審提出的保序機(jī)制(Isotonic Mechanism),通過讓作者提供關(guān)于自身論文質(zhì)量的信息,再通過統(tǒng)計(jì)方式更好地估計(jì)論文質(zhì)量,這里面還涉及博弈論的思想。這個(gè)方法今年在ICML上得到了實(shí)際應(yīng)用。
《知識(shí)分子》:您的研究里怎么找問題的,是先有一個(gè)已經(jīng)呈現(xiàn)出來的難題,還是先有一套擅長(zhǎng)的方法,再去找適合的問題?
蘇煒杰:我認(rèn)為,問題首先要有實(shí)際的重要性,而不是先拿一個(gè)理論框架去套。比如差分隱私,背后對(duì)應(yīng)的是一個(gè)非常現(xiàn)實(shí)的問題:如果直接使用用戶數(shù)據(jù)訓(xùn)練各種模型,用戶隱私可能會(huì)暴露。再比如審稿質(zhì)量下降,近年來人工智能會(huì)議的投稿量快速增長(zhǎng),同行評(píng)審面臨越來越大的壓力,論文能否被接收有時(shí)已經(jīng)不完全取決于論文本身的質(zhì)量。
找到這樣的問題之后,下一步是挖掘它背后是否存在某種機(jī)制上的、統(tǒng)計(jì)上的或者數(shù)學(xué)上的結(jié)構(gòu),并嘗試建立理論模型。
02 AI還沒有“物理學(xué)”,數(shù)學(xué)家正在尋找底層規(guī)律
《知識(shí)分子》:ChatGPT出來之后,您的研究是不是更多轉(zhuǎn)向了AI方面?
蘇煒杰:大概是從三年半前開始的。其實(shí)我們組一直在關(guān)注機(jī)器學(xué)習(xí)的統(tǒng)計(jì)基礎(chǔ),2022年底ChatGPT出現(xiàn)后,我們意識(shí)到這不僅是技術(shù)突破,更是驗(yàn)證理論的絕佳場(chǎng)景,因此將主要精力集中在了大語言模型方向,主要集中在它的統(tǒng)計(jì)和優(yōu)化這兩個(gè)維度。
《知識(shí)分子》:在AI時(shí)代,應(yīng)用數(shù)學(xué)能給大模型帶來什么?
蘇煒杰:大模型的訓(xùn)練大概可以分為兩個(gè)環(huán)節(jié):預(yù)訓(xùn)練(pre-training)和后訓(xùn)練(post-training)。預(yù)訓(xùn)練主要是讓模型從海量數(shù)據(jù)中學(xué)習(xí),這個(gè)過程中數(shù)學(xué)里的優(yōu)化發(fā)揮了非常重要的作用。用數(shù)學(xué)語言來說,就是不斷最小化一個(gè)損失函數(shù),通過梯度迭代讓損失函數(shù)逐漸降低。所以預(yù)訓(xùn)練階段,本質(zhì)上對(duì)應(yīng)的是一個(gè)優(yōu)化問題,這也是應(yīng)用數(shù)學(xué)中的優(yōu)化理論能夠發(fā)揮作用的地方。
后訓(xùn)練階段則更多體現(xiàn)了統(tǒng)計(jì)學(xué)的作用。這個(gè)階段主要是讓模型更好地符合人類指令和社會(huì)規(guī)范,把預(yù)訓(xùn)練階段獲得的能力進(jìn)一步發(fā)揮出來。這個(gè)過程很多時(shí)候需要用概率語言來描述,比如在對(duì)齊(alignment)過程中,我們希望模型對(duì)不同選項(xiàng)的偏好符合某種預(yù)期的概率分布,這就涉及如何更好地估計(jì)和逼近真實(shí)分布的問題。同時(shí),實(shí)際數(shù)據(jù)中往往存在大量噪聲,如何從噪聲中找到真正的信號(hào),也是統(tǒng)計(jì)學(xué)一直試圖解決的問題。
《知識(shí)分子》:現(xiàn)在的大模型研究很大程度上依賴工程經(jīng)驗(yàn)和實(shí)驗(yàn)迭代,應(yīng)用數(shù)學(xué)能提供的獨(dú)特貢獻(xiàn)在于什么?
蘇煒杰:當(dāng)然,一個(gè)研究?jī)?yōu)化或者統(tǒng)計(jì)的學(xué)者如果要訓(xùn)練大模型,也需要掌握一定的工程能力。比如通過實(shí)驗(yàn)調(diào)整模型、改進(jìn)訓(xùn)練流程。但工程方法更多依賴經(jīng)驗(yàn)和試錯(cuò),而應(yīng)用數(shù)學(xué)關(guān)注的是如何從復(fù)雜現(xiàn)象中抽象出問題背后的結(jié)構(gòu)。
隨著編程智能體(coding agent)等工具的發(fā)展,工程實(shí)現(xiàn)的門檻正在降低,這個(gè)時(shí)候,數(shù)學(xué)建模能力的重要性反而更加凸顯。
數(shù)學(xué)家的獨(dú)特之處在于,他們往往更容易抓住問題的數(shù)學(xué)本質(zhì)。數(shù)學(xué)建模的過程,就是把一個(gè)復(fù)雜問題去粗取精,提煉出最核心的因素,弄清楚這些因素之間在數(shù)學(xué)上、定量上的關(guān)系,從而更好地刻畫它們之間的依賴關(guān)系,并尋找更優(yōu)的解決方案。
單純從工程角度出發(fā),很多問題當(dāng)然也可以解決,但這種解決方案可能只是針對(duì)某個(gè)具體場(chǎng)景的經(jīng)驗(yàn)性方案(ad hoc),換一個(gè)條件就未必適用;同時(shí),它也未必是最優(yōu)的,因?yàn)樗鼪]有真正揭示問題背后的結(jié)構(gòu)。
《知識(shí)分子》:數(shù)學(xué)對(duì)理解AI本身有幫助嗎?您之前提到過,AI現(xiàn)在還沒有發(fā)現(xiàn)一個(gè)像物理學(xué)那樣大家都認(rèn)同的底層規(guī)律。
蘇煒杰:這需要分兩方面來看。一方面,AI最底層的數(shù)學(xué)原理確實(shí)還沒有被發(fā)現(xiàn)。現(xiàn)在的模型規(guī)模越來越大,架構(gòu)也越來越復(fù)雜,想從純理論上理解這些系統(tǒng)背后的基本規(guī)律,難度非常高,可能需要新的數(shù)學(xué)突破。我也和一些做純數(shù)學(xué)研究的同學(xué)交流過,他們對(duì)此都很感興趣,但目前還不知道具體應(yīng)該從哪里入手。
另一方面,這并不意味著定量的應(yīng)用數(shù)學(xué)方法現(xiàn)在無法發(fā)揮作用。以優(yōu)化為例,簡(jiǎn)單來說,我們要做的是最小化一個(gè)函數(shù)。通過梯度方法,我們并不需要知道這個(gè)函數(shù)完整的形狀,只需要知道梯度,然后沿著梯度下降的方向不斷迭代。就像一個(gè)人在山上尋找下山的路徑,他只需要知道周圍哪個(gè)方向更低,然后一步步走下去。
也就是說,即使不知道一個(gè)系統(tǒng)最底層的機(jī)制,我們?nèi)匀豢梢酝ㄟ^數(shù)學(xué)方法有效地解決問題。統(tǒng)計(jì)學(xué)更是如此。我們不一定需要知道系統(tǒng)內(nèi)部所有的因果機(jī)制,只要能夠觀察到數(shù)據(jù),就可以對(duì)隨機(jī)性進(jìn)行建模,從中識(shí)別真正的信號(hào)。生物統(tǒng)計(jì)和神經(jīng)科學(xué)中很多問題也是這樣,雖然我們對(duì)生命系統(tǒng)的底層機(jī)制仍然沒有完全理解,但統(tǒng)計(jì)方法依然能夠幫助我們發(fā)現(xiàn)規(guī)律、做出預(yù)測(cè)。
《知識(shí)分子》:AI研究有沒有可能形成一套類似物理學(xué)的底層理論,還是說它可能會(huì)一直處于不同問題對(duì)應(yīng)不同理論的狀態(tài)?
蘇煒杰:這是個(gè)好問題。學(xué)界現(xiàn)在明確的一點(diǎn)是,目前還沒有一個(gè)完善的數(shù)學(xué)底層理論來解釋AI的運(yùn)作。至于未來會(huì)不會(huì)有,學(xué)界兩種觀點(diǎn)都有:一種認(rèn)為未來還是會(huì)有一個(gè)AI的數(shù)學(xué)理論,人工智能最終變成了一種"物理學(xué)",我們能發(fā)現(xiàn)它的"相對(duì)論""量子力學(xué)"。另一種認(rèn)為,隨著AI系統(tǒng)復(fù)雜度越來越高,最底層的數(shù)學(xué)理論可能永遠(yuǎn)無法建立。據(jù)我的觀察,學(xué)界目前還不清楚到底哪種是對(duì)的。
我覺得其中一個(gè)關(guān)鍵問題在于,AI不是一個(gè)靜態(tài)的研究對(duì)象。物理學(xué)面對(duì)的是相對(duì)穩(wěn)定的自然規(guī)律,我們可以不斷逼近這些規(guī)律。但AI系統(tǒng)本身一直在變化,模型架構(gòu)、訓(xùn)練方法都在不斷演進(jìn)。比如,如果Transformer被新的架構(gòu)取代,那么針對(duì)上一代模型建立的理論,可能未必能夠直接解釋下一代模型。這個(gè)追趕過程是非常動(dòng)態(tài)的,理論就一直沒辦法逼近,可能永遠(yuǎn)存在代差。
《知識(shí)分子》:AI相關(guān)的問題中,從數(shù)學(xué)的角度上看哪些最值得關(guān)注?
蘇煒杰:有一個(gè)非常重要的問題:現(xiàn)在模型參數(shù)規(guī)模已經(jīng)達(dá)到萬億級(jí)別,在做反向傳播、梯度下降過程中,參數(shù)的變化到底和模型最終表現(xiàn)出來的宏觀能力之間是什么關(guān)系?這是理論上非常重要的問題。
另一個(gè)相關(guān)問題是它和“過參數(shù)化”(overparameterization)的關(guān)系。因?yàn)槟P蛥?shù)非常多,要達(dá)到某個(gè)目標(biāo)的解往往不是唯一的,而是存在無窮多個(gè)解。那么,在梯度下降過程中,為什么模型最終會(huì)找到某些解,而不是另外一些解?背后是什么機(jī)制導(dǎo)致了這種偏好?
這些問題和傳統(tǒng)數(shù)學(xué)問題有一點(diǎn)不同:我們現(xiàn)在還很難把它們寫成一個(gè)非常清晰、定義良好的問題。很多現(xiàn)象已經(jīng)被觀察到了,但我們對(duì)它們的描述還比較定性,缺少精確的定量刻畫。這正是應(yīng)用數(shù)學(xué)面臨的困難,也是有機(jī)會(huì)突破的地方。
舉個(gè)例子,現(xiàn)在大模型的長(zhǎng)程任務(wù)(long horizon)能力越來越強(qiáng)。要完成這樣的工作,模型需要調(diào)用各種工具,并與用戶多輪交互。這是一個(gè)非常長(zhǎng)的過程,通常來說,模型參數(shù)規(guī)模越大,基礎(chǔ)模型的能力越強(qiáng),也越有可能支撐這類復(fù)雜任務(wù)。但這種能力和模型規(guī)模、訓(xùn)練方式之間到底是什么關(guān)系,目前還沒有完整的理論解釋。
我們知道,隨著模型規(guī)模擴(kuò)大、架構(gòu)不斷變化,模型會(huì)展現(xiàn)出一些新的能力,但這些能力為什么出現(xiàn),以及它們和參數(shù)規(guī)模、訓(xùn)練過程之間有什么定量關(guān)系,目前仍然缺少理論描述。甚至連經(jīng)驗(yàn)性的擴(kuò)展定律(scaling law)在這些更復(fù)雜能力上的適用范圍,都還沒有完全弄清楚。
![]()
蘇煒杰在蘇黎世聯(lián)邦理工學(xué)院愛因斯坦的儲(chǔ)物柜前。
《知識(shí)分子》:這次國(guó)際數(shù)學(xué)家大會(huì)上,有沒有哪些報(bào)告讓您看到,應(yīng)用數(shù)學(xué)能夠?yàn)槔斫釧I提供新的思路?
蘇煒杰:這次大會(huì)上,各個(gè)方向都有很多精彩的工作。給我印象比較深的是Peter Bartlett的報(bào)告。他是伯克利教授,同時(shí)也在Google DeepMind擔(dān)任相關(guān)研究職位。他講了一些利用簡(jiǎn)單模型去理解神經(jīng)網(wǎng)絡(luò)訓(xùn)練中一些奇妙現(xiàn)象的工作。深度學(xué)習(xí)中有很多現(xiàn)象其實(shí)還沒有完全被理論解釋,比如為什么規(guī)模巨大的神經(jīng)網(wǎng)絡(luò)能夠有效泛化,為什么簡(jiǎn)單的優(yōu)化方法能夠訓(xùn)練如此復(fù)雜的模型,這些都是非常值得研究的問題。
另外,Stephen Wright關(guān)于優(yōu)化的報(bào)告也讓我印象深刻。他回顧了優(yōu)化領(lǐng)域的發(fā)展歷程,討論了優(yōu)化理論與實(shí)際應(yīng)用之間不斷相互推動(dòng)的關(guān)系。很多優(yōu)化算法的發(fā)展,都是理論分析和實(shí)際需求共同作用的結(jié)果:實(shí)際問題為理論研究提供了動(dòng)力,而理論上的新理解又會(huì)反過來推動(dòng)算法的發(fā)展。我覺得這也是AI時(shí)代數(shù)學(xué)發(fā)展的一個(gè)重要特點(diǎn)——理論和應(yīng)用需要齊頭并進(jìn),誰都缺不了誰。
03 學(xué)術(shù)休假期加入OpenAI,他想尋找AI背后的數(shù)學(xué)規(guī)律
《知識(shí)分子》:您這次是在學(xué)術(shù)休假期間加入OpenAI。您希望從這段經(jīng)歷中獲得什么?
蘇煒杰:一方面,我很好奇真實(shí)世界里他們是怎么訓(xùn)練GPT-5這樣的模型的,也想了解AI實(shí)際運(yùn)作過程中出現(xiàn)的一些奇妙現(xiàn)象。但我最終的目標(biāo),還是希望從應(yīng)用數(shù)學(xué)的角度去理解AI的機(jī)制。
短期來看,我希望能為統(tǒng)計(jì)和優(yōu)化設(shè)計(jì)更好的算法。長(zhǎng)期來看,我希望能夠嘗試建立一個(gè)AI的數(shù)學(xué)理論,這是我的夢(mèng)想。當(dāng)然,學(xué)界也有一部分觀點(diǎn)認(rèn)為,這樣的理論可能永遠(yuǎn)無法建立,但我還是希望把它作為一個(gè)重要方向去探索。
另一方面,公司內(nèi)部有更充足的算力和實(shí)驗(yàn)條件,很多在學(xué)校環(huán)境下難以開展的實(shí)驗(yàn),在那里可以更容易實(shí)現(xiàn)。這些一線經(jīng)驗(yàn),也會(huì)幫助我未來更好地設(shè)計(jì)統(tǒng)計(jì)和優(yōu)化方法,推動(dòng)對(duì)AI理論的研究。
《知識(shí)分子》:現(xiàn)在AI研究越來越依賴算力和工程資源,高校在這一領(lǐng)域面臨怎樣的挑戰(zhàn)?
蘇煒杰:我不覺得未來會(huì)有改變。學(xué)校畢竟是科研、教育單位,不可能在商業(yè)化過程中跟AI的前沿實(shí)驗(yàn)室去比,這個(gè)資源差距永遠(yuǎn)會(huì)存在,甚至有擴(kuò)大的可能。
但這不表示學(xué)術(shù)界就不能做AI研究了。一方面,小模型的研究對(duì)大模型性質(zhì)的研究還是有一些指導(dǎo)意義的,至少在優(yōu)化、統(tǒng)計(jì)方面。比較難的是架構(gòu)(architecture)這一塊,可能需要非常大的模型規(guī)模才能真正知道效果。
另一方面,學(xué)術(shù)界可以研究大模型的合規(guī)問題,包括隱私、可信機(jī)制,往大了說是安全性。未來隨著模型能力上升,它對(duì)社會(huì)在公平性、隱私保護(hù)和安全方面的挑戰(zhàn)會(huì)越來越大,緩解這些壓力很難靠公司主動(dòng)去做,因?yàn)楣井吘故巧虡I(yè)驅(qū)動(dòng)的。這個(gè)時(shí)候,學(xué)校其實(shí)承擔(dān)了一個(gè)社會(huì)責(zé)任人的角色,去為大模型建立一套合規(guī)框架,可以說是給模型做"審計(jì)",這是學(xué)術(shù)界應(yīng)該承擔(dān)的責(zé)任,也是機(jī)會(huì)。
《知識(shí)分子》:過去很多基礎(chǔ)研究主要由高校完成,再通過產(chǎn)業(yè)轉(zhuǎn)化落地。但現(xiàn)在大模型能力的提升高度依賴算力、數(shù)據(jù)和工程投入,這些工作越來越集中在企業(yè)中。您覺得這會(huì)改變高校和產(chǎn)業(yè)之間原有的關(guān)系嗎?
蘇煒杰:一定程度上這不可避免,但不是說學(xué)校完全做不了任何事情。大模型前沿能力這一塊,不光是北美,國(guó)內(nèi)也是一樣,基本上領(lǐng)導(dǎo)者都是商業(yè)公司。
商業(yè)化的本質(zhì)是要把規(guī)模成本打下去,需要大量的試錯(cuò)和資本投入,學(xué)校是非營(yíng)利機(jī)構(gòu),不可能有公司這么強(qiáng)的競(jìng)爭(zhēng)力,這就跟很多學(xué)校有航空航天專業(yè),但沒見過哪個(gè)學(xué)校真正造出一架大飛機(jī)一樣,到一定程度就要交給市場(chǎng)化過程去完成。
但學(xué)校可以做的事情還有很多。除了前面說過的研究方向,還有大模型人才培養(yǎng),這還是需要學(xué)校來完成的。
大模型能力越來越強(qiáng),就像一把劍越來越鋒利,我們也需要打造一面更好的盾來保護(hù)自己。某種意義上,提升模型能力和提升安全能力是同樣重要的課題。
《知識(shí)分子》:在AI時(shí)代,學(xué)校應(yīng)該如何培養(yǎng)下一代AI人才?
蘇煒杰:理論培養(yǎng)和實(shí)際操作應(yīng)該并行,但理論基礎(chǔ)可能要稍微打得靠前一點(diǎn),實(shí)際應(yīng)用能力也需要不斷提升。
同時(shí),也不能光喊口號(hào)。國(guó)內(nèi)也好,美國(guó)也好,其實(shí)大家都還沒有真正普遍地在學(xué)校層面開設(shè)AI倫理課程,讓本科生、研究生在進(jìn)入社會(huì)開發(fā)AI之前,先認(rèn)真討論這些問題:當(dāng)AI能力達(dá)到一定程度以后,我們應(yīng)該怎么看待它?邊界在哪里?怎么樣才能保證即使未來AI能力超過人類,依然保持人的主體性:人是主體,AI仍然是工具或者輔助角色。
我覺得這是非常重要的。如果價(jià)值觀不夠堅(jiān)定,未來出現(xiàn)嚴(yán)重的安全事故并不是完全不可能。技術(shù)能力越強(qiáng),越需要有相應(yīng)的責(zé)任意識(shí)和安全意識(shí)。
04 未來還需要論文這種形式嗎?
《知識(shí)分子》:您也參與機(jī)器學(xué)習(xí)頂會(huì)的審稿工作。在論文數(shù)量快速增長(zhǎng)、AI生成內(nèi)容不斷增加的背景下,未來同行評(píng)審會(huì)發(fā)生怎樣的變化?
蘇煒杰:AI參與審稿是一個(gè)必然趨勢(shì),完全依靠人工審稿已經(jīng)很難支撐下去了。現(xiàn)在寫論文的門檻和成本大幅下降,大量AI輔助生成的低質(zhì)量論文涌入,如果不仔細(xì)看,很多并不容易識(shí)別。這些論文大量進(jìn)入ICML這樣的頂會(huì),投稿量比去年增長(zhǎng)了大約百分之六七十,而且這個(gè)增長(zhǎng)速度本身還在不斷加快。
在這種情況下,如果AI不參與,未來學(xué)術(shù)共同體可能很難維持。但同時(shí),也不能完全讓AI替代人來審稿。人仍然需要參與,尤其是在整體方向判斷和價(jià)值觀把握上。我更希望未來形成一種模式:人占主導(dǎo),AI作為輔助工具。具體怎么設(shè)計(jì)這樣的機(jī)制,我覺得還存在不少挑戰(zhàn)。
再往大了講,未來我們還需要論文這種形式嗎?這可能也是一個(gè)值得思考的問題。現(xiàn)在很多人已經(jīng)不是直接閱讀論文,而是先讓AI幫助總結(jié)和提煉。未來,論文或者說知識(shí)本身,可能會(huì)變成一個(gè)更大的知識(shí)庫,知識(shí)的獲取、加工、存儲(chǔ)和整合都會(huì)通過AI完成。
現(xiàn)在論文有標(biāo)題、摘要、引言等結(jié)構(gòu),本質(zhì)上都是為人類閱讀設(shè)計(jì)的。但對(duì)AI來說,論文可能就是一個(gè)序列(sequence),它并不需要標(biāo)題這樣的結(jié)構(gòu),很快就可以處理完整篇內(nèi)容。
所以未來,大部分科研成果可能未必還會(huì)以現(xiàn)在這種PDF論文的形式存在,而可能會(huì)變成某種知識(shí)庫或數(shù)據(jù)庫。當(dāng)然,一些非常重要的知識(shí)總結(jié),可能仍然需要人主動(dòng)提煉出來,因?yàn)榻逃乱淮匀恍枰四軌蚶斫夂蛯W(xué)習(xí)的形式,比如論文或教科書。
《知識(shí)分子》:如果未來科研越來越多地借助AI完成,我們應(yīng)該如何評(píng)價(jià)一個(gè)人的科研貢獻(xiàn)?
蘇煒杰:這個(gè)問題我也沒有一個(gè)很好的答案,但我覺得未來肯定會(huì)變得非常復(fù)雜。
以后一個(gè)人的科研成果本身可能也是在AI輔助下產(chǎn)生的,然后又可能被集成到另外一個(gè)更大的AI系統(tǒng)中。這樣一來,個(gè)人成果的作用有點(diǎn)像變成了某個(gè)模型預(yù)訓(xùn)練的數(shù)據(jù)。
但“某一部分?jǐn)?shù)據(jù)到底對(duì)模型貢獻(xiàn)了多少”,本身就是一個(gè)非常基礎(chǔ)的問題。比如,用一部分文本做預(yù)訓(xùn)練,這部分文本究竟貢獻(xiàn)了多少,很難直接衡量。當(dāng)然,可以訓(xùn)練兩個(gè)模型進(jìn)行比較,一個(gè)使用這部分?jǐn)?shù)據(jù),一個(gè)不使用,然后看兩者之間的差異。但這種方法不可擴(kuò)展(scalable):如果數(shù)據(jù)規(guī)模非常大,需要訓(xùn)練無數(shù)個(gè)模型去做比較,成本是無法承受的。
這個(gè)問題和經(jīng)濟(jì)學(xué)里的沙普利值(Shapley value)有一些類似,核心思想是通過比較“有”和“沒有某個(gè)因素”時(shí)結(jié)果的變化,來衡量它的重要性。這個(gè)方向的工作獲得過諾貝爾經(jīng)濟(jì)學(xué)獎(jiǎng)。未來評(píng)價(jià)個(gè)人科研貢獻(xiàn)時(shí),可能也會(huì)面臨類似的問題:貢獻(xiàn)如何分解、如何量化,會(huì)成為一個(gè)重要難點(diǎn)。
《知識(shí)分子》:如果未來知識(shí)越來越多通過AI被獲取和使用,您覺得科研評(píng)價(jià)體系會(huì)不會(huì)出現(xiàn)新的指標(biāo)?比如用一項(xiàng)研究被AI調(diào)用的次數(shù),來衡量它的影響力。
蘇煒杰:未來“被AI調(diào)用”確實(shí)可能會(huì)成為一種新的“引用率”形式。但這里也要注意,一方面,它確實(shí)能夠體現(xiàn)比較直接的影響力。另一方面,它也可能和現(xiàn)在的引用率一樣,在一定程度上掩蓋真正的價(jià)值。
有些知識(shí)本身并不一定特別深刻,也不一定特別重要,但因?yàn)閼?yīng)用場(chǎng)景廣、使用頻率高,可能會(huì)被大量調(diào)用。反過來,有些非常重要的研究,可能并不是最熱門的,但它的價(jià)值需要經(jīng)過更長(zhǎng)時(shí)間才能體現(xiàn)。引用次數(shù)本身也是一種影響力指標(biāo),但并不能完全等同于科研價(jià)值。
所以,未來我們可能需要在一定程度上挖掘真正有價(jià)值的貢獻(xiàn),而不能只停留在表面的調(diào)用次數(shù)上。
05 AI完成了很多數(shù)學(xué)猜想,在應(yīng)用數(shù)學(xué)也會(huì)有巨大前景
《知識(shí)分子》:AI會(huì)怎樣改變應(yīng)用數(shù)學(xué)的研究方式?
蘇煒杰:兩個(gè)層面。一個(gè)層面是,AI帶來了新的問題。過去一些傳統(tǒng)方法無法處理的問題,現(xiàn)在因?yàn)锳I的發(fā)展變得可以處理了,這本身就會(huì)產(chǎn)生很多新的研究方向。
另一個(gè)層面是,AI可能會(huì)讓應(yīng)用數(shù)學(xué)中很多模塊化的環(huán)節(jié)變得更加高效。應(yīng)用數(shù)學(xué)和純數(shù)學(xué)有一個(gè)比較大的區(qū)別:應(yīng)用數(shù)學(xué)通常是模塊化的。一個(gè)實(shí)際問題,首先需要根據(jù)背景建立數(shù)學(xué)模型,然后利用統(tǒng)計(jì)、優(yōu)化、計(jì)算等方法,在實(shí)際數(shù)據(jù)上進(jìn)行訓(xùn)練和擬合,再根據(jù)結(jié)果調(diào)整參數(shù),甚至反過來修改最初的模型。不同模塊之間彼此關(guān)聯(lián),但并沒有完全融合,所以整個(gè)過程往往需要花很多時(shí)間。
AI現(xiàn)在比較擅長(zhǎng)的是在單個(gè)模塊內(nèi)部發(fā)揮作用。比如訓(xùn)練一個(gè)小型神經(jīng)網(wǎng)絡(luò),或者求解一個(gè)具體的數(shù)值微分方程,AI都可以做得很好。
《知識(shí)分子》:現(xiàn)在AI已經(jīng)證出了很多純數(shù)學(xué)的猜想,那它在應(yīng)用數(shù)學(xué)方面有類似的突破嗎?
蘇煒杰:AI在純數(shù)學(xué)領(lǐng)域的突破更引人注目,這是因?yàn)榧償?shù)學(xué)問題具有清晰的結(jié)構(gòu)和明確的驗(yàn)證標(biāo)準(zhǔn),這對(duì)AI學(xué)習(xí)非常高效。而應(yīng)用數(shù)學(xué)有模塊化的特點(diǎn), AI在這個(gè)模塊做得很好,另一個(gè)模塊也做得很好,但轉(zhuǎn)變過程中經(jīng)常會(huì)出問題。所以,AI在應(yīng)用數(shù)學(xué)這邊的進(jìn)展是漸進(jìn)的,不是一蹴而就的。
純數(shù)學(xué)之所以不一樣,本質(zhì)原因是它是context-free的。一個(gè)數(shù)學(xué)命題的證明,對(duì)AI來說是一個(gè)非常明確、不依賴具體上下文的問題,沒有太多模糊性,可以通過強(qiáng)化學(xué)習(xí)不斷加強(qiáng)。證明正確了,獎(jiǎng)勵(lì)就是1。錯(cuò)誤了,就是0,然后不斷迭代。
所以數(shù)學(xué)證明這方面,從去年這個(gè)時(shí)候它還只能做IMO金牌題,到現(xiàn)在已經(jīng)可以做科研級(jí)別的數(shù)學(xué)證明了,前后也就過了一年時(shí)間,這個(gè)變化非常驚人。
純數(shù)學(xué)的性質(zhì)也決定了它比較適合作為AI訓(xùn)練的基準(zhǔn)測(cè)試(benchmark),它天然是一個(gè)非常適合強(qiáng)化學(xué)習(xí)的問題。問題明確、獎(jiǎng)勵(lì)明確,可以不停迭代參數(shù),這跟下圍棋、跟編程有點(diǎn)類似,都是相對(duì)沒有歧義的問題。這三個(gè)方向,也是相對(duì)來講很適合強(qiáng)化學(xué)習(xí)這種場(chǎng)景的三個(gè)例子。
《知識(shí)分子》:現(xiàn)在很多AI大廠都在招聘應(yīng)用數(shù)學(xué)人才。應(yīng)用數(shù)學(xué)研究者能夠?yàn)锳I發(fā)展解決哪些關(guān)鍵問題?
蘇煒杰:預(yù)訓(xùn)練這方面,需要更多做優(yōu)化、做計(jì)算數(shù)學(xué)的學(xué)者。這次國(guó)際數(shù)學(xué)家大會(huì)上,優(yōu)化方向就有兩個(gè)一小時(shí)報(bào)告,一個(gè)是拿了高斯獎(jiǎng)的Yurii Nesterov,還有一個(gè)是Stephen Wright,比例相當(dāng)高。
后訓(xùn)練這方面,需要大量統(tǒng)計(jì)學(xué)家。因?yàn)檫@一階段涉及很多數(shù)據(jù)分析、概率建模和不確定性處理。
但如果問有沒有某一個(gè)問題,解決了之后整個(gè)局面就會(huì)徹底打開,我倒不覺得存在這種情況。現(xiàn)在更多是一個(gè)系統(tǒng)性工程。在每一個(gè)環(huán)節(jié)上提高哪怕1%,最后整體疊加起來,可能都會(huì)帶來非常大的提升。
其中,如果一定要說一個(gè)比較核心的問題,我覺得可能是架構(gòu)。我不確定Transformer是不是現(xiàn)在應(yīng)該把所有資源都投入進(jìn)去的架構(gòu)。從直覺上講,應(yīng)該不會(huì)不存在比它更好的架構(gòu),只是現(xiàn)在大量成本已經(jīng)投入到Transformer上,并且圍繞它進(jìn)行了各種優(yōu)化。
未來會(huì)不會(huì)出現(xiàn)一個(gè)更好的架構(gòu)?這個(gè)架構(gòu)能不能被大家認(rèn)可?我覺得這些都還是未知的。
《知識(shí)分子》:您之前說過,如果有一個(gè)平行世界,希望AI沒有出現(xiàn),哪怕發(fā)展慢一些。這個(gè)說法的考慮是什么?
蘇煒杰:如果有一個(gè)平行世界,從純粹風(fēng)險(xiǎn)規(guī)避的角度,我是希望AI不要出現(xiàn)的。AI不出現(xiàn),我們的發(fā)展會(huì)慢一些,但相對(duì)來講,每一步都是比較可靠的。
今年獲得菲爾茲獎(jiǎng)的Jacob Tsimerman,去年曾和Andrew Critch合作寫過一篇討論AI可能導(dǎo)致人類毀滅情景的論文。按照他們的觀點(diǎn),AI的出現(xiàn)使人類面臨極端風(fēng)險(xiǎn)的概率增加了,雖然我們不知道具體概率是多少。
這就像一場(chǎng)賭博。沒有AI,我們不會(huì)因?yàn)锳I而面臨這種風(fēng)險(xiǎn),但發(fā)展速度可能會(huì)慢一些。有了AI,也許很大概率我們會(huì)快速發(fā)展,躍升到一個(gè)新的階段,但也存在小概率出現(xiàn)非常嚴(yán)重后果的可能。
對(duì)于一個(gè)比較謹(jǐn)慎、希望未來更確定的人來說,可能沒有AI會(huì)更好。人的智能本身其實(shí)還有很大的發(fā)展空間,只是沒有AI這種快速集成和放大的能力。
但另一方面,AI的出現(xiàn)不會(huì)以任何個(gè)人、任何國(guó)家的意志為轉(zhuǎn)移,它已經(jīng)成為一個(gè)全球性的競(jìng)爭(zhēng)問題。到了這個(gè)階段,無論喜歡還是不喜歡,我們都需要接受現(xiàn)實(shí),更重要的是思考AI會(huì)對(duì)自己所在的行業(yè)、領(lǐng)域產(chǎn)生什么影響,以及應(yīng)該如何應(yīng)對(duì)。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.