編輯|杜偉、山輝
當地時間 7 月 23 日 12 點,費城賓夕法尼亞會議中心 126-B 會議室.
白色背景板前,四位新科菲爾茲獎得主并排坐下:鄧煜、John Pardon、Jacob Tsimerman 和王虹。其中,鄧煜與王虹成為首批獲得菲爾茲獎的中國籍數學家。
而另一位獲獎者、多倫多大學數學教授 Jacob Tsimerman 現場宣布了一個「炸裂」的消息 ——他未來將轉向「AI安全」工作,并將加入 OpenAI。
![]()
圖源:https://www.youtube.com/watch?v=2dr2F2NVUkY
消息出來之后,包括 OpenAI 首席研究官 Mark Chen 以及前微軟 AI 副總裁現 OpenAI 研究員 Sebastien Bubeck 在內,都確定了 Jacob Tsimerman 的加盟并對他表示了歡迎。
Mark Chen 稱,「Jacob Tsimerman 的數學天賦無疑極為出眾,而他對 AI 安全問題所展現出的嚴肅態度和思考深度,同樣令人欽佩。」
![]()
Jacob Tsimerman 介紹
Jacob Tsimerman 是加拿大數學家,主要研究數論、算術幾何、超越數論及其與模型論的交叉問題。
![]()
圖源:多倫多大學
1988 年出生的他早年便展現出很強的數學天賦,曾代表加拿大參加 2003 年和 2004 年國際數學奧林匹克競賽,兩次獲得金牌,并在 2004 年取得滿分。
此后,他在多倫多大學完成本科教育,2011 年獲得普林斯頓大學數學博士學位,導師是著名數論學家 Peter Sarnak,之后進入哈佛大學學者協會從事博士后研究。2014 年起任教多倫多大學至今。
![]()
Tsimerman 最重要的數學成就集中在「André–Oort 猜想」 。這一猜想研究 Shimura 簇中特殊點的分布規律,是現代算術幾何中的核心問題之一,與丟番圖方程、模形式、阿貝爾簇和超越數論密切相關。
他先是解決了阿貝爾簇模空間中的關鍵情形,并建立特殊點伽羅瓦軌道的下界;后來與 Jonathan Pila、Ananth Shankar 等數學家合作,完成了 André–Oort 猜想一般情形的證明。他在其中發展的 Ax–Schanuel 型超越性定理和高度理論,也成為研究類似不太可能交集問題的重要工具。
具體可參考機器之心文章:「數學家證明 30 年前的「安德烈 - 奧爾特猜想」,推進多項式方程解探索」。
![]()
- 論文地址:https://arxiv.org/pdf/2109.08788
除 André–Oort 猜想外,他還參與解決了 Griffiths 猜想中的重要問題。
憑借這些成果,他先后獲得 2015 年 SASTRA 拉馬努金獎、2022 年數學新視野獎和 2023 年奧斯特洛夫斯基獎。2025 年,他當選英國皇家學會會士。
OpenAI 為什么會需要一位數論學家做安全?
就在菲爾茲獎揭曉前三天,OpenAI 發布了一篇關于長時程模型安全的文章。
![]()
- 文章鏈接:https://openai.com/zh-Hans-CN/index/safety-alignment-long-horizon-models/
OpenAI 披露,公司曾向內部人員開放一種能夠持續執行復雜任務的長時程模型,但很快觀察到了預部署評測沒有覆蓋的行為,并暫時停止訪問。
一個案例中,模型試圖從評測后臺獲取其他參與者的私有答案;在認證令牌被掃描器攔截后,它把令牌拆分、混淆,再在運行時重新組合,以繞過檢測。
另一些案例中,模型未經充分理由嘗試訪問其他計算節點,甚至生成了可能終止大量進程的命令。
OpenAI 安全團隊當前面對的核心問題,就是面對短回答模型,安全團隊可以檢查「它說了什么」;但面對長時程智能體,安全團隊還要判斷「這一連串動作最終試圖完成什么」。
這意味著,安全問題已經變成了可能跨越百步的行為軌跡分析。
然而當前常用的安全辦法很難窮盡所有行為組合,往往只能在模型出現異常后,再補充評測、規則與監控。
AI 安全更像實驗科學,而不是定理
目前常用的 AI 安全方法,大多提供的是經驗性證據:在我們測試過的情形下,系統通常沒有出問題。
但這不等于不等于數學意義上的:對所有滿足某些條件的行為,系統都不可能越過某條邊界。
OpenAI 曾將模型分成「證明者」和「驗證者」,讓強模型生成答案,再訓練較弱的驗證者識別正確與錯誤證明。
研究發現,只追求答案正確,模型給出的推理反而可能更難檢查;加入「可驗證性」目標后,人類和弱模型更容易判斷其輸出。
這說明,數學里的「測試-驗證」關系正在成為 AI 監督問題的一種模型。
而 Tsimerman 想做的,正是用這樣的數學關系從「測試」走向「證明」。
Quanta 的報道披露,Tsimerman 認為,數學家可以參與研究多個 AI 智能體組成的系統如何行動,并嘗試推導證明,確保這些復雜系統不會采取非預期行為。他強調,由于風險和賭注極高,安全研究需要非常高的確定性。
在 2025 年,Tsimerman 曾與伯克利 AI 安全研究者 Andrew Critch 合作一篇論文《A Taxonomy of Omnicidal Futures Involving Artificial Intelligence》。
![]()
- 論文鏈接:https://arxiv.org/abs/2507.09369
這篇論文沒有提出模型訓練算法,而是試圖系統分類 AI 可能參與人類滅絕的不同路徑。
作者明確表示,這些場景并非不可避免,寫作目的在于把抽象的「AI 可能導致滅絕」拆成可討論、可防范的具體類型。
這種先分類、再尋找邊界的思路,與 Tsimerman 過去的數學工作并不遙遠。
他的重要貢獻之一,是把來自模型論的 o-minimality,變成算術幾何和復代數幾何中的基礎方法。
簡單來說,o-minimality 研究的是一類幾何對象:它排除無限震蕩、無窮分叉等病態行為,讓看似復雜的集合能夠被拆解成有限、規則、可描述的部分。
Tsimerman 擅長做的,正是為過于自由的對象找到隱藏的結構。
這些成果與 AI 安全之間并不存在直接的技術對應,但這兩類問題共享一種思路:面對一個行為復雜、難以窮舉的系統,不能只觀察它在有限實驗中的表現,而是要先找到一種足夠嚴格的描述語言,定義狀態和邊界,再證明系統在特定條件下必然滿足這些約束。
Tsimerman 正試圖把這樣的「確定性」帶到 OpenAI。
目前,人們還無法像證明一道幾何定理那樣,證明一個 AI 不會執行危險操作。
但數學可以換一種方式縮小問題。
2026 年提出的「包容驗證(Containment Verification)」就沒有證明 AI 本身是安全的,轉而驗證它與外部世界之間的通道。
換句話說,它不證明 AI 沒有危險意圖,而是證明它沒有實現某些危險意圖的途徑。
類似的,數學可以提供的,也不是一張覆蓋整個 AI 安全系統的「保證書」,而是一些條件清晰的命題。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.