7月30日消息,Thinking Machines Lab聯(lián)合創(chuàng)始人翁荔將重返OpenAI。The Information援引OpenAI發(fā)言人確認(rèn)了這項人事變動;一名知情人士稱,她接下來將參與遞歸式自我改進(jìn)研究。所謂遞歸式自我改進(jìn),并不只是模型修改自己,更多指的是用AI參與模型研發(fā)流程本身。
距翁荔宣布離開Thinking Machines只過了兩天。她7月28日在X發(fā)布的離職信中說,過去七個月的生病頻率超過人生其他時期,持續(xù)壓力和工作量已經(jīng)超出身體能夠承受的范圍。她表示自己仍然熱愛AI研究,但希望回到職責(zé)更聚焦、節(jié)奏更可預(yù)測的研究崗位,而不是繼續(xù)擔(dān)任聯(lián)合創(chuàng)始人。翁荔當(dāng)時未披露去向,OpenAI目前也尚未公開她的新職務(wù)和所屬團(tuán)隊。
![]()
從"改模型"到"改訓(xùn)練流程"
遞歸式自我改進(jìn)常被理解成"模型改寫自己",翁荔近期給出的解釋要具體得多。她7月4日在個人博客Lil'Log發(fā)表《Harness Engineering for Self-Improvement》,把自我改進(jìn)分成兩類:一種是模型直接修改自身參數(shù);另一種是模型幫助改進(jìn)訓(xùn)練流程,再用這些流程開發(fā)更強(qiáng)的新模型。
![]()
后者涉及的并不只有模型本身,還包括工具、環(huán)境、記憶、評估和訓(xùn)練流程。例如,模型可以幫助設(shè)計實驗、編寫訓(xùn)練代碼、檢查結(jié)果和調(diào)整下一輪任務(wù),但每一步仍需要明確目標(biāo)、評估標(biāo)準(zhǔn)和外部控制。按The Information的描述,翁荔回到OpenAI后的工作將落在這條研究線上。
翁荔對這類問題并不陌生。她2018年加入OpenAI,先后負(fù)責(zé)機(jī)器人、應(yīng)用AI、安全系統(tǒng)等多個方向,并擔(dān)任研究與安全副總裁。這些經(jīng)歷覆蓋模型研發(fā)、安全評估和訓(xùn)練系統(tǒng),正是"用AI開發(fā)AI"研究所需要的核心能力。
Thinking Machines剛發(fā)布首個模型,創(chuàng)始團(tuán)隊從六人縮至兩人
翁荔離開前,Thinking Machines于7月15日發(fā)布了首個開放權(quán)重模型Inkling。官方資料顯示,Inkling是一個可處理文本、圖像和音頻的混合專家模型,總參數(shù)9750億、激活參數(shù)410億,最長支持100萬token上下文。
![]()
值得注意的是,Thinking Machines還用Inkling展示了一次受控的自我改進(jìn):模型通過公司的Tinker平臺編寫自己的微調(diào)任務(wù),生成訓(xùn)練和評估流程,完成微調(diào)后再切換到新權(quán)重。這段演示與翁荔博客討論的方向高度重合。Thinking Machines未公開她在Inkling項目中的具體職責(zé)。
Inkling發(fā)布后不到兩周,翁荔宣布離開。她是過去一年第四名離開Thinking Machines的聯(lián)合創(chuàng)始人:安德魯·圖洛克(Andrew Tulloch)轉(zhuǎn)投Meta,巴雷特·佐夫(Barret Zoph)和盧克·梅茨(Luke Metz)今年1月回歸OpenAI。至此,創(chuàng)始團(tuán)隊只剩米拉·穆拉蒂(Mira Murati)和約翰·舒爾曼(John Schulman)兩人。
對這家成立時間不長、剛發(fā)布首個自研模型的創(chuàng)業(yè)公司來說,六人創(chuàng)始團(tuán)隊縮至兩人,能同時統(tǒng)籌模型訓(xùn)練、產(chǎn)品和安全研究的核心人選明顯變少。而在另一頭,OpenAI正在重新聚集一批長期從事模型訓(xùn)練系統(tǒng)和自動化AI研發(fā)的核心研究人員。(易句)
(本文由AI翻譯,網(wǎng)易編輯負(fù)責(zé)校對)
