![]()
當你對手機說“幫我設一個明天早上 6 點的鬧鐘”,它聽懂并設置了一個新鬧鐘。接著,你又說“改成 7 點半吧”,假如這個設備用的是普通 AI,它可能就會懵掉,因為它不記得你剛才說的是“鬧鐘”,它可能只聽到了“改成 7 點半”。
這個例子反映了 AI 在處理連續(xù)信息時的一個軟肋,它要么是很短視,只聽到了眼前的某一句話;要么就是很費電,必須使用大量算力強行地記住上下文。而且,這個問題在需要處理聲音、手勢和動作這類隨時間變化的信息時顯得尤其突出。
帝國理工學院博士后孫鵬飛和蘇黎世聯(lián)邦理工博士后蘇哲,以及合作者,從人類大腦皮層里找到了一個解法。他們兩人在瑞士蘇黎世聯(lián)邦理工和蘇黎世大學神經(jīng)信息所相識,之后他們合作了這一課題探索,他們發(fā)現(xiàn)大腦在處理信息的時候,并非依靠一個統(tǒng)一的速度。
![]()
圖 | 左起;孫鵬飛、蘇哲(來源:資料圖)
具體來說:大腦的前額葉皮層處理信息較慢,故能承擔起整合長期上下文的責任;大腦的初級感官皮層處理信息較快,故能負責捕捉當下的刺激。正是這種快慢節(jié)奏的搭配,讓大腦既可以及時響應,又可以記住上下文。
他們把這種機制做成一個名為“雙重記憶路徑”的類腦網(wǎng)絡,并設計了一款配套的芯片,這顆芯片在處理語音識別任務的時候,能效比此前最好方案高出 5 倍之多。其實他們等于把一項從大腦偷師的技術推到了可以裝進芯片的地步,讓 AI 不需要太長的上下文也能聽說你說的話。
![]()
(來源:《自然·機器智能》)
孫鵬飛目前在帝國理工學院繼續(xù)博士后研究,蘇哲則加入了美國波士頓的一家芯片公司。近日,他們這一成果的相關論文發(fā)表在《自然·機器智能》上。
正如文章開頭的例子,當下的 AI 在處理時間信息時存在一個 Bug。那就是現(xiàn)在的 AI 處理一張圖片非常厲害,比如在著名的看貓實驗里,給 AI 看一萬張貓的照片,AI 就能學會認貓。然而,處理一段聲音或者一段視頻就大不一樣,聲音是一秒一秒地流過來的,上一秒的聲音可能會影響下一秒的理解,AI 必須得記住“剛才發(fā)生了什么”,才能理解“現(xiàn)在到底發(fā)生了什么”。
![]()
(來源:《自然·機器智能》)
孫鵬飛和蘇哲從大腦里找到了解決上述問題的靈感。人類大腦皮層里不同區(qū)域的神經(jīng)元有不同的時間常數(shù),有些區(qū)域處理信息較快,對當下的刺激反應十分迅速;有些區(qū)域處理得很慢,故能整合過去幾秒甚至更長時間的信息。正是這種快慢分區(qū)讓大腦不僅可以及時響應環(huán)境變化,又能保持對于上下文的感知。
他們在類腦網(wǎng)絡的每一層里都加了一個共享的小型慢速記憶模塊,這個模塊利用一個很低維度的狀態(tài)向量來概括過去一段時間的信息。低維度意味著它的體積很小,只需占用很少的存儲和計算資源。這個狀態(tài)向量能夠通過網(wǎng)絡內(nèi)部的連接反饋給該層的所有神經(jīng)元,給它們提供“剛才到底發(fā)生了什么”的上下文信息。
這一思路也體現(xiàn)了兩位博士對 AI 系統(tǒng)的理解:神經(jīng)網(wǎng)絡模塊應當是異構的,對應的部署硬件也應是異構融合的。而為了進一步提升能效,他們還主張將記憶與計算相分離——讓記憶模塊專注于存儲和維持上下文,讓計算模塊專注于處理當前輸入,兩者各自獨立優(yōu)化,避免了相互干擾和資源爭搶,也使得整體架構更加精簡高效。
盡管這個記憶模塊的大小只占整個網(wǎng)絡參數(shù)的 5%-10%,但是效果很出色,在那些需要處理長時程信息的基準測試里,這套網(wǎng)絡的準確率從 10% 提升到了 90% 以上。在順序 MNIST 數(shù)據(jù)集上,它更是達到 99% 的準確率,比此前最好的同類模型高了將近 30%。
這個架構還有另外一個關鍵優(yōu)勢,由于記憶模塊是共享的,所以它的開銷不會隨著神經(jīng)元數(shù)量線性增長,這樣一來網(wǎng)絡越做越大,這個優(yōu)勢就更加明顯。在參數(shù)量相同的情況之下,雙重記憶路徑網(wǎng)絡在準確率上明顯優(yōu)于傳統(tǒng)的循環(huán)網(wǎng)絡和延時網(wǎng)絡。
那么,算法設計好了,硬件該怎么辦?類腦計算一直存在這樣一個尷尬,那就是算法上的創(chuàng)新往往不考慮硬件能不能跑得動。一些論文固然可以發(fā)表出來,但是人們會發(fā)現(xiàn)一些精巧的設計在芯片上要么是太耗電,要么是太占面積,以至于只能停留在仿真階段。
孫鵬飛和蘇哲則從一開始就在考慮硬件實現(xiàn)問題,他們在設計算法的時候就在思考:這個記憶模塊在芯片上應該怎么存?怎么讀?怎么算?蘇哲在博士期間研究的就是類腦芯片設計,正是這個背景讓他在算法和硬件之間充當了翻譯的角色。
基于此他們在算法層面做了幾件事來降低硬件開銷:
首先,既然記憶模塊很小,那么就可以放在芯片的片上存儲里,無需頻繁訪問外部內(nèi)存;
其次,記憶更新和記憶讀取可以開展并行處理,不用花時間排隊等待;
再次,讓稀疏的脈沖計算和密集的矩陣計算分別采用不同的數(shù)據(jù)流優(yōu)化策略策略,讓它們自己進行各自優(yōu)化。
這些設計選擇也反映在了芯片架構上,他們研發(fā)的芯片采用了近存計算架構,將計算單元和存儲單元放得很近,借此減少了數(shù)據(jù)搬運的距離。在芯片內(nèi)部存在四條并行的計算路徑,分別負責處理脈沖積分、記憶讀取、記憶更新和輸出,與此同時這四條路徑可以同時工作,不用互相地等待。
他們把芯片在 22 納米工藝上完成了后布局仿真,結果顯示這套方案在處理語音識別任務的時候,能效要比同類最好的設計高出 5 倍以上,吞吐量高出 4 倍,面積效率也比循環(huán)網(wǎng)絡架構高出了 1 倍,原因在于省去了存儲循環(huán)權重矩陣的空間。
這些數(shù)字意味著對于需要長時間連續(xù)工作的設備來說,比如智能手表、AR 眼鏡和助聽器等,只需能效提升 5 倍就能讓電池壽命延長數(shù)倍之高。對于需要實時響應的場景來說,比如語音助手和手勢控制,吞吐量提升 4 倍意味著更短的延遲和更加流暢的體驗。
這個芯片架構還有另外一個優(yōu)勢就是不依賴于底層物理實現(xiàn)。不僅可以做到像文章中介紹的直接在特定工藝下實現(xiàn)優(yōu)化策略以做到效率最大化,還可以把整套優(yōu)化策略放在編譯器層次實現(xiàn)再映射到傳統(tǒng)計算芯片上。
![]()
(來源:《自然·機器智能》)
但是這篇論文的意義不只在能效上,它其實是展示了一種更根本的思路,那就是算法的設計從一開始就要考慮硬件的限制。而硬件的設計也要能夠適配算法的特點,兩者實際上是互相塑造的關系。
硬件的限制乍一看是個麻煩,但其實可以推動智能的產(chǎn)生,我們的大腦本身就是在各種約束下進化出來的。我們大腦的能量預算只有二十瓦左右,但卻可以完成超級計算機都做不到的事情,可以說正是因為能量有限,大腦才進化出了一些高效的編碼方式。
據(jù)了解,本次研究的工作還在繼續(xù),孫鵬飛未來會繼續(xù)探索“將時間作為一種計算資源”,研究軸突延遲、系統(tǒng)級異構網(wǎng)絡融合及其與異構硬件的適配。蘇哲在新公司里也在繼續(xù)研究異構 AI 系統(tǒng),類腦計算是其中一個重要的方向。目前,該工作已引起多家美國芯片公司的興趣。
同時,這篇論文的全部代碼和硬件設計已經(jīng)全部開源,其他同行可以在此基礎上繼續(xù)改進,也可以把它集成到更大的系統(tǒng)之中。這一做法在類腦計算領域并不常見,之前大多數(shù)工作只公開算法,硬件設計往往留在實驗室里面。對于個人未來發(fā)展,孫鵬飛和蘇哲對學術圈和工業(yè)界也報以開放態(tài)度,渴望與優(yōu)秀的同行共事,均表示并不排斥可能的創(chuàng)業(yè)機會。
參考資料:
相關論文 https://www.nature.com/articles/s42256-026-01255-3
運營/排版:何晨龍
注:封面/首圖由 AI 輔助生成
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.