![]()
人工智能(AI)和組合優化正在推動科學研究和工業應用的快速發展,但它們日益增長的能耗也對數字計算的可持續性提出了嚴峻挑戰。
同時,目前大多數新型計算系統要么只擅長 AI,要么只擅長優化,而且還需頻繁進行高能耗的數字轉換,效率受限。另外,在實際應用中,這些系統也常難與硬件高效配合,無論是處理內存受限的神經網絡、解決復雜優化問題,還是應對模擬計算噪聲,都表現不佳。
如果換一種思路,不再依賴“0”與“1”的切換,而是用光與模擬信號去計算呢?這種不需要頻繁轉換、不依賴數字邏輯的計算方式,能否打破現有的限制?
基于此,微軟英國劍橋研究院團隊及其合作者提出了“模擬光學計算機”(Analog Optical Computer,AOC),其在無需數字轉換的情況下,能夠同時高效完成 AI 推理與組合優化任務,并具備顯著的擴展潛力與能效優勢。
相關研究論文已發表在權威科學期刊
Nature上。 上海交大校友、微軟英國劍橋研究院首席研究員褚嘉琦(Jiaqi Chu) 為該論文的作者之一。
![]()
論文鏈接:
https://www.nature.com/articles/s41586-025-09430-z
據介紹,AOC 實現了將模擬電子技術與三維光學技術相結合,使同一平臺能夠同時加速 AI 推理和組合優化任務。這種“雙領域能力”得益于快速的定點搜索方法,無需數字轉換,同時也增強抗噪聲能力。基于這種定點抽象,AOC 可運行具備遞歸推理能力的新型計算密集型神經模型,并采用先進的梯度下降方法解決高表現力優化問題。
![]()
圖|AOC 架構與應用示意圖
研究團隊表示,AOC 架構基于可擴展的消費級技術構建,為實現更高速、更可持續的計算提供了有前景的路徑。其原生支持迭代式、計算密集型模型,為 AI 與優化領域的未來創新提供了可擴展的模擬計算平臺。
模擬光學計算機:如何加速AI和優化任務?
AOC 在應用層面主要面向兩類任務:機器學習推理任務和組合優化任務。研究團隊通過四個典型案例展示了 AOC 在這兩類任務中的能力。這項研究也體現了硬件與抽象層協同設計的優勢,呼應了數字加速器與深度學習模型共同演進的趨勢。
AOC 硬件結合了 3D 光學技術與模擬電子技術,并基于平衡模型實現了兩個機器學習推理任務:圖像分類與非線性回歸。在這兩項任務中,模型均通過 AOC-DT 進行數字訓練,并直接部署到硬件上,無需進一步校準。這對硬件精度提出了較高要求,同時也要求 AOC-DT 具備較高的保真度。
在圖像分類實驗中,AOC 的結果證明了采用數字訓練并將權重轉移至光電模擬推理硬件的可行性。將 AOC 的結果與線性分類器進行比較時,運行在 AOC 上的平衡模型所作出的貢獻更加明顯。研究人員還訓練了一個簡單的前饋模型,線性分類器和前饋模型都具有與 AOC 硬件相同數量的參數。盡管 AOC 實現了略高的準確率,但 MNIST 和 Fashion-MNIST 數據集本身較為簡單,難以充分展現自遞歸模型的全部潛力。
研究表明,AOC 硬件可以運行非線性回歸模型。他們選擇兩個非線性函數進行回歸:高斯曲線和正弦曲線。硬件準確地重現了這兩個函數。相比高斯曲線,正弦曲線由于存在多個極小值和極大值,對擬合精度提出了更高要求,因此需要更高精度的可微分數字孿生模型(AOC-DT)。此外,AOC 為運行在硬件上的平衡模型提供了支持。
![]()
圖|AOC 在機器學習推理中的應用
QUMO 代表了一類廣泛的組合優化問題,旨在最小化目標函數,QUMO 問題的求解過程即為找到一組使目標函數最小化的變量賦值。研究團隊在 AOC 硬件上展示了兩個典型的 QUMO 應用場景:醫學圖像重建與金融交易結算。
他們在 AOC 硬件上實現了壓縮感知,這是一種可以用更少的測量實現準確信號重建的技術。最終的圖像重建結果與原始線條高度一致。所有 QUMO 實例均以完全模擬方式求解,未使用任何數字后處理。為了驗證壓縮感知在大規模下的 QUMO 表達形式,研究人員使用 AOC-DT 從 FastMRI 數據集中重建了一幅腦部掃描圖像。這一問題包含超過 200000 個變量。在典型的 4 倍和 8 倍欠采樣率下,重建的均方誤差(MSE)均低于 0.07。
在金融領域的優化任務中,他們使用 AOC 硬件解決了一個交易結算問題。每一筆證券交易都是以支付換取證券的交換,清算所會處理這類交易的批次,在每個交易批次中,交易結算的目標是最大化已結算交易的總數或總價值。鑒于交易數量龐大,同時受到法律約束和其他附加要求的限制,這成為一項復雜的優化問題。在該交易結算場景中,AOC 硬件在 7 個塊坐標下降法(BCD)步驟內找到了全局最優解。相比之下,量子硬件在相同問題上的成功率僅為 40–60%。
![]()
圖|AOC 在優化中的應用
利用 AOC-DT,研究人員還在 QPLIB 基準測試中最難的具有線性不等式約束的二次二元問題上驗證了算法性能,這些問題被表述為 QUMO 實例。AOC 方法與商用求解器 Gurobi 進行了對比,后者在這些問題上通常需要超過一分鐘才能達到當前已知的最優解。
這種全模擬操作最大限度地減少了模數轉換的開銷。
未來潛力:實現100倍能效提升
值得注意的是,現實應用對硬件的擴展能力提出了更高要求。使用 AOC 處理實際任務,需要其硬件能夠支持從數億到數十億個權重的可擴展性。
研究團隊表示,AOC 通過模塊化架構具備滿足這一需求的潛力,該架構可將核心的光學矩陣–向量乘法運算分解為較小的子向量與子矩陣乘法,從而實現可擴展的內存計算。
研究團隊預計,AOC 可支持參數規模在 1 億至 20 億之間的模型,對應需要 50 至 1000 個光學模塊。如果單個光學模塊能夠同時處理正負權重,則所需模塊數量可減少一半。AOC 所采用的所有組件,包括 microLED、光電探測器、SLM 及模擬電子器件,均已具備持續擴展的制造生態系統,能夠支持晶圓級的生產。
AOC 的運行速度和功耗決定了其能效。其速度受光電組件帶寬限制,通常為 2 GHz 或更高。對于一個 1 億權重的矩陣,使用 25 個 AOC 模塊時,功耗估計為 800 W,可實現 400 Peta-OPS 的計算速度,在 8 位權重精度下的能效為每瓦 500 TOPS。相比之下,最新的 GPU 在相同精度下處理稠密矩陣時,其系統能效最高僅為每瓦 4.5 TOPS。
總之,AOC 架構在擴展到實際的機器學習和優化任務方面展現出良好前景,有望在能效方面實現約 100 倍的提升。
展望未來,AOC 的協同設計方法——將硬件與機器學習和優化算法緊密對齊——有望持續推動硬件與算法的創新飛輪,這對實現可持續計算至關重要。
整理:小羊
如需轉載或投稿,請直接在公眾號內留言
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.