![]()
建設(shè)社會主義現(xiàn)代化強國,關(guān)鍵在科技自立自強。以科技金融支持創(chuàng)新創(chuàng)造,因地制宜發(fā)展新質(zhì)生產(chǎn)力,加快建設(shè)現(xiàn)代化產(chǎn)業(yè)體系,是我國在“十五五”時期推動高質(zhì)量發(fā)展、實現(xiàn)中國式現(xiàn)代化的核心戰(zhàn)略部署。發(fā)展智能經(jīng)濟新形態(tài),需要打通科技成果轉(zhuǎn)化堵點、強化產(chǎn)業(yè)體系支撐、暢通金融賦能渠道,構(gòu)建科技、產(chǎn)業(yè)、金融良性循環(huán)。在此背景下,《清華金融評論》推出《科創(chuàng)AI+》主題專欄,旨在深入闡釋國家戰(zhàn)略部署、匯聚權(quán)威觀點、服務(wù)高質(zhì)量發(fā)展大局,為政策完善與行業(yè)實踐提供智力支持。物理空間智能賽道正迎來深度技術(shù)變革,各類技術(shù)路線不斷豐富并重塑行業(yè)生態(tài)。
在物理世界與大模型之間,如何讓具身智能“看得全、看得清、看得懂”,成為制約產(chǎn)業(yè)規(guī)模化落地的關(guān)鍵命題。光場感知——這一在給定空間和觀察視角范圍內(nèi)對所有光信號進行統(tǒng)一記錄的技術(shù)范式,被學界視為大場景物理世界具身智能最有潛力的感知路線之一。拙河科技是國內(nèi)率先實現(xiàn)億像素陣列光場相機量產(chǎn)的企業(yè),核心團隊在計算攝像學領(lǐng)域擁有多年技術(shù)積累,已相繼攻克非結(jié)構(gòu)化動態(tài)光場智能成像、多維多尺度融合光場重建、大范圍動態(tài)場景智能處理三大核心技術(shù),產(chǎn)品覆蓋安保防護、智慧城市、交通運輸?shù)榷鄨鼍啊1酒趯趪@光場感知的技術(shù)位勢與產(chǎn)業(yè)成熟度、多感知路線競爭格局、光場數(shù)據(jù)與空間大模型的閉環(huán)路徑以及硬科技創(chuàng)業(yè)方法論等議題,專訪拙河科技創(chuàng)始人兼董事長溫建偉。
一
光場感知:物理世界
的“全息之眼”
Q:光場感知被學界視為大場景物理世界具身智能最有潛力的感知路線之一,距離規(guī)模化落地還有哪些關(guān)鍵臺階?
溫建偉:光場是一個比較理想化的、大而全的物理感知模式。它的定義是在給定空間、給定觀察視角范圍之內(nèi),將所有光信號,如位置信息、光譜信息、時間維度、觀察視角等數(shù)據(jù)都完整記錄。它能克服傳統(tǒng)光學成像把所有信息簡化為二維的弊端,從而解決模型訓練中遇到的各種問題,包括深度信息、事物之間的關(guān)聯(lián)關(guān)系等。
但光場太復雜,要把整個光場記錄下來,目前硬件手段還不夠理想。早期業(yè)界嘗試用微透鏡陣列,事實證明這條路并不順利。用空間分辨率換取角度分辨率,會造成分辨率降低和成像質(zhì)量下降,從產(chǎn)業(yè)推廣角度難以走通。鏡頭陣列的方式組合光場同樣面臨挑戰(zhàn)。鏡頭數(shù)量的選取、大視場場景下多少設(shè)備才能滿足要求、采集圖像在同一時空坐標系下對齊后的數(shù)據(jù)利用,都是很大的工程難題。數(shù)據(jù)量極大,如何標定、如何給模型做輸入、如何分析關(guān)聯(lián)關(guān)系,這條鏈路還沒有完全建立起來。
大方向上說,光場相機對世界模型的訓練開發(fā)是極具潛力的。但是,實操層面,算法的收斂、理論的收斂、工程的收斂還是瓶頸;算力的挑戰(zhàn)、模型關(guān)聯(lián)關(guān)系的挑戰(zhàn)、成本的挑戰(zhàn),都是制約因素。需要系統(tǒng)性的應(yīng)用場景、采集方式和模型迭代升級結(jié)合,滾動向前發(fā)展,不是單點突破就能帶動全局;并且需要結(jié)合具體應(yīng)用場景設(shè)計光場采集方式,在光場數(shù)據(jù)中與模型結(jié)合得到更好的訓練結(jié)果,泛化之后再迭代升級。
Q:當前空間智能感知層存在視覺/光場、結(jié)構(gòu)光、ToF、事件相機、LiDAR等多條技術(shù)路線并行競爭。光場感知與其他路線的差異化壁壘在哪里?您預判未來3—5年哪些路線會率先跑出規(guī)模應(yīng)用?
溫建偉:結(jié)構(gòu)光、激光雷達、雙目視覺等技術(shù),其實都只解決了部分問題。它們的好處是成本較低、可操作性強,可以快速切入模型訓練后端。但可以這樣理解:其他技術(shù)手段都是對完整光場信息的壓縮、切割——舍棄了一些信息,得到了特定結(jié)果。理想化的光場可提供全面的信息,但全面信息以現(xiàn)在的算力和模型能力,還“處理不了”。
光場相機對于其他模態(tài)感知的壁壘在于適應(yīng)范圍最廣。不管是遠距離的大視場,還是局部的人周環(huán)境,都可以適用,沒有太大局限性,組合方式也靈活。七維全光函數(shù)中,任何一個維度都可以做增強,根據(jù)場景變化和模型需要,給出更全面準確的信息。光場也可以看作一個大的框架,一個時空四維維度下全部信息匯集的框架。其他傳感器,如結(jié)構(gòu)光、激光雷達、事件相機,采集的信號都可以在光場空間里找到自己的位置。它們是局部,光場是全局。
但靈活性也是雙刃劍。理論上,一定要明確特別場景和特定模型更需要哪一類的數(shù)據(jù),才能給出性價比最高的光場相機、采集到最合適的光場數(shù)據(jù)。模型越具體、要求越明確,才有更好的方案。光場與各種技術(shù)路線之間不是替代關(guān)系,而是整體與局部的關(guān)系,先建立一個相對泛化的光場框架,再用其他方式做局部增強,這也是可行的路徑。公司目前還是以視覺為主,沒有做多模態(tài)的結(jié)合。“全局+局部”的融合架構(gòu),可能是比單芯片集成多傳感器更務(wù)實的演進路徑。
二
產(chǎn)業(yè)拐點:從概念到
賽道的理性審視
Q:這兩年具身智能和物理世界大模型的呼聲非常強。您覺得空間智能賽道的拐點是否已至?面對當前的熱潮,您如何判斷行業(yè)的真實節(jié)奏?
溫建偉:從我個人觀點來說,知識類模型是相對成熟和閉環(huán)的,比如編程、設(shè)計等。但具身智能這一塊,反而沒有那么樂觀。從大趨勢上說,它必然要經(jīng)歷多個波峰波谷才能向前發(fā)展。這一輪熱點可能未必帶來革命性的突破,反而可能由于大量資源投入,會把短期內(nèi)的瓶頸暴露得更明顯,讓大家的熱情下降,然后進入技術(shù)積累和沉淀的階段。
在算法尤其是理論方面,需要有新的突破之后才可能迎來新的契機。完全靠堆算力和利用現(xiàn)有的大模型來推動具身智能發(fā)展,仍有困難。現(xiàn)在大模型建立起來的,更多還是一種因果概率的關(guān)系,還沒有收斂到物理概念的層面。理論上需要厘清的,是數(shù)據(jù),尤其是視覺數(shù)據(jù)和光場數(shù)據(jù)與模型之間的深層關(guān)聯(lián)。只有這方面的理論取得實質(zhì)性突破,才有可能走到下一個階段。
當大模型收斂到全物理概念層面的時候,就是光場相機最好的產(chǎn)業(yè)發(fā)展時機。在此之前,需求雖然迫切,大家都知道模型跑不通、魯棒性不強、泛化能力不夠,都在提數(shù)據(jù)缺失尤其是第一人稱視角的數(shù)據(jù)缺失,但第一人稱視角到底需要哪些數(shù)據(jù),還沒有統(tǒng)一定論。所以光場感知的規(guī)模化落地,需要場景、模型和硬件三者協(xié)同演進,而非某一單點突破。這注定是一個長周期過程,短期不宜高估,長期不應(yīng)低估
Q:在核心器件仍依賴進口的背景下,您如何看待中國在光場感知方向與國際先進水平的差距?國產(chǎn)光場方案的突圍路徑在哪里?
溫建偉:光場相機尤其是微透鏡陣列光場相機,第一波熱潮其實已經(jīng)過去了。國外好多To C商業(yè)產(chǎn)品都不做了,只做IP核授權(quán),不做硬件設(shè)計。因為本身有一些限制。用鏡頭陣列來做光場相機成本相對較高,面向的都是To B用戶,而且To B用戶還有隱私保護方面的要求。所以在國外,大型光場相機基本上只在軍事用途能見到。
相比之下,國內(nèi)在這方面的限制少一些,多場景應(yīng)用也更豐富。公司切入場景除了安全和防御,還拓展至娛樂直播領(lǐng)域,與國家級主流媒體合作,開展大場景的內(nèi)容制作與采集生成。理論上,在具身智能的數(shù)據(jù)采集領(lǐng)域,光場技術(shù)可以發(fā)揮重要的作用。需要指出的是,國內(nèi)To C市場受限于成本因素尚未迎來爆發(fā)拐點,目前商業(yè)閉環(huán)還是以To B為主,在規(guī)則化的應(yīng)用場景中推進。結(jié)構(gòu)化環(huán)境比如工廠環(huán)境,更便于部署和采集。但我反而認為,未來具身智能的泛化,是要在非結(jié)構(gòu)化環(huán)境中實現(xiàn)的。在流水線模式下,對模型收斂有極大幫助,但是不是具身智能的最優(yōu)解仍存疑問。流水線上機械手或自動化工具就能解決大部分問題,這是行業(yè)需要反思的問題。從感知技術(shù)本身來看,非結(jié)構(gòu)化的開放動態(tài)場景中,現(xiàn)有方案的泛化性仍面臨較大挑戰(zhàn),這也正是光場感知在技術(shù)層面最具想象空間的應(yīng)用方向之一。
三
數(shù)據(jù)資產(chǎn):光場數(shù)據(jù)
的“基準真值”價值
Q:高質(zhì)量空間標注數(shù)據(jù)極其稀缺,是制約物理空間智能規(guī)模化訓練的硬性瓶頸。光場感知采集的高維全光數(shù)據(jù)具有極高的信息保真度。您認為光場數(shù)據(jù)能否成為世界大模型訓練的“基準真值”來源?拙河科技在光場數(shù)據(jù)資產(chǎn)化方面有哪些探索?
溫建偉:我們首先以數(shù)據(jù)采集設(shè)備作為切入點,然后提供一些輔助工具,便于對數(shù)據(jù)進行結(jié)構(gòu)化處理與標定。但數(shù)據(jù)的下一步利用,要看雙方的合作。我們沒有自建數(shù)據(jù)集的想法,而是傾向于與生態(tài)伙伴合作,共同完成數(shù)據(jù)的采集和數(shù)據(jù)集的建立。
一個重要判斷是:并不追求數(shù)據(jù)量的大小,因為模型還不夠收斂。這些數(shù)據(jù)很可能在模型變化的時候,幾十萬小時的數(shù)據(jù)突然就變得可能只有幾個小時的有效數(shù)據(jù)。由于模型未來發(fā)展方向不夠收斂,數(shù)據(jù)的價值并沒有想象的那么大。而不同類型數(shù)據(jù)的嘗試,可能會給模型演進提供更多啟發(fā)。所以光場數(shù)據(jù)能否成為“基準真值”,取決于模型端能否有效利用這些高維數(shù)據(jù)。現(xiàn)在的大模型還是因果概率關(guān)系,沒有收斂到物理概念層面。當理論突破讓模型能夠理解物理概念時,光場數(shù)據(jù)的全息特性,如深度信息、視角信息、光譜信息、時間維度等,才能真正發(fā)揮價值。在此之前,我們的戰(zhàn)略重心是把數(shù)據(jù)采集設(shè)備和基礎(chǔ)算法做好,等待模型端的理論突破。
Q:光場感知采集的高維數(shù)據(jù),如何與空間大模型形成有效閉環(huán)?您觀察到哪些數(shù)據(jù)與模型協(xié)同的前沿趨勢?
溫建偉:高維數(shù)據(jù)的維度更豐富、靈活性更大。光場相機要取代雙目、取代激光雷達其實都可以,只是代價會不同。同時,也需要有相應(yīng)的算法來做動作捕捉、3D建模和目標提取,包括近場和遠場的群體三維建模,理論上沿著這條技術(shù)路線都可以實現(xiàn)。
一件重要的事是光場空間的構(gòu)建。若能把給定空間下的光信號記錄和保留,剩下問題就是如何呈現(xiàn)。我們采用“隱式3D可渲染”技術(shù)——即在虛擬空間中記錄光場信息,當視角移動至某一位置時,系統(tǒng)實時渲染出對應(yīng)視角的二維圖像。比如馬拉松場景,沿著一條道路記錄光場數(shù)據(jù),重建數(shù)字孿生道路,隨著視角不斷向前延伸、推進,渲染畫面不斷重建呈現(xiàn)。關(guān)注視角集中在哪里,就把那里的二維圖像渲染出來。我們與清華、北航、華科等多所高校都在開展產(chǎn)學研合作,結(jié)合數(shù)據(jù)采集設(shè)備,為模型訓練提供數(shù)據(jù)支撐。但高維數(shù)據(jù)與模型的有效閉環(huán),還需要看光場數(shù)據(jù)和模型之間的連接在理論上能否取得突破。
四
創(chuàng)業(yè)方法論:從實驗室
到產(chǎn)業(yè)化的“驚險一躍”
Q:您過去的復合型履歷給您帶來了哪些底層能力?從研究到創(chuàng)業(yè),最難跨越的是哪一個層面?
溫建偉:在不同的崗位上,見到的、學習的東西不太一樣。早年從事產(chǎn)業(yè)研究與宏觀規(guī)劃的經(jīng)歷,帶給我的是宏觀視野——從全局角度思考如何引領(lǐng)一個產(chǎn)業(yè)發(fā)展。但當時欠缺的是,這些規(guī)劃如何一步步落地變?yōu)楝F(xiàn)實。在國央企做產(chǎn)品規(guī)劃和技術(shù)研發(fā)的過程中,學到了如何將需求轉(zhuǎn)化為供給,但同時卻發(fā)現(xiàn)欠缺對整個行業(yè)發(fā)展趨勢的把握。
創(chuàng)業(yè)的過程既需要抬頭看路,又需要低頭做事,考慮問題要全面而周到;既要了解國家大的政策方針指引,同時還要在產(chǎn)業(yè)鏈上找準生態(tài)位,完成價值傳遞。過往的經(jīng)歷,對我?guī)椭艽蟆W罱K,將研發(fā)出的產(chǎn)品,交到客戶手上,變成解決客戶問題的利器,實現(xiàn)商品價值,是艱難的一次跨越;持續(xù)地跟隨市場變化,持續(xù)地滿足客戶需求,是更大的挑戰(zhàn)。
最難跨越的不是思維轉(zhuǎn)變,而是切身的體感。你真正站在那個位置上,面對那些具體問題時,才知道什么叫“如人飲水,冷暖自知”。
Q:拙河科技源自知名高校科研團隊的技術(shù)積累。從實驗室技術(shù)到商業(yè)化產(chǎn)品,中間必然經(jīng)歷關(guān)鍵的“驚險一躍”。請您回顧這一過程中最具決定性的轉(zhuǎn)折時刻。產(chǎn)學研協(xié)同方面,公司如何平衡學術(shù)前沿探索與產(chǎn)品工程化交付?
溫建偉:實驗室技術(shù)變成產(chǎn)品、再變成可商用商品,大概經(jīng)歷兩個階段。第一個階段是技術(shù)到產(chǎn)品。我們是典型的技術(shù)驅(qū)動型創(chuàng)業(yè),不是市場上有需求才去做,而是市場一直有更高要求(人總想看得更遠、更全面、更清晰),只是此前的技術(shù)達不到。技術(shù)變成產(chǎn)品很依賴產(chǎn)業(yè)鏈支持,理論上能實現(xiàn)的性能指標,不一定能用現(xiàn)有工業(yè)品實現(xiàn)。
轉(zhuǎn)折時刻其實沒有特別驚心動魄的,更多是一個坑一個坑填出來的。每一個環(huán)節(jié)都有這樣的工程問題需要解決,它可能不是科學問題,僅僅是工程問題,而工程問題反而需要經(jīng)驗的積累。做研究和做產(chǎn)品的根本區(qū)別在于,研究強調(diào)長板,創(chuàng)新點的高度決定論文的層次;而產(chǎn)品遵循木桶效應(yīng),短板決定成熟度,短板不夠整個產(chǎn)品就不可用。
產(chǎn)學研協(xié)同方面,實驗室承擔的更多是前沿方向的探索,在比較確定地收斂之前,不會把工程化工作放到公司里來,起到的是對未知領(lǐng)域和未知問題的攻關(guān)作用。公司則提供平臺,讓老師們嘗試新方法、驗證新思路,快速把想法落地成實驗環(huán)境和工程驗證的閉環(huán),推動他們堅定信念、朝著正確方向前進。這是一個互相促進、互相提供平臺的雙向循環(huán)。并且,學校探索未知,公司驗證落地,市場反饋再反哺研究。
Q:對于正在融資、擴展落地的硬科技創(chuàng)業(yè)者,以及投身硬科技賽道的在校同學,您有什么務(wù)實建議?展望未來十年,您希望拙河科技在其中扮演怎樣的角色?
溫建偉:對在校同學和青年創(chuàng)業(yè)者,我最想說的是:實驗室技術(shù)變成可商用商品,中間沒有捷徑。每一個工程問題都需要經(jīng)驗積累。它可能不是科學問題,但恰恰是這些工程問題決定了產(chǎn)品的價值與生命周期。保持科技報國的信念,把技術(shù)的工程可靠性做到極致,把企業(yè)的價值交付做到閉環(huán),才能堅持下來。展望未來十年,具身智能將從實驗室樣機走向規(guī)模化落地,光場感知會成為具身智能的原生底層視覺基礎(chǔ)設(shè)施,希望拙河科技在這個過程中成為光場感知技術(shù)的探路人和建設(shè)者,為行業(yè)的快速發(fā)展貢獻力量。
Review of Past Articles -
01
02
03
關(guān)于《清華金融評論》·《科創(chuàng)AI+》
《清華金融評論》堅守“建言金融政策,引領(lǐng)金融實踐”的辦刊初心與使命,《科創(chuàng)AI+》欄目聚焦新一輪科技革命與產(chǎn)業(yè)變革的時代浪潮。針對當前AI賦能科技創(chuàng)新、產(chǎn)融深度融合、前沿技術(shù)落地等熱點話題進行深度剖析、案例分享與訪談解讀。解碼科創(chuàng)企業(yè)成長邏輯,洞察AI技術(shù)應(yīng)用邊界,探索“科技- 產(chǎn)業(yè)-金融”協(xié)同發(fā)展新路徑。
來源 | 本人訪談
編輯 | 蘭銀帆
審核丨秦婷
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.