數字世界會反過來長進物理世界,虛實之間再沒有邊界。
—— 凱文·凱利
本文看點
01
現場五個真實演示
02
為什么它是個大腦
03
一個腦子多種身體
大家好啊,我是甲木,這周一直頻繁出差,去完上海 AGI Builder,又去杭州,接著返京 Force 原動力和 ISC 大會,現在終于到家能安靜的寫點東西了……
來聊聊前段時間去『清華』參加發布會的見聞。
![]()
— 跟朋友們在現場看具身智能的發布
發布方是一念 Unisonmind(清華團隊),發布的產品叫UnisonMind。
一句話解讀:
「這是一個端側部署、實時運行的原生多模態模型。支持流式輸入與持續狀態更新,是一套可以進入不同本體的認知大腦。」
![]()
行業首發。
它可以同時進入三種以上完全不同形態的機器:機器狗、人形機器人、電動輪椅。
![]()
一個大腦,幾種不同的本體。現場不是每臺設備各自跑一套系統,它們共享的是同一個上層認知內核。
這已經不是我第一次去看一念團隊做的東西了。
更早之前,一念團隊的好朋友英健就跟我聊過這個方向:如果機器人想從「會執行程序」走向「能理解世界」,核心問題可能不在腿、不在輪子、不在機械臂。
而在背后有沒有一個足夠統一、足夠實時、足夠靠近物理世界的大腦。
這兩年,通過春晚也能發現具身智能確實很熱。
機器狗、人形機器人、機械臂、電動輪椅、服務機器人,各種視頻每天都能刷到。
但說實話,我看多了之后,而且也在行業里,都知道演示得很熱鬧,背后其實基本是三類東西:
第一類,是遙控或者遙操。第二類,是提前寫好的腳本。第三類,是多個模型拼在一起,視覺管視覺,語音管語音,動作管動作,中間靠規則和接口硬串。
這幾種方案不是沒價值。工程上能跑起來,已經不容易。
但它們離真正進入真實世界,還有很長一段路。
真實世界不是舞臺。
人會突然走動,光線會變,聲音會重疊,任務會被打斷,硬件也會出故障。
你讓機器狗在舞臺上整齊跳舞,和讓它在一個真實小院里聽懂人話、找人、數球、去咖啡店,完全不是一回事。
前者更像表演。后者才開始接近「理解世界」。
具身智能最難的地方,其實在于持續理解正在發生的世界。
這次,一念團隊搞出來了。
而且順便帶著聰哥、袋鼠、蒼何、小李、塔塔等好朋友去小院拜訪了好幾次,他們大受震撼 哈哈哈
01
ON SITE
直擊現場情況
我建議大家先別急著聽技術詞。
先看幾個現場片段。
1. 機器狗數乒乓球
第一個是數乒乓球。
工作人員在機器狗面前顛球,球連續起落,節奏并不固定。機器狗要一邊看,一邊數,最后報出次數。
乒乓球
這個任務對人來說不算離譜。但對模型來說,很要命。
因為球不會停下來等它想明白。顛球的間隔、速度、軌跡都不穩定,一次有效觸球可能只發生在很短的瞬間。
如果只是抽幀去解決,再交給模型判斷,大概率會漏。
所以數乒乓球這個任務,重點是它在連續時間里保持了一個正在更新的狀態。
2. 連續數字倒序播報
第二個是連續數字倒序播報。
現場連續給它一串數字,它要聽進去,記住順序,最后再倒著說出來。
滾滾數數
這也不是簡單復讀,它得在連續輸入里保持短期狀態。
然后根據新的任務要求,把剛才的信息重新組織成輸出。
這其實就是物理世界里很常見的能力。人不會一次只接收一條整齊的輸入。現實里,信息總是一邊發生,一邊進入。
3. 在人群里找白襯衫
第三個是找人。現場讓機器狗去找穿白襯衫的人。
它在一群人里找目標,沒有提前錄入人臉,也不是固定點位識別。
更有意思的是,現場有個人外面披著衣服,但里面也是白襯衫。機器狗注意到了這個細節,還主動補充了出來。
滾滾找人
這個細節比「找到了」更值得說。
因為它說明系統并沒有做標簽匹配,而是在現場環境里做了語義判斷。
4. 機器人導覽兩幅畫
還有一個機器人導覽畫作的場景。它要在現場,面對作品、觀眾和自己的位置,完成講解。
楊戩導覽兩幅畫
很多模型都會說話。但 UnisonMind 證明的是,視覺理解、語言表達、身體位置和現場關系,可以進入同一個任務過程。
5. 輪椅找店
我個人更關注的是輪椅。
一臺搭載 UnisonMind 的電動輪椅,接收人的指令,識別標牌,判斷空間關系,再帶著人往目標位置移動。
輪椅找東西
機器狗和機器人,很多時候大家會下意識覺得是科技玩具。
但輪椅不一樣。輪椅這個場景,背后是很具體的人。
一個行動不便的人,能不能少依賴別人一點?能不能用一句自然語言,讓設備理解自己的意圖?
技術如果最后只停在炫技上,其實沒什么意思。但如果它能讓一個人的日常生活更有自主性,那就很值得認真看。
尤其是康養類的場景,或許我們以后都會遇到 emmm
![]()
比如點咖啡,不在話下。
還有一個非常搞笑的場景,嘯天的賤賤人格,看著機器人蹲在那,直接問:「你是來拉屎的嗎」 - -
機器人加上拉屎的.mp4
02
THE BRAIN
為什么說這是一個「大腦」
講到這里,就可以回到 UnisonMind 最核心的差異。
流式輸入,和持續狀態更新。
真實世界沒有暫停鍵。人會移動,球會起落,聲音會重疊,新指令會隨時插進來。
一個真正進入物理世界的模型,不能只在輸入結束后回答。它必須一邊看、一邊聽、一邊更新判斷。
![]()
現在很多 VLM 都是抽幀,會有很大局限。用一個簡單類比:
普通聊天機器人,像收到消息才上線。UnisonMind 想做的,是像一個始終在場的人。它知道剛才發生了什么,也知道現在正在發生什么。
![]()
當然,只有流式還不夠。如果視覺是一個模型,語音是一個模型,動作又交給另一個系統,中間靠規則臨時拼接,它依然很難形成穩定的世界理解。
一念給 Physical AGI 提了一個「3+1」框架。
![]()
我用人話翻譯一下。
01一個腦子實現多模態
視頻、圖像、語音、文字,以及設備自身狀態,都進入同一個世界表征。視覺、語音、動作,不能各做各的。
02理解和生成統一
它不只要看懂,還要根據任務說話、移動、交互。理解和輸出,最好屬于同一個認知過程。
03流式輸入、理解和生成
它不能做完一次問答就下線,而要持續運行。任務可以被打斷,可以被修正,也可以被重組。
+1完整端側運行
核心大腦在設備本體上,端側模型意味著參數量不大。
UnisonMind 是一個只有11B 參數量的模型,機器人背上的顯卡(agx)就是他們的驅動引擎。(可以看出來,樸實無華,就這么焊在背上了……)
![]()
能把一個 10B 上下的模型,壓進端側,還要同時跑視覺、語音、認知、生成、保證實時,這件事的難度,懂的人自然懂。
當然,也不是沒有代價。
現場是能感覺到「等待」的。部分任務從接令、理解到行動,反應不算快。流式疊加端側算力的限制,這是真實的短板,我不藏著。
他們有一句官方表達:
One codebook. One evolving world.
一個統一符號空間,一個持續演化的世界。這句話有點技術,但意思其實不復雜。
它的目標,是讓設備擁有一個統一的「世界狀態」。它知道自己看到了什么,聽到了什么,自己處在什么位置,剛剛發生了什么,下一步可能發生什么。然后再決定輸出語言,還是輸出動作。
話說回具身智能本身。真正困難的地方,恰恰在這里。
它更像系統工程,模型、硬件、控制、傳感器、延遲、現場噪聲、安全邊界,全部攪在一起。
你只懂模型,不夠。你只懂機器人,也不夠。你必須愿意把手伸進真實世界里,去碰那些麻煩、臟活、邊界情況。
這也是我對英健他們團隊印象很深的地方。
03
REAL WORLD
不完美,反而是物理世界的真實考題
這次現場還有一個點,我覺得應該寫出來。
它并不是一個只保留成功鏡頭的精剪 Demo。
現場有 20 多位來賓,全程錄像。人群在走,指令是臨時給的,現場有聲音干擾,硬件狀態也會變化。
其中輪椅演示里,確實出現過一次異常轉圈。
這個事情不能被包裝成成功。故障就是故障。
但它也提醒我們一件事:Physical AI 面對的不是干凈的數據集。它面對的是一個會隨時出意外的世界。
真實世界里,本來就有噪聲、遮擋、誤解、網絡問題、硬件問題。
所以判斷一套具身智能系統,不能只看它成功完成了幾次任務。還要看意外發生后,它能不能感知、回應、調整,并盡量保持安全。
這也是為什么我更愿意看真實現場,而不是看一條剪得很漂亮的視頻。漂亮視頻當然有傳播力,但真實現場更能暴露技術水平。
04
ONE BRAIN
一個腦子,多種身體
最后說說我真正關心的想象空間。
UnisonMind 最有意思的地方,不在于機器狗會不會點咖啡。而在于它讓「大腦」和「身體」開始解耦。
機器狗是一種身體。人形機器人是一種身體。輪椅也是一種身體。未來掃地機器人、配送機器人、陪伴設備、工業設備,都可能是新的身體。
如果底層執行參數和 API 接口適配好,上層認知就有機會復用。
「這件事一旦成立,商業路徑會完全不一樣。」
以前是一種硬件做一套系統。機器狗有機器狗的系統,輪椅有輪椅的系統,機器人有機器人的系統。每一種都要重新做一遍。
但如果同一個認知底座可以適配多種設備,具身智能就有機會從「項目制」走向「平臺化」。
這才是我覺得它有想象空間的地方。它更像一個物理世界里的 AI Runtime,而非一個單點產品。
當然,這條路還很長。跨本體遷移到底能做到多深,底層控制如何標準化,端側算力怎么繼續提升,安全邊界怎么定義,都還需要大量驗證。
但方向上,我認為是對的。(當然,評論區如果有高人歡迎隨時補充~)
AI 如果要真正進入物理世界,最后一定不能只靠云端大模型遠程發號施令。它必須長在設備里,持續在線,和真實世界共享同一條時間線。
ENDING
我不會說一念已經實現了 Physical AGI。這句話太大,也太早。完整的 Physical AGI,需要更多設備、更多環境、更長時間尺度的驗證。
但我愿意說,不管是這次在清華小院里還是現場發布會,我第一次比較具體地看見了一條路線:
「AI 不再只是屏幕里的回答者。它開始變成常駐在設備里的大腦。」
它要看見世界,聽見世界,記住剛才發生了什么,也理解現在正在發生什么。
以前我們討論具身智能,經常盯著腿、手、輪子和機械結構。但這次,我更關注的是那個「腦子」。
因為身體可以有很多種。真正決定它能不能走進世界的,是它有沒有能力持續理解世界。
具身智能的下半場,拼的是誰能更穩定地和真實世界待在一起。
KK 在《五千天后的世界》里說,再過五千天,數字世界會反過來長進物理世界,虛實之間,再沒有邊界。
數字世界那個腦子,已經有了。
物理世界這個腦子,剛剛開機。
而這五千天的第一天,可能就是從一個腦子、接上一個身體,開始的。
以上。
![]()
我是甲木,熱衷于分享一些 AI 干貨內容,同時也會分享 AI 在各行業的落地應用。
如果你覺得今天這篇有收獲,歡迎點贊、在看、轉發三連,我們下期再見
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.