![]()
【摘要】家庭機器人離真正進家門,差的可能不是一只更靈巧的手,或是一套精密的小腦系統,而是一套能理解生活的記憶系統。
不久前,貝塔無限提出BetaMem 全時空多模態記憶架構,試圖解決消費級具身智能最難的一環:機器人不能每次都從零開始聽命令,而要記住物品、空間、人物、情景和經驗,把互動沉淀成下一次服務的能力。
這意味著,機器人競爭的重點正在從轉向“能不能減少反復解釋的成本”。對于消費級機器人而言,真正的智能不只是聽見一句話,而是理解背后沒說出口的那句話。
以下為正文:
在過去兩年的演示里,行業習慣了一個畫面:機器人能看見桌上的杯子,聽懂人的指令,伸手、抓取、遞回,動作未必絲滑,但足夠讓人相信家庭機器人是個快來的概念。
但問題在于,真實生活里,人很少下達完美指令。
我們說“幫我找一下鑰匙”,其實省略了昨晚誰回家、鑰匙平常放哪、今天誰動過物品等各種記憶,這些記憶,是一條鏈接了物、人、空間、時間和習慣的任務鏈。機器人能否走向智能,這類記憶是一條重要門檻。
在上面問題的大背景下,具身智能初創公司貝塔無限不久前提出了一個新解法:BetaMem 全時空多模態記憶架構。
通俗來講,是把問題從機器人的單次任務,推進到“改良下一次服務”。在貝塔無限創始人兼CEO劉武龍博士看來,家庭機器人的第一性原理,不是像人,而是減少人反復解釋生活的成本。
一個機器人如果每次都從零開始,就永遠只是工具,只有當它開始記得,才有可能真正走進家門。
01
家里的指令,都是“暗號”
2023 年,Alphabet 砍掉了一個曾經被寄予厚望的機器人項目:Everyday Robots。
在此之前,這支團隊已經在Google辦公區里訓練過上百臺帶機械臂的輪式機器人。它們會擦桌子、分揀垃圾、開門,也會在辦公室里完成一些看起來頗具日常感的任務。
后來,團隊還把大語言模型接入機器人系統,讓機器人不只是聽懂“去拿薯片”,甚至能從“我餓了”這樣的自然表達里,推斷出“也許應該去找點吃的”。
這聽起來已經很接近人們想象中的服務機器人了。
但問題是,為什么連 Alphabet 這樣的公司,擁有資金、數據、模型和工程團隊,最后也沒能把機器人推進到真正的大規模日常部署?
答案在于,“日常”本身被低估了。辦公室仍然是一個相對規整的空間,邊界相對清楚,人的行為也更容易被流程化。即便如此,機器人要穩定運行也并不容易。進入家庭,變量會陡然增多:物品擺放沒有標準,人的習慣難以窮盡,很多規則只存在于長期共同生活形成的默契里。
這意味著,家庭里的指令,本質上不是命令,而是暗號。
用戶不會像給模型寫prompt一樣生活,不會每次都把目標、偏好、負向引導、歷史錯誤講清楚。一遍遍地補充、糾錯、重來,看似智能,實際十分消耗。
從這個角度看,BetaMem給出了一個新可能。
它把記憶拆成實體、空間、情景、語義、經驗、程序六類,真正要解決的問題是把家庭生活里那些模糊、分散、反復出現的經驗,轉化成機器人下一次可以調用的資源。
實體記憶讓機器人知道這是什么,空間記憶讓它知道通常在哪,情景記憶讓它記住“誰在什么時候做過什么”,經驗記憶讓它從上一次成功或失敗里修正判斷,程序記憶則把一套家庭流程沉淀成可復用的動作鏈。
它們合在一起,才有可能讓機器人從聽見一句話進化到理解一句話。
因此,家庭機器人真正難的,是判斷用戶為什么這么說、哪些話不用說、哪些事不能擅自做。誰能接住這些省略,誰才真正摸到了消費級具身智能的入口。
![]()
02
記憶不是垃圾桶
如果說家庭里的“暗號”很重要,那么下一步問題就在于:機器人到底應該怎么記憶?
公司大可以讓產品把攝像頭、麥克風、動作軌跡全都存下來。這樣看似最完整,實際上卻不一定效果好。一個家庭機器人如果 24 小時記錄所有畫面,它得到的不是記憶,而是一座越來越難檢索的倉庫,除了數據隱私問題,思考也會被計算成本和噪聲淹沒。
因此,真正的記憶不是記錄發生過什么,而是把發生過的事加工成未來能用的判斷。
同樣是收拾桌子的指令,第一次,機器人可能只是把所有東西清空;第二次,它應該知道某些東西不能亂動;再往后,它應該形成一套基于擺放習慣的家庭規則。
所以,真正的機器人記憶至少要完成三次加工。
第一次,是從原始感知里篩掉噪聲,不是所有對話都需要進入長期記憶。第二次,是把分散事件變成結構化關系:物品和位置的關系,人和習慣的關系,任務和結果的關系。第三次,是把這些關系重新變成行動策略,讓機器人下一次能少問一句、少犯一次錯、少讓人解釋一遍。
這就是BetaMem的價值。它提出實時、小時、天、周、月、年的多尺度終身記憶,提出在不同時間尺度上的信息,應該服務不同層級的決策。抓杯子需要的是即時視覺反饋;找鑰匙需要的是短期情景回溯;照顧一個家庭成員的日常習慣,則需要跨天、跨周的經驗歸納。
公司提到的“直覺留存-反思重構”快慢雙通路,類似于給機器人補上一個時間維度上的雙系統:快系統負責保留眼前任務的關鍵線索,慢系統負責在長期互動中重構穩定經驗。
所以,BetaMem要解決的,不是記住更多,而是能不能知道什么該記、怎么記、什么時候用、什么時候忘。
03
為什么是現在?
此前,劉武龍博士有個有意思的判斷,具身智能規模化落地前面有“四座大山”:硬件可靠性、高質量數據、模型范式、真實數據飛輪。
這四座山,正好解釋了為什么很多機器人 demo 看起來很近,產品化卻很遠。
硬件不穩定,機器人無法長期在場;數據不足,模型就缺少真實世界的基礎;模型范式不清,長程任務就容易中斷;數據飛輪跑不起來,產品就無法在真實使用中自我進化。
具身智能的落地,并不是一個“模型”問題,而是一個“系統”問題。
數據側,公司提出 BetaData 三階段數據引擎,先更高效地采集真實操作數據,再把人類行為遷移成機器人可學習的數據,最后讓真機在真實任務中繼續試錯和優化。
模型側,BetaBrain 統一大腦,BetaMem 負責長程記憶,BWAM 則補上對物理世界的理解。公開介紹中,BetaMem 在 15 分鐘典型長程任務中的成功率較行業主流模型提升 20%。
這也是為什么是現在的答案。
過去,機器人行業常常把硬件、數據、模型、應用拆開看。做本體的做本體,做模型的做模型,做場景的做場景。但消費級具身智能很難靠單點突破跑通,一個能夠閉環的系統十分重要。
硬件讓機器人長期在場,BetaData 提供現實經驗,BetaBrain 組織模型能力,BetaMem 沉淀長程記憶,BWAM 校正物理行動,最后由真實數據飛輪推動系統持續進化。
如此,才是一個更加完整的消費級具身智能。
這個邏輯早在智能汽車產業中已經被驗證過,無論全棧還是聯合,汽車的智能化程度取決于全棧供應商的技術理解程度,或是深度綁定供應商的合作默契,只有更加全面地理解智能,才有可能盡快產生更正確的智能。
BetaMem 的意義,則是讓這個閉環持續成立。有效記憶,是消費級具身智能的數據飛輪。
04
尾聲
過去幾年,具身智能最熱鬧的敘事是硬件,手指、關節、成本曲線都在進步。但家庭機器人仍然卡在一個尷尬的位置:很難進入日常生活。
BetaMem 把記憶、獎勵和持續演化放在同一個架構里,本質上是在重新定義家庭機器人的產品重心。
VLA 解決“如何把語言和視覺變成動作”,BetaMem 試圖解決“如何把時間和互動變成能力”。前者讓機器人完成任務,后者讓機器人積累生活。
這條路當然還需要真實家庭、長周期任務和可量化指標來檢驗。但它至少給出了一個更接近消費級落地的問題意識。
機器人行業所謂的 iPhone 時刻,未必只來自某臺驚艷的硬件。家庭機器人賣的不再是一臺機器,而是一套不斷生長的個人具身智能系統。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.