2026世界人工智能大會WAIC期間,騰訊Robotics X實驗室、福田實驗室聯合騰訊混元發布具身智能系列新模型和智能體新成果,首次系統性地打通“感知—身體—行動”的閉環,推動具身智能從“離身智能”邁向“具身原生智能”、從實驗室邁向真實生產力應用。
本次發布的具身基座模型包括Hy-Embodied-VLM-1.0、Hy-Embodied-RxBrain-1.0 和 Hy-Embodied-VLA-0.5,這三個模型都基于混元大模型打造,其中VLM 模型像“右腦”,負責理解圖像、空間和場景;RxBrain 模型像具身“大腦”,統一認知、規劃和對未來狀態的想象;VLA 模型連接“小腦”和身體,把高層目標轉化成連續的、可糾錯的動作。
同時發布具身智能體Apexio和智能體框架TairosAgent,它們通過智能體的調度能力,可以把前面的“左右腦”、“大腦”、“小腦”和身體整合成完整的系統,讓機器人形成一個持續感知、持續決策、持續行動的整體。
![]()
在 2026 WAIC 騰訊AI 應用創新論壇上,騰訊首席科學家、騰訊Robotics X實驗室、福田實驗室主任張正友指出,今天最聰明的人工智能本質上仍是“缸中之腦”——它善于邏輯推理、文本生成和知識問答,卻缺乏與物理世界直接互動的閉環:未必真正理解物體的位置、空間關系與可操作性,也難以在持續變化的環境中邊行動、邊接收反饋、邊及時調整。
“語言并不等于全部認知,它只是智能向外表達的一個通道。”張正友表示,真正的智能需要讓語言、視覺、空間認知、身體控制和環境反饋連通起來,在“感知—身體—行動”的閉環里接受驗證。此次發布的五項新成果,正體現了騰訊沿著“從離身走向具身、從分裂的模塊走向整體的閉環”探索具身原生智能的基本思路。
三大具身基座模型:看懂世界、會推理且會想象、會行動
雖然大模型已經擁有了強大的語言和圖像理解與生成能力,但是讓人工智能更好的理解物理世界一直是一個難題。過去一段時間,騰訊Robotics X 實驗室一直在探索具身智能基座模型,并將成果開源,與行業共同成長。
本次發布并開源的模型有三個,首先是新一代具身 VLM(視覺語言)基座模型Hy-Embodied-VLM-1.0,它重點解決了三個層層遞進的問題:“看物知用”(理解深度、方位、功能部件與可操作點)、“看景知變”(判斷下一步動作及其帶來的變化)、“看遠知返”(長時程任務中記憶歷史、跟蹤進度、失敗后可分析原因并重新規劃)。在覆蓋 37 個任務的評測中,三類能力均顯著優于同等規模模型;更關鍵的是,它僅以 A3B 規模、約十分之一的計算量,就接近了上一代 A32B 旗艦模型的效果,更輕量、更適合機器人端直接部署。
其次是具身原生的世界認知模型Hy-Embodied-RxBrain-1.0,它把“會推理”與“會想象”統一起來:面對一個任務,一邊用語言給出步驟與約束,一邊生成每一步完成后應達到的目標圖像,讓下游動作模型不僅“聽到做什么”,更能“看到做成什么樣”。在這個方向上,騰訊還聯合行業伙伴建立了 RxBrain-Bench 評測基準,RxBrain 顯著領先其他代表性系統,在短時未來狀態預測上也達到專用具身世界模型的水平。
最后是視覺-語言-動作(VLA)模型Hy-Embodied-VLA-0.5,其核心競爭力不是訓練一個更大的模型,而是構建“數據—模型—訓練—部署”協同發力的完整學習棧,通過亞毫米級高精度 UMI 采集系統積累超一萬小時人類示教數據。在第三方 RoboDojo 評測(泛化、記憶、精細操作、長程執行、開放語義理解五類能力)中Hy-Embodied-VLA-0.5 拿下仿真綜合排名第一,并在最考驗連續執行能力的長程任務與記憶任務兩個維度同樣排名第一。
值得注意的是,上述模型已經開始進入真實工業場景,并在導購導覽、養老服務等多個任務中完成落地驗證。借助軟硬一體的快速適配能力,同一套模型可支撐多形態機器人規模化應用。同時也聯動了騰訊內部騰訊云HAI、多網聚合加速、TRRO,以及騰訊音樂(TME)海量曲庫與IoT生態連接能力,以沉浸式聽覺體驗助力多元場景落地。
![]()
例如,HyVLA-0.5已經進入了一家日化品工廠,開展生產實測,面對高混合、小批量、SKU 頻繁迭代的產線,其作業成功率高于 95%、節拍快于 6 秒/件,新增 SKU 留給數據采集與模型后訓練的時間不到 3 天。
兩大具身智能體:時刻在線、即時反應
在智能體領域的持續探索,目的在于解決機器人與現實世界交互過程中的不自然、不流暢、不可靠的問題,讓其可以真正走入現實應用。
在廣受關注的具身智能體方向上,騰訊發布了持續在線具身智能體Apexio,它由三層以不同頻率同時在線的能力構成:最上層認知系統按需喚醒、可做深度思考;中間層感知行動系統以約 15Hz 持續接收多模態信息并快速調整;最下層執行系統以更高頻率運行,像條件反射一樣瞬間處理碰撞與失衡。系統同時由“目標驅動”,例如完成任務與“生存驅動”,主要包括維護安全、控制能耗、管理運行狀態兩條主線牽引,即便沒有外部指令,也持續感知、持續自保、為下一次行動做好準備。
其次是具身原生智能體框架TairosAgent。與從通用框架改造而來的方案不同,TairosAgent 從設計第一天起就為機器人本體而生,其感知反應、認知決策、探索沉淀三層系統全部圍繞具身任務做原生設計,并持續維護環境記憶、本體記憶與任務記憶三類記憶。通過統一的硬件適配層與標準化 Skill 接口,它可接入不同模型、技能與形態的機器人,在導航、講解、被打斷后恢復等典型場景中,響應時間從通用框架的幾十秒縮短至 2—3 秒。
Tairos 開放平臺全新升級,模型開源,智能體開放
基于 Hy-Embodied 系列模型與具身原生智能體,騰訊對2025 年發布 的Tairos 具身智能開放平臺(鈦螺絲)進行全面升級,升級后的 Tairos 將保持開源和開放,繼續提供模型、智能體與開發工具等一系列能力與服務,降低從模型到本體再到應用全鏈條開發門檻。
![]()
過去一年,騰訊Robotics X 實驗室已與宇樹、智元、越疆、松延動力、樂聚、華沿等機器人企業以及博世、藍思、景德鎮、敦煌等場景合作伙伴,探索具身智能在不同機器人、不同產業場景中的落地。
正如“Tairos”之名中的“鈦”字所寓意的,騰訊希望做具身智能行業的一顆“鈦螺絲”——也許不是最顯眼的部分,卻能可靠地連接模型、本體、工具與應用,支撐整個生態共同運轉。
探索物理人機交互,讓機器人安全地“接觸人” ![]()
在“讓具身智能聽懂人”之外,騰訊也在探索“讓機器人安全地接觸人”。在照護、康復、生活服務等領域,機器人必須與人發生物理接觸,既要絕對安全,又要動作自然、力道精準。
在此前研發的“小五”機器人基礎上,騰訊研發了新一代示范性機器人“小六”:它能與人安全相處、動作擬人,并基于鍵繩傳動,具備獨有的“暢氣通絡按摩手法”,通過自研融合力覺、觸覺、視覺的數據采集系統獲得高質量手法數據,并經強化學習訓練,實現手法軌跡與按摩力道的精準復現。
基于此,未來騰訊也將繼續聚焦力覺、觸覺、視覺與具身大模型的融合,讓機器人真正走到現實生活中。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.