![]()
智東西
作者 畢偉豪
編輯|漠影
智東西7月18日報道,走到WAIC一號館展區(qū)最里面,有一間“房子”圍滿了人。如果不是周圍站著機(jī)器人、擺著芯片、掛著各種AI模型介紹,我差點以為自己穿越到了未來之家。
你回家說一句“我回來啦”,茶吧機(jī)會自動倒上一杯溫水,機(jī)器狗主動跑過來,問你今天過得怎么樣,有沒有什么趣聞分享;躺在床上,智能床墊會詢問需不需要按摩;你說無聊,智能電視就推送熱門電視劇。
整個過程沒有遙控器,沒有App,一切自然發(fā)生。
![]()
這并不是提前設(shè)定好的演示,是京東在WAIC現(xiàn)場搭建的,一套基于附身智能JoyInside的“AI Home”實景樣板間。客廳、廚房、書房、臥室一應(yīng)俱全,臺燈、床墊、茶吧機(jī)、毛絨玩具——屋里的每一件設(shè)備,仿佛都長了一個大腦,能夠理解人的意圖,并主動參與到整個家庭活動的協(xié)同之中。
![]()
但在WAIC現(xiàn)場,京東想展示的并不只有一間屋子,還有對于AI如何進(jìn)入物理世界的一次完整回答。京東探索研究院相關(guān)負(fù)責(zé)人表示:“整個京東集團(tuán)會用AI去賦能未來發(fā)展,讓京東成為全球最大的物理世界運(yùn)營中心。”
展區(qū)之外,一場分論壇正在同步進(jìn)行。如果說展區(qū)在回答“AI進(jìn)入物理世界長什么樣”,那么論壇就在解釋,這條成為“全球最大物理世界運(yùn)營中心”的路,京東要如何走。
一、AI進(jìn)入物理世界,京東的第一站是家庭
在京東論壇中,京東探索研究院相關(guān)負(fù)責(zé)人認(rèn)為:“人工智能發(fā)展到今天,在數(shù)字AI上的研究已經(jīng)足夠先進(jìn),但現(xiàn)在的模型還無法駕馭真實的物理世界,京東整體的戰(zhàn)略,就是基于從數(shù)字AI到物理AI的路徑,去進(jìn)行技術(shù)上的開發(fā)與迭代。”
![]()
而京東AI走進(jìn)物理世界的第一站,是家庭,也就是附身智能JoyInside。
家庭是JoyInside一個容易落地的入口,但也是通用智能非常難啃的測試場景。容易落地,是因為家電家居品類足夠多、交互足夠高頻。難啃,是因為這里開放程度高,難以標(biāo)準(zhǔn)化,有多人同時說話的客廳、有開著電視的噪音、有老人孩子寵物的隨機(jī)行為、有不同品牌不同協(xié)議的設(shè)備,人多、設(shè)備多、場景多。
![]()
如果連家庭這種非結(jié)構(gòu)化環(huán)境都能跑通,物流倉庫、零售門店、工廠產(chǎn)線就有了可復(fù)制的基礎(chǔ)。京東探索研究院相關(guān)負(fù)責(zé)人直言,附身智能所積累的數(shù)據(jù),對于具身智能來說也有參考價值,兩者之間的數(shù)據(jù)既互補(bǔ)又各具特色。
相比過去依賴指令控制的智能家居,JoyInside更希望讓AI成為家庭中的“新成員”。JoyInside產(chǎn)品負(fù)責(zé)人給出了一個很有意思的定義:他把這種能夠理解人、理解場景、能夠主動協(xié)同工作的家庭AI形態(tài)稱作“AI空間”。
![]()
過去一年多,JoyInside的核心變化不是接入了更多品類,是把散落的單品捏合成一件事。JoyInside產(chǎn)品負(fù)責(zé)人在接受采訪時,把這件事概括為“從被動控制到主動滿足”。
他舉了一個業(yè)內(nèi)反復(fù)鉆研的例子:控制烤箱。傳統(tǒng)智能家居的邏輯,是用手機(jī)App控制蒸烤箱的溫度、模式、時長,人把它當(dāng)工具,一步步按原始設(shè)定走。但JoyInside想做的是另一條路:用戶只需要說一句“我想吃烤紅薯,拳頭那么大的”,剩下的由設(shè)備自己搞定。
這種模式真正的困難,其實不在于指令遵循。
“烤紅薯沒烤好,人不會罵蒸烤箱,只會覺得是自己沒操作好。但當(dāng)你讓AI來烤,一旦烤砸了,所有問題都是AI的。”JoyInside產(chǎn)品負(fù)責(zé)人說。
人們可以允許聊天框中AI犯錯,卻不能忍受紅薯被烤糊。
無形之中,當(dāng)AI從數(shù)字世界進(jìn)入物理世界,它的容錯悄然降低。不同產(chǎn)地的紅薯不一樣,不同地方人的口味也不一樣,沒有一個標(biāo)準(zhǔn)模式能覆蓋所有場景,但這絕不是為AI開脫的借口,而是廠商必須要解決的問題。
論壇上,JoyInside產(chǎn)品負(fù)責(zé)人介紹了京東的解法:對品牌方,用類似Vibe Coding的思路——不依賴出廠前寫死的固定程序,讓最懂食材和烤箱特性的人類自己,通過自然語言描述來定義產(chǎn)品的行為。在用戶端,他把這套理念總結(jié)為“Vibe Control”,用戶不需要學(xué)習(xí)如何使用設(shè)備,只要表達(dá)意圖,設(shè)備中的AI就會理解需求并主動協(xié)同服務(wù)。
![]()
技術(shù)之外,在WAIC的圓桌論壇上,嘉賓們談?wù)摿岁P(guān)于AI進(jìn)入家庭后的邊界問題,對于如何使用AI去進(jìn)行家庭教育、AI進(jìn)入家庭后的風(fēng)險以及如何避免過度依賴等問題展開了討論。
JoyInside產(chǎn)品負(fù)責(zé)人也在論壇上提出了京東的看法,當(dāng)AI成為陪伴者,它不只是一個硬件功能,而是一個持續(xù)在線、持續(xù)學(xué)習(xí)、持續(xù)交互的互聯(lián)網(wǎng)產(chǎn)品。因此,京東從模型層面對陪伴能力進(jìn)行了管理與約束,希望讓AI在長期交互中保持安全、可靠和穩(wěn)定。
二、臺燈、機(jī)器狗、智能床墊,AI住進(jìn)家庭的每個設(shè)備
WAIC現(xiàn)場,在JoyInside的“AI Home”樣板間里,這套去中心化的邏輯被拆進(jìn)了不同的生活場景。用戶只需表達(dá)簡單的意圖,來自不同廠商的硬件就能同時行動,電視機(jī)推送劇集、茶吧機(jī)倒水、機(jī)器狗跑過來陪聊,不是遙控某臺設(shè)備,而是整個屋子的AI主動協(xié)同。
學(xué)習(xí)場景中,京造AI投影臺燈把作業(yè)批改投在桌面上,輔導(dǎo)孩子日常學(xué)習(xí)。陪伴場景里,佛山照明的AI小夜燈不僅可以智能調(diào)節(jié)亮度與色溫,還能對話、哄睡、提供情緒價值。
![]()
展區(qū)里,還有一只非常惹眼的凱米斯AI智能機(jī)器狗,它可以流暢與人進(jìn)行對話,完成各種交互,用戶還能通過編程為其設(shè)定新動作。
![]()
健康監(jiān)測方面,智能睡眠床墊24小時追蹤呼吸和體動,用戶一躺下,就會詢問是否開啟按摩、調(diào)節(jié)高度,還能自動生成健康報告。
![]()
此外,元蘿卜AI下棋機(jī)器人也非常有趣,支持圍棋、五子棋、象棋等多種棋類游戲玩法,不僅可以當(dāng)陪練,還能和孩子進(jìn)行語音交互,擔(dān)任陪聊。
![]()
在這間“AI Home”里,真正發(fā)生變化的,是每個設(shè)備里都住進(jìn)了AI。它們沒有等待一個中央控制器逐一發(fā)號施令,而是各自理解用戶需求,再主動完成協(xié)同。
“AI Home”展示的不僅僅是幾款智能硬件,更是一種AI進(jìn)入物理世界的新交互方式。對于JoyInside來說,家庭既是離用戶最近的場景,也是非常復(fù)雜并具有挑戰(zhàn)性的場景,這里不會是JoyInside的終點,當(dāng)AI能夠在家庭這樣開放、復(fù)雜的環(huán)境中跑通,它也就具備了走向零售、物流、工業(yè)等更廣闊物理世界的能力基礎(chǔ)。
三、200個品牌、千萬臺終端,一句話全屋智能主動協(xié)同
要讓不同廠商、不同算力、不同協(xié)議的硬件協(xié)同工作,比讓單臺設(shè)備變智能難得多,但這也正是京東推動AI走進(jìn)物理世界戰(zhàn)略的關(guān)鍵環(huán)節(jié)。
第一個要解決的是交互問題。家庭里電視在響、老人在嘮、掃地機(jī)器人在跑,用戶隨口說句話,設(shè)備要在這片噪音里同時判斷三件事:誰在說話、是不是在跟自己說、說的是什么。這對于AI的抗干擾拒識能力和智能交互水平提出了很高的要求。
JoyInside沒有采用傳統(tǒng)的聲紋方案,京東的策略是多模態(tài),AI不僅看語音特征,還看對話內(nèi)容的上下文連續(xù)性,把不屬于當(dāng)前交互的對話自動過濾。在電視噪音場景下,ASR識別率接近90%,疊加大模型理解后,對話有效性進(jìn)一步提升。
![]()
論壇現(xiàn)場,JoyInside產(chǎn)品負(fù)責(zé)人還提到了一個重要的技術(shù):長周期場景任務(wù)處理,比如在一段時間內(nèi)去陪伴老人、照顧孩子,這些任務(wù)不是簡單的幾輪對話交互可以解決的。JoyInside的解法是采用快慢腦架構(gòu),快腦響應(yīng)與用戶進(jìn)行交互、慢腦規(guī)劃長周期任務(wù),實現(xiàn)全流程主動服務(wù)。
第二是跨設(shè)備協(xié)同。JoyInside的做法是先幫每個品牌做好單品的能力——讓一盞燈、一個床墊、一個茶吧機(jī)先做好自己場景里的角色,然后通過角色與角色之間的主動協(xié)同來構(gòu)建AI空間。
![]()
目前,已有近200家品牌接入JoyInside,覆蓋家電家居、機(jī)器人、AI玩具、醫(yī)療器械等多個品類,對話輪次平均提升超120%,2026年預(yù)計接入超千萬臺終端設(shè)備。
![]()
雖然品類眾多,但總體上來說,學(xué)習(xí)教育類和玩具的使用活躍度最高,家電家居類相對較低,智能家電行業(yè)目前提供的AI服務(wù)還沒有得到用戶的廣泛高頻使用。
![]()
但JoyInside與傳統(tǒng)智能家居存在本質(zhì)上的不同,傳統(tǒng)智能家居是一個APP控制所有設(shè)備,各種操作都還是需要手動和自行判斷,而JoyInside則是讓每個設(shè)備都有千人千面服務(wù)的AI能力,設(shè)備之間會根據(jù)用戶的意圖進(jìn)行自主協(xié)同。
JoyInside產(chǎn)品負(fù)責(zé)人認(rèn)為,當(dāng)AI驅(qū)動的主動服務(wù)體驗在更多品類上跑通后,家電家居類的使用頻次會超過玩具類。
JoyInside去中心化的策略,正在悄悄為京東AI走進(jìn)物理世界這條路奠基:不去造一個全知全能的大腦,讓每一臺設(shè)備都擁有自己的AI能力。
一個統(tǒng)一大腦面臨的復(fù)雜度是指數(shù)級增長的,每增加一種品牌、一個品類、一個用戶,都要做兼容和適配。但去中心化的邏輯是反過來的:每接入一臺新設(shè)備,不是給系統(tǒng)增加負(fù)擔(dān),而是增加了一個新的AI入口。設(shè)備越多,場景越豐富,數(shù)據(jù)回流越厚,每個入口的AI能力反而越強(qiáng)。
只有去中心化,才能實現(xiàn)規(guī)模化,實現(xiàn)萬物互聯(lián),實現(xiàn)京東打造全球最大物理世界運(yùn)營中心的目標(biāo)。
![]()
為了加速品類覆蓋,推進(jìn)目標(biāo)的實現(xiàn),京東對品牌方免費(fèi)開放了從ASR、TTS到大模型的整套能力。
“這個行業(yè)最大的痛點是,品牌要把產(chǎn)品做出來要付很高的開發(fā)費(fèi),但不確定能不能賣成爆品,試錯成本極高,” JoyInside產(chǎn)品負(fù)責(zé)人接受采訪時坦言,“只有讓品牌在零成本負(fù)擔(dān)的前提下去大膽嘗試,體驗才不會因為控制預(yù)算而打折扣。”
四、AI Home背后,是京東AI的技術(shù)底座
大多數(shù)人走進(jìn)展區(qū),會先被這間“AI Home”吸引,但在這間屋子背后,支撐每個設(shè)備里的AI能夠理解用戶意圖、彼此協(xié)同的,是京東過去幾年持續(xù)搭建的AI技術(shù)體系。
在論壇上,京東探索研究院相關(guān)負(fù)責(zé)人詳細(xì)拆解了京東的整體技術(shù)路線:他將整個戰(zhàn)略分為三步——數(shù)字智能、附身智能、具身智能。“AI Home”所展現(xiàn)的附身智能,正建立在底層模型不斷完善的基礎(chǔ)之上。
圍繞這條路線,京東JoyAI已經(jīng)陸續(xù)布局圖像理解、多模態(tài)實時交互、世界模型等關(guān)鍵能力。
其中,JoyAI-Image-Edit負(fù)責(zé)圖像空間理解與編輯,JoyAI-VL-Interaction讓模型能夠?qū)崟r感知環(huán)境并與用戶交互,JoyAI-Echo則瞄準(zhǔn)下一代世界模型,為AI理解和模擬真實世界提供支撐。
![]()
論壇中,京東探索研究院相關(guān)負(fù)責(zé)人又展示了兩個近期將會發(fā)布的新模型:JoyAI-Talker聚焦實時語音交互,不僅能夠理解用戶說了什么,還能感知情緒、態(tài)度等信息,實現(xiàn)更加自然的語音交互;JoyAI-Video-Edit則面向流式視頻編輯,可實現(xiàn)30fps流媒體視頻實時編輯,同時服務(wù)于視頻生成和具身智能仿真數(shù)據(jù)合成,能夠為物理世界AI訓(xùn)練提供更多高質(zhì)量數(shù)據(jù)。
具身智能方面,京東推出了JoyAI-Sim 仿真架構(gòu)以及JoyAI-RA具身模型,前者為具身數(shù)據(jù)金字塔構(gòu)建及仿真與真實訓(xùn)練協(xié)同提供底層平臺支撐,后者則初步驗證了具身智能領(lǐng)域的Scaling Law,在今年下半年,京東將陸續(xù)發(fā)布系列具身相關(guān)新工作,推動行業(yè)從數(shù)字世界向物理世界的技術(shù)躍遷。
![]()
數(shù)據(jù)是這條路線上的另一個關(guān)鍵變量。京東前段時間開源的EgoLive數(shù)據(jù)集,2000小時人類第一視角雙目視頻,已經(jīng)是行業(yè)最大。但京東基礎(chǔ)云業(yè)務(wù)負(fù)責(zé)人透露的計劃更激進(jìn):未來將依托京東近 1 萬家門店、3600 余個倉儲、20 余萬個藥店等場景啟動數(shù)據(jù)采集,目標(biāo)今年底達(dá)到百萬小時量級,兩年內(nèi)沖擊千萬小時。
京東基礎(chǔ)云業(yè)務(wù)負(fù)責(zé)人直言,截至目前,京東已然構(gòu)建了一整套具身智能數(shù)據(jù)的全景技術(shù)棧,從數(shù)據(jù)的采集,包括多模態(tài)、多維、軌跡以及第一視角的數(shù)據(jù),到整個數(shù)據(jù)處理管線,整個數(shù)據(jù)的處理成本,下降了8倍以上。
![]()
展臺區(qū)域,觀眾可以體驗頭戴JoyEgoCam數(shù)采設(shè)備,第一視角感受機(jī)器人從數(shù)據(jù)采集、學(xué)習(xí)到最終落地作業(yè)的全流程。對于具身智能而言,模型決定能力上限,而真實世界數(shù)據(jù)決定能力能否真正落地。EgoLive持續(xù)擴(kuò)大的規(guī)模,也表明著京東正在為未來的物理AI積累更豐富的訓(xùn)練基礎(chǔ)。
![]()
從數(shù)字智能、附身智能到具身智能,這三層能力并不是彼此割裂的,它們共享同一套模型、數(shù)據(jù)和交互能力。“AI Home”只是消費(fèi)者最容易感知的一層,而它背后的技術(shù)體系,最終指向的是AI進(jìn)入更廣闊的物理世界。
結(jié)語:物理世界最大的AI去中心化入口
過去,大模型競爭的是誰更懂?dāng)?shù)字世界;未來,比拼的將是誰更懂真實世界。
“AI Home”雖然只是京東搭建的一間屋子,但也是AI進(jìn)入物理世界的一個縮影。當(dāng)每個設(shè)備都擁有自己的AI能力,并能夠圍繞人的意圖主動理解、主動協(xié)同,AI便不再只是一個聊天助手,開始成為現(xiàn)實世界的一部分。
萬臺設(shè)備,更是AI走向更廣闊物理世界的一條路徑。這既是京東打造AI驅(qū)動的全球最大物理世界運(yùn)營中心的終端基礎(chǔ),也是物理世界最大的AI去中心化入口的開端——讓AI從理解世界,走向參與世界。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.