Jay 發(fā)自 凹非寺
量子位 | 公眾號(hào) QbitAI
走進(jìn)一家大型汽車(chē)制造商的線束車(chē)間,你會(huì)看到和整車(chē)工廠截然不同的畫(huà)面。
整車(chē)車(chē)間干凈、明亮、幾乎完全自動(dòng)化。線束車(chē)間密密麻麻,彌漫著汗味。
很多工人培訓(xùn)一個(gè)月,在崗堅(jiān)持不到三個(gè)月就離開(kāi)了。
這是工業(yè)自動(dòng)化界公認(rèn)的「深水區(qū)」。
![]()
△圖為AI生成
如今,被具身智能徹底打爆了。
2026年WAIC,它石智航把一條1:1還原的環(huán)形線束流水線,搬進(jìn)了展館。多臺(tái)機(jī)器人集群合作,流水線輪轉(zhuǎn)線束板,每個(gè)工位同一時(shí)間裝配不同的線束線型。
![]()
效率自然大幅提升。它石智航首席科學(xué)家丁文超甚至調(diào)侃道:
現(xiàn)場(chǎng)我們都不敢讓它一直干活,怕機(jī)器人干太快給料用完了。
撐起這條全自動(dòng)化產(chǎn)線的,是它石智航剛剛發(fā)布的具身原生基座模型AWE 3.5。
這也是具身智能領(lǐng)域第一個(gè)真正打通預(yù)訓(xùn)練到后訓(xùn)練完整范式的原生模型。
一臺(tái)機(jī)器人的「多任務(wù)實(shí)戰(zhàn)」
它石給新版本取名3.5,信號(hào)也挺明確的:希望它像GPT-3.5一樣,在多任務(wù)能力上開(kāi)始展現(xiàn)新的可能。
回看AWE的發(fā)展趨勢(shì),也確實(shí)是這樣。
3.0首秀,它石打爆了線束場(chǎng)景。
![]()
到了3.5,模型開(kāi)始向更多場(chǎng)景溢出。工業(yè)裝配、插接、收納……全部被放進(jìn)同一個(gè)模型里。
今年它石WAIC展臺(tái)的主題-打造可信賴(lài)的物理AI,也是圍繞這項(xiàng)特點(diǎn)展開(kāi),任務(wù)之間不重新加載新的模型,不切換參數(shù),全靠同一個(gè)基礎(chǔ)模型。
現(xiàn)場(chǎng)的展示非常魔幻,他們的機(jī)器人簡(jiǎn)直是「勞模」,整理桌面、打包手機(jī)、插網(wǎng)線、零件分揀……反正不管啥東西,遞過(guò)去就開(kāi)干。
用丁文超的話說(shuō)就是:
跟主播帶貨一樣(笑)。
![]()
但,這只是開(kāi)胃菜。
2026年是世界模型百家爭(zhēng)鳴的元年,不過(guò),究竟什么是世界模型?
在大部分人的認(rèn)知里,它還是論文里的架構(gòu)圖和評(píng)測(cè)表格里的數(shù)字。
這次,它石智航在WAIC給出了最直接的答案:
你上手試一試。
現(xiàn)場(chǎng)觀眾戴上數(shù)據(jù)采集夾爪,就能和一個(gè)由AWE 3.5生成的平行世界展開(kāi)互動(dòng)。
你捏起一塊積木,松手,積木像受重力一樣落向桌面。你拖拽手機(jī)盒,盒子產(chǎn)生對(duì)應(yīng)的位移和摩擦。蠟燭上微弱的火焰,也在模型中被忠實(shí)地呈現(xiàn)出來(lái)。
這些交互沒(méi)有一行牛頓定律代碼,沒(méi)有碰撞引擎,沒(méi)有物理結(jié)算。所有重力、柔性、碰撞反饋、物體位移……全部,由模型從真實(shí)類(lèi)數(shù)據(jù)中學(xué)到。
![]()
而在這個(gè)涌現(xiàn)之外,有一項(xiàng)被嚴(yán)重低估的能力:長(zhǎng)時(shí)記憶與空間理解。
視頻模型有一個(gè)難以治愈的缺陷——
預(yù)測(cè)未來(lái)的時(shí)間一長(zhǎng),物體就容易突然消失、變形,或者在一幀幻覺(jué)之后徹底蒸發(fā)。
究其根本,像素監(jiān)督本身不鼓勵(lì)長(zhǎng)程物理交互的連續(xù)性,無(wú)法用于具身訓(xùn)練。
為此,AWE 3.5依托human-centric數(shù)據(jù)專(zhuān)門(mén)強(qiáng)化了模型結(jié)構(gòu),讓它顯式學(xué)習(xí)長(zhǎng)時(shí)記憶和長(zhǎng)時(shí)序空間理解,在數(shù)分鐘的連續(xù)、交互閉環(huán)推演中保持環(huán)境穩(wěn)定。在此基礎(chǔ)上,后訓(xùn)練可以從連續(xù)過(guò)程中切出多個(gè)動(dòng)作片段,而不用擔(dān)心環(huán)境在下一秒崩掉。
在世界模型中做強(qiáng)化學(xué)習(xí),成為了可能。
原生模型,從第一性原理重構(gòu)具身大腦
今年以來(lái),行業(yè)一直有VLA or 世界模型的爭(zhēng)議,但最近和很多做具身的朋友聊了后發(fā)現(xiàn),真正訓(xùn)模型的人根本不在乎所謂路線之爭(zhēng)。
無(wú)論哪條路線,最終,還是要看是否能優(yōu)化Action。
VLA架構(gòu)里,視覺(jué)和語(yǔ)言在預(yù)訓(xùn)練階段就緊密耦合,動(dòng)作模態(tài)卻要到后訓(xùn)練才通過(guò)SFT接入。這相當(dāng)于一個(gè)學(xué)生先學(xué)了全部理論課,臨考試前才開(kāi)始動(dòng)手做實(shí)驗(yàn)。理論和實(shí)操之間,隔著一道先天的裂縫。
世界模型路線往前走了一步,至少可以利用大規(guī)模視頻學(xué)習(xí)表征能力。但互聯(lián)網(wǎng)視頻模型的Attention結(jié)構(gòu)已經(jīng)在幾十萬(wàn)到百萬(wàn)小時(shí)的貓狗視頻上定型了,直接往具身基座模型里嵌,容易走向兩個(gè)極端:
1、視頻模型原有的幻覺(jué)跑進(jìn)動(dòng)作策略,導(dǎo)致操作不到位或判斷混亂;
2、視覺(jué)理解、空間理解和動(dòng)作永遠(yuǎn)無(wú)法同步。
因此,早在行業(yè)掀起「世界模型」熱浪前,它石從第一天便毅然選擇了另起爐灶——
從頭訓(xùn)一個(gè)原生的具身模型。
具體而言,AWE 3.5從預(yù)訓(xùn)練階段開(kāi)始,就把視覺(jué)、語(yǔ)言、動(dòng)作等多種模態(tài)一起喂給模型。同一套架構(gòu),既能輸出動(dòng)作,也能預(yù)測(cè)未來(lái)。
丁文超把它稱(chēng)為One Model結(jié)構(gòu)。
這個(gè)架構(gòu)設(shè)計(jì)有一個(gè)精妙之處:模型本身不變,只改變輸入輸出的組合方式,就能切換出完全不同的「人格」。
視覺(jué)到動(dòng)作,是Base Policy,負(fù)責(zé)制定策略、發(fā)出指令;以動(dòng)作為條件預(yù)測(cè)未來(lái)視覺(jué),是Action Condition World Model,負(fù)責(zé)預(yù)測(cè)環(huán)境變化。兩者交互在一起,就是一套完整的強(qiáng)化學(xué)習(xí)閉環(huán)。
打個(gè)比方:打包書(shū)包時(shí)拉拉鏈。
這是一個(gè)毫米級(jí)精度的活,而且處處是「卡點(diǎn)」。拉多一點(diǎn)可能成功,拉少一點(diǎn)可能抓不住,用力過(guò)猛可能卡住。
傳統(tǒng)的做法是把機(jī)器人放在真機(jī)上一遍遍試,失敗一次就記錄一次,數(shù)據(jù)貴、速度慢、設(shè)備磨損還大。
![]()
AWE 3.5的做法是:先在預(yù)訓(xùn)練模型的「腦海」里模擬。模型想象拉鏈在不同力度下的各種結(jié)果,然后把最優(yōu)策略告訴Base Policy。這比在真機(jī)上反復(fù)試錯(cuò)快了不止一個(gè)數(shù)量級(jí)。
這就是它石原生模型最核心的突破:模型成了自己的「仿真器」,而無(wú)需手工搭建仿真環(huán)境。預(yù)訓(xùn)練建立通用物理交互能力,后訓(xùn)練在模型內(nèi)部的世界里自我對(duì)弈、自我強(qiáng)化,形成自閉環(huán)。
這套范式,是語(yǔ)言模型在文本領(lǐng)域已經(jīng)驗(yàn)證過(guò)的路徑;但在具身原生模型里,它石開(kāi)發(fā)的AWE 3.5是第一家完整跑通的。
而之所以能成,也是它石長(zhǎng)期布局之下兩條暗線的交匯所賜——
足夠大的真實(shí)數(shù)據(jù)規(guī)模,以及能消化大規(guī)模數(shù)據(jù)的Infra。
缺任何一樣,這個(gè)閉環(huán)就轉(zhuǎn)不起來(lái)。
先看數(shù)據(jù)量——
AWE 3.5,基于超百萬(wàn)小時(shí)human-centric數(shù)據(jù)訓(xùn)練。
這個(gè)量級(jí)有多夸張?
這么說(shuō)吧,目前市面上大多數(shù)視頻生成模型,訓(xùn)練數(shù)據(jù)是在百萬(wàn)小時(shí)級(jí)別。
自動(dòng)駕駛所需數(shù)據(jù),也是這個(gè)量級(jí)。
但百萬(wàn)小時(shí),不是簡(jiǎn)單的堆量游戲。
具身數(shù)據(jù)的價(jià)值分布極不均勻。部分?jǐn)?shù)據(jù)對(duì)模型至關(guān)重要,但重復(fù)度高、交互單一的數(shù)據(jù),對(duì)模型幾乎沒(méi)用。
如何從百萬(wàn)小時(shí)中篩出真正高質(zhì)量的部分,已經(jīng)成為比采集本身更緊迫的問(wèn)題。
這對(duì)數(shù)據(jù)Infra提出了極高的要求,也是它石這幾個(gè)月以來(lái)重點(diǎn)優(yōu)化的方向。
它石數(shù)據(jù)系統(tǒng)的重心,正在從「更多」轉(zhuǎn)向「更聰明、質(zhì)量更高」,Data Efficiency正在成為新的評(píng)測(cè)維度。
![]()
而當(dāng)數(shù)據(jù)規(guī)模和數(shù)據(jù)效率同步上去后,Scaling的威力也終于得到了印證。
丁文超表示,現(xiàn)在預(yù)訓(xùn)練已經(jīng)足夠扎實(shí),一個(gè)新任務(wù)只需要小時(shí)級(jí)別的數(shù)據(jù)采集就能跑通。
這正是當(dāng)初它石選擇One Model架構(gòu)的前瞻性:先建立通用基礎(chǔ)能力,再向各個(gè)場(chǎng)景分發(fā)。
如今隨著AWE 3.5發(fā)布,這項(xiàng)前置戰(zhàn)略的紅利也終于開(kāi)始顯現(xiàn)——
它石等的,從來(lái)不是線束這一個(gè)場(chǎng)景的閉環(huán)。
量子位獲悉,除線束之外,柔性操作、分揀、檢測(cè)協(xié)同……等多個(gè)工業(yè)場(chǎng)景,也已經(jīng)在驗(yàn)證中。
![]()
基于此,丁文超給出了一個(gè)大膽判斷:
具身Scaling已全面釋放。2027年上半年到年中,可能出現(xiàn)分水嶺。
行業(yè)已經(jīng)從「機(jī)器人文娛舞蹈」,進(jìn)入「機(jī)器人真干活」的階段。
展會(huì)熱度,則是一個(gè)先行指標(biāo)。今年的WAIC,具身智能企業(yè)超過(guò)200家,機(jī)器人展區(qū)的人流明顯超過(guò)其他區(qū)域。
而它石的展區(qū),同樣也是堆滿了人。
![]()
「機(jī)器人究竟什么時(shí)候進(jìn)廠干活?」——這個(gè)問(wèn)題,無(wú)論線下還是線上,都已經(jīng)很少再被人提起。
原因很簡(jiǎn)單:各大頭部廠商早已爭(zhēng)相把機(jī)器人送進(jìn)了工廠的深水區(qū),讓它在真實(shí)環(huán)境中摔打、學(xué)習(xí)、迭代。
WAIC世博展館一樓,從北門(mén)進(jìn)入,映入眼簾的便是「模登時(shí)代·伙伴之城」。一個(gè)機(jī)器人各司其職、埋頭干活的實(shí)景展區(qū)。
而進(jìn)門(mén)右側(cè)第一個(gè)展位,它石帶來(lái)的汽車(chē)精密線束裝配演示,無(wú)疑是其中最為獨(dú)特的一個(gè)。
我親手體驗(yàn)了一番:插孔極小,必須瞇起眼睛才能勉強(qiáng)對(duì)準(zhǔn),即便插了進(jìn)去,也很可能是誤插,必須要插到正確點(diǎn)位才能使用。人工操作尚且如此,對(duì)機(jī)器人而言,難度可想而知。
![]()
這是它石首次亮相WAIC,也是我第一次在線下近距離觀看他們的Demo。但說(shuō)實(shí)話,這或許就是WAIC這類(lèi)線下活動(dòng)的意義吧,看完之后,腦海中原本模糊的印象一下子變得具象起來(lái)——
這不僅是一家技術(shù)過(guò)硬的公司,更是一家特點(diǎn)鮮明、場(chǎng)景定位極其清晰的具身智能企業(yè)。
這也是丁文超在與量子位對(duì)話中,反復(fù)強(qiáng)調(diào)的觀點(diǎn):
具身智能的下一步,是讓系統(tǒng)獲得梯度,也就是明確的迭代方向。而這個(gè)方向,不可能僅靠公司內(nèi)部的幾個(gè)Demo來(lái)牽引,它必須來(lái)自真實(shí)場(chǎng)景的正反饋。
它石正在做這件事。
![]()
對(duì)話它石首席科學(xué)家丁文超
具身Scaling能力釋放
量子位:從AWE 3.0到3.5,研發(fā)過(guò)程中有哪些困難超出了最初預(yù)期?
丁文超:整體框架基本符合之前設(shè)定的節(jié)奏,但有兩點(diǎn)與最初的判斷存在偏差。
第一點(diǎn)是硬件與軟件協(xié)同設(shè)計(jì)(Co-Design)的重要性遠(yuǎn)超預(yù)期。我們?cè)贏WE 3.0階段已經(jīng)意識(shí)到這個(gè)問(wèn)題,到了3.5及后續(xù)版本,靈巧手的關(guān)鍵作用愈發(fā)凸顯。
夾爪能解決大約80%的問(wèn)題,但剩下20%如果全部依賴(lài)特制夾爪,工程難度極高。當(dāng)前靈巧手正在走向成熟——它能否真正勝任實(shí)際任務(wù)并跑通商業(yè)閉環(huán),很可能成為具身智能領(lǐng)域的一個(gè)重要里程碑。
做好靈巧手,需要數(shù)據(jù)、模型和硬件三者兼?zhèn)?/strong>,因此它也是檢驗(yàn)一家具身智能公司綜合實(shí)力的「黃金測(cè)試」。我們?cè)趯?shí)踐中逐步加深了對(duì)手的重要性的認(rèn)知。
![]()
從AWE 3.0之前開(kāi)始,我們就持續(xù)投入自研靈巧手。市面上很多產(chǎn)品采用Bottom-Up的思路——先追求高自由度,再?gòu)挠布霭l(fā)。我們的路徑更接近Top-Down:先梳理需要完成哪些人類(lèi)動(dòng)作、匹配哪些人類(lèi)數(shù)據(jù),再反向定義硬件設(shè)計(jì)。這是一項(xiàng)計(jì)劃之外、但在過(guò)程中不斷加大的投入。
第二點(diǎn)是具身智能的Scaling已經(jīng)解鎖。如果行業(yè)繼續(xù)朝這個(gè)方向聚集資源,頭部效應(yīng)會(huì)更加顯現(xiàn)。
量子位:它石的human-centric數(shù)據(jù)已經(jīng)達(dá)到百萬(wàn)小時(shí),能否講講它石具身數(shù)據(jù)的Scaling曲線長(zhǎng)什么樣?
丁文超:我們?cè)诰呱眍I(lǐng)域?qū)caling的定義是:通過(guò)合理的預(yù)訓(xùn)練與后訓(xùn)練范式,將完成新任務(wù)所需的數(shù)據(jù)量和采集成本降到最低。
目前,一個(gè)新任務(wù)普遍只需要小時(shí)級(jí)別的數(shù)據(jù)采集,就能讓模型將任務(wù)完成到大致可用的程度。這條邊界,我們已經(jīng)觸碰到了。
量子位:要實(shí)現(xiàn)物理AGI,數(shù)據(jù)還需要增長(zhǎng)到什么規(guī)模?
丁文超:這會(huì)逐漸演變?yōu)橐粋€(gè)長(zhǎng)尾問(wèn)題。當(dāng)基礎(chǔ)數(shù)據(jù)積累到一定規(guī)模后,能夠貢獻(xiàn)高價(jià)值增量的新場(chǎng)景會(huì)越來(lái)越少。
到了那個(gè)階段,與其糾結(jié)數(shù)據(jù)總量,不如回到一個(gè)更本質(zhì)的問(wèn)題:模型到底要完成什么任務(wù)?我們要采什么樣的數(shù)據(jù)?如何以可控的成本讓機(jī)器人勝任盡可能多樣的任務(wù)?
兩者有交集,但在實(shí)際推進(jìn)路徑上存在明顯差異。
量子位:落地閉環(huán)會(huì)反過(guò)來(lái)影響模型訓(xùn)練?
丁文超:基礎(chǔ)數(shù)據(jù)達(dá)到一定規(guī)模后,當(dāng)然可以繼續(xù)堆量。但真正的難點(diǎn)在于讓系統(tǒng)獲得「梯度」——也就是明確的迭代方向。這個(gè)方向不可能靠公司內(nèi)部幾個(gè)Demo來(lái)持續(xù)牽引,它必須來(lái)自大量真實(shí)場(chǎng)景需求的正反饋。
所有成功的AI都受到真實(shí)需求的驅(qū)動(dòng)。語(yǔ)言模型早期有非常多的應(yīng)用方向,但真正把模型能力推向極致的應(yīng)用之一是AI Coding。雖然AI Coding是一個(gè)垂直應(yīng)用,但它倒逼模型公司建立起預(yù)訓(xùn)練、大規(guī)模數(shù)據(jù)閉環(huán)、Harness Engineering等一整套體系化能力,因此提供了極強(qiáng)的正反饋。
其他應(yīng)用同樣存在,只是規(guī)模相對(duì)更小。正是這些應(yīng)用的牽引,讓行業(yè)對(duì)語(yǔ)言模型能否走向AGI有了更堅(jiān)定的判斷。閉環(huán)跑通之后,技術(shù)的先進(jìn)性才有了清晰的衡量標(biāo)準(zhǔn)。
具身智能同樣需要找到若干個(gè)類(lèi)似AI Coding級(jí)別的應(yīng)用。它的能力不會(huì)局限于這些場(chǎng)景,但正反饋通路能讓數(shù)據(jù)、模型和Infra形成一條穩(wěn)定、可靠、可擴(kuò)展的完整鏈路。
我們當(dāng)前最看重的,是在多個(gè)場(chǎng)景中形成Killer App閉環(huán),并達(dá)到一定規(guī)模。至于未來(lái)數(shù)據(jù)還需要再增加幾個(gè)零,現(xiàn)階段并沒(méi)有那么重要。
具身Scaling時(shí)代,如何重新理解Research?
量子位:過(guò)早進(jìn)入具體場(chǎng)景,會(huì)不會(huì)導(dǎo)致模型過(guò)擬合?
丁文超:(笑)你看我們展臺(tái)展示的任務(wù),有過(guò)擬合嗎?
過(guò)擬合通常意味著系統(tǒng)只能做好一件事。但如果能覆蓋足夠多的任務(wù),能力自然就會(huì)形成泛化。我們?cè)谡古_(tái)上同時(shí)展示多種不同的任務(wù),本身就是在驗(yàn)證這一點(diǎn)。
量子位:具身公司既要持續(xù)做Research,又要尋找落地閉環(huán),這兩條路線會(huì)在內(nèi)部文化上形成沖突嗎?
丁文超:這是任何高科技公司都要面對(duì)的挑戰(zhàn)。追求通用技術(shù)架構(gòu)的領(lǐng)先,與建立終端客戶(hù)的反饋閉環(huán),在一定程度上存在張力,但也有共通之處,關(guān)鍵在于動(dòng)態(tài)平衡。
早期做AI Coding的公司也曾經(jīng)歷過(guò)動(dòng)搖:有些做到一半就放棄了;有些長(zhǎng)期死磕應(yīng)用,卻忽視了通用模型底座的進(jìn)展。兩端都不能缺失。
具身領(lǐng)域確實(shí)還有很多Research可做,但傳統(tǒng)意義上的學(xué)術(shù)研究機(jī)會(huì)正在逐步收窄。當(dāng)工業(yè)界開(kāi)始Scaling,學(xué)術(shù)界的空間就不會(huì)像早期那么大。
目前學(xué)術(shù)前沿正在向雙臂靈巧操作、高自由度靈巧手等方向遷移,如果繼續(xù)用單臂或雙臂夾爪去完成常規(guī)任務(wù),學(xué)術(shù)新穎性會(huì)逐漸降低。
學(xué)術(shù)界當(dāng)然還可以發(fā)表新的VLA或World Action Model方法,但隨著數(shù)據(jù)規(guī)模的提升,很多Trick雖然仍有幫助,卻不再起決定性作用。
行業(yè)規(guī)律通常是:學(xué)術(shù)界先釋放信號(hào),工業(yè)界找到更本質(zhì)的問(wèn)題并進(jìn)行Scaling,隨后該方向的學(xué)術(shù)空間收窄,研究者再去尋找新的前沿——目前靈巧手可能就是學(xué)術(shù)界新的棲息地。
因此,我們需要重新定義具身領(lǐng)域的Research。當(dāng)下真正困難的問(wèn)題包括:數(shù)據(jù)如何采集、篩選和平衡?預(yù)訓(xùn)練Infra和網(wǎng)絡(luò)架構(gòu)如何設(shè)計(jì)?后訓(xùn)練流程如何穩(wěn)定迭代?以及規(guī)模不斷擴(kuò)大后如何解決系統(tǒng)性工程問(wèn)題?
這些問(wèn)題極少能被一篇Paper完整覆蓋。部分論文可能只提供零散的啟發(fā),企業(yè)需要用第一性原理把潛在路徑排列出來(lái),再用大量實(shí)驗(yàn)逐一驗(yàn)證。這是一種「大規(guī)模Research」,只是它的形態(tài)已經(jīng)不同于傳統(tǒng)的學(xué)術(shù)研究。
學(xué)術(shù)界的數(shù)據(jù)量有限,也缺少大規(guī)模的真機(jī)閉環(huán),因此前沿研究正在加速向產(chǎn)業(yè)側(cè)轉(zhuǎn)移。這就像自動(dòng)駕駛端到端技術(shù)出現(xiàn)后引發(fā)的范式轉(zhuǎn)移一樣,具身智能正在經(jīng)歷同樣的過(guò)程。
量子位:找場(chǎng)景和做Research越來(lái)越耦合,你們內(nèi)部如何分配注意力?
丁文超:在我們內(nèi)部,沒(méi)有「預(yù)研」這個(gè)崗位,所有人統(tǒng)稱(chēng)為工程師。但大家做的工作并不重復(fù),而且很多挑戰(zhàn)目前連可供參考的論文都沒(méi)有。在行業(yè)快速爬坡的階段,研究與工程必須緊密咬合。也許再過(guò)兩年,等技術(shù)方案進(jìn)一步收斂后,研究和工程兩類(lèi)崗位才會(huì)明顯分開(kāi)。
量子位:行業(yè)進(jìn)入Scaling和Scaling Research階段后,新入局者還有機(jī)會(huì)嗎?
丁文超:新公司必須找到差異化的切入角度。在當(dāng)下這個(gè)階段,只憑幾篇World Action Model或VLA論文就想創(chuàng)業(yè),難度已經(jīng)非常高了。有了大規(guī)模數(shù)據(jù)和Infra的支撐后,工業(yè)界對(duì)潛在技術(shù)路線的探索廣度,甚至可能超過(guò)學(xué)術(shù)界。
這和自動(dòng)駕駛的發(fā)展軌跡非常相似。2021到2022年前后,很多自動(dòng)駕駛公司完成了從Research Driven到Product Driven的轉(zhuǎn)變,真正建立起了數(shù)據(jù)規(guī)模和Infra,隨后才迎來(lái)了2023、2024年端到端技術(shù)的全面爆發(fā)。
具身智能正在經(jīng)歷類(lèi)似的過(guò)程:從局部的技術(shù)亮點(diǎn),走向系統(tǒng)化的體系作戰(zhàn)。新入局者需要尋找新的生態(tài)位,例如:把自己定位為通用世界模型公司,讓具身智能只是其中一個(gè)子場(chǎng)景;或者避開(kāi)已經(jīng)高度內(nèi)卷的Tabletop(桌面級(jí))任務(wù),直接選擇全尺寸人形等方向。
量子位:它石招人才最看重哪些特質(zhì)?
丁文超:如果只用一個(gè)詞概括,就是敢想敢做;如果再加幾個(gè)詞,那就是踏實(shí)靠譜。
在AI時(shí)代,專(zhuān)業(yè)的邊界已經(jīng)大幅弱化,個(gè)人腦子里裝的知識(shí)很難超過(guò)大模型。基于這一點(diǎn),人不要給自己設(shè)限,要敢于跨越邊界去學(xué)習(xí)和行動(dòng)。
永遠(yuǎn)不要低估模型
量子位:行業(yè)路線仍然分散,也還沒(méi)有公司拿出類(lèi)似GPT-3.5的決定性成果。應(yīng)該用什么標(biāo)準(zhǔn)來(lái)判斷具身智能公司?它石智航的壁壘在哪里?
丁文超:早期判斷的信噪比確實(shí)比較低,但我預(yù)測(cè)2026年底到2027年可能會(huì)出現(xiàn)分水嶺。單場(chǎng)景任務(wù)各家公司只要努力都能完成,真正考驗(yàn)基礎(chǔ)模型能力的,是以一定的可靠率完成多個(gè)任務(wù)。
2027年上半年到年中,「能否實(shí)現(xiàn)多場(chǎng)景可靠落地」會(huì)成為關(guān)鍵的評(píng)判標(biāo)準(zhǔn)。如果一家企業(yè)能用AI化的方法實(shí)現(xiàn)多場(chǎng)景的規(guī)模化落地,就會(huì)迅速與其他公司拉開(kāi)差距。
目前投資人和普通用戶(hù)很難在線下直接接觸機(jī)器人,大多只能通過(guò)視頻了解。但在未來(lái)12個(gè)月內(nèi),機(jī)器人會(huì)真正進(jìn)入更多大眾可觸達(dá)的場(chǎng)景。雖然進(jìn)入家庭仍存在Gap,但機(jī)器人將開(kāi)始承擔(dān)更多真實(shí)的商業(yè)任務(wù)。
到那時(shí),評(píng)判標(biāo)準(zhǔn)會(huì)變得非常直觀:機(jī)器人到底完成了哪些事情?擴(kuò)展新任務(wù)的速度有多快?成本有多低?這非常類(lèi)似自動(dòng)駕駛早期的發(fā)展軌跡——各家公司先圈定幾條演示路線,隨后開(kāi)始比拼「開(kāi)城速度」,最終進(jìn)入存量競(jìng)爭(zhēng)和大規(guī)模量產(chǎn)階段。
量子位:今年WAIC上,能干活的機(jī)器人明顯變多了。具身大腦目前發(fā)展到什么階段了?
丁文超:進(jìn)展快的公司可能已經(jīng)開(kāi)始切入實(shí)際場(chǎng)景。
展會(huì)里展示的「干活」任務(wù)大多經(jīng)過(guò)了抽象和簡(jiǎn)化。真正進(jìn)入工廠后,系統(tǒng)需要長(zhǎng)期、穩(wěn)定、不間斷地運(yùn)行,工程難度依然極高。
2024年,大家看到機(jī)器人本體「能動(dòng)」就覺(jué)得很厲害;后來(lái)開(kāi)始關(guān)注Pick and Place(抓取與放置)以及稍復(fù)雜的操作;而現(xiàn)在最核心的拷問(wèn)是:它有沒(méi)有在真實(shí)場(chǎng)景中持續(xù)、穩(wěn)定地工作。
![]()
量子位:進(jìn)入工廠后,除了技術(shù),還需要具備哪些能力?
丁文超:服務(wù)客戶(hù)的精神。需要與生態(tài)企業(yè)深入交流:了解用戶(hù)喜歡什么功能、交互邏輯怎樣設(shè)計(jì),以及哪些需求源于真實(shí)現(xiàn)場(chǎng),哪些只是團(tuán)隊(duì)自己的「腦補(bǔ)」。這是技術(shù)走向落地必須經(jīng)歷的祛魅過(guò)程。
量子位:具身智能存在實(shí)時(shí)部署和推理算力的約束。有些團(tuán)隊(duì)選擇針對(duì)單一工廠訓(xùn)練小模型,以兼顧安全性和實(shí)時(shí)性。你怎么看這種妥協(xié)?
丁文超:大模型同樣可以推得很快。系統(tǒng)處理大致包含兩個(gè)環(huán)節(jié):一是消化傳感器信息并提取特征,這部分較慢;二是生成動(dòng)作,這部分其實(shí)沒(méi)有那么慢。
很多系統(tǒng)顯得遲緩,是因?yàn)榘迅兄幚砼c動(dòng)作生成串行了起來(lái)。它們完全可以異步解耦運(yùn)行:例如感知以幾赫茲的低頻更新,而動(dòng)作則以幾十赫茲的高頻輸出。推理速度與模型大小存在關(guān)聯(lián),但不能直接劃等號(hào),參數(shù)量很大的模型經(jīng)過(guò)工程優(yōu)化,同樣可以做到極速推理。
量子位:它石從第一天起就對(duì)技術(shù)架構(gòu)想得很清楚,難道就沒(méi)有什么讓你感到困惑的問(wèn)題嗎?
丁文超:我目前最大的「未解之謎」(Mystery)在靈巧手。
靈巧手會(huì)在末端增加約20個(gè)自由度,兩只手配合會(huì)額外引入約42個(gè)自由度。
面對(duì)這樣一個(gè)高維且富接觸(Contact-rich)的復(fù)雜系統(tǒng),會(huì)不會(huì)催生出新的技術(shù)挑戰(zhàn),甚至引發(fā)新的能力涌現(xiàn)?這是我目前最關(guān)心、也最興奮的事情。
量子位:靈巧手距離進(jìn)入真實(shí)場(chǎng)景還有多遠(yuǎn)?
丁文超:我們非常堅(jiān)定地要把靈巧手帶入真實(shí)場(chǎng)景,絕不會(huì)把它局限在學(xué)術(shù)探索或?qū)嶒?yàn)室Demo中。現(xiàn)在很難給出精確的時(shí)間表,但樂(lè)觀預(yù)期是12到18個(gè)月內(nèi)能看到明顯的產(chǎn)業(yè)趨勢(shì)。也許在我們的AWE后續(xù)版本中,大家就能看到一些實(shí)質(zhì)性進(jìn)展。
量子位:Sergey Levine在CVPR分享中提出,可以用機(jī)器人數(shù)據(jù)去擴(kuò)展其他模態(tài)的數(shù)據(jù),似乎不再堅(jiān)持純真機(jī)數(shù)據(jù)路線。你怎么看Physical Intelligence(π)的這種變化?
丁文超:這是一個(gè)必然選擇。過(guò)去π的路線主要依靠多場(chǎng)景的遙操作(Teleoperation)和高質(zhì)量的真實(shí)機(jī)器人數(shù)據(jù)(Robot Data)來(lái)獲取泛化能力,但這依然受限于機(jī)器人本體的物理采集效率。
我個(gè)人風(fēng)格更傾向于提前想清楚整體架構(gòu)。做一個(gè)系統(tǒng)就像建房子,最好先明確大致形態(tài)和必要的承重結(jié)構(gòu),再以高執(zhí)行力去施工。最終形態(tài)可以與預(yù)期有偏差,但絕不能做到一半才發(fā)現(xiàn)缺少關(guān)鍵的承重墻。
要真正走到大家期待的π1甚至更遠(yuǎn)的未來(lái),需要更多Top-Down(自頂向下)的全局設(shè)計(jì)思維,而不能僅僅依靠局部的拼圖擴(kuò)展。
量子位:從AWE 3.0到3.5,你們做了不少前沿探索,最想分享的Takeaway(核心心得)是什么?
丁文超:永遠(yuǎn)不要低估AI模型的能力。
人們常常在某個(gè)階段突然失去信心,從而退縮到某個(gè)過(guò)窄的垂直領(lǐng)域或特定的保守方法中。
2023、2024年,大家覺(jué)得機(jī)器人連「動(dòng)」都困難;運(yùn)動(dòng)能力提升后,又有人說(shuō)它不能「干活」;到了2025、2026年,機(jī)器人能干一些活了,質(zhì)疑又變成了「它只能完成單步任務(wù),無(wú)法處理長(zhǎng)序列」。未來(lái)還會(huì)有人說(shuō)它無(wú)法完成所有工作。
質(zhì)疑的「球門(mén)」在不斷向后移動(dòng),但行業(yè)實(shí)際已經(jīng)前進(jìn)了很遠(yuǎn)。
量子位:所以你認(rèn)為Scaling可以解決一切?
丁文超:是的。我們需要持續(xù)敬畏并重視Scaling帶來(lái)的能力躍升。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶(hù)上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.