本文來自微信公眾號(hào): 硅谷101 ,采訪:泓君,圖文:朱婕,原文標(biāo)題:《機(jī)器人走錯(cuò)路了?與蘇度韓錚聊聊具身智能的3D數(shù)據(jù)、路徑分野與硅谷競(jìng)賽》,頭圖來自:AI生成
2026世界人工智能大會(huì)(WAIC)上,成立不到一年的蘇度科技首次在國(guó)內(nèi)系統(tǒng)亮相,現(xiàn)場(chǎng)演示了10余項(xiàng)技能,覆蓋雙手操作、柔性體處理、精密組裝、移動(dòng)抓取,還有一個(gè)被視為具身智能下一階段關(guān)鍵方向的“彩蛋”:邊移動(dòng)邊操作。
讓機(jī)器人在真實(shí)世界操作物體,與單純的控制運(yùn)動(dòng)相比,難度陡然提升2到3個(gè)量級(jí),因?yàn)椤皠?dòng)手”之前,它需要理解眼前的物理世界。這正是蘇度科技想啃下的硬骨頭。蘇度科技聯(lián)合創(chuàng)始人、董事長(zhǎng)蘇昊是ImageNet的核心作者之一,師從李飛飛。這家公司走了一條與硅谷主流“純大腦黑盒大模型”不太一樣的路:軟硬件協(xié)同設(shè)計(jì),上下分層架構(gòu),上層負(fù)責(zé)任務(wù)規(guī)劃與環(huán)境理解,下層負(fù)責(zé)具體物體操作;Sim-to-Real作為核心訓(xùn)練范式,讓機(jī)器人在虛擬世界里經(jīng)歷幾百萬年的進(jìn)化,再遷移到現(xiàn)實(shí)。
這條路已經(jīng)跑出成效:在今年4月發(fā)布的Demo中,機(jī)器人零樣本通用抓取單次成功率達(dá)到98%。WAIC現(xiàn)場(chǎng)的10余項(xiàng)技能并非孤立開發(fā),它們共享同一套Sim2Real技術(shù)范式,底層跑通后,新技能的邊際成本會(huì)快速下降,最終形成一套可復(fù)用、可擴(kuò)展、能夠持續(xù)生成新能力的機(jī)器人系統(tǒng)。
本期《硅谷101》,我們邀請(qǐng)?zhí)K度科技聯(lián)合創(chuàng)始人兼CEO韓錚,一起聊聊機(jī)器人的3D數(shù)據(jù)從哪里來?Sim-to-Real這條路能不能走通?全球機(jī)器人競(jìng)賽,各大頭部玩家的技術(shù)路徑是什么,誰能真正的跑出來?韓錚預(yù)測(cè),接下來會(huì)有更多的硅谷公司重新回到“上下分層”的方向上來。而在硅谷眾多明星公司中,Deepmind+波士頓動(dòng)力的組合,可能是這條路上最值得關(guān)注的對(duì)手。
以下是這次對(duì)話內(nèi)容的精選:

泓君:我看你們現(xiàn)在做的機(jī)器人很火,我看見新聞消息說,投資人很難搶到你們的投資份額?,F(xiàn)在做機(jī)器人的公司非常多,我初步把它分成兩層,一層是造大腦的機(jī)器人,比如硅谷的PI、Skild;還有一層是造身體,像Optimus、宇樹。所以開始的時(shí)候,您要不要簡(jiǎn)單講一下蘇度科技的定位,你們做的是哪個(gè)環(huán)節(jié)?
韓錚:我們是大腦和本體都做,現(xiàn)在很多的機(jī)器人公司都在強(qiáng)調(diào)這一點(diǎn),就是要全棧,要做整個(gè)的系統(tǒng)。我們團(tuán)隊(duì)10年前就開始用機(jī)器學(xué)習(xí)方法驅(qū)動(dòng)機(jī)器人,當(dāng)時(shí)主要以軟件為主,做探索和嘗試。直到2022年,團(tuán)隊(duì)開始以商業(yè)化的方式來做準(zhǔn)備的時(shí)候,我們才開始正式地考慮自己來做硬件的本體。
因?yàn)槎嗄攴e累下來的經(jīng)驗(yàn)告訴我們,如果不碰本體,大腦的能力很難展現(xiàn)出來,也很難做迭代和驗(yàn)證。

SUDO R1機(jī)器人|圖片來源:蘇度科技
泓君:如果我們要類比一家硅谷的、大家現(xiàn)在已經(jīng)比較熟悉名字的這些機(jī)器人公司,你覺得你們做的這些環(huán)節(jié)跟哪一家機(jī)器人公司是更接近的?
韓錚:我覺得硅谷的機(jī)器人公司,不管是像Optimus,還是上一代的波士頓動(dòng)力,還是Figure、1X,其實(shí)都是本體+模型。不過這幾家公司在模型側(cè)的能力,比起Physical Intelligence、Skild,要稍弱一些,沒有那么專注。
泓君:我覺得我們要看每一家公司做機(jī)器人,它的思路有什么不一樣,可能要從它的整個(gè)歷史說起。我知道你的聯(lián)合創(chuàng)始人蘇昊,他是李飛飛的學(xué)生。李飛飛當(dāng)年成名之戰(zhàn)是ImageNet,她給上百萬的圖片做人工標(biāo)注,然后讓機(jī)器第一次看這個(gè)足夠多的世界。蘇昊他其實(shí)就是ImageNet的核心作者之一,后來他把這個(gè)思路搬到了3D。我覺得這個(gè)跟今天的蘇度整個(gè)的歷史也是一脈相承的。所以你可不可以簡(jiǎn)單跟大家介紹一下ImageNet,為什么它會(huì)成為整個(gè)AI爆發(fā)的一個(gè)導(dǎo)火索?
韓錚:蘇昊求學(xué)生涯里邊其實(shí)一共有兩個(gè)PhD,其中大概有將近4年時(shí)間的話,他是在李飛飛老師當(dāng)時(shí)在普林斯頓、后來在斯坦福的實(shí)驗(yàn)室里邊,核心的項(xiàng)目就像您講的,實(shí)際上是做ImageNet大的項(xiàng)目。他曾經(jīng)跟我講過,李飛飛對(duì)于整個(gè)ImageNet的推動(dòng)和架構(gòu)的話,實(shí)際上是非常有遠(yuǎn)見的。
ImageNet核心思想就是,用結(jié)構(gòu)化的方法,把世界上典型物體的2D圖片和對(duì)應(yīng)的文字描述配對(duì),進(jìn)行系統(tǒng)化的整理和復(fù)現(xiàn)。比如桌子上的杯子,我們需要一系列的典型圖片去描述世界上幾乎所有的杯子,但是同樣款式的杯子,我們一張或者兩張圖片可能就夠了。
這個(gè)思想在2012年、2013年,蘇昊跟隨第二個(gè)PhD導(dǎo)師Leo Guibas,在斯坦福的實(shí)驗(yàn)室的時(shí)候,把這套思想帶到了3D里邊來。所以他那個(gè)時(shí)候開始組建3D的大數(shù)據(jù)集ShapeNet。它最大最大的挑戰(zhàn)就在于,相比于ImageNet,你可以把互聯(lián)網(wǎng)上面幾乎所有的圖片和它下面的文字描述和標(biāo)題梳理清楚,并且以眾包的方法做標(biāo)注,但3D模型其實(shí)非常欠缺。
泓君:把這個(gè)思路搬到3D領(lǐng)域,就是我能想象,比如說你2D,要在圖片里面去識(shí)別這個(gè)杯子,我只需要一個(gè)標(biāo)簽。3D的話,它的標(biāo)注維度會(huì)大很多,你的文字標(biāo)注它怎么去解決這種空間的物理關(guān)系,甚至是力的反饋?我覺得這個(gè)事情聽起來要難很多。
韓錚:對(duì),這里邊的工作其實(shí)要復(fù)雜很多,所以愿意做3D大數(shù)據(jù)集的人相比于2D以及語言的大數(shù)據(jù)集的話,要少很多很多。在3D大數(shù)據(jù)集方面,我們有一系列的工作。第一個(gè)就是ShapeNet,是蘇昊在斯坦福期間的核心工作,現(xiàn)在做到了幾十萬的3D數(shù)據(jù)。但實(shí)際上還遠(yuǎn)遠(yuǎn)沒有達(dá)到像ImageNet能夠覆蓋世界上所有物體所有的模型。
這些3D模型,它只有基礎(chǔ)的幾何,和基礎(chǔ)的表面貼圖,我們大概能夠預(yù)估到它的這些物體的材質(zhì)。但再往下一步的話,同樣一個(gè)物體的話它可能會(huì)分不一樣的parts和組件,比如說一個(gè)飲料瓶子,會(huì)分成瓶身、瓶蓋……有的時(shí)候你甚至需要標(biāo)注哪個(gè)是它的瓶底。標(biāo)到PartNet的時(shí)候,就只有幾萬的物體了。
但再進(jìn)一步,比如說對(duì)于這個(gè)瓶子,它的瓶蓋究竟是往左擰還是往右擰,它擰動(dòng)之后能不能夠把它給擰下來,這個(gè)就叫動(dòng)力學(xué)約束的一些標(biāo)注,這個(gè)數(shù)據(jù)集叫PartNet-Mobility。到目前為止,如果我沒記錯(cuò)的話,它仍然是最大的帶部件、帶動(dòng)力學(xué)約束的開源數(shù)據(jù)集,但這里邊只有不到3000個(gè)物體帶有標(biāo)注的。這對(duì)像機(jī)器人合成數(shù)據(jù)的訓(xùn)練生成,像視頻生成里邊帶有連續(xù)的空間和物理一致性,都有很大的約束。
泓君:3D數(shù)據(jù)的收集,可能標(biāo)注是很費(fèi)時(shí)間成本的事情?,F(xiàn)在我們?cè)诳紤]大模型跟機(jī)器人的訓(xùn)練方法時(shí),比如說我讓它現(xiàn)在用ShapeNet的這一套開源數(shù)據(jù)集去訓(xùn)練,跟直接對(duì)著視頻網(wǎng)站成千上萬的開放世界的視頻去訓(xùn)練,它的核心區(qū)別點(diǎn)是什么呢?
韓錚:我覺得這個(gè)核心區(qū)別在我們看來,就是2D的圖片和視頻里邊,三維的信息有,但是不太全,也不太準(zhǔn)。如果你拿它用來做自動(dòng)駕駛導(dǎo)航,它對(duì)精度的要求沒有太高,有一個(gè)大概10公分左右的精度,是夠用的。但是對(duì)機(jī)器人的操作,10厘米的誤差是絕對(duì)不能忍受的。像我們面前的這個(gè)錄音機(jī),我們要把線纜插到對(duì)應(yīng)的孔位里邊去,它的要求必須是在亞毫米級(jí)以內(nèi)。對(duì)于我們做仿真(Sim-to-Real)的這條路,我們是要求機(jī)器人對(duì)于物理環(huán)境里邊的物體和環(huán)境、對(duì)于幾何有比較精準(zhǔn)的理解。它對(duì)幾何精度的理解,就要達(dá)到毫米級(jí),甚至亞毫米級(jí)才可以。

泓君:您覺得蘇昊在做整個(gè)ShapeNet以后,現(xiàn)在開始跟你們一起做蘇度機(jī)器人,在這個(gè)中間沉淀下來的最核心的資產(chǎn)是什么?
韓錚:走Sim-to-Real這條路,它有點(diǎn)像波音造飛機(jī),它是一個(gè)比較復(fù)雜的系統(tǒng)工程。所以怎么能夠把搭建這個(gè)復(fù)雜系統(tǒng)工程的團(tuán)隊(duì)建起來,我覺得這是我們團(tuán)隊(duì)最核心的積累。我們團(tuán)隊(duì)里邊的小伙伴們?cè)谔K昊的實(shí)驗(yàn)室以及我們成立公司之后,核心的這幾個(gè)大組的負(fù)責(zé)人其實(shí)都在一起工作過七八年的時(shí)間。人,還有過去做這些事情的經(jīng)驗(yàn)跟方法論,這個(gè)是無可比擬的優(yōu)勢(shì)。
包括數(shù)據(jù),比如說我們?cè)谧龇抡嫫?,其?shí)大家能夠想象到的市面上核心機(jī)器人的仿真器,不管是像Isaac、MuJoCo,甚至說新創(chuàng)的一些公司,都跟我們有千絲萬縷的聯(lián)系。

NVIDIA Isaac Sim將同一抓取任務(wù)在物理世界與仿真世界中并行呈現(xiàn)|圖片來源:NVIDIA
泓君:我先跟聽眾解釋一下Sim-to-Real,它的意思直譯就是“從仿真到現(xiàn)實(shí)”,它是讓機(jī)器人先在電腦模擬的虛擬世界中訓(xùn)練,練成之后把學(xué)到的這件事情“搬”到真機(jī)上,讓它在物理世界里面也能用。大家注意,重點(diǎn)不是說仿真這兩個(gè)字,而是“搬”的這個(gè)動(dòng)作,能不能直接把它搬到現(xiàn)實(shí)世界,還靈不靈?它是這條技術(shù)路徑上最大的一個(gè)難題。英偉達(dá)的Isaac仿真平臺(tái)就是這個(gè)路徑最大的推手之一。與它相對(duì)的另一條路徑,就是Real World Data這一派,直接用真實(shí)世界采集的數(shù)據(jù)來訓(xùn)練,比如說讓人手把手地教,然后機(jī)器照著學(xué)。
我記得蘇昊其實(shí)是非常早就在做跟機(jī)器人、跟3D數(shù)據(jù)集一系列的探索,那個(gè)是在什么時(shí)間?
韓錚:應(yīng)該是2012年、2013年。因?yàn)樵贗mageNet出來之后,他有一個(gè)想法,是要做一個(gè)類似于神經(jīng)網(wǎng)絡(luò)的架構(gòu),但當(dāng)時(shí)跟他配合的人沒有那么多。在ImageNet的挑戰(zhàn)賽AlexNet橫空出世之后,對(duì)他的沖擊我覺得是非常大的,他覺得自己可能是錯(cuò)過了非常重要的一個(gè)機(jī)會(huì)。所以他就思考,下一個(gè)大的領(lǐng)域會(huì)是什么?他想把大數(shù)據(jù)集加神經(jīng)網(wǎng)絡(luò)的方法帶到物理世界里邊來。在他拿到第一個(gè)PhD之后,在Leo Guibas教授組開始搭建新的3D學(xué)習(xí)的團(tuán)隊(duì)。
泓君:這個(gè)中間我覺得不管是機(jī)器人還是我們現(xiàn)在說的AI,它的技術(shù)已經(jīng)經(jīng)過了特別多輪的迭代了。在2012年、2013年那段時(shí)間,甚至更早的一段時(shí)間,大家覺得投資機(jī)器人都是不賺錢的,甚至是失敗的投資項(xiàng)目。那個(gè)時(shí)候其實(shí)硅谷有非常多好的機(jī)器人項(xiàng)目,像什么Covariant。
韓錚:我們?cè)趧?chuàng)業(yè)初期,也受到了上一波大家對(duì)于這個(gè)問題的影響。從2012年、2013年開始,到2015年、2016年,當(dāng)時(shí)應(yīng)該是我們叫安卓之父Andy Rubin加入谷歌之后,他負(fù)責(zé)了谷歌的X這個(gè)項(xiàng)目,當(dāng)時(shí)應(yīng)該收購(gòu)了非常多家機(jī)器人公司,最知名的可能就是波士頓動(dòng)力,后來又轉(zhuǎn)手過很多次。像您剛才提到的Vicarious、Intrinsic,現(xiàn)在還在谷歌里邊,Everyday Robots它的硬件部門已經(jīng)被關(guān)閉掉了。當(dāng)時(shí)那波,可能大家還是想用機(jī)器學(xué)習(xí)的方法往前推進(jìn),但當(dāng)時(shí)的要素我覺得可能還不是特別全。
在2022年,蘇昊想做機(jī)器人的底層操作模型公司的時(shí)候,我們當(dāng)時(shí)討論最多的一點(diǎn),是什么原因能夠促使大家覺得現(xiàn)在的機(jī)遇跟大概七八年以前明顯的不同。當(dāng)時(shí)我們決策的核心原因之一,就是DALL·E(OpenAI的文生圖模型)的出現(xiàn),它讓我們意識(shí)到,把2D升維到3D,實(shí)際上是有機(jī)會(huì)的。從一個(gè)樸素的想法來講,就是如果仿真器要重建整個(gè)世界的物體和環(huán)境,理論上是可行的了。
泓君:我們剛一直在提,你們?cè)谧逽im-to-Real的路線,你的Sim-to-Real的底層應(yīng)該是一個(gè)我理解現(xiàn)在可以說是世界模型,或者是3D的大模型。
韓錚:我覺得一定程度上是對(duì)的。其實(shí)仿真,在我們推動(dòng)Sapien和ManiSkill的時(shí)候,大概是2018年、2019年開始,比如飛行器和汽車制造里邊,我們要做流體力學(xué)仿真,機(jī)器人你要做機(jī)械包括力學(xué)的仿真,讓它跟真實(shí)的飛行器也好、車也好、機(jī)器人也好的話,盡可能地接近。
但新的機(jī)器人仿真器的設(shè)計(jì)思路就不太一樣,它并不需要我們?cè)诖笮蜋C(jī)器或大型集群里無限逼近真實(shí)環(huán)境;我們需要在一張GPU上面開出上萬、甚至上百萬個(gè)并行的環(huán)境,不需要讓它看起來非常地真實(shí),比如說它的分辨率其實(shí)非常非常低;它要求物理的一致性盡可能接近,但并不需要無限地接近——它一定是要在真實(shí)和效率之間做大量的取舍設(shè)計(jì)。
泓君:所以你們選擇了在這個(gè)仿真器里面更多地遵循整個(gè)世界底層的物理法則,犧牲觀賞性跟分辨率。
韓錚:對(duì),我們把經(jīng)典牛頓力學(xué),包括物理仿真中人類總結(jié)的大量公式都代入到仿真器里邊來,但同時(shí)我們又給它大量的開放世界3D的物體環(huán)境任務(wù)的數(shù)據(jù),讓機(jī)器人在里邊做強(qiáng)化學(xué)習(xí)。
泓君:對(duì),所以你們現(xiàn)在Sim-to-Real的這條路線,包括仿真器的設(shè)計(jì),我理解它所有的環(huán)境搭建都是為機(jī)器人服務(wù)的。機(jī)器人對(duì)一件事情的理解,你們可能是不局限于我要擰一個(gè)礦泉水的瓶蓋,而是說我想讓機(jī)器人做所有的、它能看見的現(xiàn)實(shí)世界中的環(huán)境它都能操作。我的理解是對(duì)的嗎?
韓錚:對(duì),簡(jiǎn)單來講,我們想把人類和整個(gè)生物對(duì)于環(huán)境的理解、交互、物體的操作,幾百萬年進(jìn)化的過程,放在仿真器里邊來,讓機(jī)器人再經(jīng)歷完整進(jìn)化的過程。
泓君:你覺得現(xiàn)在在機(jī)器人的訓(xùn)練中,是用極高質(zhì)量的數(shù)據(jù)更關(guān)鍵,還是說我需要用更大規(guī)模的數(shù)據(jù),但是這個(gè)數(shù)據(jù)的質(zhì)量可能沒有那么高。你怎么看這兩者之間的權(quán)衡?
韓錚:我覺得這是一個(gè)特別好的問題。我們也沒有標(biāo)準(zhǔn)答案,永遠(yuǎn)是在質(zhì)量和規(guī)模之間要取得平衡。但規(guī)模是要達(dá)到一定程度的。
我就有一個(gè)樸素的判斷,就是你要把世界上典型的物體、它們之間組合的環(huán)境和要去做的操作任務(wù),都有一個(gè)結(jié)構(gòu)化的描述。這幾乎在機(jī)器學(xué)習(xí)的歷史上,不管是2D視覺、自然語言,還是自動(dòng)駕駛領(lǐng)域,都沒有出現(xiàn)過。
在仿真器里邊,我們要搭建的結(jié)構(gòu)化數(shù)據(jù)集是非常關(guān)鍵的。但我們也清晰地知道,不太需要無限度地準(zhǔn)。比如說單個(gè)飲料瓶子,它材質(zhì)的具體描述,它的標(biāo)簽上的文字信息,需不需要100%地還原?其實(shí)是不需要的。但究竟怎么取得這樣的一個(gè)平衡,實(shí)際上每家可能都有不一樣的理解。
泓君:所以你們的數(shù)據(jù)集算是一個(gè)什么樣的質(zhì)量?
韓錚:我們對(duì)于結(jié)構(gòu)化的理解,可能是在所有的團(tuán)隊(duì)里面做得最好的。但另外一點(diǎn),我們也知道結(jié)構(gòu)化的下面,我們還應(yīng)該補(bǔ)哪些數(shù)據(jù)。比如說我們瓶子要怎么去擰,這些動(dòng)力學(xué)約束數(shù)據(jù),還是整個(gè)行業(yè)里邊最欠缺的。

泓君:機(jī)器人界有幾派爭(zhēng)議,一個(gè)就是Sim-to-Real的這一派,還有一個(gè)就是用Real World Data的這一派。質(zhì)疑Sim-to-Real的這一派就會(huì)認(rèn)為,我把仿真里面的東西放到現(xiàn)實(shí)世界中,它的效果可能沒有那么好。你們其實(shí)也有機(jī)器人的本體,然后也已經(jīng)開始操作了,可不可以講一下你們的執(zhí)行效果?
韓錚:真實(shí)世界數(shù)據(jù)采集的方法有很多種:比如機(jī)器人遙操作(Teleoperation),比如UMI這樣的動(dòng)捕設(shè)備——不管是用夾爪還是穿全身動(dòng)捕服。第三種是Ego的方法,就是大家經(jīng)常在講的第一人稱的數(shù)據(jù)。這些方法相較于Sim-to-Real,操作起來都會(huì)簡(jiǎn)單一些,但它很難保證某一類操作任務(wù)在開放世界的泛化性。
這個(gè)指的是什么呢?基礎(chǔ)模型的一般定義是:給它一個(gè)在預(yù)訓(xùn)練和后訓(xùn)練中都沒出現(xiàn)過的任意物體,它能不能以很高的成功率完成任務(wù)。
我們其實(shí)之前也稍微地提到了,就是這類的視頻和圖片,它對(duì)幾何的理解和精度可能不太夠。我們?cè)诜抡胬镞吅诵?,就是要重建這些物體和環(huán)境的3D Ground Truth的信息。但是如果規(guī)模不夠,其實(shí)是很難體現(xiàn)出Sim-to-Real的優(yōu)勢(shì)和能力的。
我們4月份放過一個(gè)結(jié)果,就是我們叫蘇度R1,它是去年底內(nèi)部的一個(gè)結(jié)果。在我們看來,這可能是整個(gè)機(jī)器人領(lǐng)域里,第一次用Sim-to-Real路線做到Zero-Shot、開放世界某一類任務(wù),把仿真到現(xiàn)實(shí)的差距填平。
這個(gè)視頻展示了連續(xù)一個(gè)小時(shí)的操作:我們?cè)嚵?00多個(gè)物體,操作了200多次。但這些物體其實(shí)都是在我們的訓(xùn)練數(shù)據(jù)里沒有出現(xiàn)過的,即使抓取失敗,我們也沒有補(bǔ)充后訓(xùn)練數(shù)據(jù)。所以它是一個(gè)對(duì)于物體通用的抓取,第一次可以做到零樣本高成功率的結(jié)果。我們會(huì)變換很多的光照、環(huán)境和物體。
到一個(gè)小時(shí)結(jié)束的時(shí)候,我們一共做了240次抓放的操作。單次抓放的成功率是將近98%。但是它第一次失敗之后,還會(huì)用一個(gè)閉環(huán)控制的方法,迅速地調(diào)整它的策略,就可以做到100%。
在這個(gè)結(jié)果發(fā)布之后,整個(gè)的研究社區(qū)里邊有一派的聲音就質(zhì)疑說:“你們肯定精心控制了變量,這些物體和環(huán)境是不是在訓(xùn)練里見過?”但事實(shí)上,我們完全沒有。

SUDO R1 60分鐘連續(xù)無剪輯實(shí)測(cè)|圖片來源:蘇度科技
泓君:我跟大家先簡(jiǎn)單解釋一下,因?yàn)榇蠹铱赡芸床坏竭@個(gè)視頻,你們第一次demo的畫面是一個(gè)機(jī)器人站在一個(gè)操作臺(tái)前,去抓不同的物體。這個(gè)物體包括像飲料的瓶子,還有小零食。這些物體,可能是橢圓形的,可能是錐形的,這就要求機(jī)器人的手要去抓不同的部位,它才能把它抓起來。這個(gè)視頻的時(shí)長(zhǎng)是60分鐘,你們是連續(xù)拍攝,沒有間斷,上面顯示一共是240次抓取。所以大家有質(zhì)疑是說你們可能是看過這些數(shù)據(jù),但其實(shí)是沒有。
韓錚:是的,所以我們當(dāng)時(shí)就決定要在公眾的面前給大家做一次展示。在6月初的時(shí)候,我們首先在維也納舉行的ICRA(國(guó)際機(jī)器人與自動(dòng)化會(huì)議)的大會(huì)上,我們把這臺(tái)機(jī)器人第一次帶到了研究者的面前,在幾天的會(huì)議里邊,可能有將近1000人來到我們的展臺(tái)前面,用他們自己各種各樣隨機(jī)的物體去做測(cè)試,比如說參會(huì)的證件、比如像手機(jī)、耳機(jī)、小玩偶。昨天我們其實(shí)也剛剛從CVPR(計(jì)算機(jī)視覺領(lǐng)域的三大頂級(jí)會(huì)議之一)的會(huì)場(chǎng)回來,我們也是搭建了一個(gè)展臺(tái),大家在一個(gè)非常隨機(jī)的環(huán)境之下去做測(cè)試。
在以前這種學(xué)術(shù)會(huì)議上,從來沒有人能夠做到這樣的展示。原因之一就在于,它幾乎沒有給你時(shí)間去做準(zhǔn)備。比如某家公司,它會(huì)在學(xué)術(shù)會(huì)議開始之前在旁邊租一個(gè)Airbnb,把自己的機(jī)器人放在那邊,去收集大量的數(shù)據(jù),可能要提前一個(gè)月進(jìn)場(chǎng),做好處理之后重復(fù)去展示,比如做咖啡的任務(wù)。
泓君:所以它是有針對(duì)單個(gè)場(chǎng)景去做適配跟練習(xí)的,你們沒有。
韓錚:我們是不需要的。只不過這兩者的區(qū)別之一就在于,我們更關(guān)注對(duì)于物體的基礎(chǔ)操作,比如說這種短的基礎(chǔ)操作的高頻動(dòng)作,也就是Zero-Shot一次性抓取成功的單個(gè)動(dòng)作。
泓君:我理解做咖啡的任務(wù)是一個(gè)連續(xù)動(dòng)作。
韓錚:對(duì),它相當(dāng)于讓人遙控這個(gè)機(jī)器人,把這個(gè)連續(xù)動(dòng)作,至少要出現(xiàn)過很多次。如果它換一個(gè)咖啡機(jī),或者是換一個(gè)環(huán)境的話,它的成功率肯定會(huì)要往下掉不少。這時(shí)候怎么辦?絕大多數(shù)機(jī)器人模型公司還得補(bǔ)充數(shù)據(jù)去做擬合。
泓君:做單個(gè)一次性抓取的任務(wù),跟做一個(gè)這種長(zhǎng)程任務(wù),就是復(fù)雜動(dòng)作的拆解,每一步都需要連續(xù)。你覺得這兩者之間哪個(gè)更難?
韓錚:我覺得如果是真正做機(jī)器人的、做操作的社區(qū)的話,肯定認(rèn)為Zero-Shot更加核心和關(guān)鍵。如果是你的短技能足夠的穩(wěn)定可靠,它的泛化性足夠高,你是可以把短技能拼成各種各樣的長(zhǎng)程操作的。這其實(shí)也就是ManiSkill整個(gè)核心框架大的思想。

WAIC大會(huì),蘇度科技展示了從強(qiáng)泛化抓取擴(kuò)展而來的10余項(xiàng)機(jī)器人技能,覆蓋雙手操作、柔性體處理、精密組裝、移動(dòng)抓取和多機(jī)協(xié)作等|圖片來源:蘇度科技
泓君:所以我理解其實(shí)最難的部分是開放世界,而不在于它是短還是長(zhǎng)。你只要在開放世界中短的能成功,那么連續(xù)長(zhǎng)程任務(wù)只是時(shí)間問題。
韓錚:對(duì),簡(jiǎn)單講是這樣。但里邊其實(shí)還有很多的核心工作,比如說你要做短技能串聯(lián)成長(zhǎng)技能,其實(shí)也是一個(gè)類似于像思維鏈的方法。思維鏈提出來大概在2023年的時(shí)候,我們其實(shí)也有同期的一個(gè)工作叫Chain of Thought Predictive Control,就是CoTPC,它其實(shí)就是專門處理短任務(wù)如何串聯(lián)成長(zhǎng)程任務(wù)的,類似于思維鏈的一個(gè)框架。

泓君:在商業(yè)化上,雖然我知道你可能還會(huì)有一個(gè)更遠(yuǎn)的夢(mèng)想,你會(huì)考慮在一些垂直的應(yīng)用場(chǎng)景開始去做一些商業(yè)化的部署嗎?
韓錚:我們認(rèn)為,各行各業(yè)會(huì)有成千上萬種的機(jī)器人應(yīng)用,我們一家公司做不完,應(yīng)該是由每個(gè)垂類的應(yīng)用最理解的這樣的一個(gè)團(tuán)隊(duì)去做推動(dòng)和參與。
我們的定位是做好基礎(chǔ)操作技能(比如抓?。雅帕薪M合的能力交給每一個(gè)開發(fā)者。他可能想要拿它做化妝品零食的分揀,也可以拿到工廠里邊去做零件的上下料組裝,也可以進(jìn)到家里邊收拾桌子做家務(wù)。
我們希望我們能夠做到的是一個(gè)底層基礎(chǔ)、短技能的穩(wěn)定可靠的基礎(chǔ)模型,提供好API,并且能夠把這些基礎(chǔ)技能拼成各種各樣不一樣的長(zhǎng)程任務(wù)。但它的要求就在于,大家有這樣的想法搭成類似大語言模型里邊的Agent,我們有一個(gè)新的描述叫“Adapt”。
泓君:對(duì),大家跟你買的是什么呢?買的是一個(gè)機(jī)器人的本體加上模型,加上API的調(diào)用次數(shù)嗎?
韓錚:簡(jiǎn)單來講,是本體加我們的軟件支持。上層的應(yīng)用實(shí)際上是開發(fā)者去做開發(fā),我們也可以幫大家二次分發(fā)。我們認(rèn)為機(jī)器人的商業(yè)模式更像是智能手機(jī),會(huì)有公司去提供一個(gè)像iPhone或者Android,它有一個(gè)硬件加一個(gè)操作系統(tǒng),它有完整的SDK,開發(fā)者就在上面去搭各種不一樣的應(yīng)用,可以貼牌,但更重要的是有人去做Uber,有人去做DoorDash,同時(shí)還有人會(huì)去做Instagram、小紅書,各種各樣的應(yīng)用。
泓君:如果說你們是一個(gè)Android操作系統(tǒng)的話,還說小了,因?yàn)槭謾C(jī)是可以自己制作的。但是我理解其實(shí)你們現(xiàn)在賣機(jī)器人整套的話,你是需要硬軟件一起賣的,因?yàn)闄C(jī)器人的硬件跟軟件是一個(gè)操作的整體,很難說它買一個(gè)軟件放在一個(gè)新的機(jī)器人上它能適配。
韓錚:對(duì),這其實(shí)可以回應(yīng)一下您提的前面的一個(gè)問題,就是說,Sim-to-Real中間的gap怎么搞,核心就是你的硬件和軟件要一起設(shè)計(jì)。包括我們仿真器里邊去仿的這臺(tái)機(jī)器人,有兩個(gè)要求:
第一個(gè)是仿真器里邊也不是萬能的,我們可能有一些構(gòu)型或者是某些組件和元件,現(xiàn)在還沒有辦法仿得特別特別好,或者是還沒有來得及去做處理,這時(shí)候我們?cè)谧鰴C(jī)器人硬件選型和構(gòu)型時(shí),要用仿真器支持比較好的方案去設(shè)計(jì)和搭建。
第二個(gè)就是硬件本身,它也有各種各樣差異和噪音,即便是我們自己,在設(shè)計(jì)同一款機(jī)器人的時(shí)候,每臺(tái)個(gè)體都有差異,同一臺(tái)機(jī)器在每一次上電的時(shí)候,它的表現(xiàn)其實(shí)也都不太一樣,這是不可能100%填平的。在仿真器里面要對(duì)這些噪音和差異做一定的仿真,但這個(gè)前提是不能差別太大。

蘇昊團(tuán)隊(duì)主導(dǎo)的Sapien/ManiSkill仿真器官方teaser圖|圖片來源:maniskill.ai
泓君:所以我理解Sim-to-Real的這條路徑,它一定要跟機(jī)器人的本體綁定在一起。
韓錚:對(duì),我們覺得是強(qiáng)綁定。在我們成立公司之前,我們做開源的Sapien和ManiSkill,包括像Isaac,大家都在強(qiáng)調(diào)說我可以支持各種不一樣的構(gòu)型。但我們想講,開源的這些方法,都是研究的方法,它極度地簡(jiǎn)化了。比如說機(jī)器人導(dǎo)入到仿真器里邊,用的URDF的格式,對(duì)于它的幾何動(dòng)力學(xué)約束都是做了一定的簡(jiǎn)化,它不太會(huì)考慮到像電機(jī)的控制里邊,它的噪聲、它響應(yīng)曲線的遲滯,包括每次上電的差別。在研究界大家還沒有辦法去考慮到這么多的細(xì)節(jié)。但要做一個(gè)能在開放世界里穩(wěn)定可靠、能真正解決Sim-to-Real差距的機(jī)器人,就必須把它當(dāng)成一個(gè)綜合系統(tǒng)來考慮。
泓君:所以靠跟硬件的整合,它是一條解決差距的路徑。還有其他的,比如說在軟件層面調(diào)控的解決路徑嗎?
韓錚:我覺得所有方法都要有機(jī)地結(jié)合在一起。比如說像數(shù)據(jù)的規(guī)模和它結(jié)構(gòu)化的規(guī)模,包括如何能夠把它的仿真效率拉得更高,比如說用不用真實(shí)世界的數(shù)據(jù)去做訓(xùn)練——我們的確也有。在仿真里邊,我們也會(huì)讓機(jī)器人觀察人做操作,看哪種方法更高效。
我還是拿這個(gè)瓶蓋舉例子,機(jī)器人的強(qiáng)化學(xué)習(xí),假如說是你要讓它把瓶蓋擰開,你會(huì)發(fā)現(xiàn)機(jī)器人一開始它可能碰的都不是瓶蓋,它可能會(huì)碰飲料瓶的標(biāo)簽或者是飲料瓶的底部,甚至往上稍微地推它一下。這些在早期強(qiáng)化學(xué)習(xí)探索里,是一些比較隨機(jī)的探索。但是你如果讓它看一段人的操作的話,它強(qiáng)化學(xué)習(xí)的效率會(huì)變高一些。這些其實(shí)都是在強(qiáng)化學(xué)習(xí)框架的設(shè)計(jì),特別是Model-Based RL,最難的其實(shí)就是在于這部分你怎么能夠給反饋,反饋設(shè)計(jì)得好,甚至是說怎么能夠把它批量自動(dòng)化。
泓君:而且我覺得,物理世界中機(jī)器人擰瓶蓋的難度,跟在仿真器里面的這個(gè)難度,是完全不一樣的,因?yàn)槟隳莻€(gè)手?jǐn)Q的不管是角度還是你控制的變量,它差幾毫米,區(qū)別就非常大。
韓錚:這其實(shí)是非常核心的一點(diǎn),仿真里的強(qiáng)化學(xué)習(xí)和Sim-to-Real,在波士頓動(dòng)力和宇樹這樣的人形機(jī)器人和四足狗的locomotion控制中,已經(jīng)得到了充分驗(yàn)證。英偉達(dá)的Isaac,里邊有一部分的強(qiáng)化學(xué)習(xí)引擎也是我們團(tuán)隊(duì)成員在早期貢獻(xiàn)的,大家都有些參與。但機(jī)器人對(duì)于物體去做操作,它這個(gè)難度要高兩到三個(gè)數(shù)量級(jí)。
因?yàn)槿绻阒皇切枰P(guān)注自身動(dòng)作的話,你其實(shí)不需要對(duì)世界有理解。你不需要知道這個(gè)物體的形狀,不需要知道它的材質(zhì),你也不需要知道我怎么能夠移動(dòng)到這個(gè)物體附近,并且在接觸到這個(gè)物體之后怎么去做適度的調(diào)整。
對(duì)于這個(gè)物體的操作而言,它的難度就在于,它首先要構(gòu)建一個(gè)結(jié)構(gòu)化的數(shù)據(jù),這個(gè)在locomotion比如說做姿態(tài)控制,實(shí)際上是并沒有這個(gè)問題,它只需要關(guān)注機(jī)器本身。第二,它其實(shí)對(duì)于環(huán)境的理解和所謂大家現(xiàn)在講World Model,其中有非常重要的一支就指的是機(jī)器人對(duì)于物理世界的理解和推理、預(yù)測(cè),這些其實(shí)它們也不太需要。

泓君:所以你們的機(jī)器人是真的理解物理世界嗎?還是它只是說數(shù)據(jù)訓(xùn)練得多,它不用管為什么,它就直接輸出就好了?
韓錚:我們的模型與另一派不同。比如Physical Intelligence主推的狹義VLA,是以模仿人類動(dòng)作為主的端到端模型。而我們的模型對(duì)物理世界的物體、環(huán)境及未來變化,是有強(qiáng)理解和強(qiáng)預(yù)測(cè)的,它并不是一個(gè)黑盒的模型。
泓君:你剛剛提到了你們不是一個(gè)黑盒模型。但是我理解,現(xiàn)在硅谷最火的這些公司像Physical Intelligence、Skild,它們做大腦,就是純做軟件層、模型層的這些公司,我理解它們還是在盡可能地去搭一個(gè)黑盒的模型,因?yàn)樗€是在遵循現(xiàn)在這一輪的生成式AI崛起的一個(gè)范式,就是說我堆的數(shù)據(jù)量越大,我的機(jī)器越智能,我未來賭的是一個(gè)通用跟開放場(chǎng)景智能的程度。
我之前也有跟一些做機(jī)器人的人聊,就是為什么白盒模型這么多年沒有起來,就是因?yàn)槿丝梢灶A(yù)測(cè)跟想到的情況是有窮盡的,同時(shí)你很難去解決很多場(chǎng)景的邊緣案例的問題。所以到底搭白盒還是搭黑盒,你們是怎么想的?以及未來的評(píng)估是怎么樣的?
韓錚:我們模型在預(yù)訓(xùn)練的過程中是有分層結(jié)構(gòu)的。預(yù)訓(xùn)練是大腦跟軟件的那一層。我們需要在預(yù)訓(xùn)練的時(shí)候讓機(jī)器人對(duì)未來它所在的環(huán)境,對(duì)物體和做操作的時(shí)候的預(yù)測(cè),是要有一定的推理和認(rèn)知的。但是最終在端側(cè)部署的時(shí)候,我們也是一個(gè)端到端的模型。
比如在仿真器里,機(jī)器人要知道物體的幾何位置,預(yù)估材質(zhì)和重量,分清瓶蓋和瓶身,操作時(shí)往哪個(gè)方向轉(zhuǎn)——這些都是有理解和推斷的,可以用隱式表達(dá)來描述。
但像硅谷和國(guó)內(nèi)絕大多數(shù)的機(jī)器人公司,在以模仿學(xué)習(xí)為主的這樣的一套思路,它其實(shí)是不太需要知道物體究竟在環(huán)境里邊它準(zhǔn)確的位置,也不太需要知道物體的幾何信息。它之所以這么接近和操作,只是因?yàn)槟莻€(gè)環(huán)境下,有人遙控過機(jī)器人或穿過動(dòng)捕服做過同樣的動(dòng)作——純粹是機(jī)械模仿,并沒有真正的理解。
泓君:所以你們?cè)诖罱ɡ斫獾倪@一部分?
韓錚:我們是需要在預(yù)訓(xùn)練的過程中是有理解的。但人類操作瓶子時(shí),腦子里并沒有"我要逆時(shí)針轉(zhuǎn)"的推理過程——這是常識(shí),已刻在肌肉記憶里了。
但假如說是小朋友第一次去擰飲料瓶子,他會(huì)左擰試一下,再右擰試一下,他是隨機(jī)的一個(gè)嘗試。但同時(shí),他又會(huì)去觀測(cè)父母是怎么去做操作的。他可能會(huì)有一些理論依據(jù)。
有些運(yùn)動(dòng)能力其實(shí)已經(jīng)刻在了人遺傳的基因里邊。比如小朋友出生之后長(zhǎng)大的過程中,他對(duì)于所有的物體都會(huì)去抓抓、咬咬、擰一擰、掰一掰。我們實(shí)際上是要把整個(gè)進(jìn)化的過程,在仿真器里邊再去復(fù)現(xiàn)一次。
泓君:你們會(huì)把人類的進(jìn)化過程在仿真器里面復(fù)現(xiàn)?這個(gè)太有意思了。
韓錚:當(dāng)時(shí)蘇昊給這個(gè)仿真器起名字叫“Sapien”,其實(shí)就是出自赫拉利《人類簡(jiǎn)史》,指的是智人從猿到人的進(jìn)化過程。但為什么我們選擇這個(gè)模型的進(jìn)化策略,核心原因就在于,機(jī)器人數(shù)據(jù)的構(gòu)建方式,跟自動(dòng)駕駛、2D圖片視頻、自然語言最大的不同,就是它沒有足夠多的數(shù)據(jù)。特斯拉十幾年以前就開始賣它的車,有幾百萬的司機(jī)買了它的車,在101的公路上面天天開。
泓君:所以它不一定要只遵循一個(gè)范式,我可以在數(shù)據(jù)不夠的情況下用白盒加黑盒的模式搭,等數(shù)據(jù)量夠了再去改變我的技術(shù)。
韓錚:對(duì),但是機(jī)器人你是很難同一款機(jī)器在沒有任何功能之前,賣500萬臺(tái)到各個(gè)辦公室、家庭或者是工廠里邊去,并且旁邊還有一個(gè)工人在遙控它。尤其是在家里面,我們很難想象我買了一臺(tái)機(jī)器人,我需要穿著一個(gè)動(dòng)捕服才能夠去做西紅柿炒雞蛋。
這就解釋了為什么英偉達(dá)一定要推Sim-to-Real——這條路躲不過去。機(jī)器人的冷啟動(dòng)數(shù)據(jù),需要百萬甚至千萬級(jí)別,而且要在所有開放環(huán)境里都收集全才行。
泓君:所以我理解這是你們用分層模型而不是硅谷主流的端到端的一個(gè)核心原因——在現(xiàn)有整個(gè)業(yè)界機(jī)器人數(shù)據(jù)都遠(yuǎn)遠(yuǎn)達(dá)不到的情況下,我們可以通過分層讓機(jī)器人先跑起來,先提高它在開放場(chǎng)景Zero-Shot的操作能力。然后你們的商業(yè)模式,比如說你現(xiàn)在是賣給很多開發(fā)者,當(dāng)大家都開始用這些機(jī)器人,其實(shí)后面你還要不要用一個(gè)新的方法去搭你的訓(xùn)練范式?是可以變的。
韓錚:對(duì),稍微分享一些我們自己認(rèn)為的一些小八卦。Physical Intelligence成立之前,核心團(tuán)隊(duì)其實(shí)都在Google Robotics,包括Generalist的成員,很多核心人員都參與過那里的工作。那個(gè)時(shí)候大家可能都是做端到端的模型。但再往前,當(dāng)時(shí)大家有一個(gè)默契,有可能是底層的模型有一個(gè)穩(wěn)定可靠的底層操作能力,再向上,去做環(huán)境理解,包括拆分成不一樣的任務(wù)。
但在大家2023年、2024年先后開始搞公司的時(shí)候,大家就選擇了自己擅長(zhǎng)和熟悉的套路,所以他們可能就不再提分層。但我們有一個(gè)暴論:可能從今年的下半年開始,上下分層的這種結(jié)構(gòu)會(huì)重新回到主流。而且可能在之后的商業(yè)化方案里,這可能是最終的一個(gè)方法。
泓君:你可不可以簡(jiǎn)單一句話總結(jié)一下,上下分層指的是哪個(gè)上下分層?
韓錚:比如說從冰箱里邊拿一個(gè)瓶子,把瓶蓋擰開,把我們倆面前的這兩杯水倒?jié)M。
上層實(shí)際上是說,我們現(xiàn)在杯子里邊沒有水了,我要去重新倒水。機(jī)器人要對(duì)我們現(xiàn)在所在的環(huán)境有理解,哪邊是冰箱,里邊有沒有水,我第一步應(yīng)該去走到這個(gè)冰箱面前,打開冰箱門,拿到這個(gè)瓶子,移動(dòng)到這邊,把瓶蓋擰開,并且朝兩個(gè)杯子里邊分別去注入一定的水,再把瓶蓋給擰上。這些是屬于我們叫拆分步驟、做推理的過程。
底層在我們的劃分里邊,就是操作的這一層,我如何走到冰箱面前,把門給打開,抓住這個(gè)瓶子,移動(dòng)到這邊,把瓶蓋擰開,往杯子里邊去倒水。這些底層的每一步具體對(duì)于物體的操作,我們叫底層操作。
泓君:所以你覺得今年所有的硅谷公司都開始會(huì)做這種分層操作?
韓錚:我覺得很難講今年,但是這個(gè)會(huì)回到大家的視野里邊來。我覺得在最近幾周的時(shí)間里,我們?cè)诟鷮W(xué)術(shù)界、工業(yè)界大家做現(xiàn)場(chǎng)展示和交流之后,有些人已經(jīng)意識(shí)到這可能是一個(gè)新的方向。
泓君:所以我理解現(xiàn)在硅谷的很多像我們說的Pi、Generalist這些公司,它還是在把操作的層面也是直接用大模型控制的?但是現(xiàn)在能做出這個(gè)判斷,證明現(xiàn)在的控制并沒有大家想象中那么好跟成功率那么高。
韓錚:我覺得是的,僅代表我自己個(gè)人,不一定是公司統(tǒng)一的想法。我覺得Physical Intelligence和Generalist、Google等等這些機(jī)器人公司,其實(shí)更擅長(zhǎng)做上層的推理。但是對(duì)于物體操作的話,靠少量的人類真實(shí)操作數(shù)據(jù)——幾十萬小時(shí)可能已是極限——遠(yuǎn)遠(yuǎn)達(dá)不到開放環(huán)境、開放物體的穩(wěn)定可靠操作。
泓君:我可不可以理解成,上層是硅谷公司的優(yōu)勢(shì),下層涉及到操作層面,因?yàn)槟憔鸵欢ㄒ布嘟Y(jié)合,這就是中國(guó)公司的優(yōu)勢(shì)?
韓錚:或者講硅谷的機(jī)器人公司也好、大廠也好,中國(guó)的模型大廠也好,大量的具身公司也好,做上層推理的機(jī)會(huì)更大一些。當(dāng)然還有很多具身和機(jī)器人的公司,它們挑某一到兩個(gè)垂直的應(yīng)用場(chǎng)景,可能就類似于像大模型,它就做一種或兩種的agent。
但是對(duì)于底層如何在隨機(jī)的環(huán)境里邊對(duì)于一個(gè)任意物體做某一類的操作,我們認(rèn)為必須是一個(gè)軟硬件強(qiáng)結(jié)合的公司才能夠達(dá)到。但這家公司是不是只有中國(guó)公司能做到?我覺得未必。

泓君:今年我看見最近有一個(gè)大熱點(diǎn)是Skild AI,它的估值是沖到了140億美元,它最新的一輪融資是14億美元,投后估值是140億到150億美元。7個(gè)月前它的估值才是45億美元。它其實(shí)就是做全身體的通用機(jī)器人的基礎(chǔ)模型Skild Brain。對(duì)比我們剛剛一直在講的Physical Intelligence,它也算是硅谷做軟件大腦的一個(gè)非常有代表性的公司,它的估值也是56億美元。你對(duì)這家公司熟悉嗎?為什么它一下能拿到這么大的一筆融資?
韓錚:估值的規(guī)模在大范圍地提升,我覺得首先Physical Intelligence如果我沒有記錯(cuò)的話,它最新的估值也是在120億到140億美金之間,不一定完全對(duì)外公開,但他們也在做新的募資。我覺得這幾家公司,包括Skild、Physical Intelligence、包括Generalist都比較接近,都做大腦。
Skild的話比較特殊一點(diǎn),兩位創(chuàng)始人Deepak和Abhinav其實(shí)跟蘇昊也做過很多的討論,他們以前是堅(jiān)決不信仿真的,但是在一開始募資的時(shí)候,他們是拿機(jī)器人仿真作為他們主要募資的方向,但實(shí)際上據(jù)我們了解,做的業(yè)務(wù)可能偏敏感一些。在美國(guó)做具身基礎(chǔ)模型的第一梯隊(duì),我覺得還是Physical Intelligence、Generalist這樣的團(tuán)隊(duì),以及還有一些創(chuàng)業(yè)的團(tuán)隊(duì),像華人的Sunday、像Dyna,都在做一些探索。
泓君:最近Figure AI好像又被看好了,之前它其實(shí)也是融資估值都很高。我覺得有一段時(shí)間整個(gè)硅谷的投資人,對(duì)Figure是有所質(zhì)疑的,甚至質(zhì)疑它放出來的demo是不是后期剪輯過。為什么最近大家又重新看好Figure了?
韓錚:最近大家對(duì)它關(guān)注是在大概幾周以前,它開始做一個(gè)產(chǎn)線里邊物體的分揀,直播了幾天。但在我們看,的確是比以前有一些進(jìn)步。但如果是按照我們要求的標(biāo)準(zhǔn),第一,它的物體泛化性其實(shí)不高,因?yàn)橐还仓挥袃深愇矬w,一個(gè)是盒子,一個(gè)是軟性的包裝,而且顏色和重量幾乎是一樣的。第二,它的機(jī)器人一直都在其公司內(nèi)部搭建的那條測(cè)試線上,并沒有走出去。
所以如果是拿遙操作做VLA這條方法的話,最大的約束和挑戰(zhàn)就在于它對(duì)于光照和環(huán)境的變化都極其的敏感,一旦變化了之后,它的成功率會(huì)直線地下降。

Figure 03機(jī)器人直播分揀快遞|圖片來源:Figure
泓君:我看見今年,有很多的機(jī)器人公司在進(jìn)入部署階段,比如說馬斯克就要把Optimus放到弗里蒙特的工廠,讓它在工廠里面去做一些工作。他說他現(xiàn)在放Optimus,主要也是為了訓(xùn)練數(shù)據(jù),而不是真正地讓它干活。從一個(gè)專業(yè)的同行業(yè)創(chuàng)業(yè)者的角度,你會(huì)怎么去看馬斯克的部署?
韓錚:在我們2025年主力團(tuán)隊(duì)搬回到國(guó)內(nèi)之前,其實(shí)我們跟特斯拉的自動(dòng)化團(tuán)隊(duì)有一些合作。當(dāng)時(shí)他們?cè)谧詣?dòng)化產(chǎn)線里邊使用的自動(dòng)化,肯定還沒有滿足讓機(jī)器人在里邊去做任務(wù)的條件。當(dāng)時(shí)只是去做一些,比如說在一個(gè)固定的位置當(dāng)中去拿電池這樣的動(dòng)作。
我覺得未來,Optimus肯定是美國(guó)的機(jī)器人行業(yè)里最大的推手,因?yàn)樗布暮诵暮椭圃炷芰Ψ浅?qiáng)。模型的話,我覺得按照Tesla和Elon Musk的風(fēng)格,可以等到這個(gè)行業(yè)有較為好的方案出現(xiàn)之后再去補(bǔ),可能也來得及。但同時(shí)我們當(dāng)時(shí)也聽到,Tesla里邊可能有一派的聲音是說,Elon他當(dāng)時(shí)提過,先造一系列的機(jī)器人,讓外界的人去做開發(fā)。
泓君:跟你們的思路有點(diǎn)像。
韓錚:我覺得有點(diǎn)像,但他的思路我覺得是跟現(xiàn)在很多做機(jī)器人硬件的團(tuán)隊(duì)更像——我不給你模型,我給你很好用的硬件,你自己去開發(fā)模型。但我們不僅給硬件,還提供大家不太好處理的底層能力。
泓君:然后我看今年波士頓動(dòng)力電動(dòng)版的Atlas也在開始出貨了,這個(gè)是一個(gè)值得關(guān)注的點(diǎn)嗎?
韓錚:我覺得這個(gè)特別值得關(guān)注。我們自己內(nèi)部定義的最大、最有潛力跟我們一起去推這個(gè)方向的,可能就是波士頓動(dòng)力的電動(dòng)版Atlas,加上Google的DeepMind。如果大家去年看Demis Hassabis的一些采訪,包括他的紀(jì)錄片,以及一系列動(dòng)作的話,我覺得Google可能是所有大廠里在物理世界AI上下注最堅(jiān)決的一家。
去年有一個(gè)非常重要的信號(hào):第一,他們已經(jīng)把硬件的平臺(tái)從原來的Apptronik和另外的一臺(tái)機(jī)器,換成了電動(dòng)版的Atlas;第二,DeepMind從波士頓動(dòng)力的硬件部門,把核心的幾個(gè)人都挖到了自己的團(tuán)隊(duì)里。所以未來機(jī)器人行業(yè)里邊,假如說我們走的是硬件也是自己造,軟件底層模型也是自己搞,那么Google會(huì)不會(huì)重走Android的路:用波士頓動(dòng)力的硬件,加上現(xiàn)代集團(tuán)的量產(chǎn)能力支持?同時(shí),他們幾年前就收購(gòu)了MuJoCo仿真器團(tuán)隊(duì),并在不斷改進(jìn)。
泓君:Google還有它自己的世界模型Genie 3這些。
韓錚:對(duì),它有幾乎無限的卡,世界上最好的人才聚集在一起,并且它是下了決心。相比于Anthropic、OpenAI、Meta、國(guó)內(nèi)的這些大廠,它可能是唯一一個(gè)帶團(tuán)隊(duì)的負(fù)責(zé)人在機(jī)器人上面如此用心的。我們感覺它是堅(jiān)定地相信Sim-to-Real這條路的。

Atlas電動(dòng)版|圖片來源:Boston Dynamics官方博客
泓君:我知道蘇昊的團(tuán)隊(duì)跟DeepMind也會(huì)有很多的交流,你們也是有合作。
韓錚:我們跟Google Robotics以前的交流合作非常多,甚至說那個(gè)團(tuán)隊(duì)里邊有很多都是蘇昊的師弟師妹,有一些核心人員是他曾經(jīng)PhD的學(xué)生,包括PI創(chuàng)始團(tuán)隊(duì)里邊的也有。但我覺得DeepMind的這波,它會(huì)把核心的人才聚集在英國(guó)倫敦,模型團(tuán)隊(duì)和硬件團(tuán)隊(duì)聚集在一起,這個(gè)事情我們覺得非常重要。就跟當(dāng)年Steve Jobs說做Apple開發(fā)的時(shí)候,有人問能不能去另外一個(gè)辦公室,能不能遠(yuǎn)程,他堅(jiān)決不同意,我覺得是一樣的。
泓君:所以在所有的機(jī)器人公司中,你們最看好的是DeepMind加波士頓動(dòng)力?
韓錚:對(duì),我覺得這可能跟大家想的都不太一樣。我覺得可能在接下來的兩到三年里邊,從機(jī)器人的操作能力和綜合能力上而言,我們認(rèn)為的最大競(jìng)爭(zhēng)對(duì)手可能是DeepMind+波士頓動(dòng)力。
泓君:我們?cè)僬f一下亞馬遜。去年年底,我聽All-In的播客,他們說其實(shí)有一家公司非常值得關(guān)注,就是亞馬遜。理由是亞馬遜馬上今年它的機(jī)器人的部署,可能已經(jīng)比它的員工還要多了。它們有倉(cāng)庫(kù)分揀,是一個(gè)天然的場(chǎng)景應(yīng)用方,而且它也收購(gòu)了Covariant。你會(huì)怎么看亞馬遜在機(jī)器人上的布局?
韓錚:我覺得亞馬遜一直是在機(jī)器人里邊投入最多的一家大公司。它在數(shù)量上還是以倉(cāng)儲(chǔ)物流為主,像做AGV(自動(dòng)導(dǎo)引運(yùn)輸車),像很早收購(gòu)的Kiva(現(xiàn)名AmazonRobotics,以其移動(dòng)機(jī)器人倉(cāng)儲(chǔ)系統(tǒng)聞名),包括各種機(jī)械臂的應(yīng)用,以及各種機(jī)器人公司,比如做人形的Agility、做操作模型的Covariant。之前可能還有一些其他的公司,都在里面去做嘗試。我覺得它會(huì)提供一定的場(chǎng)景,但亞馬遜最終要不然就是要把這些公司收購(gòu),要不然就要自己去做。Covariant也是當(dāng)時(shí)把亞馬遜作為核心的客戶之一。

泓君:剛剛在聊硅谷跟中國(guó)的這些機(jī)器人公司的發(fā)展過程中,我基本上還可以總結(jié)——整個(gè)硅谷它還是在更加看重機(jī)器人的通用性、泛化性,包括大腦層面上的這些進(jìn)展,因?yàn)槲覀兛吹绞袌?chǎng)上最高估值的公司全都是集中在這一塊;中國(guó)它有非常好的硬件的底子,但是同時(shí)我也看到很多的公司開始也抱著要去做機(jī)器人的通用性的這些想法,但是最后它因?yàn)橛猩虡I(yè)化的壓力,最后退回到了單一場(chǎng)景。你怎么去看這種理想很豐滿、最后大家回去做垂直賽道的現(xiàn)象?
韓錚:我的核心推斷還是跟前幾輪,比如說像做視覺大模型,比如像當(dāng)時(shí)的“AI四小龍”,包括后來做語言模型的科大訊飛等等類似。如果是對(duì)于基礎(chǔ)模型如何去構(gòu)建,沒有一個(gè)特別清晰的想法,只是想邊做邊試的話,我覺得其實(shí)很難,大家都會(huì)因?yàn)樯虡I(yè)上的一些壓力去做妥協(xié)。
我覺得是這個(gè)團(tuán)隊(duì)在過去七八年的合作里邊,已經(jīng)有了一些清晰的感覺和認(rèn)知,大家合作比如說12到24個(gè)月,就能夠看到第一階段的效果,我覺得這個(gè)比較關(guān)鍵。而并不是說——“我們把數(shù)據(jù)先做一些小模型,先試一下,試著把數(shù)據(jù)堆到一定程度,說不定就做出來了”。“說不定”這三個(gè)字,在我們團(tuán)隊(duì)里邊幾乎不太會(huì)出現(xiàn)。但是對(duì)于其他的團(tuán)隊(duì)而言,大家都是在探索,會(huì)受到自己團(tuán)隊(duì)內(nèi)部包括投資人和商業(yè)化的一些壓力,就會(huì)選擇一個(gè)垂類的場(chǎng)景??蛻籼岢鲂枨髸r(shí),往往與訓(xùn)練基礎(chǔ)模型的思路產(chǎn)生背離。
泓君:要做通用人工智能,它是一條更遠(yuǎn)更長(zhǎng)的路。在這個(gè)中間,怎么讓自己的公司活下來?你作為公司的CEO,你會(huì)有這個(gè)壓力存在嗎?
韓錚:肯定會(huì)有壓力,但相對(duì)而言還好一些。我覺得機(jī)器人在這一波趨勢(shì)里邊,由于大模型的出現(xiàn),包括infra的出現(xiàn),我們感覺會(huì)把它推到下一個(gè)階段。我們不會(huì)賭某一個(gè)垂類場(chǎng)景能夠跑出來,而是希望通過提供一個(gè)硬件加底層的模型,讓大家去試。
我們希望我們服務(wù)的1000個(gè)開發(fā)者里邊,有100個(gè)能夠找到小批量去做部署的應(yīng)用場(chǎng)景。這100個(gè)人里邊,可能會(huì)有5個(gè)、10個(gè)會(huì)做出超級(jí)應(yīng)用,他們可能會(huì)需要部署1萬臺(tái)甚至更多的機(jī)器人到不一樣的場(chǎng)景里去。
我們不會(huì)去賭某一個(gè)場(chǎng)景。因?yàn)槲覀儓F(tuán)隊(duì)的特質(zhì)也并不是說到工廠里邊去部署和集成測(cè)試。整個(gè)的開發(fā)者社區(qū)里邊,集成商和自動(dòng)化團(tuán)隊(duì)各有所長(zhǎng)。我們希望做底層的新的工具鏈給大家。
泓君:把更多的錢投入到你們更有長(zhǎng)遠(yuǎn)場(chǎng)景的研發(fā)上,還是說把一部分的精力也投入到比如說針對(duì)開發(fā)者的軟硬件一體的平臺(tái)分發(fā)上?你覺得哪一個(gè)是你現(xiàn)在在負(fù)責(zé)的重心?或者說你會(huì)怎么去做你的資源分配?
韓錚:我們的核心是在提供一個(gè)可靠穩(wěn)定的硬件加底層模型,從一個(gè)抓的技能到三到五個(gè)比較常見的技能,并且把它組合開發(fā)的工具做好,讓開發(fā)者能夠在上面去做不一樣的應(yīng)用嘗試。這是我們?cè)诂F(xiàn)在和接下來幾年的時(shí)間最核心的一個(gè)目標(biāo)。
但是為了驗(yàn)證大家可以拿它去做行業(yè)里面的垂類應(yīng)用,我們肯定也會(huì)挑一到兩個(gè)場(chǎng)景,跟一到兩個(gè)開發(fā)者緊密地配合,把我們的開發(fā)工具做好。
泓君:如果10年后回頭來看,你是希望蘇度科技被人記住的是說我們做出了一個(gè)通用機(jī)器人的產(chǎn)品,還是說我們證明了Sim-to-Real這條路是對(duì)的?
韓錚:我覺得驗(yàn)證Sim-to-Real這條路是對(duì)的,是一個(gè)副產(chǎn)物。我們希望10年以后,當(dāng)大家回看今天這個(gè)時(shí)間節(jié)點(diǎn)的時(shí)候,會(huì)認(rèn)為這可能是一個(gè)類似于iPhone加iOS操作系統(tǒng),那個(gè)時(shí)候會(huì)有新的Uber、滴滴、美團(tuán)長(zhǎng)出來。我們希望大家用的硬件加底層的系統(tǒng)和軟件,至少有一部分是我們提供的。
