久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

本文是《硅谷101》對(duì)蘇度科技CEO韓錚的訪談,聊具身智能技術(shù)路徑、全球競(jìng)爭(zhēng)與商業(yè)化方向,分享了蘇度Sim-to-Real路線的實(shí)踐成果。 ## 1. 蘇度科技的定位與核心積累 蘇度科技是全棧軟硬一體的具身智能機(jī)器人公司,走Sim-to-Real(仿真到現(xiàn)實(shí))技術(shù)路線,而非硅谷主流純黑盒大模型路線。 蘇度聯(lián)合創(chuàng)始人蘇昊是ImageNet核心作者,曾主導(dǎo)全球最大帶動(dòng)力學(xué)約束的開源3D數(shù)據(jù)集PartNet-Mobility,團(tuán)隊(duì)核心成員已合作七八年,積累了完整的復(fù)雜系統(tǒng)搭建方法論。 ## 2. Sim-to-Real路線的技術(shù)邏輯與實(shí)踐成果 Sim-to-Real是讓機(jī)器人在虛擬仿真中完成訓(xùn)練再遷移到現(xiàn)實(shí),為適配機(jī)器人操作需求,蘇度選擇遵循物理法則,犧牲分辨率,在單GPU上開百萬并行環(huán)境,平衡真實(shí)度與訓(xùn)練效率。 蘇度R1實(shí)現(xiàn)了行業(yè)首個(gè)Sim-to-Real路線零樣本開放世界通用抓取,對(duì)未見過的100+物體完成240次抓取,單次成功率達(dá)98%,首次失敗后經(jīng)閉環(huán)調(diào)整可實(shí)現(xiàn)100%成功率,已在ICRA、CVPR展會(huì)接受隨機(jī)物體現(xiàn)場(chǎng)測(cè)試驗(yàn)證。 蘇度采用上下分層架構(gòu)而非端到端黑盒:上層負(fù)責(zé)任務(wù)規(guī)劃與環(huán)境推理,下層負(fù)責(zé)具體物體操作,預(yù)訓(xùn)練階段讓機(jī)器人理解物理世界,最終部署為端到端模型,解決了機(jī)器人真實(shí)訓(xùn)練數(shù)據(jù)不足的痛點(diǎn)。 ## 3. 全球具身智能玩家的技術(shù)路徑分野 目前硅谷主流純黑盒端到端路線以模仿人類動(dòng)作為主,依賴真實(shí)采集數(shù)據(jù),難以支撐開放場(chǎng)景下任意物體操作,數(shù)據(jù)量最多僅數(shù)十萬小時(shí),無法滿足需求。 韓錚預(yù)測(cè),2024下半年開始上下分層架構(gòu)會(huì)重新回到行業(yè)主流;DeepMind+波士頓動(dòng)力是Sim-to-Real路線最具競(jìng)爭(zhēng)力的對(duì)手:谷歌堅(jiān)定押注該方向,擁有波士頓動(dòng)力硬件、MuJoCo仿真器、充足算力與頂尖人才。 特斯拉Optimus擁有極強(qiáng)硬件制造能力,思路類似蘇度,開放硬件給第三方開發(fā),但暫不提供底層操作模型;亞馬遜以倉(cāng)儲(chǔ)物流場(chǎng)景為核心,布局了大量機(jī)器人項(xiàng)目與公司;Figure、Physical Intelligence、Skild AI等硅谷明星公司側(cè)重上層推理與軟件大腦,底層操作能力仍待突破。 ## 4. 商業(yè)化定位與發(fā)展規(guī)劃 蘇度定位類似智能手機(jī)的硬件+操作系統(tǒng),提供穩(wěn)定可靠的底層操作基礎(chǔ)模型與軟硬件一體平臺(tái),開放API,由垂直開發(fā)者開發(fā)上層應(yīng)用,蘇度不直接賭單一場(chǎng)景。 蘇度當(dāng)前核心目標(biāo)是打磨硬件與底層操作技能,做好開發(fā)工具鏈,僅配合少量開發(fā)者驗(yàn)證場(chǎng)景,長(zhǎng)期目標(biāo)成為通用機(jī)器人時(shí)代的底層基礎(chǔ)平臺(tái)。
機(jī)器人走錯(cuò)路了?
2026-07-21 16:19

機(jī)器人走錯(cuò)路了?

本文來自微信公眾號(hào): 硅谷101 ,采訪:泓君,圖文:朱婕,原文標(biāo)題:《機(jī)器人走錯(cuò)路了?與蘇度韓錚聊聊具身智能的3D數(shù)據(jù)、路徑分野與硅谷競(jìng)賽》,頭圖來自:AI生成


2026世界人工智能大會(huì)(WAIC)上,成立不到一年的蘇度科技首次在國(guó)內(nèi)系統(tǒng)亮相,現(xiàn)場(chǎng)演示了10余項(xiàng)技能,覆蓋雙手操作、柔性體處理、精密組裝、移動(dòng)抓取,還有一個(gè)被視為具身智能下一階段關(guān)鍵方向的“彩蛋”:邊移動(dòng)邊操作。


讓機(jī)器人在真實(shí)世界操作物體,與單純的控制運(yùn)動(dòng)相比,難度陡然提升2到3個(gè)量級(jí),因?yàn)椤皠?dòng)手”之前,它需要理解眼前的物理世界。這正是蘇度科技想啃下的硬骨頭。蘇度科技聯(lián)合創(chuàng)始人、董事長(zhǎng)蘇昊是ImageNet的核心作者之一,師從李飛飛。這家公司走了一條與硅谷主流“純大腦黑盒大模型”不太一樣的路:軟硬件協(xié)同設(shè)計(jì),上下分層架構(gòu),上層負(fù)責(zé)任務(wù)規(guī)劃與環(huán)境理解,下層負(fù)責(zé)具體物體操作;Sim-to-Real作為核心訓(xùn)練范式,讓機(jī)器人在虛擬世界里經(jīng)歷幾百萬年的進(jìn)化,再遷移到現(xiàn)實(shí)。


這條路已經(jīng)跑出成效:在今年4月發(fā)布的Demo中,機(jī)器人零樣本通用抓取單次成功率達(dá)到98%。WAIC現(xiàn)場(chǎng)的10余項(xiàng)技能并非孤立開發(fā),它們共享同一套Sim2Real技術(shù)范式,底層跑通后,新技能的邊際成本會(huì)快速下降,最終形成一套可復(fù)用、可擴(kuò)展、能夠持續(xù)生成新能力的機(jī)器人系統(tǒng)。


本期《硅谷101》,我們邀請(qǐng)?zhí)K度科技聯(lián)合創(chuàng)始人兼CEO韓錚,一起聊聊機(jī)器人的3D數(shù)據(jù)從哪里來?Sim-to-Real這條路能不能走通?全球機(jī)器人競(jìng)賽,各大頭部玩家的技術(shù)路徑是什么,誰能真正的跑出來?韓錚預(yù)測(cè),接下來會(huì)有更多的硅谷公司重新回到“上下分層”的方向上來。而在硅谷眾多明星公司中,Deepmind+波士頓動(dòng)力的組合,可能是這條路上最值得關(guān)注的對(duì)手。


以下是這次對(duì)話內(nèi)容的精選:



泓君:我看你們現(xiàn)在做的機(jī)器人很火,我看見新聞消息說,投資人很難搶到你們的投資份額?,F(xiàn)在做機(jī)器人的公司非常多,我初步把它分成兩層,一層是造大腦的機(jī)器人,比如硅谷的PI、Skild;還有一層是造身體,像Optimus、宇樹。所以開始的時(shí)候,您要不要簡(jiǎn)單講一下蘇度科技的定位,你們做的是哪個(gè)環(huán)節(jié)?


韓錚:我們是大腦和本體都做,現(xiàn)在很多的機(jī)器人公司都在強(qiáng)調(diào)這一點(diǎn),就是要全棧,要做整個(gè)的系統(tǒng)。我們團(tuán)隊(duì)10年前就開始用機(jī)器學(xué)習(xí)方法驅(qū)動(dòng)機(jī)器人,當(dāng)時(shí)主要以軟件為主,做探索和嘗試。直到2022年,團(tuán)隊(duì)開始以商業(yè)化的方式來做準(zhǔn)備的時(shí)候,我們才開始正式地考慮自己來做硬件的本體。


因?yàn)槎嗄攴e累下來的經(jīng)驗(yàn)告訴我們,如果不碰本體,大腦的能力很難展現(xiàn)出來,也很難做迭代和驗(yàn)證。


SUDO R1機(jī)器人|圖片來源:蘇度科技


泓君:如果我們要類比一家硅谷的、大家現(xiàn)在已經(jīng)比較熟悉名字的這些機(jī)器人公司,你覺得你們做的這些環(huán)節(jié)跟哪一家機(jī)器人公司是更接近的?


韓錚:我覺得硅谷的機(jī)器人公司,不管是像Optimus,還是上一代的波士頓動(dòng)力,還是Figure、1X,其實(shí)都是本體+模型。不過這幾家公司在模型側(cè)的能力,比起Physical Intelligence、Skild,要稍弱一些,沒有那么專注。


泓君:我覺得我們要看每一家公司做機(jī)器人,它的思路有什么不一樣,可能要從它的整個(gè)歷史說起。我知道你的聯(lián)合創(chuàng)始人蘇昊,他是李飛飛的學(xué)生。李飛飛當(dāng)年成名之戰(zhàn)是ImageNet,她給上百萬的圖片做人工標(biāo)注,然后讓機(jī)器第一次看這個(gè)足夠多的世界。蘇昊他其實(shí)就是ImageNet的核心作者之一,后來他把這個(gè)思路搬到了3D。我覺得這個(gè)跟今天的蘇度整個(gè)的歷史也是一脈相承的。所以你可不可以簡(jiǎn)單跟大家介紹一下ImageNet,為什么它會(huì)成為整個(gè)AI爆發(fā)的一個(gè)導(dǎo)火索?


韓錚:蘇昊求學(xué)生涯里邊其實(shí)一共有兩個(gè)PhD,其中大概有將近4年時(shí)間的話,他是在李飛飛老師當(dāng)時(shí)在普林斯頓、后來在斯坦福的實(shí)驗(yàn)室里邊,核心的項(xiàng)目就像您講的,實(shí)際上是做ImageNet大的項(xiàng)目。他曾經(jīng)跟我講過,李飛飛對(duì)于整個(gè)ImageNet的推動(dòng)和架構(gòu)的話,實(shí)際上是非常有遠(yuǎn)見的。


ImageNet核心思想就是,用結(jié)構(gòu)化的方法,把世界上典型物體的2D圖片和對(duì)應(yīng)的文字描述配對(duì),進(jìn)行系統(tǒng)化的整理和復(fù)現(xiàn)。比如桌子上的杯子,我們需要一系列的典型圖片去描述世界上幾乎所有的杯子,但是同樣款式的杯子,我們一張或者兩張圖片可能就夠了。


這個(gè)思想在2012年、2013年,蘇昊跟隨第二個(gè)PhD導(dǎo)師Leo Guibas,在斯坦福的實(shí)驗(yàn)室的時(shí)候,把這套思想帶到了3D里邊來。所以他那個(gè)時(shí)候開始組建3D的大數(shù)據(jù)集ShapeNet。它最大最大的挑戰(zhàn)就在于,相比于ImageNet,你可以把互聯(lián)網(wǎng)上面幾乎所有的圖片和它下面的文字描述和標(biāo)題梳理清楚,并且以眾包的方法做標(biāo)注,但3D模型其實(shí)非常欠缺。


泓君:把這個(gè)思路搬到3D領(lǐng)域,就是我能想象,比如說你2D,要在圖片里面去識(shí)別這個(gè)杯子,我只需要一個(gè)標(biāo)簽。3D的話,它的標(biāo)注維度會(huì)大很多,你的文字標(biāo)注它怎么去解決這種空間的物理關(guān)系,甚至是力的反饋?我覺得這個(gè)事情聽起來要難很多。


韓錚:對(duì),這里邊的工作其實(shí)要復(fù)雜很多,所以愿意做3D大數(shù)據(jù)集的人相比于2D以及語言的大數(shù)據(jù)集的話,要少很多很多。在3D大數(shù)據(jù)集方面,我們有一系列的工作。第一個(gè)就是ShapeNet,是蘇昊在斯坦福期間的核心工作,現(xiàn)在做到了幾十萬的3D數(shù)據(jù)。但實(shí)際上還遠(yuǎn)遠(yuǎn)沒有達(dá)到像ImageNet能夠覆蓋世界上所有物體所有的模型。


這些3D模型,它只有基礎(chǔ)的幾何,和基礎(chǔ)的表面貼圖,我們大概能夠預(yù)估到它的這些物體的材質(zhì)。但再往下一步的話,同樣一個(gè)物體的話它可能會(huì)分不一樣的parts和組件,比如說一個(gè)飲料瓶子,會(huì)分成瓶身、瓶蓋……有的時(shí)候你甚至需要標(biāo)注哪個(gè)是它的瓶底。標(biāo)到PartNet的時(shí)候,就只有幾萬的物體了。


但再進(jìn)一步,比如說對(duì)于這個(gè)瓶子,它的瓶蓋究竟是往左擰還是往右擰,它擰動(dòng)之后能不能夠把它給擰下來,這個(gè)就叫動(dòng)力學(xué)約束的一些標(biāo)注,這個(gè)數(shù)據(jù)集叫PartNet-Mobility。到目前為止,如果我沒記錯(cuò)的話,它仍然是最大的帶部件、帶動(dòng)力學(xué)約束的開源數(shù)據(jù)集,但這里邊只有不到3000個(gè)物體帶有標(biāo)注的。這對(duì)像機(jī)器人合成數(shù)據(jù)的訓(xùn)練生成,像視頻生成里邊帶有連續(xù)的空間和物理一致性,都有很大的約束。


泓君:3D數(shù)據(jù)的收集,可能標(biāo)注是很費(fèi)時(shí)間成本的事情?,F(xiàn)在我們?cè)诳紤]大模型跟機(jī)器人的訓(xùn)練方法時(shí),比如說我讓它現(xiàn)在用ShapeNet的這一套開源數(shù)據(jù)集去訓(xùn)練,跟直接對(duì)著視頻網(wǎng)站成千上萬的開放世界的視頻去訓(xùn)練,它的核心區(qū)別點(diǎn)是什么呢?


韓錚:我覺得這個(gè)核心區(qū)別在我們看來,就是2D的圖片和視頻里邊,三維的信息有,但是不太全,也不太準(zhǔn)。如果你拿它用來做自動(dòng)駕駛導(dǎo)航,它對(duì)精度的要求沒有太高,有一個(gè)大概10公分左右的精度,是夠用的。但是對(duì)機(jī)器人的操作,10厘米的誤差是絕對(duì)不能忍受的。像我們面前的這個(gè)錄音機(jī),我們要把線纜插到對(duì)應(yīng)的孔位里邊去,它的要求必須是在亞毫米級(jí)以內(nèi)。對(duì)于我們做仿真(Sim-to-Real)的這條路,我們是要求機(jī)器人對(duì)于物理環(huán)境里邊的物體和環(huán)境、對(duì)于幾何有比較精準(zhǔn)的理解。它對(duì)幾何精度的理解,就要達(dá)到毫米級(jí),甚至亞毫米級(jí)才可以。



泓君:您覺得蘇昊在做整個(gè)ShapeNet以后,現(xiàn)在開始跟你們一起做蘇度機(jī)器人,在這個(gè)中間沉淀下來的最核心的資產(chǎn)是什么?


韓錚:走Sim-to-Real這條路,它有點(diǎn)像波音造飛機(jī),它是一個(gè)比較復(fù)雜的系統(tǒng)工程。所以怎么能夠把搭建這個(gè)復(fù)雜系統(tǒng)工程的團(tuán)隊(duì)建起來,我覺得這是我們團(tuán)隊(duì)最核心的積累。我們團(tuán)隊(duì)里邊的小伙伴們?cè)谔K昊的實(shí)驗(yàn)室以及我們成立公司之后,核心的這幾個(gè)大組的負(fù)責(zé)人其實(shí)都在一起工作過七八年的時(shí)間。人,還有過去做這些事情的經(jīng)驗(yàn)跟方法論,這個(gè)是無可比擬的優(yōu)勢(shì)。


包括數(shù)據(jù),比如說我們?cè)谧龇抡嫫?,其?shí)大家能夠想象到的市面上核心機(jī)器人的仿真器,不管是像Isaac、MuJoCo,甚至說新創(chuàng)的一些公司,都跟我們有千絲萬縷的聯(lián)系。


NVIDIA Isaac Sim將同一抓取任務(wù)在物理世界與仿真世界中并行呈現(xiàn)|圖片來源:NVIDIA


泓君:我先跟聽眾解釋一下Sim-to-Real,它的意思直譯就是“從仿真到現(xiàn)實(shí)”,它是讓機(jī)器人先在電腦模擬的虛擬世界中訓(xùn)練,練成之后把學(xué)到的這件事情“搬”到真機(jī)上,讓它在物理世界里面也能用。大家注意,重點(diǎn)不是說仿真這兩個(gè)字,而是“搬”的這個(gè)動(dòng)作,能不能直接把它搬到現(xiàn)實(shí)世界,還靈不靈?它是這條技術(shù)路徑上最大的一個(gè)難題。英偉達(dá)的Isaac仿真平臺(tái)就是這個(gè)路徑最大的推手之一。與它相對(duì)的另一條路徑,就是Real World Data這一派,直接用真實(shí)世界采集的數(shù)據(jù)來訓(xùn)練,比如說讓人手把手地教,然后機(jī)器照著學(xué)。


我記得蘇昊其實(shí)是非常早就在做跟機(jī)器人、跟3D數(shù)據(jù)集一系列的探索,那個(gè)是在什么時(shí)間?


韓錚:應(yīng)該是2012年、2013年。因?yàn)樵贗mageNet出來之后,他有一個(gè)想法,是要做一個(gè)類似于神經(jīng)網(wǎng)絡(luò)的架構(gòu),但當(dāng)時(shí)跟他配合的人沒有那么多。在ImageNet的挑戰(zhàn)賽AlexNet橫空出世之后,對(duì)他的沖擊我覺得是非常大的,他覺得自己可能是錯(cuò)過了非常重要的一個(gè)機(jī)會(huì)。所以他就思考,下一個(gè)大的領(lǐng)域會(huì)是什么?他想把大數(shù)據(jù)集加神經(jīng)網(wǎng)絡(luò)的方法帶到物理世界里邊來。在他拿到第一個(gè)PhD之后,在Leo Guibas教授組開始搭建新的3D學(xué)習(xí)的團(tuán)隊(duì)。


泓君:這個(gè)中間我覺得不管是機(jī)器人還是我們現(xiàn)在說的AI,它的技術(shù)已經(jīng)經(jīng)過了特別多輪的迭代了。在2012年、2013年那段時(shí)間,甚至更早的一段時(shí)間,大家覺得投資機(jī)器人都是不賺錢的,甚至是失敗的投資項(xiàng)目。那個(gè)時(shí)候其實(shí)硅谷有非常多好的機(jī)器人項(xiàng)目,像什么Covariant。


韓錚:我們?cè)趧?chuàng)業(yè)初期,也受到了上一波大家對(duì)于這個(gè)問題的影響。從2012年、2013年開始,到2015年、2016年,當(dāng)時(shí)應(yīng)該是我們叫安卓之父Andy Rubin加入谷歌之后,他負(fù)責(zé)了谷歌的X這個(gè)項(xiàng)目,當(dāng)時(shí)應(yīng)該收購(gòu)了非常多家機(jī)器人公司,最知名的可能就是波士頓動(dòng)力,后來又轉(zhuǎn)手過很多次。像您剛才提到的Vicarious、Intrinsic,現(xiàn)在還在谷歌里邊,Everyday Robots它的硬件部門已經(jīng)被關(guān)閉掉了。當(dāng)時(shí)那波,可能大家還是想用機(jī)器學(xué)習(xí)的方法往前推進(jìn),但當(dāng)時(shí)的要素我覺得可能還不是特別全。


在2022年,蘇昊想做機(jī)器人的底層操作模型公司的時(shí)候,我們當(dāng)時(shí)討論最多的一點(diǎn),是什么原因能夠促使大家覺得現(xiàn)在的機(jī)遇跟大概七八年以前明顯的不同。當(dāng)時(shí)我們決策的核心原因之一,就是DALL·E(OpenAI的文生圖模型)的出現(xiàn),它讓我們意識(shí)到,把2D升維到3D,實(shí)際上是有機(jī)會(huì)的。從一個(gè)樸素的想法來講,就是如果仿真器要重建整個(gè)世界的物體和環(huán)境,理論上是可行的了。


泓君:我們剛一直在提,你們?cè)谧逽im-to-Real的路線,你的Sim-to-Real的底層應(yīng)該是一個(gè)我理解現(xiàn)在可以說是世界模型,或者是3D的大模型。


韓錚:我覺得一定程度上是對(duì)的。其實(shí)仿真,在我們推動(dòng)Sapien和ManiSkill的時(shí)候,大概是2018年、2019年開始,比如飛行器和汽車制造里邊,我們要做流體力學(xué)仿真,機(jī)器人你要做機(jī)械包括力學(xué)的仿真,讓它跟真實(shí)的飛行器也好、車也好、機(jī)器人也好的話,盡可能地接近。


但新的機(jī)器人仿真器的設(shè)計(jì)思路就不太一樣,它并不需要我們?cè)诖笮蜋C(jī)器或大型集群里無限逼近真實(shí)環(huán)境;我們需要在一張GPU上面開出上萬、甚至上百萬個(gè)并行的環(huán)境,不需要讓它看起來非常地真實(shí),比如說它的分辨率其實(shí)非常非常低;它要求物理的一致性盡可能接近,但并不需要無限地接近——它一定是要在真實(shí)和效率之間做大量的取舍設(shè)計(jì)。


泓君:所以你們選擇了在這個(gè)仿真器里面更多地遵循整個(gè)世界底層的物理法則,犧牲觀賞性跟分辨率。


韓錚:對(duì),我們把經(jīng)典牛頓力學(xué),包括物理仿真中人類總結(jié)的大量公式都代入到仿真器里邊來,但同時(shí)我們又給它大量的開放世界3D的物體環(huán)境任務(wù)的數(shù)據(jù),讓機(jī)器人在里邊做強(qiáng)化學(xué)習(xí)。


泓君:對(duì),所以你們現(xiàn)在Sim-to-Real的這條路線,包括仿真器的設(shè)計(jì),我理解它所有的環(huán)境搭建都是為機(jī)器人服務(wù)的。機(jī)器人對(duì)一件事情的理解,你們可能是不局限于我要擰一個(gè)礦泉水的瓶蓋,而是說我想讓機(jī)器人做所有的、它能看見的現(xiàn)實(shí)世界中的環(huán)境它都能操作。我的理解是對(duì)的嗎?


韓錚:對(duì),簡(jiǎn)單來講,我們想把人類和整個(gè)生物對(duì)于環(huán)境的理解、交互、物體的操作,幾百萬年進(jìn)化的過程,放在仿真器里邊來,讓機(jī)器人再經(jīng)歷完整進(jìn)化的過程。


泓君:你覺得現(xiàn)在在機(jī)器人的訓(xùn)練中,是用極高質(zhì)量的數(shù)據(jù)更關(guān)鍵,還是說我需要用更大規(guī)模的數(shù)據(jù),但是這個(gè)數(shù)據(jù)的質(zhì)量可能沒有那么高。你怎么看這兩者之間的權(quán)衡?


韓錚:我覺得這是一個(gè)特別好的問題。我們也沒有標(biāo)準(zhǔn)答案,永遠(yuǎn)是在質(zhì)量和規(guī)模之間要取得平衡。但規(guī)模是要達(dá)到一定程度的。


我就有一個(gè)樸素的判斷,就是你要把世界上典型的物體、它們之間組合的環(huán)境和要去做的操作任務(wù),都有一個(gè)結(jié)構(gòu)化的描述。這幾乎在機(jī)器學(xué)習(xí)的歷史上,不管是2D視覺、自然語言,還是自動(dòng)駕駛領(lǐng)域,都沒有出現(xiàn)過。


在仿真器里邊,我們要搭建的結(jié)構(gòu)化數(shù)據(jù)集是非常關(guān)鍵的。但我們也清晰地知道,不太需要無限度地準(zhǔn)。比如說單個(gè)飲料瓶子,它材質(zhì)的具體描述,它的標(biāo)簽上的文字信息,需不需要100%地還原?其實(shí)是不需要的。但究竟怎么取得這樣的一個(gè)平衡,實(shí)際上每家可能都有不一樣的理解。


泓君:所以你們的數(shù)據(jù)集算是一個(gè)什么樣的質(zhì)量?


韓錚:我們對(duì)于結(jié)構(gòu)化的理解,可能是在所有的團(tuán)隊(duì)里面做得最好的。但另外一點(diǎn),我們也知道結(jié)構(gòu)化的下面,我們還應(yīng)該補(bǔ)哪些數(shù)據(jù)。比如說我們瓶子要怎么去擰,這些動(dòng)力學(xué)約束數(shù)據(jù),還是整個(gè)行業(yè)里邊最欠缺的。



泓君:機(jī)器人界有幾派爭(zhēng)議,一個(gè)就是Sim-to-Real的這一派,還有一個(gè)就是用Real World Data的這一派。質(zhì)疑Sim-to-Real的這一派就會(huì)認(rèn)為,我把仿真里面的東西放到現(xiàn)實(shí)世界中,它的效果可能沒有那么好。你們其實(shí)也有機(jī)器人的本體,然后也已經(jīng)開始操作了,可不可以講一下你們的執(zhí)行效果?


韓錚:真實(shí)世界數(shù)據(jù)采集的方法有很多種:比如機(jī)器人遙操作(Teleoperation),比如UMI這樣的動(dòng)捕設(shè)備——不管是用夾爪還是穿全身動(dòng)捕服。第三種是Ego的方法,就是大家經(jīng)常在講的第一人稱的數(shù)據(jù)。這些方法相較于Sim-to-Real,操作起來都會(huì)簡(jiǎn)單一些,但它很難保證某一類操作任務(wù)在開放世界的泛化性。


這個(gè)指的是什么呢?基礎(chǔ)模型的一般定義是:給它一個(gè)在預(yù)訓(xùn)練和后訓(xùn)練中都沒出現(xiàn)過的任意物體,它能不能以很高的成功率完成任務(wù)。


我們其實(shí)之前也稍微地提到了,就是這類的視頻和圖片,它對(duì)幾何的理解和精度可能不太夠。我們?cè)诜抡胬镞吅诵?,就是要重建這些物體和環(huán)境的3D Ground Truth的信息。但是如果規(guī)模不夠,其實(shí)是很難體現(xiàn)出Sim-to-Real的優(yōu)勢(shì)和能力的。


我們4月份放過一個(gè)結(jié)果,就是我們叫蘇度R1,它是去年底內(nèi)部的一個(gè)結(jié)果。在我們看來,這可能是整個(gè)機(jī)器人領(lǐng)域里,第一次用Sim-to-Real路線做到Zero-Shot、開放世界某一類任務(wù),把仿真到現(xiàn)實(shí)的差距填平。


這個(gè)視頻展示了連續(xù)一個(gè)小時(shí)的操作:我們?cè)嚵?00多個(gè)物體,操作了200多次。但這些物體其實(shí)都是在我們的訓(xùn)練數(shù)據(jù)里沒有出現(xiàn)過的,即使抓取失敗,我們也沒有補(bǔ)充后訓(xùn)練數(shù)據(jù)。所以它是一個(gè)對(duì)于物體通用的抓取,第一次可以做到零樣本高成功率的結(jié)果。我們會(huì)變換很多的光照、環(huán)境和物體。


到一個(gè)小時(shí)結(jié)束的時(shí)候,我們一共做了240次抓放的操作。單次抓放的成功率是將近98%。但是它第一次失敗之后,還會(huì)用一個(gè)閉環(huán)控制的方法,迅速地調(diào)整它的策略,就可以做到100%。


在這個(gè)結(jié)果發(fā)布之后,整個(gè)的研究社區(qū)里邊有一派的聲音就質(zhì)疑說:“你們肯定精心控制了變量,這些物體和環(huán)境是不是在訓(xùn)練里見過?”但事實(shí)上,我們完全沒有。


SUDO R1 60分鐘連續(xù)無剪輯實(shí)測(cè)|圖片來源:蘇度科技


泓君:我跟大家先簡(jiǎn)單解釋一下,因?yàn)榇蠹铱赡芸床坏竭@個(gè)視頻,你們第一次demo的畫面是一個(gè)機(jī)器人站在一個(gè)操作臺(tái)前,去抓不同的物體。這個(gè)物體包括像飲料的瓶子,還有小零食。這些物體,可能是橢圓形的,可能是錐形的,這就要求機(jī)器人的手要去抓不同的部位,它才能把它抓起來。這個(gè)視頻的時(shí)長(zhǎng)是60分鐘,你們是連續(xù)拍攝,沒有間斷,上面顯示一共是240次抓取。所以大家有質(zhì)疑是說你們可能是看過這些數(shù)據(jù),但其實(shí)是沒有。


韓錚:是的,所以我們當(dāng)時(shí)就決定要在公眾的面前給大家做一次展示。在6月初的時(shí)候,我們首先在維也納舉行的ICRA(國(guó)際機(jī)器人與自動(dòng)化會(huì)議)的大會(huì)上,我們把這臺(tái)機(jī)器人第一次帶到了研究者的面前,在幾天的會(huì)議里邊,可能有將近1000人來到我們的展臺(tái)前面,用他們自己各種各樣隨機(jī)的物體去做測(cè)試,比如說參會(huì)的證件、比如像手機(jī)、耳機(jī)、小玩偶。昨天我們其實(shí)也剛剛從CVPR(計(jì)算機(jī)視覺領(lǐng)域的三大頂級(jí)會(huì)議之一)的會(huì)場(chǎng)回來,我們也是搭建了一個(gè)展臺(tái),大家在一個(gè)非常隨機(jī)的環(huán)境之下去做測(cè)試。


在以前這種學(xué)術(shù)會(huì)議上,從來沒有人能夠做到這樣的展示。原因之一就在于,它幾乎沒有給你時(shí)間去做準(zhǔn)備。比如某家公司,它會(huì)在學(xué)術(shù)會(huì)議開始之前在旁邊租一個(gè)Airbnb,把自己的機(jī)器人放在那邊,去收集大量的數(shù)據(jù),可能要提前一個(gè)月進(jìn)場(chǎng),做好處理之后重復(fù)去展示,比如做咖啡的任務(wù)。


泓君:所以它是有針對(duì)單個(gè)場(chǎng)景去做適配跟練習(xí)的,你們沒有。


韓錚:我們是不需要的。只不過這兩者的區(qū)別之一就在于,我們更關(guān)注對(duì)于物體的基礎(chǔ)操作,比如說這種短的基礎(chǔ)操作的高頻動(dòng)作,也就是Zero-Shot一次性抓取成功的單個(gè)動(dòng)作。


泓君:我理解做咖啡的任務(wù)是一個(gè)連續(xù)動(dòng)作。


韓錚:對(duì),它相當(dāng)于讓人遙控這個(gè)機(jī)器人,把這個(gè)連續(xù)動(dòng)作,至少要出現(xiàn)過很多次。如果它換一個(gè)咖啡機(jī),或者是換一個(gè)環(huán)境的話,它的成功率肯定會(huì)要往下掉不少。這時(shí)候怎么辦?絕大多數(shù)機(jī)器人模型公司還得補(bǔ)充數(shù)據(jù)去做擬合。


泓君:做單個(gè)一次性抓取的任務(wù),跟做一個(gè)這種長(zhǎng)程任務(wù),就是復(fù)雜動(dòng)作的拆解,每一步都需要連續(xù)。你覺得這兩者之間哪個(gè)更難?


韓錚:我覺得如果是真正做機(jī)器人的、做操作的社區(qū)的話,肯定認(rèn)為Zero-Shot更加核心和關(guān)鍵。如果是你的短技能足夠的穩(wěn)定可靠,它的泛化性足夠高,你是可以把短技能拼成各種各樣的長(zhǎng)程操作的。這其實(shí)也就是ManiSkill整個(gè)核心框架大的思想。


WAIC大會(huì),蘇度科技展示了從強(qiáng)泛化抓取擴(kuò)展而來的10余項(xiàng)機(jī)器人技能,覆蓋雙手操作、柔性體處理、精密組裝、移動(dòng)抓取和多機(jī)協(xié)作等|圖片來源:蘇度科技


泓君:所以我理解其實(shí)最難的部分是開放世界,而不在于它是短還是長(zhǎng)。你只要在開放世界中短的能成功,那么連續(xù)長(zhǎng)程任務(wù)只是時(shí)間問題。


韓錚:對(duì),簡(jiǎn)單講是這樣。但里邊其實(shí)還有很多的核心工作,比如說你要做短技能串聯(lián)成長(zhǎng)技能,其實(shí)也是一個(gè)類似于像思維鏈的方法。思維鏈提出來大概在2023年的時(shí)候,我們其實(shí)也有同期的一個(gè)工作叫Chain of Thought Predictive Control,就是CoTPC,它其實(shí)就是專門處理短任務(wù)如何串聯(lián)成長(zhǎng)程任務(wù)的,類似于思維鏈的一個(gè)框架。



泓君:在商業(yè)化上,雖然我知道你可能還會(huì)有一個(gè)更遠(yuǎn)的夢(mèng)想,你會(huì)考慮在一些垂直的應(yīng)用場(chǎng)景開始去做一些商業(yè)化的部署嗎?


韓錚:我們認(rèn)為,各行各業(yè)會(huì)有成千上萬種的機(jī)器人應(yīng)用,我們一家公司做不完,應(yīng)該是由每個(gè)垂類的應(yīng)用最理解的這樣的一個(gè)團(tuán)隊(duì)去做推動(dòng)和參與。


我們的定位是做好基礎(chǔ)操作技能(比如抓?。雅帕薪M合的能力交給每一個(gè)開發(fā)者。他可能想要拿它做化妝品零食的分揀,也可以拿到工廠里邊去做零件的上下料組裝,也可以進(jìn)到家里邊收拾桌子做家務(wù)。


我們希望我們能夠做到的是一個(gè)底層基礎(chǔ)、短技能的穩(wěn)定可靠的基礎(chǔ)模型,提供好API,并且能夠把這些基礎(chǔ)技能拼成各種各樣不一樣的長(zhǎng)程任務(wù)。但它的要求就在于,大家有這樣的想法搭成類似大語言模型里邊的Agent,我們有一個(gè)新的描述叫“Adapt”。


泓君:對(duì),大家跟你買的是什么呢?買的是一個(gè)機(jī)器人的本體加上模型,加上API的調(diào)用次數(shù)嗎?


韓錚:簡(jiǎn)單來講,是本體加我們的軟件支持。上層的應(yīng)用實(shí)際上是開發(fā)者去做開發(fā),我們也可以幫大家二次分發(fā)。我們認(rèn)為機(jī)器人的商業(yè)模式更像是智能手機(jī),會(huì)有公司去提供一個(gè)像iPhone或者Android,它有一個(gè)硬件加一個(gè)操作系統(tǒng),它有完整的SDK,開發(fā)者就在上面去搭各種不一樣的應(yīng)用,可以貼牌,但更重要的是有人去做Uber,有人去做DoorDash,同時(shí)還有人會(huì)去做Instagram、小紅書,各種各樣的應(yīng)用。


泓君:如果說你們是一個(gè)Android操作系統(tǒng)的話,還說小了,因?yàn)槭謾C(jī)是可以自己制作的。但是我理解其實(shí)你們現(xiàn)在賣機(jī)器人整套的話,你是需要硬軟件一起賣的,因?yàn)闄C(jī)器人的硬件跟軟件是一個(gè)操作的整體,很難說它買一個(gè)軟件放在一個(gè)新的機(jī)器人上它能適配。


韓錚:對(duì),這其實(shí)可以回應(yīng)一下您提的前面的一個(gè)問題,就是說,Sim-to-Real中間的gap怎么搞,核心就是你的硬件和軟件要一起設(shè)計(jì)。包括我們仿真器里邊去仿的這臺(tái)機(jī)器人,有兩個(gè)要求:


第一個(gè)是仿真器里邊也不是萬能的,我們可能有一些構(gòu)型或者是某些組件和元件,現(xiàn)在還沒有辦法仿得特別特別好,或者是還沒有來得及去做處理,這時(shí)候我們?cè)谧鰴C(jī)器人硬件選型和構(gòu)型時(shí),要用仿真器支持比較好的方案去設(shè)計(jì)和搭建。


第二個(gè)就是硬件本身,它也有各種各樣差異和噪音,即便是我們自己,在設(shè)計(jì)同一款機(jī)器人的時(shí)候,每臺(tái)個(gè)體都有差異,同一臺(tái)機(jī)器在每一次上電的時(shí)候,它的表現(xiàn)其實(shí)也都不太一樣,這是不可能100%填平的。在仿真器里面要對(duì)這些噪音和差異做一定的仿真,但這個(gè)前提是不能差別太大。


蘇昊團(tuán)隊(duì)主導(dǎo)的Sapien/ManiSkill仿真器官方teaser圖|圖片來源:maniskill.ai


泓君:所以我理解Sim-to-Real的這條路徑,它一定要跟機(jī)器人的本體綁定在一起。


韓錚:對(duì),我們覺得是強(qiáng)綁定。在我們成立公司之前,我們做開源的Sapien和ManiSkill,包括像Isaac,大家都在強(qiáng)調(diào)說我可以支持各種不一樣的構(gòu)型。但我們想講,開源的這些方法,都是研究的方法,它極度地簡(jiǎn)化了。比如說機(jī)器人導(dǎo)入到仿真器里邊,用的URDF的格式,對(duì)于它的幾何動(dòng)力學(xué)約束都是做了一定的簡(jiǎn)化,它不太會(huì)考慮到像電機(jī)的控制里邊,它的噪聲、它響應(yīng)曲線的遲滯,包括每次上電的差別。在研究界大家還沒有辦法去考慮到這么多的細(xì)節(jié)。但要做一個(gè)能在開放世界里穩(wěn)定可靠、能真正解決Sim-to-Real差距的機(jī)器人,就必須把它當(dāng)成一個(gè)綜合系統(tǒng)來考慮。


泓君:所以靠跟硬件的整合,它是一條解決差距的路徑。還有其他的,比如說在軟件層面調(diào)控的解決路徑嗎?


韓錚:我覺得所有方法都要有機(jī)地結(jié)合在一起。比如說像數(shù)據(jù)的規(guī)模和它結(jié)構(gòu)化的規(guī)模,包括如何能夠把它的仿真效率拉得更高,比如說用不用真實(shí)世界的數(shù)據(jù)去做訓(xùn)練——我們的確也有。在仿真里邊,我們也會(huì)讓機(jī)器人觀察人做操作,看哪種方法更高效。


我還是拿這個(gè)瓶蓋舉例子,機(jī)器人的強(qiáng)化學(xué)習(xí),假如說是你要讓它把瓶蓋擰開,你會(huì)發(fā)現(xiàn)機(jī)器人一開始它可能碰的都不是瓶蓋,它可能會(huì)碰飲料瓶的標(biāo)簽或者是飲料瓶的底部,甚至往上稍微地推它一下。這些在早期強(qiáng)化學(xué)習(xí)探索里,是一些比較隨機(jī)的探索。但是你如果讓它看一段人的操作的話,它強(qiáng)化學(xué)習(xí)的效率會(huì)變高一些。這些其實(shí)都是在強(qiáng)化學(xué)習(xí)框架的設(shè)計(jì),特別是Model-Based RL,最難的其實(shí)就是在于這部分你怎么能夠給反饋,反饋設(shè)計(jì)得好,甚至是說怎么能夠把它批量自動(dòng)化。


泓君:而且我覺得,物理世界中機(jī)器人擰瓶蓋的難度,跟在仿真器里面的這個(gè)難度,是完全不一樣的,因?yàn)槟隳莻€(gè)手?jǐn)Q的不管是角度還是你控制的變量,它差幾毫米,區(qū)別就非常大。


韓錚:這其實(shí)是非常核心的一點(diǎn),仿真里的強(qiáng)化學(xué)習(xí)和Sim-to-Real,在波士頓動(dòng)力和宇樹這樣的人形機(jī)器人和四足狗的locomotion控制中,已經(jīng)得到了充分驗(yàn)證。英偉達(dá)的Isaac,里邊有一部分的強(qiáng)化學(xué)習(xí)引擎也是我們團(tuán)隊(duì)成員在早期貢獻(xiàn)的,大家都有些參與。但機(jī)器人對(duì)于物體去做操作,它這個(gè)難度要高兩到三個(gè)數(shù)量級(jí)。


因?yàn)槿绻阒皇切枰P(guān)注自身動(dòng)作的話,你其實(shí)不需要對(duì)世界有理解。你不需要知道這個(gè)物體的形狀,不需要知道它的材質(zhì),你也不需要知道我怎么能夠移動(dòng)到這個(gè)物體附近,并且在接觸到這個(gè)物體之后怎么去做適度的調(diào)整。


對(duì)于這個(gè)物體的操作而言,它的難度就在于,它首先要構(gòu)建一個(gè)結(jié)構(gòu)化的數(shù)據(jù),這個(gè)在locomotion比如說做姿態(tài)控制,實(shí)際上是并沒有這個(gè)問題,它只需要關(guān)注機(jī)器本身。第二,它其實(shí)對(duì)于環(huán)境的理解和所謂大家現(xiàn)在講World Model,其中有非常重要的一支就指的是機(jī)器人對(duì)于物理世界的理解和推理、預(yù)測(cè),這些其實(shí)它們也不太需要。



泓君:所以你們的機(jī)器人是真的理解物理世界嗎?還是它只是說數(shù)據(jù)訓(xùn)練得多,它不用管為什么,它就直接輸出就好了?


韓錚:我們的模型與另一派不同。比如Physical Intelligence主推的狹義VLA,是以模仿人類動(dòng)作為主的端到端模型。而我們的模型對(duì)物理世界的物體、環(huán)境及未來變化,是有強(qiáng)理解和強(qiáng)預(yù)測(cè)的,它并不是一個(gè)黑盒的模型。


泓君:你剛剛提到了你們不是一個(gè)黑盒模型。但是我理解,現(xiàn)在硅谷最火的這些公司像Physical Intelligence、Skild,它們做大腦,就是純做軟件層、模型層的這些公司,我理解它們還是在盡可能地去搭一個(gè)黑盒的模型,因?yàn)樗€是在遵循現(xiàn)在這一輪的生成式AI崛起的一個(gè)范式,就是說我堆的數(shù)據(jù)量越大,我的機(jī)器越智能,我未來賭的是一個(gè)通用跟開放場(chǎng)景智能的程度。


我之前也有跟一些做機(jī)器人的人聊,就是為什么白盒模型這么多年沒有起來,就是因?yàn)槿丝梢灶A(yù)測(cè)跟想到的情況是有窮盡的,同時(shí)你很難去解決很多場(chǎng)景的邊緣案例的問題。所以到底搭白盒還是搭黑盒,你們是怎么想的?以及未來的評(píng)估是怎么樣的?


韓錚:我們模型在預(yù)訓(xùn)練的過程中是有分層結(jié)構(gòu)的。預(yù)訓(xùn)練是大腦跟軟件的那一層。我們需要在預(yù)訓(xùn)練的時(shí)候讓機(jī)器人對(duì)未來它所在的環(huán)境,對(duì)物體和做操作的時(shí)候的預(yù)測(cè),是要有一定的推理和認(rèn)知的。但是最終在端側(cè)部署的時(shí)候,我們也是一個(gè)端到端的模型。


比如在仿真器里,機(jī)器人要知道物體的幾何位置,預(yù)估材質(zhì)和重量,分清瓶蓋和瓶身,操作時(shí)往哪個(gè)方向轉(zhuǎn)——這些都是有理解和推斷的,可以用隱式表達(dá)來描述。


但像硅谷和國(guó)內(nèi)絕大多數(shù)的機(jī)器人公司,在以模仿學(xué)習(xí)為主的這樣的一套思路,它其實(shí)是不太需要知道物體究竟在環(huán)境里邊它準(zhǔn)確的位置,也不太需要知道物體的幾何信息。它之所以這么接近和操作,只是因?yàn)槟莻€(gè)環(huán)境下,有人遙控過機(jī)器人或穿過動(dòng)捕服做過同樣的動(dòng)作——純粹是機(jī)械模仿,并沒有真正的理解。


泓君:所以你們?cè)诖罱ɡ斫獾倪@一部分?


韓錚:我們是需要在預(yù)訓(xùn)練的過程中是有理解的。但人類操作瓶子時(shí),腦子里并沒有"我要逆時(shí)針轉(zhuǎn)"的推理過程——這是常識(shí),已刻在肌肉記憶里了。


但假如說是小朋友第一次去擰飲料瓶子,他會(huì)左擰試一下,再右擰試一下,他是隨機(jī)的一個(gè)嘗試。但同時(shí),他又會(huì)去觀測(cè)父母是怎么去做操作的。他可能會(huì)有一些理論依據(jù)。


有些運(yùn)動(dòng)能力其實(shí)已經(jīng)刻在了人遺傳的基因里邊。比如小朋友出生之后長(zhǎng)大的過程中,他對(duì)于所有的物體都會(huì)去抓抓、咬咬、擰一擰、掰一掰。我們實(shí)際上是要把整個(gè)進(jìn)化的過程,在仿真器里邊再去復(fù)現(xiàn)一次。


泓君:你們會(huì)把人類的進(jìn)化過程在仿真器里面復(fù)現(xiàn)?這個(gè)太有意思了。


韓錚:當(dāng)時(shí)蘇昊給這個(gè)仿真器起名字叫“Sapien”,其實(shí)就是出自赫拉利《人類簡(jiǎn)史》,指的是智人從猿到人的進(jìn)化過程。但為什么我們選擇這個(gè)模型的進(jìn)化策略,核心原因就在于,機(jī)器人數(shù)據(jù)的構(gòu)建方式,跟自動(dòng)駕駛、2D圖片視頻、自然語言最大的不同,就是它沒有足夠多的數(shù)據(jù)。特斯拉十幾年以前就開始賣它的車,有幾百萬的司機(jī)買了它的車,在101的公路上面天天開。


泓君:所以它不一定要只遵循一個(gè)范式,我可以在數(shù)據(jù)不夠的情況下用白盒加黑盒的模式搭,等數(shù)據(jù)量夠了再去改變我的技術(shù)。


韓錚:對(duì),但是機(jī)器人你是很難同一款機(jī)器在沒有任何功能之前,賣500萬臺(tái)到各個(gè)辦公室、家庭或者是工廠里邊去,并且旁邊還有一個(gè)工人在遙控它。尤其是在家里面,我們很難想象我買了一臺(tái)機(jī)器人,我需要穿著一個(gè)動(dòng)捕服才能夠去做西紅柿炒雞蛋。


這就解釋了為什么英偉達(dá)一定要推Sim-to-Real——這條路躲不過去。機(jī)器人的冷啟動(dòng)數(shù)據(jù),需要百萬甚至千萬級(jí)別,而且要在所有開放環(huán)境里都收集全才行。


泓君:所以我理解這是你們用分層模型而不是硅谷主流的端到端的一個(gè)核心原因——在現(xiàn)有整個(gè)業(yè)界機(jī)器人數(shù)據(jù)都遠(yuǎn)遠(yuǎn)達(dá)不到的情況下,我們可以通過分層讓機(jī)器人先跑起來,先提高它在開放場(chǎng)景Zero-Shot的操作能力。然后你們的商業(yè)模式,比如說你現(xiàn)在是賣給很多開發(fā)者,當(dāng)大家都開始用這些機(jī)器人,其實(shí)后面你還要不要用一個(gè)新的方法去搭你的訓(xùn)練范式?是可以變的。


韓錚:對(duì),稍微分享一些我們自己認(rèn)為的一些小八卦。Physical Intelligence成立之前,核心團(tuán)隊(duì)其實(shí)都在Google Robotics,包括Generalist的成員,很多核心人員都參與過那里的工作。那個(gè)時(shí)候大家可能都是做端到端的模型。但再往前,當(dāng)時(shí)大家有一個(gè)默契,有可能是底層的模型有一個(gè)穩(wěn)定可靠的底層操作能力,再向上,去做環(huán)境理解,包括拆分成不一樣的任務(wù)。


但在大家2023年、2024年先后開始搞公司的時(shí)候,大家就選擇了自己擅長(zhǎng)和熟悉的套路,所以他們可能就不再提分層。但我們有一個(gè)暴論:可能從今年的下半年開始,上下分層的這種結(jié)構(gòu)會(huì)重新回到主流。而且可能在之后的商業(yè)化方案里,這可能是最終的一個(gè)方法。


泓君:你可不可以簡(jiǎn)單一句話總結(jié)一下,上下分層指的是哪個(gè)上下分層?


韓錚:比如說從冰箱里邊拿一個(gè)瓶子,把瓶蓋擰開,把我們倆面前的這兩杯水倒?jié)M。


上層實(shí)際上是說,我們現(xiàn)在杯子里邊沒有水了,我要去重新倒水。機(jī)器人要對(duì)我們現(xiàn)在所在的環(huán)境有理解,哪邊是冰箱,里邊有沒有水,我第一步應(yīng)該去走到這個(gè)冰箱面前,打開冰箱門,拿到這個(gè)瓶子,移動(dòng)到這邊,把瓶蓋擰開,并且朝兩個(gè)杯子里邊分別去注入一定的水,再把瓶蓋給擰上。這些是屬于我們叫拆分步驟、做推理的過程。


底層在我們的劃分里邊,就是操作的這一層,我如何走到冰箱面前,把門給打開,抓住這個(gè)瓶子,移動(dòng)到這邊,把瓶蓋擰開,往杯子里邊去倒水。這些底層的每一步具體對(duì)于物體的操作,我們叫底層操作。


泓君:所以你覺得今年所有的硅谷公司都開始會(huì)做這種分層操作?


韓錚:我覺得很難講今年,但是這個(gè)會(huì)回到大家的視野里邊來。我覺得在最近幾周的時(shí)間里,我們?cè)诟鷮W(xué)術(shù)界、工業(yè)界大家做現(xiàn)場(chǎng)展示和交流之后,有些人已經(jīng)意識(shí)到這可能是一個(gè)新的方向。


泓君:所以我理解現(xiàn)在硅谷的很多像我們說的Pi、Generalist這些公司,它還是在把操作的層面也是直接用大模型控制的?但是現(xiàn)在能做出這個(gè)判斷,證明現(xiàn)在的控制并沒有大家想象中那么好跟成功率那么高。


韓錚:我覺得是的,僅代表我自己個(gè)人,不一定是公司統(tǒng)一的想法。我覺得Physical Intelligence和Generalist、Google等等這些機(jī)器人公司,其實(shí)更擅長(zhǎng)做上層的推理。但是對(duì)于物體操作的話,靠少量的人類真實(shí)操作數(shù)據(jù)——幾十萬小時(shí)可能已是極限——遠(yuǎn)遠(yuǎn)達(dá)不到開放環(huán)境、開放物體的穩(wěn)定可靠操作。


泓君:我可不可以理解成,上層是硅谷公司的優(yōu)勢(shì),下層涉及到操作層面,因?yàn)槟憔鸵欢ㄒ布嘟Y(jié)合,這就是中國(guó)公司的優(yōu)勢(shì)?


韓錚:或者講硅谷的機(jī)器人公司也好、大廠也好,中國(guó)的模型大廠也好,大量的具身公司也好,做上層推理的機(jī)會(huì)更大一些。當(dāng)然還有很多具身和機(jī)器人的公司,它們挑某一到兩個(gè)垂直的應(yīng)用場(chǎng)景,可能就類似于像大模型,它就做一種或兩種的agent。


但是對(duì)于底層如何在隨機(jī)的環(huán)境里邊對(duì)于一個(gè)任意物體做某一類的操作,我們認(rèn)為必須是一個(gè)軟硬件強(qiáng)結(jié)合的公司才能夠達(dá)到。但這家公司是不是只有中國(guó)公司能做到?我覺得未必。



泓君:今年我看見最近有一個(gè)大熱點(diǎn)是Skild AI,它的估值是沖到了140億美元,它最新的一輪融資是14億美元,投后估值是140億到150億美元。7個(gè)月前它的估值才是45億美元。它其實(shí)就是做全身體的通用機(jī)器人的基礎(chǔ)模型Skild Brain。對(duì)比我們剛剛一直在講的Physical Intelligence,它也算是硅谷做軟件大腦的一個(gè)非常有代表性的公司,它的估值也是56億美元。你對(duì)這家公司熟悉嗎?為什么它一下能拿到這么大的一筆融資?


韓錚:估值的規(guī)模在大范圍地提升,我覺得首先Physical Intelligence如果我沒有記錯(cuò)的話,它最新的估值也是在120億到140億美金之間,不一定完全對(duì)外公開,但他們也在做新的募資。我覺得這幾家公司,包括Skild、Physical Intelligence、包括Generalist都比較接近,都做大腦。


Skild的話比較特殊一點(diǎn),兩位創(chuàng)始人Deepak和Abhinav其實(shí)跟蘇昊也做過很多的討論,他們以前是堅(jiān)決不信仿真的,但是在一開始募資的時(shí)候,他們是拿機(jī)器人仿真作為他們主要募資的方向,但實(shí)際上據(jù)我們了解,做的業(yè)務(wù)可能偏敏感一些。在美國(guó)做具身基礎(chǔ)模型的第一梯隊(duì),我覺得還是Physical Intelligence、Generalist這樣的團(tuán)隊(duì),以及還有一些創(chuàng)業(yè)的團(tuán)隊(duì),像華人的Sunday、像Dyna,都在做一些探索。


泓君:最近Figure AI好像又被看好了,之前它其實(shí)也是融資估值都很高。我覺得有一段時(shí)間整個(gè)硅谷的投資人,對(duì)Figure是有所質(zhì)疑的,甚至質(zhì)疑它放出來的demo是不是后期剪輯過。為什么最近大家又重新看好Figure了?


韓錚:最近大家對(duì)它關(guān)注是在大概幾周以前,它開始做一個(gè)產(chǎn)線里邊物體的分揀,直播了幾天。但在我們看,的確是比以前有一些進(jìn)步。但如果是按照我們要求的標(biāo)準(zhǔn),第一,它的物體泛化性其實(shí)不高,因?yàn)橐还仓挥袃深愇矬w,一個(gè)是盒子,一個(gè)是軟性的包裝,而且顏色和重量幾乎是一樣的。第二,它的機(jī)器人一直都在其公司內(nèi)部搭建的那條測(cè)試線上,并沒有走出去。


所以如果是拿遙操作做VLA這條方法的話,最大的約束和挑戰(zhàn)就在于它對(duì)于光照和環(huán)境的變化都極其的敏感,一旦變化了之后,它的成功率會(huì)直線地下降。


Figure 03機(jī)器人直播分揀快遞|圖片來源:Figure


泓君:我看見今年,有很多的機(jī)器人公司在進(jìn)入部署階段,比如說馬斯克就要把Optimus放到弗里蒙特的工廠,讓它在工廠里面去做一些工作。他說他現(xiàn)在放Optimus,主要也是為了訓(xùn)練數(shù)據(jù),而不是真正地讓它干活。從一個(gè)專業(yè)的同行業(yè)創(chuàng)業(yè)者的角度,你會(huì)怎么去看馬斯克的部署?


韓錚:在我們2025年主力團(tuán)隊(duì)搬回到國(guó)內(nèi)之前,其實(shí)我們跟特斯拉的自動(dòng)化團(tuán)隊(duì)有一些合作。當(dāng)時(shí)他們?cè)谧詣?dòng)化產(chǎn)線里邊使用的自動(dòng)化,肯定還沒有滿足讓機(jī)器人在里邊去做任務(wù)的條件。當(dāng)時(shí)只是去做一些,比如說在一個(gè)固定的位置當(dāng)中去拿電池這樣的動(dòng)作。


我覺得未來,Optimus肯定是美國(guó)的機(jī)器人行業(yè)里最大的推手,因?yàn)樗布暮诵暮椭圃炷芰Ψ浅?qiáng)。模型的話,我覺得按照Tesla和Elon Musk的風(fēng)格,可以等到這個(gè)行業(yè)有較為好的方案出現(xiàn)之后再去補(bǔ),可能也來得及。但同時(shí)我們當(dāng)時(shí)也聽到,Tesla里邊可能有一派的聲音是說,Elon他當(dāng)時(shí)提過,先造一系列的機(jī)器人,讓外界的人去做開發(fā)。


泓君:跟你們的思路有點(diǎn)像。


韓錚:我覺得有點(diǎn)像,但他的思路我覺得是跟現(xiàn)在很多做機(jī)器人硬件的團(tuán)隊(duì)更像——我不給你模型,我給你很好用的硬件,你自己去開發(fā)模型。但我們不僅給硬件,還提供大家不太好處理的底層能力。


泓君:然后我看今年波士頓動(dòng)力電動(dòng)版的Atlas也在開始出貨了,這個(gè)是一個(gè)值得關(guān)注的點(diǎn)嗎?


韓錚:我覺得這個(gè)特別值得關(guān)注。我們自己內(nèi)部定義的最大、最有潛力跟我們一起去推這個(gè)方向的,可能就是波士頓動(dòng)力的電動(dòng)版Atlas,加上Google的DeepMind。如果大家去年看Demis Hassabis的一些采訪,包括他的紀(jì)錄片,以及一系列動(dòng)作的話,我覺得Google可能是所有大廠里在物理世界AI上下注最堅(jiān)決的一家。


去年有一個(gè)非常重要的信號(hào):第一,他們已經(jīng)把硬件的平臺(tái)從原來的Apptronik和另外的一臺(tái)機(jī)器,換成了電動(dòng)版的Atlas;第二,DeepMind從波士頓動(dòng)力的硬件部門,把核心的幾個(gè)人都挖到了自己的團(tuán)隊(duì)里。所以未來機(jī)器人行業(yè)里邊,假如說我們走的是硬件也是自己造,軟件底層模型也是自己搞,那么Google會(huì)不會(huì)重走Android的路:用波士頓動(dòng)力的硬件,加上現(xiàn)代集團(tuán)的量產(chǎn)能力支持?同時(shí),他們幾年前就收購(gòu)了MuJoCo仿真器團(tuán)隊(duì),并在不斷改進(jìn)。


泓君:Google還有它自己的世界模型Genie 3這些。


韓錚:對(duì),它有幾乎無限的卡,世界上最好的人才聚集在一起,并且它是下了決心。相比于Anthropic、OpenAI、Meta、國(guó)內(nèi)的這些大廠,它可能是唯一一個(gè)帶團(tuán)隊(duì)的負(fù)責(zé)人在機(jī)器人上面如此用心的。我們感覺它是堅(jiān)定地相信Sim-to-Real這條路的。


Atlas電動(dòng)版|圖片來源:Boston Dynamics官方博客


泓君:我知道蘇昊的團(tuán)隊(duì)跟DeepMind也會(huì)有很多的交流,你們也是有合作。


韓錚:我們跟Google Robotics以前的交流合作非常多,甚至說那個(gè)團(tuán)隊(duì)里邊有很多都是蘇昊的師弟師妹,有一些核心人員是他曾經(jīng)PhD的學(xué)生,包括PI創(chuàng)始團(tuán)隊(duì)里邊的也有。但我覺得DeepMind的這波,它會(huì)把核心的人才聚集在英國(guó)倫敦,模型團(tuán)隊(duì)和硬件團(tuán)隊(duì)聚集在一起,這個(gè)事情我們覺得非常重要。就跟當(dāng)年Steve Jobs說做Apple開發(fā)的時(shí)候,有人問能不能去另外一個(gè)辦公室,能不能遠(yuǎn)程,他堅(jiān)決不同意,我覺得是一樣的。


泓君:所以在所有的機(jī)器人公司中,你們最看好的是DeepMind加波士頓動(dòng)力?


韓錚:對(duì),我覺得這可能跟大家想的都不太一樣。我覺得可能在接下來的兩到三年里邊,從機(jī)器人的操作能力和綜合能力上而言,我們認(rèn)為的最大競(jìng)爭(zhēng)對(duì)手可能是DeepMind+波士頓動(dòng)力。


泓君:我們?cè)僬f一下亞馬遜。去年年底,我聽All-In的播客,他們說其實(shí)有一家公司非常值得關(guān)注,就是亞馬遜。理由是亞馬遜馬上今年它的機(jī)器人的部署,可能已經(jīng)比它的員工還要多了。它們有倉(cāng)庫(kù)分揀,是一個(gè)天然的場(chǎng)景應(yīng)用方,而且它也收購(gòu)了Covariant。你會(huì)怎么看亞馬遜在機(jī)器人上的布局?


韓錚:我覺得亞馬遜一直是在機(jī)器人里邊投入最多的一家大公司。它在數(shù)量上還是以倉(cāng)儲(chǔ)物流為主,像做AGV(自動(dòng)導(dǎo)引運(yùn)輸車),像很早收購(gòu)的Kiva(現(xiàn)名AmazonRobotics,以其移動(dòng)機(jī)器人倉(cāng)儲(chǔ)系統(tǒng)聞名),包括各種機(jī)械臂的應(yīng)用,以及各種機(jī)器人公司,比如做人形的Agility、做操作模型的Covariant。之前可能還有一些其他的公司,都在里面去做嘗試。我覺得它會(huì)提供一定的場(chǎng)景,但亞馬遜最終要不然就是要把這些公司收購(gòu),要不然就要自己去做。Covariant也是當(dāng)時(shí)把亞馬遜作為核心的客戶之一。



泓君:剛剛在聊硅谷跟中國(guó)的這些機(jī)器人公司的發(fā)展過程中,我基本上還可以總結(jié)——整個(gè)硅谷它還是在更加看重機(jī)器人的通用性、泛化性,包括大腦層面上的這些進(jìn)展,因?yàn)槲覀兛吹绞袌?chǎng)上最高估值的公司全都是集中在這一塊;中國(guó)它有非常好的硬件的底子,但是同時(shí)我也看到很多的公司開始也抱著要去做機(jī)器人的通用性的這些想法,但是最后它因?yàn)橛猩虡I(yè)化的壓力,最后退回到了單一場(chǎng)景。你怎么去看這種理想很豐滿、最后大家回去做垂直賽道的現(xiàn)象?


韓錚:我的核心推斷還是跟前幾輪,比如說像做視覺大模型,比如像當(dāng)時(shí)的“AI四小龍”,包括后來做語言模型的科大訊飛等等類似。如果是對(duì)于基礎(chǔ)模型如何去構(gòu)建,沒有一個(gè)特別清晰的想法,只是想邊做邊試的話,我覺得其實(shí)很難,大家都會(huì)因?yàn)樯虡I(yè)上的一些壓力去做妥協(xié)。


我覺得是這個(gè)團(tuán)隊(duì)在過去七八年的合作里邊,已經(jīng)有了一些清晰的感覺和認(rèn)知,大家合作比如說12到24個(gè)月,就能夠看到第一階段的效果,我覺得這個(gè)比較關(guān)鍵。而并不是說——“我們把數(shù)據(jù)先做一些小模型,先試一下,試著把數(shù)據(jù)堆到一定程度,說不定就做出來了”。“說不定”這三個(gè)字,在我們團(tuán)隊(duì)里邊幾乎不太會(huì)出現(xiàn)。但是對(duì)于其他的團(tuán)隊(duì)而言,大家都是在探索,會(huì)受到自己團(tuán)隊(duì)內(nèi)部包括投資人和商業(yè)化的一些壓力,就會(huì)選擇一個(gè)垂類的場(chǎng)景??蛻籼岢鲂枨髸r(shí),往往與訓(xùn)練基礎(chǔ)模型的思路產(chǎn)生背離。


泓君:要做通用人工智能,它是一條更遠(yuǎn)更長(zhǎng)的路。在這個(gè)中間,怎么讓自己的公司活下來?你作為公司的CEO,你會(huì)有這個(gè)壓力存在嗎?


韓錚:肯定會(huì)有壓力,但相對(duì)而言還好一些。我覺得機(jī)器人在這一波趨勢(shì)里邊,由于大模型的出現(xiàn),包括infra的出現(xiàn),我們感覺會(huì)把它推到下一個(gè)階段。我們不會(huì)賭某一個(gè)垂類場(chǎng)景能夠跑出來,而是希望通過提供一個(gè)硬件加底層的模型,讓大家去試。


我們希望我們服務(wù)的1000個(gè)開發(fā)者里邊,有100個(gè)能夠找到小批量去做部署的應(yīng)用場(chǎng)景。這100個(gè)人里邊,可能會(huì)有5個(gè)、10個(gè)會(huì)做出超級(jí)應(yīng)用,他們可能會(huì)需要部署1萬臺(tái)甚至更多的機(jī)器人到不一樣的場(chǎng)景里去。


我們不會(huì)去賭某一個(gè)場(chǎng)景。因?yàn)槲覀儓F(tuán)隊(duì)的特質(zhì)也并不是說到工廠里邊去部署和集成測(cè)試。整個(gè)的開發(fā)者社區(qū)里邊,集成商和自動(dòng)化團(tuán)隊(duì)各有所長(zhǎng)。我們希望做底層的新的工具鏈給大家。


泓君:把更多的錢投入到你們更有長(zhǎng)遠(yuǎn)場(chǎng)景的研發(fā)上,還是說把一部分的精力也投入到比如說針對(duì)開發(fā)者的軟硬件一體的平臺(tái)分發(fā)上?你覺得哪一個(gè)是你現(xiàn)在在負(fù)責(zé)的重心?或者說你會(huì)怎么去做你的資源分配?


韓錚:我們的核心是在提供一個(gè)可靠穩(wěn)定的硬件加底層模型,從一個(gè)抓的技能到三到五個(gè)比較常見的技能,并且把它組合開發(fā)的工具做好,讓開發(fā)者能夠在上面去做不一樣的應(yīng)用嘗試。這是我們?cè)诂F(xiàn)在和接下來幾年的時(shí)間最核心的一個(gè)目標(biāo)。


但是為了驗(yàn)證大家可以拿它去做行業(yè)里面的垂類應(yīng)用,我們肯定也會(huì)挑一到兩個(gè)場(chǎng)景,跟一到兩個(gè)開發(fā)者緊密地配合,把我們的開發(fā)工具做好。


泓君:如果10年后回頭來看,你是希望蘇度科技被人記住的是說我們做出了一個(gè)通用機(jī)器人的產(chǎn)品,還是說我們證明了Sim-to-Real這條路是對(duì)的?


韓錚:我覺得驗(yàn)證Sim-to-Real這條路是對(duì)的,是一個(gè)副產(chǎn)物。我們希望10年以后,當(dāng)大家回看今天這個(gè)時(shí)間節(jié)點(diǎn)的時(shí)候,會(huì)認(rèn)為這可能是一個(gè)類似于iPhone加iOS操作系統(tǒng),那個(gè)時(shí)候會(huì)有新的Uber、滴滴、美團(tuán)長(zhǎng)出來。我們希望大家用的硬件加底層的系統(tǒng)和軟件,至少有一部分是我們提供的。

AI原生產(chǎn)品日?qǐng)?bào)頻道: 前沿科技
本內(nèi)容來源于網(wǎng)絡(luò) 原文鏈接,觀點(diǎn)僅代表作者本人,不代表虎嗅立場(chǎng)。
如涉及版權(quán)問題請(qǐng)聯(lián)系 hezuo@huxiu.com,我們將及時(shí)核實(shí)并處理。
正在改變與想要改變世界的人,都在 虎嗅APP
武汉市| 普定县| 青阳县| 明水县| 黔西县| 天柱县| 锡林郭勒盟| 寿阳县| 长葛市| 汤阴县| 冕宁县| 边坝县| 乌兰浩特市| 博乐市| 宁城县| 调兵山市| 桑植县| 正安县| 威远县| 宜城市| 民权县| 宣恩县| 平远县| 临武县| 咸宁市| 仙居县| 邵武市| 萍乡市| 塔河县| 曲麻莱县| 恭城| 镇宁| 道真| 湟源县| 柞水县| 惠东县| 法库县| 息烽县| 永济市| 茶陵县| 定襄县|