出品|虎嗅黃青春頻道
作者|商業(yè)消費(fèi)主筆 黃青春
題圖|視覺中國
外界總揶揄騰訊在 AI 賽道“起大早趕晚集”,這顯然低估了其野心。
事實(shí)上,騰訊的布局草蛇灰線,伏線千里:從底層混元大模型,到中間層智能體開發(fā)平臺(tái) ADP、具身智能平臺(tái) Tairos,再到應(yīng)用層 WorkBuddy、CodeBuddy 等產(chǎn)品,一條從底層技術(shù)到終端應(yīng)用的落地路徑脈絡(luò)清晰。
其中,具身智能作為騰訊向物理世界延伸的“戰(zhàn)略要塞”,由騰訊首席科學(xué)家、Robotics X 實(shí)驗(yàn)室主任、福田實(shí)驗(yàn)室主任張正友帶隊(duì),摸索出一套與行業(yè)主流“端到端單模型”截然不同的技術(shù)路線,底層邏輯直指具身智能的本質(zhì):語言不等于完整認(rèn)知,真正的智能必須在“感知、決策、行動(dòng)”的閉環(huán)中形成。
具身智能為何不智能?
張正友以神經(jīng)科學(xué)經(jīng)典的“裂腦實(shí)驗(yàn)”點(diǎn)破行業(yè)通?。寒?dāng)前多數(shù)具身方案過度依賴語言模型邏輯,錯(cuò)將流暢描述任務(wù)視作真正理解了物理世界。
事實(shí)上,人腦左腦負(fù)責(zé)語言與邏輯推理,右腦負(fù)責(zé)空間感知與圖像認(rèn)知,語言只是智能的對外表達(dá)通道,并非認(rèn)知的全部。
基于這一判斷,騰訊構(gòu)建了三層異構(gòu)的具身智能架構(gòu) Apexio,精準(zhǔn)對應(yīng)人腦的認(rèn)知決策、感知行動(dòng)、條件反射:
最上層為認(rèn)知系統(tǒng):按需喚醒,調(diào)用大模型完成深度推理與任務(wù)規(guī)劃,核心回答“要做什么”;
中間層為感知行動(dòng)系統(tǒng):接收視覺等環(huán)境信息并快速調(diào)整行為,負(fù)責(zé)“怎么動(dòng)態(tài)調(diào)整”;
最底層為反射系統(tǒng):以更高頻率運(yùn)行,無需經(jīng)過語言推理,像條件反射一樣處理碰撞、失衡等突發(fā)狀況,具備“即時(shí)自?!蹦芰?/strong>。
在張正友看來,這套分層架構(gòu)是面向真實(shí)場景的長期技術(shù)路線,其核心優(yōu)勢貼合物理世界的運(yùn)行規(guī)律。
此前,行業(yè)單一端到端模型要求感知、決策、執(zhí)行全鏈路同頻運(yùn)算:要么為保障認(rèn)知精度拉高推理延遲,無法滿足實(shí)時(shí)性要求;要么為壓縮響應(yīng)速度犧牲深度推理能力,難以處理復(fù)雜任務(wù),導(dǎo)致主流具身模型存在普遍短板:一類靠文本拆解任務(wù),邏輯清晰卻落不了地;一類能生成預(yù)測畫面,卻講不清規(guī)則與邊界。
與之對應(yīng),分層架構(gòu)能讓不同能力模塊各司其職,既保留了上層的深度思考能力,又滿足了底層的實(shí)時(shí)反應(yīng)需求,與人腦運(yùn)行邏輯高度契合,是更具穩(wěn)定性的長期技術(shù)架構(gòu)。
據(jù)虎嗅了解,騰訊發(fā)布的 RxBrain (騰訊 Robotics X 聯(lián)合混元發(fā)布并開源的具身世界認(rèn)知基座模型)實(shí)現(xiàn)了兩類核心能力打通:面對復(fù)雜任務(wù),它既能用語言拆解執(zhí)行步驟、明確規(guī)則約束,也能同步生成每一步的目標(biāo)場景圖像。這種“先想象目標(biāo),再執(zhí)行動(dòng)作”的模式,解決了大量文本難以精準(zhǔn)描述的場景問題。
比如擺放西餐餐具,用文字定義規(guī)則需要大量篇幅,一張目標(biāo)圖即可清晰傳遞要求。執(zhí)行過程中,機(jī)器人還能實(shí)時(shí)對比當(dāng)前畫面與目標(biāo)畫面,判斷執(zhí)行進(jìn)度,發(fā)現(xiàn)偏差及時(shí)重新規(guī)劃,顯著提升任務(wù)完成效率。
張正友補(bǔ)充稱,騰訊自研的 HyVLA-0.5 模型已實(shí)現(xiàn)工業(yè)級(jí)落地,依托自研亞毫米級(jí) UMI 穿戴式數(shù)據(jù)采集手套,積累了超過 1 萬小時(shí)的人類第一視角操作數(shù)據(jù)。其采用雙路徑訓(xùn)練模式:一條針對特定機(jī)器人本體做精細(xì)化微調(diào),保障場景適配精度;一條通過 UMI 數(shù)據(jù)實(shí)現(xiàn)跨本體遷移,提升通用適配能力。部署環(huán)節(jié)則通過異步推理與軌跡平滑技術(shù),實(shí)現(xiàn)高頻閉環(huán)控制。
虎嗅溝通發(fā)現(xiàn),這套模型已在日化品工廠產(chǎn)線完成落地實(shí)測,作業(yè)成功率超過 95%,新增品類(SKU)適配周期不到 3 天,完全滿足工業(yè)產(chǎn)線的嚴(yán)苛要求。
除了產(chǎn)線落地的成績,HyVLA-0.5 在權(quán)威仿真評測中也拿下綜合排名第一,在核心的長時(shí)序任務(wù)、記憶任務(wù)兩個(gè)維度同樣登頂,完成了從實(shí)驗(yàn)室指標(biāo)到真實(shí)生產(chǎn)力的跨越。
Tairos要做具身時(shí)代的“大腦”
此前,騰訊始終明確不做機(jī)器人硬件,一度曾引發(fā)外界質(zhì)疑。
對此,張正友以手機(jī)行業(yè)格局類比:行業(yè)最終會(huì)形成兩種成熟模式,一種是蘋果式的軟硬件全閉環(huán),體驗(yàn)最優(yōu)但生態(tài)封閉;另一種是安卓式的底層系統(tǒng)賦能,開放生態(tài)、規(guī)?;涞?。
如今,騰訊選擇的正是第二條路。這很大程度上源于,中國機(jī)器人本體制造能力已高度成熟,迭代快、穩(wěn)定性強(qiáng),騰訊無需重復(fù)造輪子。
騰訊的核心優(yōu)勢在 AI、云與連接能力,因此 Tairos 定位是做具身智能的“通用大腦”:向上支撐應(yīng)用開發(fā)商,向下賦能機(jī)器人本體廠商,讓硬件廠商無需從零搭建智能能力,讓應(yīng)用廠商無需適配五花八門的硬件,整體降低行業(yè)落地門檻。
據(jù)虎嗅了解,落地?cái)?shù)據(jù)已驗(yàn)證這一戰(zhàn)略的價(jià)值:首次和宇樹打磨導(dǎo)覽場景時(shí),基礎(chǔ)適配花了三個(gè)月,依托標(biāo)準(zhǔn)化接口后,新增場景 5 天即可落地;給越疆機(jī)器狗做系統(tǒng)適配更是只用了一天就完成部署。
張正友透露,騰訊選擇優(yōu)先綁定越疆、宇樹、智元等頭部本體廠商,核心邏輯在于:頭部廠商的硬件穩(wěn)定性高、問題少,算法打磨效率更高?!耙坏┡c頭部廠商跑通標(biāo)桿場景,圍繞其布局的集成商、生態(tài)客戶即可快速復(fù)制方案,實(shí)現(xiàn)做通一個(gè)、輻射一片的效果,效率遠(yuǎn)高于零散對接中小廠商?!?/p>
值得強(qiáng)調(diào)的是,具身智能核心瓶頸仍是數(shù)據(jù),亦是當(dāng)前行業(yè)投入成本最高的環(huán)節(jié)。
張正友認(rèn)為,當(dāng)前行業(yè)普遍依賴的遙操作數(shù)據(jù),正處于金字塔頂端,成本高、規(guī)模小、泛化性差。騰訊的思路是打通四層數(shù)據(jù)體系:用底層大規(guī)模數(shù)據(jù)做預(yù)訓(xùn)練,提升模型泛化能力;用頂層高精度數(shù)據(jù)做微調(diào),適配特定場景,最大化數(shù)據(jù)利用效率。
即便騰訊并非數(shù)據(jù)采集服務(wù)商,但其核心優(yōu)勢在于模型研發(fā)與數(shù)據(jù)生產(chǎn)的聯(lián)動(dòng):模型團(tuán)隊(duì)明確數(shù)據(jù)優(yōu)化方向,反向指導(dǎo)數(shù)據(jù)廠商定向采集高價(jià)值數(shù)據(jù),再通過騰訊云的存儲(chǔ)、計(jì)算能力,為具身智能企業(yè)提供數(shù)據(jù)存儲(chǔ)、處理、訓(xùn)練的一體化解決方案,形成“數(shù)據(jù) - 模型 - 云”的完整閉環(huán)。
算力層面,具身智能的需求正呈爆發(fā)式增長。
騰訊云異構(gòu)計(jì)算研發(fā)總監(jiān)陳煜東透露,具身智能客戶的算力需求年增速達(dá) 200%-300%,訓(xùn)練規(guī)模從百卡級(jí)躍升至千卡、萬卡級(jí);模型迭代周期縮短至兩三天,多模態(tài)數(shù)據(jù)清洗、標(biāo)注的算力消耗也同步暴漲。
至于國產(chǎn)芯片的適配難題,陳煜東給出了高效解法:用 AI Agent 輔助算子遷移?!斑^去工程師手動(dòng)遷移一個(gè)算子平均需要 5 天,如今通過 Agent 人機(jī)協(xié)同,一天就能完成精度達(dá)標(biāo)、性能更優(yōu)的遷移,大幅降低國產(chǎn)算力的使用門檻。”
當(dāng)前,具身智能行業(yè)同質(zhì)化嚴(yán)重,本體形態(tài)、落地場景都高度扎堆。張正友認(rèn)為,這是行業(yè)早期的正常狀態(tài),規(guī)?;涞厣形磫?dòng),玩家集中探索可行場景并非壞事,充分競爭會(huì)加速技術(shù)迭代。
所以在落地節(jié)奏上,行業(yè)必然遵循“從易到難”的路徑:工業(yè)場景會(huì)率先實(shí)現(xiàn)規(guī)?;涞?,因?yàn)榄h(huán)境結(jié)構(gòu)化、物體類別少、任務(wù)標(biāo)準(zhǔn)化,數(shù)據(jù)需求相對可控,更容易達(dá)到生產(chǎn)級(jí)要求;而家庭、養(yǎng)老等非結(jié)構(gòu)化場景,落地難度要高得多,核心門檻是安全。
張正友一再強(qiáng)調(diào),進(jìn)入家庭場景的機(jī)器人,安全性必須做到 100%,沒有任何妥協(xié)空間?!耙獙?shí)現(xiàn)安全的人機(jī)接觸,觸覺、力覺感知是必備能力。沒有力覺控制的機(jī)器人,攙扶老人時(shí)可能造成骨折,根本無法進(jìn)入養(yǎng)老、康復(fù)等場景。”
綜上,騰訊在 AI 領(lǐng)域并不執(zhí)著于技術(shù)噱頭式領(lǐng)先?;ヂ?lián)網(wǎng)時(shí)代,其靠連接人與人、人與服務(wù)、人與內(nèi)容建立壁壘;AI 時(shí)代,它要靠連接模型與場景、智能與硬件、開發(fā)者與產(chǎn)業(yè),成為 AI 基建的“水電煤”。
# 虎嗅商業(yè)消費(fèi)主筆黃青春、黃青春頻道出品人,關(guān)注文娛社交、游戲影音等多個(gè)領(lǐng)域,行業(yè)人士交流加微信:724051399,新聞線索亦可郵件至 huangqingchun@huxiu.com
