久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

本文是業(yè)內(nèi)專家對世界模型的概念、發(fā)展現(xiàn)狀、技術(shù)路徑與行業(yè)格局的深度討論,梳理了行業(yè)核心問題與發(fā)展方向。 ## 1. 世界模型的定義與升溫原因 世界模型當(dāng)前主要分為三類:做視頻生成的渲染器、服務(wù)強(qiáng)化學(xué)習(xí)的仿真器、可生成動作策略的規(guī)劃器(world action model)。 視頻生成模型不算是真正的世界模型:**核心區(qū)別是可交互性與世界狀態(tài)維護(hù)**,Sora僅擬合像素,缺少對物體物理屬性的建模,長生成易出現(xiàn)違反物理規(guī)律的問題,屬于范式缺陷而非參數(shù)規(guī)模問題。 世界模型近年升溫源于兩個(gè)關(guān)鍵變化:以DiT為代表的擴(kuò)散模型技術(shù)突破,可從互聯(lián)網(wǎng)數(shù)據(jù)學(xué)到物理直覺;大語言模型帶來的算力、基建資源溢出,推動資源流向多模態(tài)方向。需求側(cè)則源于具身數(shù)據(jù)缺口、VLA泛化性不足的補(bǔ)位需要。 ## 2. 世界模型與具身數(shù)據(jù)的定位 世界模型對現(xiàn)有具身數(shù)據(jù)金字塔是補(bǔ)充而非替代,核心作用是數(shù)據(jù)增廣,可低成本生成長尾、柔性物體、多SKU場景的泛化數(shù)據(jù),解決真機(jī)采集成本高周期長的痛點(diǎn)。 當(dāng)前行業(yè)仍面臨數(shù)據(jù)供給短板:開源世界模型的真機(jī)數(shù)據(jù)僅一兩萬小時(shí),遠(yuǎn)不足二次預(yù)訓(xùn)練需求,跨任務(wù)、跨機(jī)型泛化幻覺問題突出,頂級遙操作數(shù)據(jù)的力學(xué)與力反饋信息難以合成。 當(dāng)前可行路徑是對真實(shí)樣本做變體增廣,生成加重建是折中方案,可大幅降低純生成的幻覺問題。第一人稱Ego數(shù)據(jù)泛化性更強(qiáng)、和真機(jī)數(shù)據(jù)天然對齊,但采集噪聲大,增量收益尚不明確。 ## 3. 世界模型的主流技術(shù)范式 當(dāng)前純生成、純表征、神經(jīng)-物理混合三條路線未收斂:純生成可復(fù)用現(xiàn)有基建,但無持久狀態(tài),長生成易漂移;純表征推理效率高,但無法輸出人可讀像素;融合路線已被驗(yàn)證可行,是行業(yè)共識方向。 世界模型與VLA最終會走向融合:二者只是切入點(diǎn)不同,目前VLA已吸收世界模型的稠密監(jiān)督思路,世界模型也借用VLM做reward設(shè)計(jì),未來概念會逐漸統(tǒng)一。 **當(dāng)前最被忽略的核心問題是評測**:現(xiàn)有多用視頻生成的畫質(zhì)標(biāo)準(zhǔn)評測世界模型,忽略核心的可交互性評測,好的評測可直接作為強(qiáng)化學(xué)習(xí)獎勵(lì)函數(shù)驅(qū)動模型進(jìn)步。 ## 4. 行業(yè)發(fā)展展望與格局判斷 當(dāng)前世界模型仍處于小圈子討論階段,未到出圈節(jié)點(diǎn),僅學(xué)會生成世界、預(yù)測簡單狀態(tài)變化,尚未達(dá)到物理AGI自主推理物理因果的水平。 行業(yè)最被低估的兩個(gè)硬骨頭:一是模型自進(jìn)化能力,需要讓模型從失敗案例中學(xué)習(xí)實(shí)現(xiàn)自我迭代;二是適配長時(shí)任務(wù)的agentic調(diào)度系統(tǒng),支撐機(jī)器人持續(xù)運(yùn)行。 三年后行業(yè)格局將類似當(dāng)前語言模型:少數(shù)玩家掌握通用世界基模,大量參與者在基模上做垂類精調(diào),物理世界場景復(fù)雜度高,垂類專用模型仍有充足生存空間,該判斷不受算力成本下降一個(gè)數(shù)量級影響。
世界模型的GPT時(shí)刻:距離物理AGI出圈,還有多遠(yuǎn)?
2026-06-18 15:17

世界模型的GPT時(shí)刻:距離物理AGI出圈,還有多遠(yuǎn)?

本文來自微信公眾號: AI前線 ,編輯:宇琪,作者:AICon


    什么是世界模型?


    王飛:世界模型到底是什么?Sora算不算世界模型?OpenAI說它是"物理世界模擬器的雛形",但也有人說能生成好看的視頻和真正理解物理是兩件完全不同的事。在各位看來,從"視頻生成"到"真正的世界模型",中間缺的那一環(huán)是什么?


    朱政:世界模型這個(gè)概念從去年開始被討論得越來越多,尤其是李飛飛教授和楊立昆教授創(chuàng)業(yè)之后,他們的公司都跟世界模型有關(guān)。從李飛飛最新一篇博客來看,世界模型大概在做三件事。第一是渲染器,指的是視頻生成——不管用純生成還是生成加重建的方式,最終產(chǎn)出內(nèi)容、影視、游戲。比如World Labs可以根據(jù)單張圖片創(chuàng)建一個(gè)3D或4D世界,你可以在里面自由漫游。一些帶camera control的視頻生成模型也具備了類似功能。


    第二塊是仿真器,主要針對強(qiáng)化學(xué)習(xí),作為一個(gè)仿真環(huán)境和agent進(jìn)行交互,這一塊我們也可以認(rèn)為是世界模型。


    第三是現(xiàn)在討論最熱烈的world action model,也就是規(guī)劃器,它本身可以產(chǎn)生policy、可以產(chǎn)生action。很多人認(rèn)為它可能是VLA的下一代,或者會和VLA走向融合?,F(xiàn)在大家講的世界模型,我認(rèn)為主要是這三塊,這樣劃分比較明確,不會把不同的事情混在一起討論。


    王騰飛:Sora是一個(gè)很好的視頻生成模型,但它很難算世界模型。視頻生成和世界模型關(guān)注的東西完全不一樣。前者關(guān)心畫面質(zhì)感、美學(xué)、敘事感;后者最核心的能力是可交互性——根據(jù)動作指令去影響未來的演變。


    Sora視覺效果極好,但它缺少世界狀態(tài),所以生成時(shí)間一長就會漂移、穿模、違反各種物理規(guī)律。這不是模型參數(shù)夠不夠大的工程問題,而是這個(gè)范式本身就缺了世界狀態(tài)這個(gè)核心。世界模型一個(gè)是要能交互,另一個(gè)是需要維護(hù)世界狀態(tài)。


    它不只是在擬合像素,而是能識別空間里有幾個(gè)物體、是什么形狀、帶有什么物理量。你才能去問它:這東西離我多遠(yuǎn)、多重、我推它會怎樣?世界狀態(tài)可以是顯示的3D形式,也可以是隱空間的feature。交互性,就是區(qū)分視頻生成和世界模型的那道線。


    王飛:世界模型不是新概念,為什么2025到2026年突然變成了最熱的方向?


    王騰飛:這個(gè)概念幾十年前就有了,但最近一輪熱度是從2023年啟動的。兩個(gè)關(guān)鍵變化。第一是以DiT為代表的生成模型技術(shù)的重大突破,擴(kuò)散模型能從海量互聯(lián)網(wǎng)數(shù)據(jù)中學(xué)到物理直覺和一些時(shí)空動態(tài)規(guī)律。


    第二是大語言模型帶來的資源溢出效應(yīng)——語言模型這一波吸引了海量資金和人才,把算力、infra、數(shù)據(jù)基建都做到了很高的水平,溢出的資源自然而然流向其它AI模態(tài)。這兩股力量疊加,把世界模型重新推到了風(fēng)口上。


    朱政:我們23年開始做世界模型,最早切入的是自動駕駛這個(gè)垂類。當(dāng)時(shí)自動駕駛從BEV感知到分段式端到端再到VLA,數(shù)據(jù)需求很明確,但corner case數(shù)據(jù)的收集極其困難——真實(shí)路采成本高、周期不可控,世界模型恰好是解決這個(gè)痛點(diǎn)的好方案。


    借助開源基?!猄table Diffusion、Stable Video Diffusion——做預(yù)訓(xùn)練,再加自動駕駛后訓(xùn)練數(shù)據(jù),就能得到一個(gè)不錯(cuò)的閉環(huán)仿真器或數(shù)據(jù)生成器。后來隨自動駕駛方向逐步收斂,大家的目光轉(zhuǎn)向了具身。具身數(shù)據(jù)目前遠(yuǎn)不足以從頭預(yù)訓(xùn)練一個(gè)模型,還得依賴多模態(tài)和視頻模型的進(jìn)展。


    具身場景現(xiàn)在還沒到討論corner case的階段,更緊迫的是泛化數(shù)據(jù)生成和與強(qiáng)化學(xué)習(xí)結(jié)合的混合訓(xùn)練,也就是world action model這條線。VLA最近很火但缺點(diǎn)明顯,大家希望用世界模型來補(bǔ)位,目前整體還在探索過程中。


    王飛:從需求側(cè)看,驅(qū)動力主要是兩個(gè)。一是數(shù)據(jù)生成引擎,具身場景數(shù)據(jù)缺口巨大,互聯(lián)網(wǎng)數(shù)據(jù)、仿真數(shù)據(jù)、真機(jī)數(shù)據(jù)三層金字塔里,世界模型的合成數(shù)據(jù)是很好的結(jié)構(gòu)性補(bǔ)充。尤其在具身當(dāng)前的發(fā)展階段,數(shù)據(jù)是最大的瓶頸。二是具身大腦,VLA從23年到現(xiàn)在進(jìn)入了落地瓶頸,泛化性不夠,沒見過場景的成功率偏低。


    世界模型從海量互聯(lián)網(wǎng)視頻里學(xué)到了千奇百怪的時(shí)空模式,天然泛化能力更強(qiáng),正好彌補(bǔ)VLA的短板,這就是VLA當(dāng)前滿足不了落地需求而世界模型能補(bǔ)位的地方。


    王飛:語言模型有ChatGPT這個(gè)清晰的milestone,世界模型有沒有對應(yīng)的技術(shù)節(jié)點(diǎn)?


    朱政:語言模型有兩個(gè)爆點(diǎn),聊天和Coding,Agent還沒形成并駕齊驅(qū)的局面。世界模型不管是to C帶物理理解的內(nèi)容生成還是具身場景,都還處在學(xué)術(shù)界和工業(yè)界內(nèi)部的小圈子里,遠(yuǎn)沒到出圈的時(shí)候。


    大家心目中的標(biāo)桿是一個(gè)通用世界模型,而不是只能做自動駕駛或只能做具身的垂類模型?,F(xiàn)在可能還是處在學(xué)術(shù)圈和工業(yè)界討論比較多、但大眾還沒感知到的階段,朝通用這個(gè)目標(biāo)還需要一些時(shí)間。


    但今年模型靠數(shù)據(jù)規(guī)模就能學(xué)到一定的物理規(guī)律,雖然還不夠強(qiáng),但只要它學(xué)到了,后續(xù)通過強(qiáng)化學(xué)習(xí)去增強(qiáng)是完全可行的。所以我覺得現(xiàn)在就是一個(gè)合適的可以去做的時(shí)間窗口。


    但像語言模型那樣出現(xiàn)"智能涌現(xiàn)",模型突然自己理解了物理規(guī)律之間的深層聯(lián)系,目前在世界模型上還沒觀察到。它還處于"學(xué)會了生成世界、能預(yù)測簡單狀態(tài)變化"的階段,尚未達(dá)到自主理解和推理物理因果的程度。這個(gè)物理AGI的milestone還需要大家一起推。


    具身數(shù)據(jù)的結(jié)構(gòu)問題


    王飛:行業(yè)對具身數(shù)據(jù)已形成金字塔共識——底層互聯(lián)網(wǎng)視頻、中層仿真數(shù)據(jù)、頂層遙操作真機(jī)數(shù)據(jù)。世界模型在這三層里分別能做什么、不能做什么?它最大的價(jià)值是替代某一層,還是打通各層之間的壁壘?


    王飛:世界模型作為數(shù)據(jù)生成引擎,對金字塔是很好的補(bǔ)充,絕非替代關(guān)系。智能駕駛到深水區(qū)之后,長尾場景數(shù)據(jù)采集周期長、成本高,世界模型快速生成場景數(shù)據(jù)是很好的方案。仿真里最難的是流體模擬和柔性物體模擬,但對世界模型反而更自然,ROI很高。零售場景里海量SKU,真機(jī)采集成本高、周期長,世界模型做快速替換和增廣就游刃有余。在具身場景下,它的主要作用還是數(shù)據(jù)內(nèi)容的增廣。


    朱政:大家對數(shù)據(jù)金字塔本身認(rèn)知比較一致,但虛擬世界模型自身的數(shù)據(jù)配比應(yīng)該怎么定,有沒有自己的金字塔結(jié)構(gòu),我們還在探索。目前市面上開源的最大世界模型真機(jī)數(shù)據(jù)大概只有一兩萬小時(shí),遠(yuǎn)遠(yuǎn)不夠做高質(zhì)量的二次預(yù)訓(xùn)練,容易過擬合到特定機(jī)型或特定場景。


    各家的基模收集了幾十萬甚至上百萬小時(shí)的數(shù)據(jù),但這些能不能無縫移植來訓(xùn)世界模型,還不確定。在數(shù)據(jù)供給方面,針對特定場景和已知任務(wù)做泛化數(shù)據(jù)生成沒問題,甚至可以結(jié)合真機(jī)做強(qiáng)化學(xué)習(xí)。但跨任務(wù)、跨機(jī)型泛化的幻覺還比較嚴(yán)重——換了沒見過的機(jī)型、不同的自由度配置和機(jī)械臂形態(tài),它就暴露了沒完全學(xué)會物理規(guī)律的短板。


    王飛:如果說一個(gè)訓(xùn)好的世界模型,它可以反過來像給VLA/World Action Model,提供一些什么樣的燃料呢?


    朱政:現(xiàn)在看起來的話,我們針對特定場景,比如說工業(yè)場景或者泛服務(wù)場景,因?yàn)榇蟾怕是闆r下,VLA在這種場景下只需要做一種任務(wù)或者幾種任務(wù),而且這一種任務(wù)或者幾種任務(wù)你是提前知道的。所以你可以產(chǎn)生海量的泛化數(shù)據(jù),針對某種機(jī)型或者某種task而言,這個(gè)是沒問題的。


    甚至更進(jìn)一步,我們可以基于某些公開的數(shù)據(jù)集或者自采的數(shù)據(jù)集,針對某種平臺、某幾種任務(wù),做一個(gè)閉環(huán)模擬器,在里邊結(jié)合你的真機(jī)強(qiáng)化學(xué)習(xí),結(jié)合世界模型加真機(jī)做強(qiáng)化學(xué)習(xí),這一點(diǎn)也是沒有問題的。


    但是我們現(xiàn)在看起來,跨任務(wù)或者跨機(jī)型的泛化可能還是有一些問題,它的幻覺還是比較嚴(yán)重的。比如說換了任務(wù),在訓(xùn)練的時(shí)候,所謂OD的場景,或者說訓(xùn)練時(shí)沒有見過的機(jī)型,一種新的機(jī)型,它的自由度、它的機(jī)械臂可能長得不太一樣。在這樣的情況下,它可能還是沒有完全學(xué)會背后的物理規(guī)律,還是容易出現(xiàn)比較多的幻覺。這是我們目前觀察到的一個(gè)現(xiàn)象。


    王飛:那您覺得這種幻覺,或者說這種生成數(shù)據(jù),真的在現(xiàn)在VLA/World Action Model當(dāng)中起到一個(gè)很大的作用嗎?或者說它能夠給下游任務(wù)提點(diǎn)嗎?


    朱政:所謂的泛化數(shù)據(jù),在集群里邊情況還是比較復(fù)雜的。你看像最常見的,表觀的泛化,比如說顏色、紋理、光照,它其實(shí)不影響動作空間,也不影響視角這些變化,它僅僅做這種表觀的泛化,這個(gè)肯定就非常成熟了,大家也做了非常多的工作。然后第二塊,可能更進(jìn)一步,比如說我要做各種視角的泛化,當(dāng)然也得益于之前的MVS還有新視角合成的一些成果,現(xiàn)在視角泛化基本上被大家解決了。


    當(dāng)然最難的就是所謂動作的泛化,包括各種反事實(shí)的、各種動作空間的組合,包括我讓強(qiáng)化學(xué)習(xí)去探索,不僅要讓它去探索正確的軌跡,還要去探索失敗的軌跡。失敗的軌跡就牽扯到各種因果推理,還有一些反事實(shí)的東西,我覺得這一塊相對來說還是比較難的。


    王騰飛:世界模型的核心價(jià)值在于把海量互聯(lián)網(wǎng)視頻知識內(nèi)化到模型里,去放大仿真和真機(jī)數(shù)據(jù)的價(jià)值。傳統(tǒng)仿真資產(chǎn)靠手搓,量小,而且和真實(shí)世界有明顯gap。


    王飛:頂層遙操作數(shù)據(jù)公認(rèn)質(zhì)量最高、成本也最貴,世界模型到底能不能合成出這個(gè)質(zhì)量?還是說有些東西在本質(zhì)上就不可能被合成?


    王騰飛:視覺效果可以逼近,物理層面非常困難。人抓一個(gè)軟包裝的瞬間,手指能感受形變和阻力,大腦實(shí)時(shí)調(diào)整力度——這些力學(xué)信息攝像頭根本記錄不了,合成更是另一回事。包覆力反饋和操作者的實(shí)時(shí)決策鏈?zhǔn)呛铣蓴?shù)據(jù)很難跨越的障礙。但從頭合成難不代表擴(kuò)充數(shù)據(jù)的路走不通,對真實(shí)樣本做變體增廣這條路徑反而是清晰的。


    朱政:生成加重建是目前一個(gè)很好的折中探索,重建技術(shù)可以大幅彌補(bǔ)甚至規(guī)避純生成的幻覺。純生成的上限當(dāng)然更高,通過海量數(shù)據(jù)scaling理論上能消除幻覺。但重建作為一條中間路徑,在解決新視角一致性、大場景探索上更穩(wěn)健。剛體交互大家解決得比較好了,可變形物體也有了一定進(jìn)展,流體這類最難的,可能還得回歸到結(jié)合CG的進(jìn)展,計(jì)算機(jī)圖形學(xué)那邊現(xiàn)在也有不少突破。


    王騰飛:我們做得比較聚焦,現(xiàn)在只做仿真資產(chǎn)生成,包括場景和3D物體資產(chǎn),帶物理碰撞和材質(zhì)屬性——金屬的、透明的、粗糙的、光滑的。生成之后導(dǎo)入仿真引擎,物理仿真的任務(wù)交給成熟的物理引擎來處理。


    王飛:Ego數(shù)據(jù)天然攜帶"意圖—動作—結(jié)果"這條因果鏈,是第三視角數(shù)據(jù)永遠(yuǎn)無法捕獲的。這兩種數(shù)據(jù)在模型能力上會產(chǎn)生什么本質(zhì)差異?


    王騰飛:第一人稱學(xué)習(xí)泛化性更強(qiáng)。不同主體的形狀外觀各不相同,第三人稱視角還要學(xué)習(xí)主體和背景的相關(guān)性,這部分消耗了大量模型能力。第一人稱和本體幾乎無關(guān),能更純粹地處理"看到了什么、怎么因果推理"的問題。


    朱政:第三人稱數(shù)據(jù)大多從互聯(lián)網(wǎng)視頻中洗出來的,跟互聯(lián)網(wǎng)數(shù)據(jù)的分布自然接近。第一人稱,不管是頭戴、眼鏡還是腕戴攝像頭,跟真機(jī)數(shù)據(jù)天然對齊,價(jià)值明顯更高。但采集的麻煩事很多:單目還是雙目?帶不帶IMU?SLAM算法能到什么精度?這些變量決定了數(shù)據(jù)的噪聲水平和可用性,而且噪聲會隨著數(shù)據(jù)量的增加等比例放大。


    增加數(shù)據(jù)帶來的收益能不能覆蓋噪聲成本,目前沒有明確結(jié)論。至于學(xué)習(xí)范式,數(shù)據(jù)量足夠大的時(shí)候隱空間學(xué)習(xí)上限更高,這很像語言模型界那句"苦澀的教訓(xùn)",少做人工先驗(yàn),讓模型自己學(xué)。但現(xiàn)階段數(shù)據(jù)就幾十萬小時(shí),顯示地提取手部和腕部的骨骼關(guān)鍵點(diǎn)還是有現(xiàn)實(shí)必要性的。


    王飛:期待行業(yè)里能有些工作互相指引一下。最近這種高精度多模態(tài)異構(gòu)數(shù)據(jù)的積累,對行業(yè)牽引很關(guān)鍵。你們世界模型的架構(gòu)是怎么設(shè)計(jì)的,去學(xué)這些異構(gòu)的具身數(shù)據(jù)?


    朱政:我們現(xiàn)在是拿一個(gè)很強(qiáng)的視頻生成基模,在上面做第二次預(yù)訓(xùn)練,混合自動駕駛數(shù)據(jù)、異構(gòu)數(shù)據(jù)加上一部分真機(jī)數(shù)據(jù),再針對特定場景做后訓(xùn)練。訓(xùn)練時(shí)聯(lián)合預(yù)測未來的action和視頻,但會隨機(jī)mask掉一些生成視頻的分支,這樣推理的時(shí)候可以只出action。我們的WAM大概就長這樣。


    王騰飛:我們沒有針對ego做特殊設(shè)計(jì),還是希望世界模型盡可能通用。


    王騰飛:長視頻生成必須考慮memory機(jī)制,前后不能沖突。其實(shí)人類空間記憶就是異構(gòu)的、以自我為中心的,你會記得樓下左轉(zhuǎn)30米有個(gè)咖啡店,而不是記經(jīng)緯度。所以我們用相當(dāng)local的memory,以agent為中心的局部表示,全局memory反而是用一個(gè)比較模糊的單一embedding。


    王飛:所以memory在交互世界模型里確實(shí)很關(guān)鍵。那前面那個(gè)理解模塊,現(xiàn)在行業(yè)里通用做法是用VLM做前置,編碼成token或embedding,它的重要性各位怎么看?


    朱政:理解模塊很重要。我們做世界模型,不管是生成數(shù)據(jù)還是World Action Model,都希望能把互聯(lián)網(wǎng)學(xué)到的大量知識繼承下來,帶到具身或自動駕駛里。這個(gè)模塊就是我們保留這些知識的一個(gè)最大的抓手。


    王騰飛:現(xiàn)在理解可能還是單獨(dú)的,但在多模態(tài)領(lǐng)域,生圖生視頻已經(jīng)在走向統(tǒng)一理解和生成的模型了,我覺得未來世界模型也會慢慢把理解和生成統(tǒng)一到一個(gè)范式里。


    王飛:我們也觀察到,理解得越好、描述越細(xì)致,生成視頻和動作交互的質(zhì)量分?jǐn)?shù)就越高??赡芤话僮值睦斫夂臀灏僮值募?xì)致描述,差距非常大。所以要想把狀態(tài)預(yù)測和視頻生成做到一個(gè)比較好的水平,理解、生成、預(yù)測一體化的框架,未來還是非常有必要的。


    世界模型的技術(shù)范式


    王飛:從生成式、表征式到神經(jīng)-物理混合,現(xiàn)有這幾條技術(shù)路線走到今天,你認(rèn)為它們各自能走多遠(yuǎn)?有沒有哪條路線,你覺得它在范式層面就有天花板——不是工程問題,而是這條路本身走不到「真正理解物理世界」這個(gè)目標(biāo)?


    王騰飛:三條路線各有利弊,目前都沒有收斂。純視頻生成做的是像素?cái)M合,沒有持久狀態(tài),生成時(shí)長一上去就漂移。JEPA這類表征模型理論上非常優(yōu)雅合理,如果只運(yùn)行在機(jī)器人內(nèi)部、不需要給人看,還湊合。但大量應(yīng)用場景需要輸出人眼可讀的像素——游戲、短劇、生成內(nèi)容的質(zhì)量檢查和可解釋性。


    朱政:我們基本走視頻生成路線,可以直接利用現(xiàn)成的視頻生成基模和VLA訓(xùn)練數(shù)據(jù),基建成熟度和數(shù)據(jù)可得性都更有優(yōu)勢。楊立昆那條路我們也在探索,它更接近人類認(rèn)知機(jī)制——我們開車或者行動的時(shí)候,大腦不會先渲染一幀RGB畫面再決策,更多是在隱空間里高效推理。上限可能更高,但現(xiàn)階段還不能下結(jié)論。


    王飛:純視頻生成最大的命門是算力消耗,做數(shù)據(jù)生成引擎可以靠尺度定律慢慢堆,但做具身大腦,需要實(shí)時(shí)推理來控制機(jī)器人,效率瓶頸就很致命了。


    朱政:目前比較實(shí)用的方案是訓(xùn)練時(shí)聯(lián)合預(yù)測action和視頻,推理時(shí)只輸出action,類似VLA的做法,算是一種折中。如果實(shí)時(shí)視頻生成通過蒸餾或原生方案得到解決,這個(gè)推理效率的問題就不是根本障礙。


    王飛:但折中方案可能丟掉了世界模型相比VLA最大的差異化優(yōu)勢,推理時(shí)同步輸出狀態(tài)演變的視頻畫面,從而能判斷任務(wù)是成功還是失敗。我個(gè)人判斷,未來大概率走向表征和生成的融合。純表征式能預(yù)測狀態(tài)但不會渲染外觀變化,純生成式容易穿模且物理理解偏弱。Cosmos 3就是表征、生成、理解一體化的架構(gòu),效果很好,說明融合路線是走得通的。


    王騰飛:我們已經(jīng)落地了一個(gè)實(shí)用方案:用3D重建模型做reward model——給指令生成視頻后重建出運(yùn)動軌跡,和輸入指令做對比,通過強(qiáng)化學(xué)習(xí)反饋去校準(zhǔn)模型的指令跟隨能力。這也是混合路線在當(dāng)前階段的一種實(shí)踐。


    王飛:現(xiàn)在世界模型大多用的是模仿學(xué)習(xí),如果用強(qiáng)化學(xué)習(xí),會不會帶來一些質(zhì)的飛躍?


    王飛:世界模型和VLA是否最終會融合成一體?但融合這件事,是生成式路線能做到、表征式路線能做到,還是只有神經(jīng)-物理混合路線才能真正實(shí)現(xiàn)?跨本體泛化這個(gè)目標(biāo),在你們押注的技術(shù)范式下,路徑是什么?


    朱政:我非常傾向于會。理想中的那個(gè)終極模型,應(yīng)該既能預(yù)測action,又能隱式或顯示地預(yù)測未來state,可以是RGB空間的state,也可以是隱空間的state,甚至還能像人一樣預(yù)測reward:你做了這個(gè)動作之后,會收到獎勵(lì)還是懲罰?


    現(xiàn)在VLA已經(jīng)在吸收世界模型的稠密監(jiān)督和視頻監(jiān)督思路,比如加更豐富的監(jiān)督信號;世界模型也在用VLM做自動化的reward設(shè)計(jì)。本質(zhì)上,做VLA和做世界模型的是同一批人、同一個(gè)社區(qū),只是切入點(diǎn)不同。這兩個(gè)概念會越來越統(tǒng)一,可能今年大家還為這兩個(gè)名詞爭論,再過一段時(shí)間就不再是話題了。


    王飛:殊途同歸。一個(gè)以語言為核心,一個(gè)以視覺為核心,最終都是對世界的建模和狀態(tài)表征。在一個(gè)統(tǒng)一架構(gòu)下,兩者的長處應(yīng)該能被同時(shí)容納。今年的爭論,也許再過一段時(shí)間就不再是話題了。


    王飛:今天大家都在做世界模型,但行業(yè)還沒有形成類似MMLU、ImageNet這樣的統(tǒng)一評測標(biāo)準(zhǔn)。如果一個(gè)模型能夠生成逼真的視頻,它就算好的世界模型嗎?你認(rèn)為真正有價(jià)值的世界模型,應(yīng)該被哪些能力維度衡量?


    王騰飛:最被系統(tǒng)性忽略的維度是可交互性?,F(xiàn)在幾乎所有人都在用視頻生成的標(biāo)準(zhǔn)來評測世界模型,看看畫質(zhì)好不好、細(xì)節(jié)精不精細(xì)。但對世界模型來說,視覺質(zhì)量未必是第一位的事。可交互性的評測必須在實(shí)際交互過程中才能完成:模型能撐多少秒不崩?做出的每個(gè)動作是否符合預(yù)期和物理規(guī)律?沒有這類評測,scaling就是盲目的。


    目前交互時(shí)長大概是分鐘級,一兩分鐘就算很不錯(cuò)了。真正跑出來,需要實(shí)時(shí)可控加開放世界三個(gè)維度同時(shí)達(dá)標(biāo)。但好消息是最近已經(jīng)有不少評測工作開始聚焦這個(gè)方向了,雖然到底測什么,是畫面不崩還是符合所有物理定律,共識還在形成中。


    朱政:世界模型的評測還非常間接。不管是做數(shù)據(jù)生成、閉環(huán)模擬器還是自己出policy,最終都要靠下游任務(wù),比如VLA的精度漲點(diǎn),來間接證明價(jià)值。這個(gè)反饋鏈路長、延遲高,需要大量訓(xùn)練數(shù)據(jù)和rollout,遠(yuǎn)不是即時(shí)的。這是評測這塊天然比較難的地方。


    最被低估的挑戰(zhàn)與展望


    王飛:世界模型領(lǐng)域,有沒有一個(gè)大家都在回避、但遲早要面對的硬骨頭——不是最難的挑戰(zhàn),而是最被低估的那一個(gè)?


    朱政:最關(guān)鍵的還是自進(jìn)化。展開講至少兩個(gè)方向。一是視頻生成的強(qiáng)化學(xué)習(xí)后訓(xùn)練——打破純監(jiān)督學(xué)習(xí)框架,讓模型從失敗案例里也提取出有用的信號,實(shí)現(xiàn)模型的自我迭代,而不僅僅依賴人類標(biāo)注的正確軌跡。二是和agentic系統(tǒng)結(jié)合——現(xiàn)在的世界模型和VLA都只能執(zhí)行十幾秒的短程任務(wù),要讓一個(gè)機(jī)器人24小時(shí)持續(xù)工作、隨時(shí)響應(yīng)各種指令,上面必須有一套agentic調(diào)度層,把各種模型串成一個(gè)實(shí)時(shí)響應(yīng)、持續(xù)運(yùn)行的完整系統(tǒng)。這可能是比單模型能力提升更迫切的事情。


    王騰飛:最被低估的就是評測本身。很多人覺得評測沒什么技術(shù)含量,但評測維度和模型能力是互為因果的。沒有好的評測,你根本不知道模型到底進(jìn)步在哪里、短板在哪里。反過來說,如果評測維度和指標(biāo)設(shè)計(jì)得好,這些東西本身就可以拿來當(dāng)強(qiáng)化學(xué)習(xí)的獎勵(lì)函數(shù),直接驅(qū)動模型能力定向提升。


    王飛:三年后,世界模型是少數(shù)通用大模型通吃,還是場景化專用模型各占山頭?如果算力成本再降一個(gè)數(shù)量級,你的判斷會改變嗎?


    王騰飛:格局應(yīng)該跟現(xiàn)在的語言模型類似。少數(shù)幾家做出通用基模型,大量參與者在基模型上面做垂類精調(diào),游戲、內(nèi)容創(chuàng)作、自動駕駛、機(jī)器人,各有各的主場。垂類場景非常豐富,每個(gè)細(xì)分領(lǐng)域都有自己獨(dú)特的需求和數(shù)據(jù)分布。


    朱政:垂類模型的量會非常大,物理世界場景的復(fù)雜度遠(yuǎn)超數(shù)字世界,自動駕駛和具身的每一個(gè)細(xì)分領(lǐng)域情況都千差萬別。但通用世界模型因?yàn)橘Y金投入和人才密度要求極高,最終應(yīng)該會收斂到少數(shù)幾款,這個(gè)判斷即使算力成本再降一個(gè)數(shù)量級應(yīng)該也不會改變。


    王飛:物理世界的多樣性決定了垂類模型會有獨(dú)立生存空間,尤其工業(yè)、物流等特定場景,垂類模型的ROI可能反而更高。通用基模型大概率走向收斂,但通用和垂類的均衡線在哪里,未來變數(shù)很大,這是從業(yè)者需要持續(xù)關(guān)注的核心問題。

    AI原生產(chǎn)品日報(bào)頻道: 前沿科技
    本內(nèi)容來源于網(wǎng)絡(luò) 原文鏈接,觀點(diǎn)僅代表作者本人,不代表虎嗅立場。
    如涉及版權(quán)問題請聯(lián)系 hezuo@huxiu.com,我們將及時(shí)核實(shí)并處理。
    正在改變與想要改變世界的人,都在 虎嗅APP
    富民县| 宣汉县| 阿坝县| 河东区| 巴东县| 腾冲县| 营口市| 建昌县| 富裕县| 佛教| 板桥市| 定西市| 平塘县| 孝昌县| 普陀区| 玉屏| 双桥区| 罗田县| 天津市| 翁源县| 介休市| 清镇市| 阳信县| 平泉县| 麻江县| 汪清县| 新营市| 梁山县| 泾阳县| 桦南县| 河北区| 平度市| 旬阳县| 商丘市| 若羌县| 正阳县| 武定县| 河北区| 安达市| 邹平县| 华容县|