久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

大語(yǔ)言模型驅(qū)動(dòng)AI智能體已進(jìn)入災(zāi)難逃生仿真領(lǐng)域,解決了傳統(tǒng)物理模型的缺陷,但仍面臨驗(yàn)證難題,商業(yè)化尚需謹(jǐn)慎推進(jìn)。 ## 1. 從AI派對(duì)到逃生仿真的技術(shù)演進(jìn) 原本用于AI小鎮(zhèn)虛擬社交的生成式智能體技術(shù),已被多個(gè)頂尖研究機(jī)構(gòu)應(yīng)用于災(zāi)難疏散逃生仿真。傳統(tǒng)疏散仿真僅為純物理模型,假設(shè)人群是服從物理規(guī)律的理性粒子,無(wú)法還原真實(shí)災(zāi)難中人類的猶豫、恐慌等非理性行為,而新型架構(gòu)將物理層與認(rèn)知層分離,給虛擬人群配上了會(huì)思考決策的大腦。 ## 2. 四個(gè)前沿逃生仿真研究案例 1. **卡內(nèi)基梅隆大學(xué)畢業(yè)典禮疏散預(yù)案**:歷時(shí)16個(gè)月迭代,最終實(shí)現(xiàn)13000個(gè)匹配真實(shí)規(guī)模的智能體仿真,產(chǎn)出的三條建議已被寫(xiě)入學(xué)校正式應(yīng)急SOP,是目前唯一落地應(yīng)用的研究。 2. **天津大學(xué)等團(tuán)隊(duì)的地鐵火災(zāi)仿真系統(tǒng)RESCUE**:聚焦解決虛擬人身體物理真實(shí)性問(wèn)題,可實(shí)時(shí)計(jì)算24個(gè)身體部位的碰撞受力,還原推搡摔倒的動(dòng)態(tài)過(guò)程,已被ICCV 2025接收,代碼公開(kāi)。 3. **清華大學(xué)AgentSociety城市級(jí)仿真**:可支持一萬(wàn)余個(gè)智能體模擬城市級(jí)社會(huì)活動(dòng),累計(jì)生成500萬(wàn)次互動(dòng),可模擬颶風(fēng)沖擊下的城市疏散,也可用于其他社會(huì)政策推演。 4. **斯坦福HAI數(shù)字分身可信度驗(yàn)證**:結(jié)合深度訪談等數(shù)據(jù)生成的數(shù)字分身,復(fù)現(xiàn)真人決策的準(zhǔn)確率達(dá)到0.86,遠(yuǎn)高于傳統(tǒng)人口統(tǒng)計(jì)標(biāo)簽方法,減少了分組預(yù)測(cè)偏差,為仿真可信度提供了量化基準(zhǔn)。 ## 3. 學(xué)界的核心質(zhì)疑:驗(yàn)證是繞不開(kāi)的核心挑戰(zhàn) 阿姆斯特丹大學(xué)研究者提出,大語(yǔ)言模型的黑箱性質(zhì)導(dǎo)致結(jié)果不可復(fù)現(xiàn),存在刻板印象偏差,在無(wú)先例的災(zāi)難場(chǎng)景中容易行為失控。加入大語(yǔ)言模型后,驗(yàn)證難題反而被惡化,現(xiàn)有研究多只滿足表面效度,方法論定位模糊。領(lǐng)域內(nèi)研究者也普遍認(rèn)可這一問(wèn)題,不同大模型的模擬偏差最高可超過(guò)20%。 ## 4. 商業(yè)化路徑與現(xiàn)存風(fēng)險(xiǎn) 這項(xiàng)技術(shù)可分為三層商業(yè)化路徑,風(fēng)險(xiǎn)隨層級(jí)遞增:第一層是標(biāo)準(zhǔn)化應(yīng)急管理SaaS工具,第二層是城市數(shù)字孿生行為層,第三層是保險(xiǎn)風(fēng)險(xiǎn)定價(jià)。目前該技術(shù)存在三個(gè)明確風(fēng)險(xiǎn):一是大模型輸出偏向平均反應(yīng),容易抹平真實(shí)災(zāi)難中影響傷亡的極端個(gè)體行為;二是微觀單一個(gè)體的高可信度,不能推導(dǎo)出宏觀群體涌現(xiàn)現(xiàn)象的可信度,仍缺乏驗(yàn)證;三是大模型的安全對(duì)齊會(huì)讓模型行為偏于“溫和”,天然低估真實(shí)災(zāi)難中的恐慌與混亂程度。
別問(wèn)AI像不像人了,先問(wèn)它在災(zāi)難里能不能逃命
2026-07-05 15:53

別問(wèn)AI像不像人了,先問(wèn)它在災(zāi)難里能不能逃命

題圖來(lái)自:AI生成


2023 年,斯坦福和 Google 聯(lián)手做了一個(gè)實(shí)驗(yàn):25 個(gè) AI 居民在一個(gè)叫 Smallville 的虛擬小鎮(zhèn)里生活,會(huì)自己組織一場(chǎng)情人節(jié)派對(duì),會(huì)互相八卦,會(huì)因?yàn)椤皼](méi)被邀請(qǐng)”而不高興。


Generative Agents:游戲世界中的 25 個(gè)生成式智能體


這個(gè)叫《Generative Agents》的項(xiàng)目,作者之一正是斯坦福博士生 Joon Sung Park,當(dāng)時(shí)更多被當(dāng)作一個(gè)好玩的技術(shù)展示——原來(lái)大模型不只是一個(gè)聊天窗口,它還能“扮演人”,還能被放進(jìn)一個(gè)持續(xù)運(yùn)轉(zhuǎn)的世界里,自己生成記憶、自己做計(jì)劃、自己和別人互動(dòng)。論文里最出圈的一張圖,就是智能體們自發(fā)在 Hobbs 咖啡館辦起情人節(jié)派對(duì)的場(chǎng)景——沒(méi)人安排劇本,是幾個(gè) agent 自己商量、自己發(fā)邀請(qǐng)、自己決定要不要去。


Generative Agents:智能體自發(fā)組織的情人節(jié)派對(duì)場(chǎng)景




CMU 論文 Figure 1:應(yīng)急管理人員從不信任到信任LLM智能體模擬的 16 個(gè)月過(guò)程


過(guò)去幾年,這項(xiàng)技術(shù)被一批研究機(jī)構(gòu)從派對(duì)場(chǎng)景,一路帶進(jìn)了地鐵火災(zāi)、颶風(fēng)疏散、畢業(yè)典禮疏散預(yù)案這類不能開(kāi)玩笑的場(chǎng)景里??▋?nèi)基梅隆大學(xué)、清華大學(xué)、天津大學(xué)、斯坦福 HAI……這些機(jī)構(gòu)在做同一件事:讓AI智能體不再演一場(chǎng)派對(duì),而是演一場(chǎng)逃命。而與此同時(shí),另一批研究者——比如阿姆斯特丹大學(xué)的計(jì)算社會(huì)科學(xué)學(xué)者 Petter T?rnberg ——正在從方法論根子上質(zhì)疑:這些“演得像”的智能體,到底能不能被當(dāng)真。這篇文章就想把這兩撥人放在一起看。


逃命是決策問(wèn)題,不是物理問(wèn)題


傳統(tǒng)的疏散仿真是純物理模型:給定一個(gè)空間、一群點(diǎn)、一個(gè)出口,用元胞自動(dòng)機(jī)或者社會(huì)力模型算出人流怎么走、多久能走完。這類模型的問(wèn)題是,它假設(shè)人是理性的、勻速的、只服從物理規(guī)律的粒子——但真實(shí)災(zāi)難現(xiàn)場(chǎng)里,人會(huì)愣住、會(huì)往回跑找家人、會(huì)因?yàn)榭床磺宄隹跇?biāo)志而原地打轉(zhuǎn)、會(huì)因?yàn)槿后w恐慌而互相踩踏。這些恰恰是純物理模型算不出來(lái)的東西,卻是歷史上大多數(shù)踩踏事故里真正致命的部分。


物理模型想象的人群 vs 災(zāi)難現(xiàn)場(chǎng)真實(shí)的人群


新一代仿真的思路是把系統(tǒng)拆成兩層:“物理層”繼續(xù)負(fù)責(zé)碰撞、力學(xué)這些傳統(tǒng)計(jì)算機(jī)圖形學(xué)擅長(zhǎng)的事,“認(rèn)知層”則交給大語(yǔ)言模型驅(qū)動(dòng)的智能體,去處理判斷、猶豫、恐慌、信息不對(duì)稱——這套“物理—認(rèn)知分離架構(gòu),本質(zhì)上是給虛擬人群配了一個(gè)會(huì)猶豫的“腦子”,而不只是一具會(huì)跑的身體。過(guò)去一年里,至少有四組獨(dú)立的研究,分別從“決策”、“身體”、“規(guī)?!?、“個(gè)體精度”四個(gè)不同角度,往這套架構(gòu)里填內(nèi)容。

“物理—認(rèn)知分離”架構(gòu)示意


四個(gè)真實(shí)案例,四種做法


卡內(nèi)基梅隆大學(xué):從 100 人到 13000 人的畢業(yè)典禮預(yù)案


這項(xiàng)研究由 CMU 計(jì)算機(jī)學(xué)院的 Yuxuan Li、Sauvik Das 和 Hirokazu Shirado 三人主導(dǎo),和學(xué)校應(yīng)急管理團(tuán)隊(duì)做了一項(xiàng)歷時(shí) 16 個(gè)月的迭代設(shè)計(jì)研究,目標(biāo)是給學(xué)校真實(shí)的畢業(yè)典禮疏散預(yù)案提供參考。系統(tǒng)經(jīng)歷了五輪迭代:從 100 個(gè)智能體的小規(guī)模驗(yàn)證,擴(kuò)展到 500、3000,最終做到 13000 個(gè)智能 體——這個(gè)數(shù)字直接對(duì)應(yīng)了這所學(xué)校畢業(yè)典禮的真實(shí)人群規(guī)模。研究團(tuán)隊(duì)沒(méi)有一上來(lái)就做大規(guī)模仿真,而是花了很長(zhǎng)時(shí)間先解決“應(yīng)急管理人員愿不愿意相信一個(gè)AI模擬結(jié)果”這個(gè)更基礎(chǔ)的問(wèn)題:論文標(biāo)題里用的說(shuō)法是“從不信任到信任”的轉(zhuǎn)變過(guò)程,這本身說(shuō)明,這類系統(tǒng)的門檻不完全是技術(shù)門檻,也是一個(gè)組織信任建立的過(guò)程。


Figure 4:真實(shí)畢業(yè)典禮人群動(dòng)力學(xué)與模擬結(jié)果對(duì)比



論文里有一張圖(對(duì)應(yīng)上方Figure 4)把真實(shí)畢業(yè)典禮的人群動(dòng)力學(xué)數(shù)據(jù)和模擬結(jié)果做了對(duì)比,另有一張圖畫(huà)出了不同疏散方案下的累積疏散進(jìn)度曲線。




Figure 5:不同疏散方案下的累積疏散進(jìn)度曲線


最終,這項(xiàng)為期 16 個(gè)月的合作產(chǎn)出了三條具體建議,已經(jīng)被寫(xiě)進(jìn)了學(xué)校真實(shí)的標(biāo)準(zhǔn)操作流程(SOP)——這是目前四個(gè)案例里,唯一一個(gè)已經(jīng)從“論文里的 demo ”變成“真被寫(xiě)進(jìn)制度文件”的例子。


天津大學(xué) + 卡迪夫大學(xué) + 清華大學(xué):地鐵火災(zāi)里的“身體”


這個(gè)叫 RESCUE 的系統(tǒng)由天津大學(xué)教授李坤(國(guó)家優(yōu)青、天大智能與計(jì)算學(xué)部三維視覺(jué)研究組負(fù)責(zé)人)牽頭,聯(lián)合卡迪夫大學(xué)、清華大學(xué)團(tuán)隊(duì)完成,解決的是另一個(gè)問(wèn)題:光有“會(huì)決策的腦子”還不夠,虛擬人還得有一具“物理上可信”的身體——推擠時(shí)手臂會(huì)不會(huì)真的碰到別人、摔倒姿態(tài)自不自然、不同體型的人跑起來(lái)速度是否符合真實(shí)生理數(shù)據(jù)。


RESCUE 項(xiàng)目:個(gè)性化、物理合理、三維自適應(yīng)的在線人群疏散模擬


團(tuán)隊(duì)在項(xiàng)目主頁(yè)上還放了一段實(shí)際的 demo 視頻(imgs/demo_4201.mp4),可以看到虛擬人群在擁擠中推搡、摔倒、爬起來(lái)繼續(xù)跑的連貫過(guò)程,這是目前四個(gè)案例里唯一能看到“動(dòng)態(tài)演示”而不只是論文截圖的一個(gè)。


RESCUE 論文:24 個(gè)身體部位碰撞受力可視化


團(tuán)隊(duì)做了一個(gè)個(gè)性化步態(tài)轉(zhuǎn)換器,可以實(shí)時(shí)計(jì)算 24 個(gè)身體部位在擁擠碰撞中的受力情況(上圖),論文附帶的定性對(duì)比結(jié)果和消融實(shí)驗(yàn)顯示這套方法比過(guò)去的疏散仿真更貼近真實(shí)人群錄像,團(tuán)隊(duì)還專門統(tǒng)計(jì)了不同類別人群(老人、兒童、成年人)在擁擠狀態(tài)下的速度分布箱線圖,用來(lái)驗(yàn)證模擬出的個(gè)體差異是否符合真實(shí)生理數(shù)據(jù)。這項(xiàng)工作已被計(jì)算機(jī)視覺(jué)頂會(huì) ICCV 2025 接收,項(xiàng)目代碼和主頁(yè)已經(jīng)公開(kāi)。


清華大學(xué):把智能體放進(jìn)一整座城市


如果說(shuō)前兩個(gè)案例是“事件級(jí)”的模擬,清華大學(xué)電子工程系李勇教授團(tuán)隊(duì)做的 AgentSociety 做的是“城市級(jí)”:論文 16 位作者名單里,Jinghua Piao、Yuwei Yan 等為共同一作,李勇是通訊作者。論文摘要里寫(xiě)的數(shù)字是,給超過(guò)一萬(wàn)個(gè)智能體生成完整的社會(huì)生活,累計(jì)產(chǎn)生了 500 萬(wàn)次互動(dòng)。


AgentSociety 論文 Figure 2:總體框架圖


這套系統(tǒng)被用來(lái)跑過(guò)好幾組社會(huì)實(shí)驗(yàn),其中一組專門模擬颶風(fēng)等外部沖擊下的城市反應(yīng),另外幾組則用來(lái)看社交媒體上極端信息傳播、無(wú)條件基本收入這類政策變量如何影響一整座虛擬城市的行為分布。這意味著,同一套底層技術(shù),既能拿來(lái)算一場(chǎng)畢業(yè)典禮怎么疏散,也能拿來(lái)算一場(chǎng)颶風(fēng)來(lái)了以后一整座城市會(huì)不會(huì)亂——從單一場(chǎng)館到整座城市,驗(yàn)證難度是指數(shù)級(jí)上升的,這也是后面 T?rnberg 那波質(zhì)疑最主要針對(duì)的規(guī)模區(qū)間。



AgentSociety 論文 Figure 10:大規(guī)模社會(huì)模擬引擎系統(tǒng)架構(gòu)


斯坦福:AI分身能有多像你


前三個(gè)案例都在解決“怎么讓一群虛擬人看起來(lái)像真人在逃命”,斯坦福 HAI 這項(xiàng)由博士生 Joon Sung Park 主導(dǎo)的研究問(wèn)的是更基礎(chǔ)的問(wèn)題:AI 分身到底能在多大程度上準(zhǔn)確預(yù)測(cè)一個(gè)具體真人會(huì)怎么做決定。團(tuán)隊(duì)招募了 1052 名具有全美代表性的受試者,先做兩小時(shí)深度訪談,再結(jié)合社會(huì)調(diào)查量表(GSS)、五因素人格測(cè)試、五種行為經(jīng)濟(jì)學(xué)博弈實(shí)驗(yàn),最后比較AI生成的“數(shù)字分身”和真人本人兩周后重新作答的結(jié)果有多接近。結(jié)論是:結(jié)合訪談和問(wèn)卷數(shù)據(jù)的智能體,復(fù)現(xiàn)真人自己兩周后重復(fù)作答的準(zhǔn)確率達(dá)到 0.86,比單純依賴人口統(tǒng)計(jì)學(xué)變量的傳統(tǒng)方法明顯更準(zhǔn),也明顯減少了按政治立場(chǎng)、種族、性別分組時(shí)的預(yù)測(cè)偏差。


Park在斯坦福HAI的采訪中說(shuō)得很直接:“這些語(yǔ)言模型其實(shí)是在扮演它剛剛采訪過(guò)的那個(gè)人。”(The language model is trying to role-play as the person it just interviewed.)他認(rèn)為訪談數(shù)據(jù)比單純的人口統(tǒng)計(jì)標(biāo)簽更關(guān)鍵,因?yàn)椤霸L談數(shù)據(jù)的好處在于,它包含了每個(gè)人的獨(dú)特之處,語(yǔ)言模型因此不會(huì)那么頻繁地做出基于種族的籠統(tǒng)概括”。他也把這項(xiàng)研究的野心說(shuō)得很明白:“我確實(shí)認(rèn)為,現(xiàn)在有很多社會(huì)問(wèn)題我們沒(méi)能很好解決,而這個(gè)測(cè)試平臺(tái)可以讓它們變得更容易應(yīng)對(duì),氣候變化、疫情政策這類'棘手問(wèn)題'都需要極其復(fù)雜的規(guī)劃和條件推演?!边@項(xiàng)研究的價(jià)值在于,它給“ AI 分身到底有多可信”這個(gè)問(wèn)題提供了一個(gè)可以量化的基準(zhǔn)線,而這條基準(zhǔn)線,正是前面幾個(gè)逃生仿真系統(tǒng)能不能被信任的地基。




潑冷水的人:驗(yàn)證才是真正的難題


如果只聽(tīng)這四組研究者的說(shuō)法,這項(xiàng)技術(shù)的發(fā)展軌跡會(huì)顯得異常順利——從 100 人到 13000 人,從單一場(chǎng)館到一整座城市,準(zhǔn)確率還能量化到 86%。但阿姆斯特丹大學(xué)計(jì)算社會(huì)科學(xué)副教授Petter T?rnberg 和合作者 Maik Larooij 在一篇題為《大語(yǔ)言模型解決了基于智能體建模的問(wèn)題嗎?》的批評(píng)性綜述里,給這條樂(lè)觀敘事潑了一盆冷水。他們論文摘要里的原話是:


"We argue that there are reasons to believe that LLMs will exacerbate rather than resolve the long-standing challenges of ABMs. The black-box nature of LLMs moreover limit their usefulness for disentangling complex emergent causal mechanisms."

——Larooij & T?rnberg, arXiv:2504.03274




他們提出的第一個(gè)問(wèn)題是黑箱性質(zhì):“大語(yǔ)言模型從根本上是黑箱模型……幾乎不可能確定為什么某個(gè)特定輸入會(huì)產(chǎn)生某個(gè)特定輸出?!备闊┑氖?,同樣的輸入在不同次運(yùn)行里可能給出不同的輸出,這直接威脅到科學(xué)研究最看重的可復(fù)現(xiàn)性。第二個(gè)問(wèn)題是偏差與刻板化:“模型經(jīng)常錯(cuò)誤地表征群體及其特征,經(jīng)常表現(xiàn)出夸張的刻板印象”。第三個(gè)問(wèn)題是幻覺(jué)和分布外場(chǎng)景下的失控:“在歷史上沒(méi)有先例的場(chǎng)景中,模型行為可能變得不穩(wěn)定”——而災(zāi)難現(xiàn)場(chǎng),恰恰經(jīng)常是“歷史上沒(méi)有先例的場(chǎng)景”。


T?rnberg 團(tuán)隊(duì)給出的核心診斷是:“驗(yàn)證仍然是核心挑戰(zhàn)”,而且“加入大語(yǔ)言模型,惡化而非解決了這個(gè)問(wèn)題”(“the addition of LLMs exacerbates rather than resolves this issue”)。他們認(rèn)為,目前很多研究依賴的是“表面效度或者只是松散關(guān)聯(lián)底層機(jī)制的結(jié)果指標(biāo)”,這讓這類模型"占據(jù)了一個(gè)模糊不清的方法論位置"——聽(tīng)起來(lái)很像科學(xué),但既不完全是傳統(tǒng)的基于規(guī)則的仿真,也不是被充分驗(yàn)證過(guò)的統(tǒng)計(jì)模型。


這個(gè)批評(píng)并非無(wú)的放矢。就連專門做“數(shù)字分身”驗(yàn)證的斯坦福團(tuán)隊(duì),也在論文里承認(rèn)自己的方法存在局限;另一項(xiàng)研究疫苗猶豫政策模擬的論文里,作者們同樣明確寫(xiě)道“這項(xiàng)早期探索不旨在提供確定的政策指導(dǎo)”,并且發(fā)現(xiàn)不同大模型之間的表現(xiàn)差異巨大,部分模型的偏差能超過(guò) 20%,這背后正是“預(yù)訓(xùn)練數(shù)據(jù)偏差”在作祟。換句話說(shuō),連身處這個(gè)領(lǐng)域內(nèi)部、真心想把這件事做成的研究者,也在論文的角落里,寫(xiě)下了和 T?rnberg 遙相呼應(yīng)的保留意見(jiàn)。


三層商業(yè)價(jià)值


把這四類研究串起來(lái)看,能看出一條清晰的商業(yè)化路徑,一共三層,風(fēng)險(xiǎn)隨層級(jí)依次升高:


  • 第一層 · 應(yīng)急管理 SaaS 工具:把 CMU 那樣耗時(shí) 16 個(gè)月的定制研究,做成學(xué)校、體育場(chǎng)館、地鐵站可以直接調(diào)用的標(biāo)準(zhǔn)化預(yù)案生成服務(wù)。

  • 第二層 · 城市數(shù)字孿生行為層:AgentSociety 這類城市級(jí)模擬可以讓數(shù)字孿生從“看得見(jiàn)的建筑物理模型”升級(jí)成“算得出人會(huì)怎么反應(yīng)的社會(huì)模型”。

  • 第三層 · 保險(xiǎn)風(fēng)險(xiǎn)定價(jià):如果一套系統(tǒng)能相對(duì)準(zhǔn)確地模擬出某個(gè)場(chǎng)館在特定人群密度下的傷亡概率分布,這本身就是一種可以被保險(xiǎn)精算模型直接使用的數(shù)據(jù)。


但按照 T?rnberg 的批評(píng),這三層商業(yè)化里,越往后風(fēng)險(xiǎn)越大:SaaS 化的預(yù)案生成工具,出錯(cuò)了大不了是建議不夠好;但如果保險(xiǎn)公司真的把一個(gè)尚未被充分驗(yàn)證的黑箱模型的輸出,直接喂進(jìn)精算定價(jià)模型,一旦模型在某個(gè)“沒(méi)有先例的場(chǎng)景”里悄悄失控,代價(jià)可能是系統(tǒng)性的。


圖:逃生模擬技術(shù)的三層商業(yè)化路徑


別高興太早:三個(gè)具體風(fēng)險(xiǎn)


結(jié)合 T?rnberg 的批評(píng)和四個(gè)案例本身暴露的問(wèn)題,至少有三個(gè)風(fēng)險(xiǎn)值得單獨(dú)拎出來(lái)。


逃生模擬技術(shù)的三個(gè)具體風(fēng)險(xiǎn)


第一個(gè)風(fēng)險(xiǎn)是“模型太平均”。大語(yǔ)言模型的訓(xùn)練數(shù)據(jù)本質(zhì)上是海量人類文本的統(tǒng)計(jì)平均,這意味著它扮演出來(lái)的“虛擬人”,行為上很容易向“最常見(jiàn)的反應(yīng)”收斂,而真實(shí)災(zāi)難現(xiàn)場(chǎng)的極端個(gè)體行為——比如某個(gè)人因?yàn)樘厥庑睦韯?chuàng)傷而做出完全反常的舉動(dòng)——恰恰是最容易被模型“磨平”的部分,而這些極端個(gè)體行為往往又是傷亡集中發(fā)生的地方。這正好對(duì)應(yīng) T?rnberg 說(shuō)的“夸張的刻板印象”問(wèn)題的反面:不是刻板印象太夸張,而是個(gè)體差異被抹得太平。


第二個(gè)風(fēng)險(xiǎn)是“微觀可信、宏觀失真”。斯坦福的研究證明了單個(gè)數(shù)字分身在特定任務(wù)上可以做到 86%的還原度,但這不代表幾千個(gè)這樣的分身放在一起模擬一場(chǎng)疏散時(shí),群體層面涌現(xiàn)出的踩踏、擁堵、次生恐慌這些宏觀現(xiàn)象也同樣可信——微觀精度和宏觀涌現(xiàn)是兩個(gè)不同量級(jí)的驗(yàn)證問(wèn)題,這恰恰是T?rnberg 那句“驗(yàn)證仍是核心挑戰(zhàn)”想說(shuō)的事情:目前沒(méi)有哪項(xiàng)研究能證明兩者可以簡(jiǎn)單疊加。


第三個(gè)風(fēng)險(xiǎn)是“過(guò)度對(duì)齊導(dǎo)致失真”。大模型在訓(xùn)練過(guò)程中被反復(fù)調(diào)教得“安全、禮貌、避免過(guò)激反應(yīng)”,但災(zāi)難現(xiàn)場(chǎng)里恰恰需要模擬出違規(guī)、非理性、甚至攻擊性的人類行為,一個(gè)被安全對(duì)齊磨平了棱角的模型,很可能天然地低估真實(shí)人群的混亂程度和恐慌烈度——這也是一種分布外失控,只不過(guò)失控的方向不是“太混亂”,而是“太乖”。


結(jié)語(yǔ):?jiǎn)栴}變了


從 AI 小鎮(zhèn)到今天,這項(xiàng)技術(shù)真正的進(jìn)步不是讓虛擬人“看起來(lái)更像人”,而是讓研究者開(kāi)始問(wèn)一個(gè)更尖銳的問(wèn)題:這些虛擬人在最壞的那幾分鐘里,還像不像人?


派對(duì)上像不像人,考驗(yàn)的是語(yǔ)言和社交表現(xiàn);火災(zāi)里像不像人,考驗(yàn)的是在信息缺失、極度恐慌、生死攸關(guān)的狀態(tài)下,會(huì)不會(huì)跟真人一樣做出誤判、跟風(fēng)、甚至互相傷害。


CMU、天大、清華、斯坦福這四組人,正在用各自的方式回答“能不能做到”;T?rnberg 這樣的批評(píng)者,則在提醒所有人先回答“你怎么知道它做到了”。這才是 “逃生模擬” 和 “AI 小鎮(zhèn)”之間真正的分野,也是這項(xiàng)技術(shù)接下來(lái)能不能被應(yīng)急管理部門、保險(xiǎn)公司真正信任并投入使用的關(guān)鍵。


但不管這些系統(tǒng)能做到多精確,最后按下疏散指令、決定是否相信模擬結(jié)果的,終究還得是人。


參考資料:

1. CMU應(yīng)急疏散研究:arXiv:2509.21868(作者:Yuxuan Li, Sauvik Das, Hirokazu Shirado / CMU)

2. RESCUE地鐵疏散系統(tǒng):arXiv:2507.20117|項(xiàng)目主頁(yè)|演示視頻|GitHub(負(fù)責(zé)人:李坤 / 天津大學(xué),ICCV 2025)

3. AgentSociety城市級(jí)模擬:arXiv:2502.08691|項(xiàng)目文檔(通訊作者:李勇 / 清華大學(xué))

4. 斯坦福數(shù)字分身研究:arXiv:2411.10109|項(xiàng)目頁(yè)|GitHub|Joon Sung Park采訪原文,Stanford HAI

5. T?rnberg批評(píng)性綜述:arXiv:2504.03274《Do Large Language Models Solve the Problems of Agent-Based Modeling? A Critical Review of Generative Social Simulations》(Petter T?rnberg, Maik Larooij / 阿姆斯特丹大學(xué))

6. 疫苗猶豫模擬局限性討論:arXiv:2503.09639

7. 2023年"AI小鎮(zhèn)"原始論文:arXiv:2304.03442《Generative Agents: Interactive Simulacra of Human Behavior》


AI創(chuàng)投日?qǐng)?bào)頻道: 前沿科技
本內(nèi)容由作者授權(quán)發(fā)布,觀點(diǎn)僅代表作者本人,不代表虎嗅立場(chǎng)。
如對(duì)本稿件有異議或投訴,請(qǐng)聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
成安县| 专栏| 金湖县| 鸡泽县| 辽阳市| 苗栗县| 茶陵县| 龙州县| 平武县| 龙川县| 凌海市| 永川市| 衡阳市| 容城县| 龙陵县| 远安县| 木里| 文成县| 会同县| 石景山区| 万宁市| 时尚| 虎林市| 铜鼓县| 衡南县| 洪雅县| 合水县| 绥江县| 唐河县| 竹山县| 北海市| 缙云县| 浦东新区| 临沭县| 常州市| 台南市| 澄江县| 浙江省| 宿州市| 潮安县| 龙海市|