久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

AI大模型與大數(shù)據(jù)沖擊了生物學(xué)理論的傳統(tǒng)定位,本文以虛擬細(xì)胞構(gòu)建為切入點(diǎn),重新反思理論在當(dāng)代生物學(xué)中的核心價值與發(fā)展路徑。 ## 1. 重新定義理論在科學(xué)中的角色 理論并非科學(xué)的終極目標(biāo),而是科學(xué)推理的工具,核心作用分為三類:解釋系統(tǒng)行為背后的本質(zhì)邏輯,內(nèi)插即通過簡約框架統(tǒng)一關(guān)聯(lián)海量數(shù)據(jù),外推即對未知事物做出預(yù)測。 理論以模型為操作對象,而非直接處理數(shù)據(jù);當(dāng)下多數(shù)理論困于象牙塔,對 broader 科學(xué)生態(tài)影響極小,例如工業(yè)中超過95%的控制器仍是百年歷史的PID,先進(jìn)控制理論極少落地。 計算機(jī)、機(jī)器學(xué)習(xí)先后改變了范式:計算機(jī)的數(shù)值模擬精度已超過理論抽象,大統(tǒng)計模型依托海量數(shù)據(jù)成為主流,系統(tǒng)生物學(xué)早年尋找普適設(shè)計原理的愿景基本被擱置,領(lǐng)域轉(zhuǎn)向方法開發(fā),亟需重新評估理論角色。 ## 2. 經(jīng)典理論相對于大統(tǒng)計模型的不可替代性 構(gòu)建虛擬細(xì)胞存在兩種路徑:自下而上的機(jī)制性模型和自上而下的統(tǒng)計模型,機(jī)制性模型本身是可解釋的知識庫,能通過模型與數(shù)據(jù)的不匹配指引知識增長,這是純統(tǒng)計模型難以做到的。 類似海王星發(fā)現(xiàn)的案例:牛頓力學(xué)模型通過軌道偏差推斷未知行星的存在,純統(tǒng)計模型僅能擬合現(xiàn)有數(shù)據(jù),很難做出這類概念性飛躍;當(dāng)前的可解釋性工具無法解決這類深層問題,過度依賴純數(shù)據(jù)驅(qū)動模型可能讓我們失去探究細(xì)胞本質(zhì)的核心提問能力。 ## 3. 生物學(xué)建模的合理路徑:從簡單可驗(yàn)證的子系統(tǒng)逐步構(gòu)建 要識別模型與數(shù)據(jù)的不匹配,要么依靠不可能性結(jié)果指明系統(tǒng)基本極限,要么依靠顯式建模,但全細(xì)胞顯式機(jī)理模型依賴上百個預(yù)設(shè)方程,參數(shù)正確性無法保障,且當(dāng)前常用的觀測指標(biāo)RNA-seq本身是粗粒度的間接替代,建模可靠性極低。 合理建模需要從簡單過程出發(fā),先明確參數(shù)測量精度,驗(yàn)證對擾動的預(yù)測能力;需要主動簡化模型保證參數(shù)可識別,追求“可理論推導(dǎo)、可數(shù)據(jù)證實(shí)”的中間路徑,而非堆砌所有已知機(jī)理。 類比飛機(jī)研發(fā):無論是全數(shù)據(jù)大模型還是全機(jī)理模擬,都很難讓人信任;可靠復(fù)雜系統(tǒng)都是逐步驗(yàn)證子系統(tǒng)、逐步整合測試而來,細(xì)胞建模也應(yīng)遵循這一路徑。 ## 4. 生物學(xué)理論發(fā)展可借鑒其他領(lǐng)域的成功經(jīng)驗(yàn) 奈奎斯特穩(wěn)定判據(jù)是理論介入學(xué)科的經(jīng)典范例:早年判斷動力系統(tǒng)穩(wěn)定性需要拆解所有零件寫微分方程,奈奎斯特僅依靠實(shí)驗(yàn)測得的頻域響應(yīng)就能判定反饋系統(tǒng)穩(wěn)定性,無需提前知曉內(nèi)部參數(shù),解決了試錯法無法破解的工程死胡同。 經(jīng)濟(jì)學(xué)、生物學(xué)、機(jī)器學(xué)習(xí)形成了鮮明對照:經(jīng)濟(jì)學(xué)理論長期跑在數(shù)據(jù)前,預(yù)測能力極差;生物學(xué)長期重實(shí)證拒理論,實(shí)驗(yàn)爆炸但理論缺位;機(jī)器學(xué)習(xí)實(shí)現(xiàn)了理論突破快速轉(zhuǎn)化工程改進(jìn)的良性飛輪。 AI生物學(xué)目前仍處于缺少堅實(shí)數(shù)理基礎(chǔ)的階段,學(xué)界很多人只是生硬拼接AI套取經(jīng)費(fèi),低估了底層基礎(chǔ)工作的必要性;生物學(xué)需要先完成核心目標(biāo)的嚴(yán)肅審視,借鑒領(lǐng)域發(fā)展的成熟模板加速進(jìn)程,沒有捷徑可走。
AI 時代,生物學(xué)還需要理論嗎?— 從虛擬細(xì)胞(AIVC) 說起
2026-05-30 00:19

AI 時代,生物學(xué)還需要理論嗎?— 從虛擬細(xì)胞(AIVC) 說起

本文來自微信公眾號: 范陽 ,編輯:范陽,作者:范陽,原文標(biāo)題:《AI 時代,生物學(xué)還需要理論嗎?— 從虛擬細(xì)胞 (AIVC) 說起》


以下信件由哈佛大學(xué)保爾森實(shí)驗(yàn)室(Paulsson laboratory)的科學(xué)家諾亞·奧斯曼(Noah Olsman)撰寫。這些信件原本無意發(fā)表,許多細(xì)節(jié)也可進(jìn)一步完善。經(jīng)諾亞許可,我在此將其發(fā)表,希望它們能成為更多討論的起點(diǎn)。如有反饋意見,請發(fā)送郵件至noah.olsman@gmail.com。


第一封信


Letter#1


理論在科學(xué)中扮演著怎樣的角色?我認(rèn)為,這個問題所包含的微妙細(xì)節(jié)遠(yuǎn)比大多數(shù)人想象的要多,而且在過去的一個世紀(jì)里,其答案已經(jīng)發(fā)生了改變。


存在一種廣泛存在卻未經(jīng)明言的假設(shè)—通常在教科書中被傳授—即理論是科學(xué)的終極目標(biāo)(theory is the end goal of science)。實(shí)驗(yàn)被用來構(gòu)建理論,而當(dāng)一個理論能夠正確預(yù)測實(shí)驗(yàn)結(jié)果時,它就通過了檢驗(yàn)。在這種框架下,實(shí)驗(yàn)扮演著從屬于理論的次要角色。這種觀點(diǎn)在教學(xué)上固然有用,但我們有必要暫時將理論請下神壇,把它僅僅視作科學(xué)推理的另一種工具。


從這個視角來看,理論在科學(xué)中的角色可以歸納為三個范疇:解釋(explanation)、內(nèi)插(interpolation)和外推(extrapolate)(注1)。


解釋,意味著理論能夠通過推導(dǎo)模型的通用特性,來闡明或解釋其行為背后的本質(zhì)邏輯(例如:該系統(tǒng)在何時處于穩(wěn)定狀態(tài)?是否存在守恒量?)。


內(nèi)插,是理論與建模的結(jié)合(Interpolation is the marriage of theory and modeling),它讓我們能夠嘗試尋找一種簡約的框架,將眾多數(shù)據(jù)點(diǎn)以某種統(tǒng)一的方式聯(lián)系起來(例如:愛因斯坦統(tǒng)一慣性質(zhì)量與引力質(zhì)量,或者諾特定理將守恒定律與對稱性緊密相連)。


外推,則是理論帶來的核心回報(the big payoff);它讓理論能夠?qū)ι形窗l(fā)生、且不存在于現(xiàn)有數(shù)據(jù)中的事物做出預(yù)測(theory making predictions about things that have not yet happened and do not exist in current data)。


注1:這雖然是一種簡化,但需要注意的是,理論其實(shí)并不直接作用于數(shù)據(jù),而是作用于模型(theory doesn’t really operate on data directly,but rather on models)?,F(xiàn)行科學(xué)課程體系的一個重大缺失,就是完全沒有對“如何構(gòu)建數(shù)學(xué)模型”這一問題進(jìn)行過嚴(yán)肅的探討。在我上過的每一門課里,模型幾乎都是被直接塞給你的。你能看到模型是如何擬合數(shù)據(jù)的,但這些模型就像是一組從虛無中憑空抓出來的方程或形式化體系。我們經(jīng)常將“建模”與“理論”混為一談,但實(shí)際上,理論是以模型為操作對象的。


順便提一句,我認(rèn)為這也部分回答了你關(guān)于“生物學(xué)中的理論”那個問題:如果你的模型本身不夠好,理論也就沒有多少可供加工的原材料。


長期以來,“外推”一直被用來證明理論的合理性,而且理論構(gòu)想也確實(shí)帶來過巨大的概念性突破。但發(fā)展到今天,許多理論都存在于象牙塔(或孤島)之中,對更廣泛的科學(xué)與工程生態(tài)系統(tǒng)僅能產(chǎn)生微乎其微的影響(注2)(a lot of theory exists in a bubble,with only marginal impact on the broader science and engineering ecosystem)。


注2:在控制理論領(lǐng)域,有一個經(jīng)常被引用的統(tǒng)計數(shù)據(jù):工業(yè)中超過95%的控制器都是PID控制器,盡管PID已經(jīng)有一百多年的歷史,而且現(xiàn)在還有許多更先進(jìn)的技術(shù)。這個說法總是被當(dāng)作一個有點(diǎn)幽默的自嘲式軼事來提及,但它凸顯了理論的理想化版本與理論家的工作在現(xiàn)實(shí)世界中實(shí)際發(fā)揮作用的方式之間的差距。理論工作之所以能夠持續(xù)存在,是因?yàn)橛凶銐蚨嘤袑?shí)際用途的產(chǎn)出在支撐著它。


我懷疑這種轉(zhuǎn)變始于20世紀(jì)中葉,當(dāng)時計算機(jī)開始在“外推”能力上與理論展開競爭:原子彈是基于理論建造出來的,但氫彈結(jié)構(gòu)過于復(fù)雜,在很大程度上依賴于數(shù)值模擬(注3)。


注3:馮·諾依曼和他的妻子為此做了編程工作。這也是“蒙特卡洛模擬”(Monte Carlo simulation)這一術(shù)語的起源。


在過去,理論的合理性是自證的:它是進(jìn)行預(yù)測的唯一工具;且由于當(dāng)時的數(shù)據(jù)有限且成本高昂,模型無論如何都必須足夠簡單,以便進(jìn)行理論分析。而隨著計算機(jī)的接管,人們開始質(zhì)疑:當(dāng)模擬可以做到更精確時,理論抽象本身是否還有價值(whether theoretical abstractions were intrinsically worthwhile when simulation could be more precise)?


如果我們快進(jìn)到今天,我認(rèn)為機(jī)器學(xué)習(xí)再次改變了這一范式。如果我們能夠收集海量數(shù)據(jù),而我們對這些數(shù)據(jù)建構(gòu)的最佳模型,又是些龐大且不可解釋的統(tǒng)計模型,那么理論該往何處安放?你或許可以爭辯說,理論仍然能對現(xiàn)實(shí)提供更深層的洞察(theory will still offer deeper insight into reality),但這也正是我想帶入我們所處的生物學(xué)世界的地方,而且我認(rèn)為系統(tǒng)生物學(xué)(systems biology)的發(fā)展史就是一個很好的案例研究。


當(dāng)系統(tǒng)生物學(xué)作為一個領(lǐng)域剛剛興起時,其愿景是:我們終于能夠?qū)?shù)據(jù)驅(qū)動的生物過程模型整合在一起,并在這些模型中揭示出生物系統(tǒng)簡單且普適的設(shè)計原理(we could finally put together data-driven models of biological processes,and that within these models we would uncover simple and universal design principles for biological systems)(注4)。


注4:參見烏里·阿?。║ri Alon)在2000年代初的研究工作。


但看看過去二十年里這個領(lǐng)域發(fā)生了什么!這一愿景基本上已經(jīng)被束之高閣(或被淘汰)了。該領(lǐng)域在2000年代和2010年代的許多領(lǐng)軍人物都轉(zhuǎn)向了方法開發(fā);那些理性的行動者意識到,該領(lǐng)域的數(shù)據(jù)本質(zhì)上過于粗粒度,根本無法用來生成第一性原理模型(first-principles models),因此他們圍繞解決這些問題調(diào)整了自己的研究方向。


直到不久前,數(shù)據(jù)生成還遵循著一種“只要你建好,自然會有人來”(if you build it,they will come)的思路。認(rèn)為只要生成足夠多的數(shù)據(jù),我們就能回歸到那些簡單的理論模型,實(shí)現(xiàn)該領(lǐng)域早期所設(shè)想的圖景。但現(xiàn)在,游戲規(guī)則已經(jīng)改變,驅(qū)動方向轉(zhuǎn)向了統(tǒng)計模型。就連系統(tǒng)生物學(xué)早期許多最杰出的理論家,也已用腳投票。許多頂尖的定量生物學(xué)系已經(jīng)偏離了理論,轉(zhuǎn)而支持以方法為導(dǎo)向的研究(moved away from theory in favor of methods-oriented research)。


是時候重新評估理論在科學(xué)和工程中的角色了。在生物學(xué)內(nèi)部,我們需要深刻反思:理論到底為這個領(lǐng)域貢獻(xiàn)了什么?我之所以這樣說,是因?yàn)槲沂欠浅V匾暲碚摰娜耍⑶椅业墓ぷ饕彩菄@理論來構(gòu)建的!我并不認(rèn)為理論已經(jīng)走入死胡同,但我認(rèn)為理論家們需要認(rèn)真思考:他們究竟為自己的領(lǐng)域貢獻(xiàn)了什么(注5)。


注5:這方面的一個正面例子是控制理論家們發(fā)起了“動力學(xué)與控制學(xué)習(xí)”(Learning for Dynamics and Control,簡稱L4DC)學(xué)術(shù)會議,其唯一目的就是讓控制理論家與機(jī)器學(xué)習(xí)領(lǐng)域的人坐在一起,共同探討這兩個領(lǐng)域如何才能開展建設(shè)性的互動。


尼科的回信


Response from Niko


諾亞,你是否認(rèn)為在生物學(xué)中,有哪些東西是我們只能通過經(jīng)典理論獲取,而無法從大型統(tǒng)計模型中得到的(do you reckon there are things in biology we can only get from classical theory,and not from large statistical models)?


思考這個問題的一個有效框架或許是“虛擬細(xì)胞”(virtual cell)。構(gòu)建虛擬細(xì)胞基本上有兩種路徑:自上而下(top-down)或自下而下(bottom-up)。


自下而上或稱“機(jī)制性”的方法(mechanistic”approach),其最佳代表或許是斯坦福大學(xué)的馬庫斯·科弗特(Markus Covert)。該路徑旨在依據(jù)方程和第一性原理來構(gòu)建一個全細(xì)胞模型(a whole-cell model from equations and first principles)。它給人的感覺比自上而下的嘗試更為優(yōu)雅,因?yàn)樗鼧?gòu)建出了一個可解釋的“知識庫”?;旧?,模型會提出預(yù)測,實(shí)驗(yàn)揭示其中的差異,每一個不匹配之處都會告訴你你的理解哪里出了錯,以及哪個實(shí)驗(yàn)可能有助于填補(bǔ)這一空白。這是一種增長知識(grow knowledge)的途徑。


同時,似乎有些東西是我們只能從機(jī)制性模型中學(xué)習(xí)到的,而無法從純粹的統(tǒng)計模型中獲取。馬庫斯·科弗特曾給我講過發(fā)現(xiàn)海王星的故事,這個發(fā)現(xiàn)源于數(shù)據(jù)集中的偏差。天文學(xué)家們擁有關(guān)于已知行星的牛頓模型,他們注意到天王星的軌道行為與預(yù)測不符,便推斷出這些擾動是由一顆當(dāng)時未知的行星—海王星—施加的引力引起的。科弗特的觀點(diǎn)是:今天你可以用同樣的數(shù)據(jù)訓(xùn)練一個統(tǒng)計模型來預(yù)測行星運(yùn)動,但這個模型不太可能做出這種性質(zhì)的概念性飛躍,推斷出一顆缺失行星的存在。有些發(fā)現(xiàn)似乎仍然需要人類推理,在一個機(jī)制性框架上運(yùn)作,至少目前是這樣(There are some discoveries that seem to require human reasoning,operating on a mechanistic framework—at least for now)(注6)。


注6:阿爾文·賈賈迪克塔(Alvin Djajadikerta)在Asimov Press上也闡述過類似的觀點(diǎn)。可以參考他在該平臺上發(fā)表的文章《為顛覆性科學(xué)而設(shè)計的人工智能》(AI for Disruptive Science)


https://www.asimov.press/p/ai-science


每當(dāng)我坐下來撰寫關(guān)于生物學(xué)理論的文章,并試圖闡明我對統(tǒng)計模型的批判時,我總會擔(dān)心讀者會輕描淡寫地回一句:“得了吧,我們可以構(gòu)建稀疏自編碼器(sparse autoencoders)來解釋那些原本不透明的模型(opaque models)所做出的預(yù)測?!保ㄗ?)


注7:Adam Green(亞當(dāng)·格林)在Markov.bio平臺上對此多有論述??蓞㈤喫奈恼隆度缤糁粔K暗色玻璃:機(jī)制可解釋性作為通向端到端生物學(xué)的橋梁》(Through a Glass Darkly:Mechanistic Interpretability as the Bridge to End-to-End Biology)。


https://www.markov.bio/research/mech-interp-path-to-e2e-biology


也許他們是對的。但隨后我想到馬庫斯以及海王星的例子,我便不再確定這些可解釋性工具是否真的能解決更深層次的問題(not sure interpretability tools actually solve the deeper problem)。


我個人對純數(shù)據(jù)驅(qū)動模型的擔(dān)憂在于,我們可能會失去一些科學(xué)本身所固有的、極其獨(dú)特的東西。如果我們探究一個模型的目的,僅僅局限于做出有用的預(yù)測,或者為某種疾病尋找治療方法,我們是否還能真正提出正確的問題,去理解一個細(xì)胞最根本的本質(zhì)?如果我們從頭到尾都只采用這種自上而下的路徑,我們甚至還知道該如何去駕馭這些稀疏自編碼器嗎?又或者,我們還會知道該向它們提出什么樣的問題嗎?


第二封信


Letter#2


我同意,理論帶來的最大好處之一,就是提供了一種將我們對某個系統(tǒng)的信念(認(rèn)知)形式化、做出預(yù)測、然后觀察數(shù)據(jù)與之是否匹配的方法。但在我看來,問題在于,我們只有在兩種情況下才能滿懷信心地去識別那些“不匹配”之處。


第一種情況,我們可以利用理論試圖去證明“不可能性的結(jié)果”(impossibility results)。例如,我們可以論證:任何包含XYZ相互作用元件的系統(tǒng),都絕不可能實(shí)現(xiàn)某種特定行為(比如振蕩或?qū)⒃肼暱刂圃谔囟ㄋ揭韵拢?。這種理論的優(yōu)勢在于,你不需要關(guān)于整個系統(tǒng)的詳細(xì)模型,而只需要了解某個特定子系統(tǒng)的信息。


有一篇論文給出了反饋系統(tǒng)抑制噪聲能力的四次方根標(biāo)度律:要將噪聲降低10倍,就需要將信號速率提高10,000倍。這種理論的局限性在于,它從未真正具有建設(shè)性。它最多能告訴你,一個給定的系統(tǒng)何時觸及了某個基本極限。如果你確實(shí)超過了這個極限,那么(假設(shè)你的理論結(jié)果是正確的)就意味著你對系統(tǒng)中受限部分的理解是錯誤的。



第二種情況,我們可以嘗試對系統(tǒng)進(jìn)行顯式建模(explicit modeling)。顯而易見,這能帶來精確得多的結(jié)果,但這些結(jié)果的有效性,與模型結(jié)構(gòu)以及模型參數(shù)的正確性高度綁定。我認(rèn)為,這正是自下而上的細(xì)胞模型駛?cè)胛kU水域的地方。如果你想對整個細(xì)胞進(jìn)行顯式建模,在對其進(jìn)行嚴(yán)密分析并將數(shù)據(jù)與理論進(jìn)行對比之前,你必須對注入模型之中的成百上千個方程抱有極其異乎尋常的信心。


坦率地說,這也是為什么我對這整個嘗試持懷疑態(tài)度。誠然,你確實(shí)可以把它做出來,也許你還能展示你的全細(xì)胞模型在某種均方誤差(MSE)意義上表現(xiàn)良好;但如果你想用這個模型做點(diǎn)別的事情,你要么需要極其確信這個模型在機(jī)理上是完全正確的,要么必須對“哪些參數(shù)對特定的預(yù)測結(jié)果影響最深”有非常扎實(shí)的底層理解。而當(dāng)你所觀測的輸出結(jié)果,僅僅是你真正關(guān)心的核心指標(biāo)的一個間接替代變量(indirect proxy)時,這種建模方式就會變得更加不靠譜(sketchy)(注8)。


注8:如今,我們最常作為輸出結(jié)果(觀測指標(biāo))的是轉(zhuǎn)錄組測序(RNA-seq)。而且我認(rèn)為,我們(定量生物學(xué)界)在這上面投入了太多信念,潛意識里覺得:既然我們能以如此高效且經(jīng)濟(jì)的方式進(jìn)行RNA-seq,它就一定能為我們提供關(guān)于細(xì)胞狀態(tài)的可靠信息。這在宏觀上或許大致正確,但不妨考慮這樣一個思想實(shí)驗(yàn):


想象在未來的某個時刻,我們已經(jīng)徹底完善了單細(xì)胞蛋白質(zhì)組學(xué)(single-cell proteomics),并且能夠獲取細(xì)胞中每種蛋白質(zhì)狀態(tài)的完整讀數(shù)。一旦這一天到來,我們對RNA-seq這種分析手段還能保留多少信任?我的猜測是,相比之下,轉(zhuǎn)錄組學(xué)(transcriptomics)屆時看起來會顯得極其粗粒度且原始。


眼下,RNA-seq是我們所能寫出的最優(yōu)解,所以我們多多少少必須去信任它??梢坏┫乱淮夹g(shù)席卷而來,我們就會納悶,當(dāng)年自己為什么會對它寄予如此厚望——正像當(dāng)年微陣列芯片(microarrays)、定量PCR(qPCR)以及許多其他技術(shù)曾歷過的宿命一樣。


如果我們想開始真正對細(xì)胞進(jìn)行建模,我認(rèn)為我們需要從簡單的過程做起,并開展那些真正艱難的工作:確切搞清楚我們測量參數(shù)的精度究竟有多高、預(yù)測新數(shù)據(jù)的能力有多強(qiáng)、對實(shí)驗(yàn)施加擾動后我們的預(yù)測是否依然準(zhǔn)確。而一個反直覺的事實(shí)是,這樣的努力實(shí)際上會把我們推離純粹的“機(jī)理模型”(mechanistic models),轉(zhuǎn)而推向更具“現(xiàn)象學(xué)意義的模型”(phenomenological models)。


我之所以這么說,是因?yàn)榧幢阍谖覀兺耆獣韵到y(tǒng)內(nèi)部機(jī)理的情況下,如果我們仔細(xì)推演報告基因(reporters)實(shí)際上能告訴我們什么,往往會發(fā)現(xiàn)某些參數(shù)組合是退化的(degenerate),無法通過任何實(shí)驗(yàn)來唯一識別。


舉個簡單的例子:如果你手中唯一的觀測數(shù)據(jù)是穩(wěn)態(tài)基因表達(dá)量,你是無法分別推斷出基因的產(chǎn)生速率(kp)和降解速率(kd)的,因?yàn)榉€(wěn)態(tài)僅僅是這兩者比值(kp/kd)的一個函數(shù)。因此,我們不能一腦股地把所有已知的生物學(xué)知識都塞進(jìn)模型里,相反,我們必須深思熟慮地去簡化模型,使得模型的參數(shù)在給定的實(shí)驗(yàn)數(shù)據(jù)集下是可識別的(注9)。


注9:這類介于底層機(jī)理與全系統(tǒng)數(shù)值模擬之間的建模方式,有時會招致批評,因?yàn)槲锢韺W(xué)家往往傾向于提出模型并推導(dǎo)其理論特性,卻止步于將其與數(shù)據(jù)進(jìn)行映射(對接)的下一步。真正值得追求的中間地帶(當(dāng)然,這是基于我個人工作所帶有的偏見)是:模型既要足夠簡單以適應(yīng)理論推導(dǎo),同時又能得到數(shù)據(jù)的嚴(yán)格證實(shí)。


這是我非常喜歡的一個思想實(shí)驗(yàn)。想象一下,有人邀請你登上一架全新研發(fā)的飛機(jī)。當(dāng)你詢問安全問題時,他們告訴你,他們在飛機(jī)的每一個零部件上都安裝了傳感器,并將所有數(shù)據(jù)喂給了一個龐大的模型,而模型顯示這架飛機(jī)可以安全飛行。你敢上去嗎?大概率不敢。


現(xiàn)在,假設(shè)他們把整架飛機(jī)的機(jī)理模型(機(jī)制模型)輸入到了一臺超級計算機(jī)中進(jìn)行模擬。你敢上去嗎?我的答案依然傾向于不敢,因?yàn)樾湃芜@種模擬,需要對建模時的種種假設(shè)抱有極其巨大的信念。


現(xiàn)實(shí)情況是,我們構(gòu)建復(fù)雜系統(tǒng)的方式,是通過不斷驗(yàn)證各個子系統(tǒng)的模型、將它們整合、測試這些整合后的性能,一步步推進(jìn)的(we build up complex systems by validating models of various subsystems,integrating them,testing those integrations)。這雖然不是某個宏偉的統(tǒng)一框架,但卻是做出可靠預(yù)測的路徑。


也許目前最前沿的細(xì)胞模型已經(jīng)做到了這一點(diǎn),但在我的感覺中,現(xiàn)有的文獻(xiàn)看起來更像是一個把數(shù)據(jù)和假設(shè)強(qiáng)行縫合在一起的“科學(xué)怪人”(Frankenstein)。它確實(shí)能產(chǎn)生一些結(jié)果,但絕對還不是一架能讓你心甘情愿坐上去的飛機(jī)(注10)。


注10:我認(rèn)為這非常能說明問題:盡管縮放定律(scaling laws)和通用大模型取得了巨大的成功,但作為首個對安全有著極苛刻要求的機(jī)器學(xué)習(xí)系統(tǒng)—自動駕駛汽車,依然是以漸進(jìn)、增量的方式研發(fā)出來的(developed incrementally)。


也許這種情況未來會發(fā)生改變,但我認(rèn)為,我們?nèi)匀恍枰吓傻墓こ虒W(xué)(old-school engineering)來足夠深刻地理解這些復(fù)雜系統(tǒng),從而能夠?qū)λ鼈冞M(jìn)行工程化改造,無論這些系統(tǒng)是汽車,還是CAR-T細(xì)胞。


第三封信


Letter#3


我腦子里又冒出了幾個后續(xù)的想法,覺得還是得在它們色散消退之前發(fā)給你。我最近在聽一個(非常小眾的)由控制理論家主持的播客,節(jié)目里他講述了該領(lǐng)域最核心的一項理論成果的歷史—奈奎斯特穩(wěn)定判據(jù)(Nyquist stability criterion)。


范陽注:此播客的鏈接


https://www.incontrolpodcast.com/1632769/episodes/18850371-ep42-incontrol-guide-to-the-nyquist-criterion


在19世紀(jì)(如麥克斯韋或勞斯的方法),你想知道一個蒸汽機(jī)或一個動力系統(tǒng)會不會失控爆炸,你必須把這個系統(tǒng)的每一個物理零件、每一顆螺絲的質(zhì)量、摩擦力全部寫成微分方程。這就像馬庫斯·科弗特試圖把細(xì)胞里的每一個分子都寫進(jìn)方程一樣。但你也可以用“外在數(shù)據(jù)”錨定系統(tǒng)的“內(nèi)在邊界”:哈里·奈奎斯特(Harry Nyquist,一位同樣來自貝爾實(shí)驗(yàn)室的傳奇人物)在1932年發(fā)現(xiàn):你根本不需要知道這個黑盒系統(tǒng)內(nèi)部是怎么連線的,也不需要知道里面有幾百個未知參數(shù)。你只需要對這個系統(tǒng)輸入不同頻率的正弦波信號(擾動),測量它輸出的幅度和相位(這就是純粹的實(shí)驗(yàn)數(shù)據(jù),即頻域響應(yīng)),在復(fù)平面上畫出一條曲線(奈奎斯特圖),你就能以100%的數(shù)學(xué)確定性確信:這個系統(tǒng)是絕對穩(wěn)定的。


不用展開太多細(xì)節(jié),簡而言之,這是每一門控制理論入門課都會講到的成果。它是首批允許工程師預(yù)測反饋系統(tǒng)何時穩(wěn)定、何時不穩(wěn)定的實(shí)用方法之一。盡管在19世紀(jì)就已經(jīng)有了許多可以用來證明給定微分方程組穩(wěn)定性的成果,但它們都有一個共同的前提:你必須在事前就擁有一個高度參數(shù)化的系統(tǒng)模型。


而奈奎斯特判據(jù)的精妙之處在于:盡管在擁有模型的情況下它確實(shí)能用來證明系統(tǒng)的穩(wěn)定性,但它同樣可以純粹基于實(shí)驗(yàn)數(shù)據(jù)來做到這一點(diǎn)(注11)。


注11:其基本思路是:你對一個開環(huán)(Open-loop)輸入/輸出系統(tǒng)(比如一個電子管放大器)進(jìn)行一次標(biāo)準(zhǔn)化的實(shí)驗(yàn)。實(shí)驗(yàn)中,你輸入振幅恒定、但頻率逐漸增高的正弦波信號(掃頻)。


如果該系統(tǒng)是線性的,那么輸出也必然是一個相同頻率的正弦波,但其振幅和相位(即波峰錯開的時間)不一定保持原樣。利用這些實(shí)驗(yàn)數(shù)據(jù),你可以繪制出輸入信號的頻率與輸出信號的振幅及相位之間的關(guān)系圖。這一對圖表,在工程上被稱為波特圖(Bode plot)。


現(xiàn)在關(guān)鍵的問題來了:你能夠僅僅依靠這種“開環(huán)”的測試特性,去準(zhǔn)確預(yù)測該系統(tǒng)在“閉環(huán)”(引入反饋)狀態(tài)下的穩(wěn)定性嗎?奈奎斯特所意識到的正是:你可以基于動力學(xué)系統(tǒng)底層深奧的數(shù)學(xué)特性,推導(dǎo)出一套完備的理論。這便誕生了著名的奈奎斯特穩(wěn)定判據(jù)(Nyquist stability criterion)。


從最基礎(chǔ)的層面來說,該判據(jù)表明:你可以將上述波特圖中的相位和幅值數(shù)據(jù)提取出來,將它們合并并繪制成復(fù)平面上的一條運(yùn)動軌跡(即奈奎斯特圖),然后數(shù)一數(shù)這條軌跡圍繞“-1”這個點(diǎn)圈了多少次。這個繞圈的次數(shù),將直接對應(yīng)并決定該系統(tǒng)究竟是穩(wěn)定還是不穩(wěn)定。如果你覺得上述討論過于抽象,這里還有一個用Claude制作的交互式小教程。


我之所以提起這個,是因?yàn)樗且粋€非常優(yōu)美的歷史范例,展示了理論究竟是如何真正進(jìn)入一門學(xué)科的(how theory actually enters a discipline)。


一個領(lǐng)域首先會發(fā)現(xiàn)某種出人意料且極具實(shí)用價值的新現(xiàn)象(在當(dāng)下這個案例中,即電子系統(tǒng)的反饋控制),隨后便利用它構(gòu)建出日益復(fù)雜的底層技術(shù),并憑借著工程直覺一路高歌猛進(jìn)—直到他們撞上那些單憑“試錯法”(trial and error)根本無法解決的死胡同。在這個關(guān)頭,如果我們足夠幸運(yùn),理論就會挺身而出并大放異彩。


在奈奎斯特的案例中,電話公司發(fā)現(xiàn)長距離網(wǎng)絡(luò)因其反饋放大器而出現(xiàn)不穩(wěn)定性,但卻沒有系統(tǒng)的方法來解決。奈奎斯特找到了如何利用現(xiàn)有實(shí)驗(yàn)數(shù)據(jù)來破解核心問題的方法,他的工作為控制理論成為一門嚴(yán)謹(jǐn)?shù)膶W(xué)科奠定了基礎(chǔ)。你可以講一個結(jié)構(gòu)完全相同的故事,關(guān)于香農(nóng)與信息論,或者麥克斯韋與電磁學(xué)(注12)。


注12:如果你沒讀過《原子彈秘史》(The Making of the Atomic Bomb),強(qiáng)烈推薦,這本書精彩極了,前半部分全是關(guān)于這段科學(xué)史的。


范陽注:目前的AI生物學(xué)研究到大部分的AI4Science研究都還在電磁學(xué)被整合發(fā)明之前的時期,要么是“堆砌數(shù)據(jù)的純AI黑盒”,要么是人類科學(xué)家陷入到不同細(xì)節(jié)和局域的無限復(fù)雜性當(dāng)中,又缺少堅實(shí)的數(shù)理基礎(chǔ)。


我盡量不把篇幅拉得太長,但我認(rèn)為今天有三個獨(dú)特且有趣的領(lǐng)域非常值得對照思考(three idiosyncratic but interesting juxtapositions),那就是:經(jīng)濟(jì)學(xué)、機(jī)器學(xué)習(xí)和生物學(xué)(economics,machine learning,and biology)。這三個學(xué)科構(gòu)成了一個關(guān)于理論的金發(fā)姑娘故事。


在光譜的一端是經(jīng)濟(jì)學(xué),其理論在過去數(shù)十年里遠(yuǎn)遠(yuǎn)跑在了數(shù)據(jù)前面(theory outpaced data for decades)。那些理論曾是如此優(yōu)美且數(shù)學(xué)上精確,但隨著數(shù)據(jù)收集技術(shù)的提升,事實(shí)證明它們的預(yù)測能力相當(dāng)糟糕,導(dǎo)致整個領(lǐng)域目前已經(jīng)轉(zhuǎn)向了更加務(wù)實(shí)的實(shí)證主義(the field has shifted to be more empirical)。


在光譜的另一端則是生物學(xué),幾十年來一直堅定地保持實(shí)證傳統(tǒng),抵制全面的理論化處理(resisted comprehensive theoretical treatment)。這導(dǎo)致實(shí)驗(yàn)技術(shù)爆炸式增長,但人們對理論的普遍持懷疑態(tài)度。似乎把理論搞對是如此困難,以至于我們基本上認(rèn)定,不如一門心思埋頭做實(shí)驗(yàn)更簡單。


而在這兩者之間的,則是機(jī)器學(xué)習(xí)。在這里,理論與實(shí)驗(yàn)進(jìn)入了一種狂熱且高效的良性飛輪:每一個邊際上的概念突破,似乎都能立即轉(zhuǎn)化為工程實(shí)踐上的改進(jìn),并驅(qū)動全新的工程落地。為了讓這個飛輪不停運(yùn)轉(zhuǎn),頂尖的研究人員在市場上被賦予了天文數(shù)字般的身價。這至少在某種程度上是個泡沫,但勞動力市場告訴我們,在理想條件下研究人員可以有多么高效。


也許生物學(xué)永遠(yuǎn)不會迎來那樣的拐點(diǎn),但我懷疑,即便它迎來了,也必須經(jīng)歷與其他領(lǐng)域成功案例一模一樣的陣痛。我的意思是,我們必須承認(rèn),這個領(lǐng)域注定要走完它該走的軌跡。這條路上大概率沒有捷徑可走,但如果我們能意識到這個“模板”的存在,就能試著去加速這一進(jìn)程。也許這在元科學(xué)(metascience,關(guān)于科學(xué)自身的科學(xué))領(lǐng)域已經(jīng)是陳詞濫調(diào)了,但我認(rèn)為,通過這種對其他領(lǐng)域成功經(jīng)驗(yàn)的歷史剖析,去觀察有哪些東西可以映射到那些尚未迎來拐點(diǎn)的領(lǐng)域,是一件具有極高實(shí)用價值的事。


我們需要對“我們當(dāng)下在生物學(xué)中究竟想達(dá)成什么”開展某種嚴(yán)肅的智力審視(serious intellectual investigation of what we are trying to accomplish in biology now)。盡管人們對AI在生物學(xué)未來中所扮演的角色感到由衷且巨大的興奮,但我擔(dān)心,我們大大低估了在這些工具能夠兌現(xiàn)其承諾之前,究竟還有多少底座性的開創(chuàng)工作(foundational work)需要去完成。看到這么多學(xué)界教職人員為了吸引資助者,將人工智能生硬地貼到自己工作上,而沒有對更大的圖景進(jìn)行認(rèn)真思考,這讓我感到有些悲哀(It has been a bit sad seeing so many faculty staple AI onto their own work to appeal to funders,without much serious engagement with the bigger picture)。


這讓我想起了庫爾特·馮內(nèi)古特(Kurt Vonnegut)在《上帝保佑你,羅斯瓦特先生》中的開篇第一句話:


“在這個關(guān)于人的故事里,一筆金錢成為了主角;正如同在一個關(guān)于蜜蜂的故事里,一包蜂蜜理所當(dāng)然地會成為主角一樣(A sum of money is a leading character in this tale about people,just as a sum of honey might properly be a leading character in a tale about bees)?!?/p>


原文鏈接:


https://nikomc.com/essays/theory

AI創(chuàng)投日報頻道: 前沿科技
本內(nèi)容來源于網(wǎng)絡(luò) 原文鏈接,觀點(diǎn)僅代表作者本人,不代表虎嗅立場。
如涉及版權(quán)問題請聯(lián)系 hezuo@huxiu.com,我們將及時核實(shí)并處理。
正在改變與想要改變世界的人,都在 虎嗅APP
昭通市| 望都县| 固镇县| 延边| 长子县| 舟山市| 黄山市| 紫金县| 高雄市| 宜春市| 武义县| 东台市| 苏尼特左旗| 平定县| 安新县| 曲松县| 丰都县| 海南省| 宁阳县| 从江县| 湘乡市| 鸡西市| 两当县| 巴中市| 吉水县| 静乐县| 鄯善县| 郧西县| 阿拉善右旗| 江城| 德钦县| 平原县| 安吉县| 阜康市| 桐庐县| 玛曲县| 依安县| 奉节县| 巍山| 石城县| 丘北县|