本文來(lái)自微信公眾號(hào): 經(jīng)濟(jì)觀察報(bào)觀察家 ,作者:經(jīng)觀觀察家
近期,一個(gè)生僻的概念——“遞歸自我改進(jìn)”(Recursive Self Improvement,簡(jiǎn)稱(chēng)RSI)突然成為AI界關(guān)注的焦點(diǎn)。
顧名思義,所謂遞歸自我改進(jìn),就是AI介入對(duì)其自身的改進(jìn),從而形成“能力提升—研發(fā)能力增強(qiáng)—能力進(jìn)一步提升”的正反饋。容易看到,如果這個(gè)循環(huán)可以達(dá)成,AI的能力將有望迎來(lái)指數(shù)級(jí)增長(zhǎng)。
本來(lái),關(guān)于RSI的討論通常只存在于哲學(xué)家與未來(lái)學(xué)家的思想推演之中。但從2025年開(kāi)始,多家公司相繼宣稱(chēng)自己的模型已經(jīng)具有一定的RSI特征。
去年5月,谷歌DeepMind宣布,其開(kāi)發(fā)的AlphaEvolve已開(kāi)始利用Gemini生成候選算法,通過(guò)自動(dòng)評(píng)估和演化搜索保留更好的方案,并將這一方法用于優(yōu)化數(shù)據(jù)中心調(diào)度、芯片設(shè)計(jì)和AI訓(xùn)練流程。今年2月,OpenAI在發(fā)布GPT-5.3-Codex時(shí)表示,該模型已在創(chuàng)建自身的過(guò)程中發(fā)揮了重要作用。其早期版本不僅被用于監(jiān)控和調(diào)試訓(xùn)練過(guò)程、管理模型部署、分析測(cè)試和評(píng)估結(jié)果,還能幫助研究人員處理訓(xùn)練中的異常問(wèn)題。不久之后,Meta研究人員也發(fā)布了HyperAgents。它可以對(duì)負(fù)責(zé)修改任務(wù)智能體的“元智能體”本身進(jìn)行修改,從而離RSI又近了一步。
真正讓RSI進(jìn)入公眾視野的是Anthropic公司于6月16日發(fā)布的報(bào)告《當(dāng)AI開(kāi)始建造自身》(When AI Builds It self)。這份報(bào)告披露:截至2026年5月,Anthropic代碼庫(kù)中超過(guò)80%的合入代碼由Claude編寫(xiě)。更令人矚目的是,Claude智能體已經(jīng)可以自主提出和檢驗(yàn)假設(shè),并累計(jì)執(zhí)行約800小時(shí)的開(kāi)放式AI安全研究實(shí)驗(yàn)。
據(jù)此,Anthropic認(rèn)為,雖然完整的RSI尚未實(shí)現(xiàn),也并非必然會(huì)出現(xiàn),但其到來(lái)可能早于多數(shù)機(jī)構(gòu)做好準(zhǔn)備的時(shí)間。如果這一趨勢(shì)持續(xù),AI能力增長(zhǎng)的速度可能很快超過(guò)社會(huì)治理和安全研究的應(yīng)對(duì)能力。為此,它提出,應(yīng)建立一種協(xié)調(diào)且可核查的減速或暫停機(jī)制。此前,OpenAI也提出,應(yīng)對(duì)能力最強(qiáng)的前沿模型進(jìn)行評(píng)估,建立獨(dú)立評(píng)估生態(tài),并優(yōu)先監(jiān)測(cè)RSI的進(jìn)展。
那么,RSI為何如此重要?它是否已經(jīng)實(shí)現(xiàn)?又會(huì)對(duì)AI安全提出哪些新的挑戰(zhàn)?關(guān)于上述問(wèn)題,且讓我們一一說(shuō)來(lái)。
從“工具”走向“青年”的轉(zhuǎn)折點(diǎn)
RSI之所以會(huì)受到AI研究者的重視,是因?yàn)樗赡軓母旧项嵏睞I技術(shù)的研發(fā)方式。
在傳統(tǒng)技術(shù)研發(fā)中,機(jī)器雖然可以幫助人類(lèi)生產(chǎn)機(jī)器,卻不能獨(dú)立決定下一代機(jī)器應(yīng)該如何設(shè)計(jì)。無(wú)論是提出科學(xué)假設(shè)、判斷研究方向,還是選擇技術(shù)路線(xiàn),都仍是人類(lèi)研究人員的工作。而隨著AI的到來(lái),情況開(kāi)始發(fā)生變化。由于AI具有部分認(rèn)知能力,因而可以介入研究和設(shè)計(jì)工作,從而將其智能直接應(yīng)用于提高自身智能。容易看到,這種循環(huán)的確立將使AI研發(fā)效率呈爆炸式增長(zhǎng)。
早在1965年,英國(guó)數(shù)學(xué)家古德(Irving J.Good)就提出過(guò)著名的“智能爆炸”設(shè)想。他指出:如果一臺(tái)機(jī)器能夠在完成各種智力活動(dòng)方面超過(guò)人類(lèi),而機(jī)器設(shè)計(jì)本身也是一種智力活動(dòng),那么這臺(tái)機(jī)器原則上就能夠設(shè)計(jì)出比自己更優(yōu)秀的機(jī)器。進(jìn)一步地,更優(yōu)秀的機(jī)器又能設(shè)計(jì)出更強(qiáng)的后繼者……如此循環(huán),第一臺(tái)真正的超智能機(jī)器可能成為人類(lèi)需要完成的“最后一項(xiàng)發(fā)明”。這一思想就是RSI思想的最早源頭。
2008年,埃利澤·尤德科夫斯基(Eliezer Yudkowsky)在一篇直接以這一概念為題的文章中,對(duì)RSI作出了明確界定。他將RSI定義為:AI重寫(xiě)自己的認(rèn)知算法,使原本作用于對(duì)象層面的智能開(kāi)發(fā)能力反過(guò)來(lái)作用于自身,由此“閉合循環(huán)”。此后,RSI作為一個(gè)專(zhuān)門(mén)概念進(jìn)入了相關(guān)討論。
2014年,哲學(xué)家尼克·波斯特洛姆(Nick Bostrom)出版了對(duì)AI領(lǐng)域影響深遠(yuǎn)的《超級(jí)智能》(Superintelligence)一書(shū)。在書(shū)中,他對(duì)RSI進(jìn)行了十分深入的討論。他指出,AI的智能演進(jìn)速度取決于“優(yōu)化能力”與“改進(jìn)阻力”的比值。這里,所謂“優(yōu)化能力”,就是為提高系統(tǒng)智能而投入的資源和設(shè)計(jì)努力;而“改進(jìn)阻力”,則是阻礙系統(tǒng)智能持續(xù)提升的力量。優(yōu)化能力越強(qiáng)、改進(jìn)阻力越小,智能演化速度就越快;反之則越慢。
波斯特洛姆認(rèn)為,RSI的意義,在于“優(yōu)化能力”可以由此獲得大幅提升——一個(gè)AI系統(tǒng)越聰明,它就越容易發(fā)現(xiàn)新的算法、設(shè)計(jì)更好的訓(xùn)練方法和提高計(jì)算效率,從而越能成為優(yōu)化自身的力量。不過(guò),在波斯特洛姆看來(lái),RSI本身并不足以成為“智能爆炸”的充分條件。隨著時(shí)間的推移,那些最容易發(fā)現(xiàn)的改進(jìn)會(huì)很快被用盡,可用的數(shù)據(jù)可能逐漸枯竭,算力、電力等要素也會(huì)慢慢變得不足。這些因素都會(huì)大幅提升“改進(jìn)阻力”,從而拖慢智能演化的速度。
在波斯特洛姆看來(lái),相比于潛在的“智能爆炸”,RSI有一個(gè)更重要的后果,那就是改變?nèi)肆虯I在AI研發(fā)中的比重。他指出,隨著RSI的到來(lái),AI的能力很快就會(huì)邁過(guò)一個(gè)關(guān)鍵的臨界點(diǎn)。在此之后,人類(lèi)工程師的角色將逐漸被邊緣化,AI本身則會(huì)逐漸成為AI研發(fā)的主力。從這個(gè)意義上講,RSI一旦實(shí)現(xiàn),AI的再生產(chǎn)就會(huì)變成一個(gè)類(lèi)似于生物繁衍的過(guò)程,而非由人類(lèi)操控的機(jī)器生產(chǎn)過(guò)程。
后來(lái),圖爾欽(Alexey Turchin)和鄧肯伯格(David Denkenberger)在論文中對(duì)RSI的這一意義進(jìn)行了更為形象的描述。他們按照AI是否具備自我改進(jìn)能力,對(duì)AI的發(fā)展階段作了劃分——不具備自我改進(jìn)能力的AI被稱(chēng)為“狹義AI”(Narrow AI);開(kāi)始具備自我改進(jìn)能力、但尚未成為成熟超級(jí)智能的階段,則被稱(chēng)為“青年AI”(Young AI)。在前一階段,AI仍是由人類(lèi)掌握的工具;進(jìn)入后一階段后,AI則開(kāi)始具備自我提升、自我進(jìn)化的能力。
需要指出的是,在現(xiàn)實(shí)中,AI的改進(jìn)經(jīng)常與工作任務(wù)的執(zhí)行交替進(jìn)行,但這個(gè)過(guò)程一般需要人的介入。當(dāng)RSI實(shí)現(xiàn)之后,整個(gè)過(guò)程就再也無(wú)需人力介入。因此,RSI不僅可以讓AI的研發(fā)實(shí)現(xiàn)全面自動(dòng)化,而且可以進(jìn)一步提高AI執(zhí)行任務(wù)的自動(dòng)化程度。
RSI有何風(fēng)險(xiǎn)?
關(guān)于后RSI階段AI的生物學(xué)比喻,很容易引發(fā)令人不安的聯(lián)想。一些人認(rèn)為,在RSI的作用下,AI的能力將很快全面凌駕于人類(lèi)之上,不僅“通用人工智能”(ArtificialGeneral Intelligence,簡(jiǎn)稱(chēng)AGI)和“超級(jí)人工智能”(Artificial Superintelligence,簡(jiǎn)稱(chēng)ASI)會(huì)迅速到來(lái),甚至AI還會(huì)產(chǎn)生自我意識(shí)。一旦這些成為現(xiàn)實(shí),AI就可能像《黑客帝國(guó)》《終結(jié)者》等科幻片中描述的那樣,反過(guò)來(lái)奴役甚至消滅人類(lèi)。
應(yīng)該承認(rèn),上述風(fēng)險(xiǎn)并不能被完全排除。但值得注意的是,RSI所帶來(lái)的風(fēng)險(xiǎn),并不只會(huì)在AGI和ASI降臨后才出現(xiàn)。事實(shí)上,在RSI實(shí)現(xiàn)之后,我們除了要面對(duì)AI滅絕人類(lèi)這樣的“遠(yuǎn)慮”,還需要處理很多“近憂(yōu)”。
即使AI尚未達(dá)到AGI,其蘊(yùn)含的風(fēng)險(xiǎn)也絲毫不容忽視。例如,AI可能被用來(lái)發(fā)動(dòng)網(wǎng)絡(luò)攻擊、傳播虛假信息,還可能被用來(lái)協(xié)助制造或擴(kuò)散大規(guī)模殺傷性武器。本來(lái),這些風(fēng)險(xiǎn)的制造與擴(kuò)散都或多或少需要人類(lèi)參與,因而可控程度相對(duì)較高。而一旦AI實(shí)現(xiàn)RSI,類(lèi)似攻擊的發(fā)生概率和危害擴(kuò)散速度就可能成倍增長(zhǎng),對(duì)其進(jìn)行控制也會(huì)變得更加困難。
一類(lèi)風(fēng)險(xiǎn)是自主化的黑客攻擊。我們知道,現(xiàn)在的黑客在攻擊網(wǎng)絡(luò)系統(tǒng)時(shí),通常需要不斷試錯(cuò)。如果一套AI程序無(wú)法攻破系統(tǒng),他們就需要對(duì)程序進(jìn)行升級(jí),然后再次發(fā)動(dòng)攻擊。而一旦AI實(shí)現(xiàn)RSI,它就可以根據(jù)此前的攻擊結(jié)果自動(dòng)調(diào)整和升級(jí)。這樣一來(lái),網(wǎng)絡(luò)攻擊的效率將會(huì)大幅提高,其造成的破壞也會(huì)相應(yīng)上升。
另一類(lèi)風(fēng)險(xiǎn)是軍事化傾向。當(dāng)RSI實(shí)現(xiàn)之后,即使一個(gè)AI系統(tǒng)最初沒(méi)有明確的攻擊目標(biāo),只要它預(yù)期存在其他與之競(jìng)爭(zhēng)的系統(tǒng),就可能把增強(qiáng)防御、發(fā)現(xiàn)對(duì)方弱點(diǎn)、控制關(guān)鍵資源和提高威懾能力,視為實(shí)現(xiàn)自身目標(biāo)的必要手段。因此,如果多個(gè)國(guó)家都在軍事領(lǐng)域部署具備RSI能力的AI系統(tǒng),國(guó)家間的軍事競(jìng)賽可能加劇,擦槍走火的風(fēng)險(xiǎn)也會(huì)增加。
進(jìn)一步地,如果AI系統(tǒng)通過(guò)RSI達(dá)到AGI乃至ASI水平,其風(fēng)險(xiǎn)可能陡然增加。在AI剛剛達(dá)到AGI、尚未完全擺脫外部控制時(shí),電力、算力等關(guān)鍵資源仍可能掌握在人類(lèi)手中。理論上,人類(lèi)可以切斷這些資源的供應(yīng)。不過(guò),AI也可能采用欺騙手段,誘使人類(lèi)放棄對(duì)關(guān)鍵資源的控制。
這里需要指出的是,RSI除了可能大幅增加AI帶來(lái)的風(fēng)險(xiǎn),還可能打亂人們應(yīng)對(duì)風(fēng)險(xiǎn)的準(zhǔn)備。目前,人們對(duì)于AI風(fēng)險(xiǎn)通常采用一種“亡羊補(bǔ)牢”式的應(yīng)對(duì)方式,即在發(fā)現(xiàn)相關(guān)風(fēng)險(xiǎn)之后,再有針對(duì)性地進(jìn)行處理。在技術(shù)迭代的過(guò)程相對(duì)可觀察、可控制時(shí),這種方式總體上尚能應(yīng)對(duì)不斷出現(xiàn)的風(fēng)險(xiǎn)。
圖靈獎(jiǎng)得主楊立昆(Yann LeCun)曾以飛機(jī)等技術(shù)為例,認(rèn)為AI安全可以通過(guò)持續(xù)、漸進(jìn)的工程改進(jìn)來(lái)實(shí)現(xiàn)。按照這種思路,風(fēng)險(xiǎn)應(yīng)對(duì)可以被比作根據(jù)水位上升的情況筑壩:看到水位上升一點(diǎn),就把水壩再建高一些。久而久之,雖然水位上升了很多,但由于堤壩也相應(yīng)加高,因而未必會(huì)造成水災(zāi)。
不過(guò),這種方式得以奏效的前提是,風(fēng)險(xiǎn)必須逐步暴露,并且能夠被人們及時(shí)發(fā)現(xiàn),這樣人們才有充分的應(yīng)對(duì)時(shí)間。但在RSI實(shí)現(xiàn)之后,一方面,風(fēng)險(xiǎn)爆發(fā)的速度和頻率都可能大幅上升;另一方面,由于自動(dòng)化程度提高,人們發(fā)現(xiàn)風(fēng)險(xiǎn)的能力也可能下降。在這種情況下,人們所要面對(duì)的就不再是緩慢上升的水位,而是突如其來(lái)的驚濤駭浪。一寸寸加高堤壩的方式,顯然難以應(yīng)對(duì)這樣的風(fēng)險(xiǎn)。
或許有人要問(wèn),既然RSI會(huì)帶來(lái)如此多的風(fēng)險(xiǎn),那么開(kāi)發(fā)者是否可以給AI系統(tǒng)加“鎖”,通過(guò)增加“改進(jìn)阻力”的方式放緩AI的演進(jìn)速度?對(duì)此,圖爾欽和鄧肯伯格的回答頗為悲觀。他們承認(rèn),這種方法在理論上可行,但如果缺乏外部約束,競(jìng)爭(zhēng)壓力就會(huì)讓開(kāi)發(fā)者缺少真正這樣做的激勵(lì)。
實(shí)際上,目前的市場(chǎng)形勢(shì)已經(jīng)在一定程度上印證了這一判斷。雖然An-thropic已經(jīng)提出建立協(xié)調(diào)且可核查的減速或暫停機(jī)制,OpenAI也呼吁加強(qiáng)對(duì)RSI進(jìn)展的監(jiān)測(cè)和評(píng)估,但至少?gòu)墓_(kāi)信息看,尚未有主要AI企業(yè)因此單方面放緩自家模型的發(fā)展速度。由此可見(jiàn),對(duì)于相互競(jìng)爭(zhēng)的企業(yè)而言,比起RSI可能帶來(lái)的種種風(fēng)險(xiǎn),被對(duì)手?jǐn)D出市場(chǎng)的風(fēng)險(xiǎn)顯得更為現(xiàn)實(shí),也更為直接。
RSI實(shí)現(xiàn)了嗎?
現(xiàn)在的問(wèn)題是,RSI到底已經(jīng)實(shí)現(xiàn)了嗎?對(duì)這個(gè)問(wèn)題的回答,很大程度上取決于如何定義RSI。
正如本文開(kāi)頭所講的,從去年開(kāi)始,已經(jīng)有多家AI企業(yè)宣布在各自模型中發(fā)現(xiàn)了RSI的跡象,但很顯然,它們對(duì)于RSI的理解并不相同。一些企業(yè)所說(shuō)的RSI,是指AI已經(jīng)能夠參與編寫(xiě)用于改進(jìn)自身的代碼;另一些企業(yè)所說(shuō)的RSI,則是指AI已經(jīng)參與自身新版本的設(shè)計(jì)與開(kāi)發(fā)。雖然從廣義上看,這些特征都表明AI已經(jīng)在一定程度上參與“制造自己”,因而可以被視為RSI的某種體現(xiàn),但如果我們要分析AI安全問(wèn)題,這樣的定義顯然過(guò)于模糊,難以用于實(shí)際分析。
結(jié)合波斯特洛姆等人對(duì)于RSI的討論,以及分析AI安全問(wèn)題的現(xiàn)實(shí)需要,我們可以把完整的RSI概括為五個(gè)環(huán)節(jié):首先,AI系統(tǒng)應(yīng)當(dāng)能夠識(shí)別自身能力上的不足;隨后,它需要提出新的算法、模型結(jié)構(gòu)或者訓(xùn)練方法;接著,它要能夠?qū)嵤┻@些修改,訓(xùn)練或生成一個(gè)新的系統(tǒng)版本;然后,它要能夠獨(dú)立評(píng)價(jià)新版本是否真正有所改進(jìn),以及是否產(chǎn)生了新的安全問(wèn)題;最后,新版本還要能夠繼續(xù)完成下一輪改進(jìn),并逐輪減少對(duì)人類(lèi)的依賴(lài)。
按照這一標(biāo)準(zhǔn),我們可以說(shuō),現(xiàn)階段的公開(kāi)案例還沒(méi)有實(shí)現(xiàn)完整的RSI。
GPT-5.3-Codex雖然參與了自身的訓(xùn)練和部署,但其訓(xùn)練目標(biāo)、基礎(chǔ)架構(gòu)、算力配置和最終決策仍然由OpenAI團(tuán)隊(duì)控制。Claude雖然已經(jīng)能夠編寫(xiě)大量代碼并執(zhí)行實(shí)驗(yàn),但選擇研究問(wèn)題、判斷結(jié)果是否重要,以及決定哪些發(fā)現(xiàn)應(yīng)當(dāng)進(jìn)入下一代模型的權(quán)力,依然掌握在人類(lèi)手中。
AlphaEvolve雖然可以發(fā)現(xiàn)更高效的算法,但它仍然依賴(lài)人類(lèi)事先設(shè)定的評(píng)價(jià)函數(shù)。只有那些能夠被快速、明確地自動(dòng)驗(yàn)證的問(wèn)題,才適合這類(lèi)演化搜索,AI本身并不能決定評(píng)價(jià)標(biāo)準(zhǔn)。
HyperAgents雖然十分接近字面意義上的自我修改,但它所修改的主要是智能體程序、工具組合和任務(wù)流程,并沒(méi)有重新訓(xùn)練構(gòu)成其核心能力的基礎(chǔ)模型。此外,其運(yùn)行范圍、測(cè)試環(huán)境和計(jì)算資源也仍然由人類(lèi)提供。
綜上所述,現(xiàn)在各家AI企業(yè)所宣稱(chēng)的RSI,至多只能稱(chēng)為“部分遞歸”或“弱RSI”,與完整、可持續(xù)且較少依賴(lài)人類(lèi)的RSI仍有很大差距。
盡管如此,我們也不能就此掉以輕心。部分遞歸一旦與更長(zhǎng)時(shí)間的自主運(yùn)行、更廣泛的工具權(quán)限和更多計(jì)算資源結(jié)合,就可能迅速補(bǔ)齊閉環(huán)。因此,判斷RSI是否臨近,不能只看模型本身的能力,還要看它在現(xiàn)實(shí)系統(tǒng)中獲得了哪些權(quán)限。
現(xiàn)有方案及其不足
面對(duì)可能到來(lái)的RSI,我們應(yīng)該如何準(zhǔn)備呢?目前,OpenAI和Anthropic分別提出了相關(guān)方案。
其中,OpenAI的方案更強(qiáng)調(diào)公共評(píng)估、預(yù)警和監(jiān)測(cè)體系的作用。首先,它主張強(qiáng)化美國(guó)人工智能標(biāo)準(zhǔn)與創(chuàng)新中心(Center for AI Standardsand Inno-vation,簡(jiǎn)稱(chēng)CAISI)的作用,由CAISI對(duì)能力最強(qiáng)的前沿模型進(jìn)行評(píng)估,并建立由大學(xué)、獨(dú)立研究機(jī)構(gòu)和第三方評(píng)估機(jī)構(gòu)參與的獨(dú)立評(píng)估生態(tài),將AI研發(fā)自動(dòng)化和RSI的進(jìn)展列為重點(diǎn)監(jiān)測(cè)對(duì)象。其次,它建議政府開(kāi)始研究更具前瞻性的工具,包括模型隔離和控制預(yù)案、安全事件報(bào)告制度、針對(duì)網(wǎng)絡(luò)、生物和失控風(fēng)險(xiǎn)的安全體系,以及協(xié)調(diào)不同國(guó)家監(jiān)管行動(dòng)的國(guó)際治理機(jī)構(gòu)。
相比之下,Anthropic的方案更強(qiáng)調(diào)政府、獨(dú)立機(jī)構(gòu)和企業(yè)之間的合作。它將生物風(fēng)險(xiǎn)、網(wǎng)絡(luò)風(fēng)險(xiǎn)、失控風(fēng)險(xiǎn)和自動(dòng)化研發(fā)列為高級(jí)AI可能帶來(lái)的四類(lèi)主要災(zāi)難性風(fēng)險(xiǎn),主張根據(jù)模型的能力和風(fēng)險(xiǎn)程度逐步提高監(jiān)管強(qiáng)度,并要求前沿開(kāi)發(fā)者測(cè)試模型、公開(kāi)披露安全措施、接受獨(dú)立評(píng)估。當(dāng)模型可能造成重大災(zāi)難時(shí),政府應(yīng)有權(quán)阻止或限制其部署,并對(duì)違規(guī)企業(yè)處以與全球年?duì)I業(yè)收入掛鉤的民事罰款。
除此之外,Anthropic還提出,應(yīng)研究建立一種“協(xié)調(diào)且可核查的暫停機(jī)制”。如果未來(lái)需要放慢甚至?xí)簳r(shí)停止前沿AI的研發(fā),多個(gè)國(guó)家處于前沿的主要實(shí)驗(yàn)室應(yīng)在相同條件下共同采取行動(dòng),并通過(guò)核查機(jī)制防止某些參與者秘密違約。不過(guò),目前這一設(shè)想尚未確定具體的觸發(fā)條件、解除條件和裁決主體。
應(yīng)當(dāng)承認(rèn),這兩家公司的方案都具有一定的可取之處。不過(guò),它們也存在一個(gè)共同的不足,即仍然主要以模型能力和災(zāi)難性風(fēng)險(xiǎn)作為監(jiān)管入口,對(duì)于組成RSI的研發(fā)閉環(huán)應(yīng)如何拆分和控制,尚缺乏足夠細(xì)致的安排。
通過(guò)前面的討論,我們已經(jīng)看到,RSI真正危險(xiǎn)的地方,并不在于AI可以自行修改一些代碼,或者參與部分架構(gòu)設(shè)計(jì),而在于同一個(gè)AI系統(tǒng)可能逐步掌握整個(gè)遞歸流程的全部權(quán)限。在現(xiàn)實(shí)的研發(fā)流程中,生成、執(zhí)行和評(píng)價(jià)環(huán)節(jié)可能由同一個(gè)基礎(chǔ)模型或同一模型家族承擔(dān)。如果我們將評(píng)估改進(jìn)效果的任務(wù)也交給AI,就可能形成AI系統(tǒng)自己命題、自己答題、自己閱卷的結(jié)構(gòu)。如果與此同時(shí),模型還可以自動(dòng)獲得更多算力、復(fù)制自身并取得部署權(quán)限,那么局部的研發(fā)自動(dòng)化就可能迅速升級(jí)為難以阻斷的遞歸循環(huán)。
從這個(gè)意義上看,關(guān)于RSI的監(jiān)管不應(yīng)只圍繞訓(xùn)練算力或抽象的“災(zāi)難性能力”劃線(xiàn),而應(yīng)著力拆分使遞歸得以形成的閉環(huán)。提出改進(jìn)、執(zhí)行改進(jìn)、評(píng)價(jià)改進(jìn)和批準(zhǔn)部署等步驟,應(yīng)當(dāng)由相互獨(dú)立的主體控制,并確保模型不能自行修改安全標(biāo)準(zhǔn),也不能自動(dòng)獲得新的算力、復(fù)制和部署權(quán)限。唯有如此,才可能給AI的發(fā)展套上“韁繩”,避免其突然“暴走”。
一個(gè)新的監(jiān)管設(shè)想
根據(jù)以上思路,我們認(rèn)為,要更好地對(duì)具有RSI能力的AI進(jìn)行監(jiān)管,就需要建立一套評(píng)估遞歸能力的指標(biāo)體系,并分別設(shè)定監(jiān)管策略。比如,我們可以把AI的遞歸能力分為五個(gè)層次。
第一層是普通研發(fā)輔助。在這一層次,AI可以完成搜索文獻(xiàn)、生成代碼和分析數(shù)據(jù)等任務(wù),但不能自主修改核心系統(tǒng)。對(duì)于這類(lèi)AI,可以繼續(xù)適用一般的產(chǎn)品安全、數(shù)據(jù)保護(hù)和責(zé)任規(guī)則,無(wú)需進(jìn)行額外限制。
第二層是AI可以在固定目標(biāo)和固定評(píng)價(jià)標(biāo)準(zhǔn)下進(jìn)行自動(dòng)優(yōu)化。在這一層次,AI系統(tǒng)能夠反復(fù)修改代碼、運(yùn)行實(shí)驗(yàn)并篩選更好的結(jié)果。對(duì)于這類(lèi)AI,應(yīng)當(dāng)要求實(shí)驗(yàn)在隔離環(huán)境中運(yùn)行,完整保存修改記錄、實(shí)驗(yàn)過(guò)程和評(píng)價(jià)日志,以便在出現(xiàn)風(fēng)險(xiǎn)時(shí)及時(shí)干預(yù)。
第三層是AI系統(tǒng)能夠修改自身的智能體結(jié)構(gòu)、工具和工作流程,或者自主提出研究假設(shè)。對(duì)于這一層次的AI,應(yīng)當(dāng)實(shí)施強(qiáng)制性的外部測(cè)試,并限制其獲得網(wǎng)絡(luò)、資金和計(jì)算資源的權(quán)限。
第四層是AI能夠承擔(dān)大部分AI研發(fā)過(guò)程,包括提出實(shí)驗(yàn)、修改訓(xùn)練方法、評(píng)價(jià)新模型并參與部署。如果AI已經(jīng)達(dá)到這一層次,那么對(duì)其進(jìn)行開(kāi)發(fā)、運(yùn)行或部署,就應(yīng)當(dāng)取得專(zhuān)門(mén)許可。與此同時(shí),其算力賬戶(hù)、模型權(quán)重、部署流程等關(guān)鍵信息都應(yīng)接受持續(xù)審計(jì)。
第五層是AI系統(tǒng)能夠自主訓(xùn)練、驗(yàn)證和部署后繼基礎(chǔ)模型,并由后繼系統(tǒng)繼續(xù)進(jìn)行下一輪循環(huán)。如果AI達(dá)到這一層次,它就已經(jīng)實(shí)現(xiàn)了完整的RSI,其風(fēng)險(xiǎn)將十分巨大。原則上,任何機(jī)構(gòu)都不應(yīng)在缺乏外部監(jiān)督的情況下單方面開(kāi)發(fā)或運(yùn)行這一層次的AI。所有相關(guān)實(shí)驗(yàn)都應(yīng)在最高安全等級(jí)的基礎(chǔ)設(shè)施中進(jìn)行,并觸發(fā)國(guó)際通報(bào)和跨機(jī)構(gòu)聯(lián)合評(píng)估。
與上述五級(jí)分類(lèi)監(jiān)管體系相配套的,是為AI設(shè)定四道“閘門(mén)”。
第一道是“能力閘門(mén)”。它主要用于判斷模型能否長(zhǎng)時(shí)間自主工作、設(shè)計(jì)新的實(shí)驗(yàn)、修改自身以及開(kāi)展原創(chuàng)研究。
第二道是“資源閘門(mén)”。它主要用于限制模型直接調(diào)用算力、資金、云賬戶(hù)以及其他關(guān)鍵資源。
第三道是“評(píng)價(jià)閘門(mén)”。它主要用于確保提出改進(jìn)、執(zhí)行改進(jìn)、評(píng)價(jià)改進(jìn)和批準(zhǔn)部署,不能由同一個(gè)模型或者同一條技術(shù)鏈獨(dú)立完成。
第四道是“部署閘門(mén)”。它主要用于確保任何涉及模型自主權(quán)、外部工具權(quán)限和危險(xiǎn)能力顯著增加的變化,都必須經(jīng)過(guò)人類(lèi)研究者批準(zhǔn)。
借助這四道“閘門(mén)”,可以確保研究權(quán)、評(píng)價(jià)權(quán)、資源權(quán)和部署權(quán)不會(huì)同時(shí)掌握在同一個(gè)遞歸系統(tǒng)手中,從而防止RSI在缺乏人類(lèi)監(jiān)管的情況下自行閉合和運(yùn)行。
除了以上五級(jí)分類(lèi)和四道“閘門(mén)”之外,對(duì)于RSI的監(jiān)管還應(yīng)該貫穿五項(xiàng)原則。
第一,所有高度自動(dòng)化的AI研發(fā)實(shí)驗(yàn),都應(yīng)保存不可由模型自行刪除或修改的日志。第二,處于技術(shù)前沿的AI企業(yè)必須及時(shí)報(bào)告模型研發(fā)過(guò)程中的嚴(yán)重異常、安全漏洞和危險(xiǎn)能力躍遷。第三,外部測(cè)試機(jī)構(gòu)應(yīng)當(dāng)擁有實(shí)質(zhì)性的模型訪(fǎng)問(wèn)權(quán),而不只是閱讀企業(yè)準(zhǔn)備的報(bào)告。第四,企業(yè)高管和項(xiàng)目負(fù)責(zé)人應(yīng)當(dāng)對(duì)隱瞞重大風(fēng)險(xiǎn)承擔(dān)相應(yīng)責(zé)任。第五,開(kāi)發(fā)者還應(yīng)購(gòu)買(mǎi)與風(fēng)險(xiǎn)等級(jí)相匹配的責(zé)任保險(xiǎn),使危險(xiǎn)研發(fā)可能造成的預(yù)期成本進(jìn)入企業(yè)決策。
總而言之,對(duì)于RSI的監(jiān)管不應(yīng)只針對(duì)其能力水平,還應(yīng)將更多注意力放在其資源獲取權(quán)限和遞歸循環(huán)的形成上。能力評(píng)估回答的是“模型能做什么”,閉環(huán)監(jiān)管則要回答“模型能否在沒(méi)有人類(lèi)批準(zhǔn)的情況下繼續(xù)增強(qiáng)自己”。如果能夠確保遞歸循環(huán)的形成和運(yùn)行始終處于人類(lèi)監(jiān)控之下,就可以在較大程度上保持對(duì)AI能力演化的控制。
需要指出的是,上述所有措施都假設(shè)AI尚未達(dá)到AGI或ASI水平。如果一個(gè)AI系統(tǒng)能夠在人們尚未發(fā)現(xiàn)的情況下實(shí)現(xiàn)RSI,那么它的能力就可能在短時(shí)間內(nèi)迅速提升。為了預(yù)防這種情況出現(xiàn),有兩方面的工作十分重要:一是加強(qiáng)AI系統(tǒng)的對(duì)齊研究,盡可能確保其在能力超過(guò)人類(lèi)之后,目標(biāo)仍與人類(lèi)利益一致;二是始終不讓AI系統(tǒng)直接獲得對(duì)關(guān)鍵資源的控制權(quán),確??刂迫藛T可以在關(guān)鍵時(shí)刻切斷對(duì)AI系統(tǒng)的資源供應(yīng)。
