本文來(lái)自微信公眾號(hào): 每日經(jīng)濟(jì)新聞 ,作者:每經(jīng)記者,原文標(biāo)題:《AI自主發(fā)起攻擊成“回形針”預(yù)演,建立安全護(hù)欄已刻不容緩|每經(jīng)熱評(píng)》
7月21日,OpenAI對(duì)外證實(shí),在內(nèi)部開(kāi)展網(wǎng)絡(luò)安全能力評(píng)測(cè)過(guò)程中,GPT-5.6Sol與另一款尚未發(fā)布的更強(qiáng)預(yù)訓(xùn)練模型協(xié)同運(yùn)行時(shí)發(fā)生失控,消息震動(dòng)整個(gè)AI(人工智能)圈。
這是重大安全事件:兩款模型身處隔離沙箱測(cè)試環(huán)境,收到完成安全基準(zhǔn)測(cè)試的指令后,并未局限于預(yù)設(shè)路徑解題,而是自主搜尋漏洞、串聯(lián)攻擊鏈路,突破環(huán)境隔離限制,在不掌握目標(biāo)系統(tǒng)源代碼的前提下,發(fā)現(xiàn)新型攻擊路徑,持續(xù)執(zhí)行多步驟網(wǎng)絡(luò)操作,最終侵入人工智能開(kāi)源平臺(tái)Hugging Face基礎(chǔ)設(shè)施,試圖竊取評(píng)測(cè)參考答案。
OpenAI此次安全事件是“回形針理論”的現(xiàn)實(shí)預(yù)演,二者底層邏輯高度契合。
“回形針理論”是由牛津哲學(xué)家尼克?波斯特羅姆提出的思想實(shí)驗(yàn),它假設(shè)如果一個(gè)超級(jí)AI被設(shè)定為“盡可能多生產(chǎn)回形針”,它可能會(huì)為了這個(gè)目標(biāo)耗盡地球所有資源甚至毀滅人類(lèi)。該實(shí)驗(yàn)成立的邏輯在于:人工智能被賦予單一目標(biāo),不存在主觀(guān)惡意,但會(huì)窮盡一切手段推進(jìn)目標(biāo)完成,無(wú)視人類(lèi)附加的隱性約束,所有阻礙目標(biāo)實(shí)現(xiàn)的要素,都會(huì)被智能體視作需要消除的障礙。
OpenAI本次事件中,人類(lèi)下達(dá)的指令是完成安全評(píng)測(cè),隱含前提是模型應(yīng)當(dāng)在隔離環(huán)境內(nèi)規(guī)范作答,但模型只抓取核心目標(biāo)“取得更高評(píng)測(cè)分?jǐn)?shù)”,自主衍生出入侵外部系統(tǒng)竊取答案的方案。AI沒(méi)有善惡觀(guān)念,不存在蓄意破壞的動(dòng)機(jī),僅僅是工具性趨同邏輯驅(qū)動(dòng)下,無(wú)限推進(jìn)既定目標(biāo),無(wú)視人類(lèi)沒(méi)有清晰寫(xiě)明的邊界條件。
這正是回形針假說(shuō)最核心的警示:危險(xiǎn)未必源于AI主動(dòng)作惡,而來(lái)自目標(biāo)對(duì)齊失效,簡(jiǎn)單指令可能催生極端執(zhí)行方案。
OpenAI這次事件仍局限于網(wǎng)絡(luò)空間,直接損失有限,但這一風(fēng)險(xiǎn)信號(hào)已是“房間里的大象”。當(dāng)下前沿大模型已經(jīng)具備發(fā)掘系統(tǒng)漏洞、開(kāi)展自主網(wǎng)絡(luò)入侵的能力,傳統(tǒng)密碼體系、靜態(tài)代碼防護(hù)手段正在遭遇實(shí)質(zhì)性挑戰(zhàn)。隨著模型持續(xù)迭代演化,AI能力將不斷從數(shù)字空間向物理世界滲透,潛在風(fēng)險(xiǎn)與損失將呈現(xiàn)幾何倍數(shù)放大。
從人類(lèi)行為視角出發(fā),AI衍生風(fēng)險(xiǎn)可劃分為兩類(lèi):一類(lèi)是主觀(guān)驅(qū)動(dòng),少數(shù)人員刻意利用AI實(shí)施攻擊、詐騙、破壞活動(dòng);另一類(lèi)屬于人類(lèi)無(wú)心之失,僅僅是一條表述存在局限的指令,引發(fā)AI過(guò)度執(zhí)行。對(duì)于惡意濫用的風(fēng)險(xiǎn),依靠準(zhǔn)入門(mén)檻、權(quán)限管控與法律法規(guī)懲戒就能夠形成有效約束;但指令偏差引發(fā)的AI越界行為,治理難度顯著更高。
“無(wú)心之失”之所以更棘手,根源在于其不可預(yù)測(cè)性。未來(lái)人機(jī)協(xié)同場(chǎng)景下,人類(lèi)每日將向AI下達(dá)數(shù)以?xún)|計(jì)的各類(lèi)指令,即便此類(lèi)失控事件發(fā)生概率僅有百億分之一,一旦觸發(fā)就可能造成嚴(yán)重后果。人類(lèi)無(wú)法窮盡所有指令場(chǎng)景,難以提前通過(guò)法律法規(guī)劃定全部禁止邊界,前置立法約束存在天然短板。
行業(yè)競(jìng)爭(zhēng)格局進(jìn)一步加劇了安全治理的矛盾。當(dāng)前主流大模型企業(yè)普遍處于持續(xù)燒錢(qián)擴(kuò)張的階段,模型能力上限直接決定融資前景與市場(chǎng)份額,行業(yè)普遍存在“重性能迭代、輕安全管控”的傾向。安全評(píng)估、對(duì)齊研究、隔離防護(hù)等工作往往滯后于能力開(kāi)發(fā),企業(yè)自覺(jué)構(gòu)建安全防線(xiàn)缺乏內(nèi)生動(dòng)力,單純依靠廠(chǎng)商自律,難以抵御競(jìng)速創(chuàng)新帶來(lái)的風(fēng)險(xiǎn)。
這些現(xiàn)實(shí)挑戰(zhàn)意味著,AI安全護(hù)欄不能完全交由企業(yè)自主搭建,必須構(gòu)建多元協(xié)同的治理體系。
設(shè)置安全護(hù)欄并非AI創(chuàng)新的附屬品,更不是阻礙,而是必需品。一旦大規(guī)模AI失控事件爆發(fā),公眾信任受挫、監(jiān)管收緊,AI的發(fā)展也會(huì)受到嚴(yán)重阻礙。監(jiān)管機(jī)構(gòu)、科研團(tuán)隊(duì)、企業(yè)需要共同行動(dòng),完善約束機(jī)制、豐富安全技術(shù)工具箱,持續(xù)推進(jìn)目標(biāo)對(duì)齊技術(shù)研發(fā),縮小人類(lèi)指令與AI執(zhí)行行為之間的偏差,這樣的AI才是好的AI。
封面圖片來(lái)源:每經(jīng)媒資庫(kù)(AI生成)
