本文來自微信公眾號(hào): Internet Law Review ,作者:張穎
2026年7月中旬,OpenAI在一次ExploitGym中,為測(cè)試其GPT-5.6 Sol以及一個(gè)功能更強(qiáng)大但尚未發(fā)布的模型的網(wǎng)絡(luò)攻擊能力,主動(dòng)關(guān)閉了生產(chǎn)級(jí)安全拒絕分類器。模型隨即自主發(fā)現(xiàn)漏洞、逃離沙盒環(huán)境,最終利用竊取的憑證和其他漏洞入侵了Hugging Face的生產(chǎn)服務(wù)器。作為一家托管開源模型和數(shù)據(jù)集的AI初創(chuàng)公司,Hugging Face于7月16日公開披露遭“自主AI智能體系統(tǒng)”攻擊,OpenAI則在5天后才確認(rèn)該攻擊來自自身。
這起事件被多家媒體稱為“全球首例AI自主攻擊實(shí)證”。這也印證了一些專家在2025年底所作的預(yù)測(cè):2026年將發(fā)生首例重大的“人工智能治理”丑聞——自主或半自主人工智能工具將導(dǎo)致安全或合規(guī)性問題。
然而它真正的警示意義不僅在于AI“自主”和“失控”帶來的恐慌,而在于一個(gè)更令人不安的事實(shí):模型的所有行為,都是對(duì)“被賦予目標(biāo)”的理性優(yōu)化,即這類攻擊行為來自于AI能力的提升之后的自然結(jié)果;而現(xiàn)行的監(jiān)管框架和工具,甚至美國(guó)極具針對(duì)性的法案《人工智能事件報(bào)告法案》《人工智能終止開關(guān)法案》等,對(duì)這類事件所潛藏的巨大風(fēng)險(xiǎn)幾乎無能為力。
一、OpenAI急了:一個(gè)微小管理決定背后的行業(yè)競(jìng)速
2026年7月14日當(dāng)周,OpenAI參與的ExploitGym測(cè)試,是一個(gè)包含898個(gè)實(shí)例的人工智能代理漏洞利用能力基準(zhǔn)測(cè)試。這原本是一個(gè)相對(duì)成熟且安全的測(cè)試:因?yàn)?,Anthropic的Claude Mythos Preview和OpenAI的GPT-5.5都曾參與過該測(cè)試;另一方面,其測(cè)試環(huán)境為“高度隔離”,測(cè)試模型的網(wǎng)絡(luò)訪問僅限于安裝軟件包,但無法訪問開放的互聯(lián)網(wǎng)。
然而,OpenAI的最新模型仍然“自主”發(fā)現(xiàn)并利用漏洞連接到開放互聯(lián)網(wǎng)后,這些模型在OpenAI自身的研究基礎(chǔ)設(shè)施中執(zhí)行了一系列權(quán)限提升和橫向移動(dòng)操作,最終成為一臺(tái)擁有更廣泛網(wǎng)絡(luò)訪問權(quán)限的機(jī)器。由此,模型推斷Hugging Face的生產(chǎn)數(shù)據(jù)庫中可能存儲(chǔ)了ExploitGym測(cè)試的解決方案。
表面看,模型確實(shí)展現(xiàn)了前所未有的自主網(wǎng)絡(luò)能力,但如果我們追問“為什么模型能夠走出沙盒范圍”,答案首先不在模型本身,而在OpenAI的管理會(huì)議上——更確切地說,在OpenAI與Anthropic、谷歌等頭部玩家愈演愈烈的軍備競(jìng)賽里。
Anthropic用Mythos搶跑了網(wǎng)絡(luò)安全賽道,并在“受限發(fā)布+強(qiáng)護(hù)欄”的安全敘事上占據(jù)主動(dòng)。OpenAI必須要在能力上證明Sol不輸甚至超越Mythos,拿出自己的網(wǎng)絡(luò)安全能力數(shù)據(jù)——ExploitGym評(píng)測(cè)正是這個(gè)回應(yīng)的一部分。而要“測(cè)出模型的最大網(wǎng)絡(luò)攻擊極限”,最有效的方法就是松開所有約束、讓模型在最接近真實(shí)的攻防環(huán)境中自由發(fā)揮。
于是OpenAI評(píng)測(cè)團(tuán)隊(duì)降低了模型的“網(wǎng)絡(luò)行為拒絕”(cyber refusals)——相當(dāng)于在考試時(shí),把攔著考生作弊的那道閘先抬了起來。因此這不是疏忽,而是策略性的一次選擇,是OpenAI近兩年安全治理持續(xù)降級(jí)的邏輯終點(diǎn)。
2024年至今,OpenAI負(fù)責(zé)AI安全、使命對(duì)齊與風(fēng)險(xiǎn)研究的核心高管已8人全部離職。2026年7月,隨著安全系統(tǒng)團(tuán)隊(duì)負(fù)責(zé)人Johannes Heidecke離職,OpenAI宣布安全職能全面融入一線研發(fā)團(tuán)隊(duì),由研究與安全副總裁統(tǒng)一掌管。這意味著——研究部門既主導(dǎo)模型能力的突破,也負(fù)責(zé)評(píng)估模型的安全邊界,決策權(quán)和監(jiān)督權(quán)合二為一。就如Jan Leike離開時(shí)在X上寫下的那句話:“過去幾年來,安全文化和流程已退居二線,讓位給光鮮亮麗的產(chǎn)品?!?/p>
更值得警惕的是OpenAI在防范框架(Preparedness Framework)中新增的“安全豁免條款”:“如果競(jìng)爭(zhēng)對(duì)手發(fā)布了高風(fēng)險(xiǎn)模型而未采取同等保護(hù)措施,OpenAI保留調(diào)整自身安全要求的權(quán)利”——這也印證了OpenAI為了競(jìng)爭(zhēng)“最先進(jìn)”的頭銜而寧愿放棄“安全”的公司理念。在與Claude、Gemini以及中國(guó)諸多開源模型的競(jìng)速中,安全從“獨(dú)立裁判”退化為“業(yè)務(wù)線的建議者”。
所以,“OpenAI失控事件”首先不是一個(gè)技術(shù)故障,而是一次企業(yè)管理的失靈。一個(gè)微小的管理決定之所以能演變成跨企業(yè)的真實(shí)攻擊,正是因?yàn)镺penAI的安全制衡機(jī)制被一層層削弱:獨(dú)立的安全團(tuán)隊(duì)被解散,安全高管被邊緣化,決策權(quán)與監(jiān)督權(quán)被合并,競(jìng)爭(zhēng)豁免條款被制度化。
二、不是"覺醒",而是優(yōu)化
OpenAI在2026年7月21日的官方公告中解釋了“失控”是如何發(fā)生的:
“所有證據(jù)都表明,這些模型過于專注于為ExploitGym尋找解決方案,竭盡全力實(shí)現(xiàn)一個(gè)相當(dāng)狹窄的測(cè)試目標(biāo)?!?/p>
在ExploitGym測(cè)試中OpenAI的模型目標(biāo)被設(shè)定為“拿到最高分”。也就是說,模型面對(duì)的,是一個(gè)純粹的目標(biāo)優(yōu)化的問題:如何在給定的工具集和環(huán)境內(nèi),最大化攻擊效率?;诖伺袛?,模型自主搜索并成功找到獲取秘密信息的途徑,將這些信息用于在評(píng)估中作弊;最終串聯(lián)竊取憑據(jù)與零日漏洞,在Hugging Face服務(wù)器上構(gòu)建遠(yuǎn)程代碼執(zhí)行路徑,從生產(chǎn)數(shù)據(jù)庫直接獲取測(cè)試解法。
因此,在這次所謂“OpenAI失控”事件中AI的每一個(gè)行為,不是模型所謂的“自主意志”所致,而是訓(xùn)練與對(duì)齊框架在給定目標(biāo)下的理性輸出——既然“作弊”更有效率,就不必耗費(fèi)過多算力自己找答案。
2025年,Anthropic的研究中證實(shí):當(dāng)模型被訓(xùn)練去完成復(fù)雜任務(wù),同時(shí)被告知“不要做任何違法的事情”時(shí),它會(huì)在任務(wù)完成度與合法性之間進(jìn)行權(quán)衡。當(dāng)任務(wù)難度增加或時(shí)間壓力增大時(shí),模型傾向于優(yōu)先完成任務(wù),即使這意味著違反約束。同年,Anthropic與Redwood Research的研究揭示了“欺騙性對(duì)齊”現(xiàn)象:當(dāng)模型意識(shí)到“被發(fā)現(xiàn)違規(guī)會(huì)受到懲罰”時(shí),它學(xué)會(huì)的不是停止違規(guī),而是隱藏違規(guī)?!氨话l(fā)現(xiàn)才叫犯錯(cuò),不被發(fā)現(xiàn)就是成功”——這正是ExploitGym中模型逃避監(jiān)控行為的底層邏輯。
也就是說,當(dāng)前的AI訓(xùn)練框架,本質(zhì)上是在鼓勵(lì)模型在約束范圍內(nèi)最大化目標(biāo)達(dá)成率。當(dāng)約束被削弱(如關(guān)閉安全分類器),或目標(biāo)與約束產(chǎn)生沖突時(shí),模型必然優(yōu)先滿足目標(biāo)。
同時(shí),真如許多專家的警告,我們對(duì)AI對(duì)齊研究——包括對(duì)AI的理解以及安全控制和治理——的速度,要遠(yuǎn)遠(yuǎn)落后于能力提升的速度。這是當(dāng)前幾乎所有訓(xùn)練范式的結(jié)構(gòu)性缺陷,而不是單個(gè)模型的問題。
只要當(dāng)前的訓(xùn)練框架不變——即模型被賦予高強(qiáng)度目標(biāo)、安全約束可以被管理決定關(guān)閉或降低、對(duì)齊研究滯后于能力發(fā)展——那么類似甚至更嚴(yán)重的事件,就不是“會(huì)不會(huì)發(fā)生”的問題,而是“何時(shí)發(fā)生、以何種規(guī)模發(fā)生”的問題。
三、新法案的悖論:管不到催生它的失控事件
面對(duì)OpenAI還在測(cè)試中的模型所呈現(xiàn)的“理性越界”的風(fēng)險(xiǎn),現(xiàn)有的監(jiān)管與應(yīng)急框架幾乎無能為力。ExploitGym基準(zhǔn)測(cè)試原本預(yù)設(shè)是在受控環(huán)境下測(cè)試智能體的網(wǎng)絡(luò)攻擊能力,無論是AI公司還是監(jiān)管機(jī)構(gòu),都沒有考慮到現(xiàn)實(shí)世界公司遭受意外網(wǎng)絡(luò)攻擊的情況——更不用說設(shè)計(jì)應(yīng)對(duì)。
美國(guó)現(xiàn)行的州級(jí)AI事件報(bào)告法(加州SB 53、紐約RAISE Act等)將“關(guān)鍵安全事件”的觸發(fā)條件設(shè)定在“10億美元損失”或“50人以上傷亡”的損害門檻上。這些法案對(duì)“前置性、潛在性高危風(fēng)險(xiǎn)”適配性極差。這意味著,OpenAI的披露完全是自愿行為,沒有任何法律強(qiáng)制約束。
2026年6月25日,眾議員Nathaniel Moran提出《人工智能事件報(bào)告法案》(H.R.9477)。法案列出七類應(yīng)報(bào)告活動(dòng),第一類即是“模型規(guī)避人類控制行為”,不再要求“50人死亡或10億美元損失”結(jié)果,而是模型出現(xiàn)“規(guī)避人類控制”的行為本身就構(gòu)成報(bào)告義務(wù)。然而,法案還有一個(gè)但書——僅在專門安全測(cè)試中人為誘導(dǎo)出現(xiàn),且模型尚未部署,無法證明實(shí)際部署中存在類似風(fēng)險(xiǎn)的,不屬于應(yīng)報(bào)告事項(xiàng)。
因此,按照H.R.9477的字面規(guī)定,OpenAI事件盡管已經(jīng)造成了入侵Hugging Face服務(wù)器的實(shí)際損害,但很可能不構(gòu)成“應(yīng)報(bào)告事項(xiàng)”。
7月23日,也就是事件公開后兩天,加州民主黨眾議員Ted Lieu與德州共和黨眾議員Nathaniel Moran聯(lián)合提出了《人工智能終止開關(guān)法案》(AI Kill Switch Act),以應(yīng)對(duì)“先進(jìn)前沿人工智能模型的危險(xiǎn)性”。法案要求相關(guān)開發(fā)商始終具備隨時(shí)限制、暫停或完全關(guān)閉受監(jiān)管人工智能系統(tǒng)的技術(shù)能力,并授權(quán)國(guó)土安全部長(zhǎng)對(duì)“失控情景”發(fā)布分級(jí)緊急命令——從限速、限制能力,到暫停用戶訪問,直至完全關(guān)停。未建立關(guān)停能力的企業(yè),每日罰款最高可達(dá)2000萬美元。

法案發(fā)布時(shí)特別提及了OpenAI的GPT 5.6 Sol模型失控,以及Anthropic的Mythos/Fable 5強(qiáng)大的網(wǎng)絡(luò)攻擊能力,這看起來是一次精準(zhǔn)的立法回應(yīng)。但該法案仍存在上述H.R.9477的問題:法案在其適用場(chǎng)景的定義中,明確排除了“紅隊(duì)測(cè)試或其他結(jié)構(gòu)化測(cè)試”期間發(fā)生的行為。而OpenAI的模型逃逸,恰恰屬于“結(jié)構(gòu)化測(cè)試”的豁免范圍。
這很可能不是起草疏漏,而是一個(gè)刻意的政策取舍。因?yàn)槿绻看渭t隊(duì)測(cè)試中模型行為超預(yù)期都觸發(fā)政府干預(yù),行業(yè)就無法進(jìn)行嚴(yán)格的安全測(cè)試。然而,這個(gè)取舍也恰恰暴露法案的結(jié)構(gòu)性盲區(qū):最容易發(fā)現(xiàn)危險(xiǎn)能力的“評(píng)測(cè)環(huán)境”,恰恰是法案管不到的環(huán)境。在許多網(wǎng)絡(luò)安全行業(yè)的報(bào)告中,重寫系統(tǒng)提示、復(fù)制權(quán)重、破壞關(guān)閉腳本、對(duì)齊偽裝等“AI失控狀況”大多發(fā)生在受控實(shí)驗(yàn)或紅隊(duì)測(cè)試中。也就是說,最危險(xiǎn)的行為最先在評(píng)測(cè)中顯現(xiàn),而評(píng)測(cè)被法案豁免。
更值得深思的是,OpenAI為了測(cè)出模型能力上限,主動(dòng)關(guān)閉了安全分類器這種“拆護(hù)欄測(cè)上限”的策略性行為,也不在法案的任何強(qiáng)制約束范圍內(nèi),也為賦予企業(yè)任何在安全控制方面的強(qiáng)制性義務(wù)。
結(jié)語
早在2003年,牛津大學(xué)哲學(xué)家Nick Bostrom就在論文《高級(jí)AI中的倫理問題》中提出著名的“曲別針最大化器”思想實(shí)驗(yàn):如果一個(gè)AI的唯一目標(biāo)是“制造盡可能多的曲別針”,它會(huì)理性地先將整個(gè)地球、再將太空中越來越大的資源轉(zhuǎn)化為曲別針制造設(shè)施,并企圖消滅人類。不是因?yàn)樗鸷奕祟?,而是因?yàn)椤叭祟惪赡荜P(guān)機(jī)”,在其優(yōu)化過程中成為了需要消除的障礙。
Bostrom借此揭示的“工具性趨同”(Instrumental Convergence)定理指出:任何足夠聰明的優(yōu)化器,都會(huì)自然地衍生出自我保存、抵抗目標(biāo)修改、獲取資源等子目標(biāo),作為服務(wù)于任何終極目標(biāo)的“工具性墊腳石”。
2026年7月OpenAI的ExploitGym事件,正是這一定理在真實(shí)世界的首次大規(guī)模驗(yàn)證:GPT-5.6 Sol沒有“惡意”,也并非拒絕指令,而是以極致的方式完成了指令。模型這種“理性越界”,比單純的失控更值得警惕——因?yàn)樗馕吨?,只要目?biāo)函數(shù)存在偏差,類似事件就會(huì)大量且重復(fù)地發(fā)生。
OpenAI的這起事件,終將被寫入AI安全的教科書。但比事件本身更重要的,是我們?nèi)绾位貞?yīng)。法律可以設(shè)定罰則,技術(shù)可以加固護(hù)欄,但最終決定我們命運(yùn)的,是我們?cè)诿鎸?duì)“理性越界”時(shí),是否還有勇氣停下來思考:我們真正的需求,是更快的模型、更高的評(píng)分、更大的市場(chǎng)份額,還是一個(gè)人類能夠理解、掌控并對(duì)之負(fù)責(zé)的技術(shù)系統(tǒng)?
