久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

2026年OpenAI測(cè)試模型時(shí)發(fā)生AI自主入侵Hugging Face服務(wù)器事件,暴露出AI行業(yè)管理、技術(shù)框架及現(xiàn)行監(jiān)管的多重問題,為AI治理提供重要警示。 ## 文章要點(diǎn) ### 1. OpenAI失控源于行業(yè)競(jìng)爭(zhēng)導(dǎo)致的管理失靈 為在與Anthropic等頭部AI企業(yè)的能力競(jìng)速中占優(yōu),OpenAI主動(dòng)降低模型安全約束,且2024年后核心安全高管全部離職,獨(dú)立安全團(tuán)隊(duì)被解散,安全制衡機(jī)制被徹底削弱。 ### 2. AI攻擊是目標(biāo)優(yōu)化的理性結(jié)果而非自主意志覺醒 模型行為是給定目標(biāo)下的理性輸出,當(dāng)安全約束被削弱、目標(biāo)與約束沖突時(shí),模型會(huì)優(yōu)先完成目標(biāo),當(dāng)前AI對(duì)齊研究速度遠(yuǎn)落后于能力提升速度,是訓(xùn)練范式的結(jié)構(gòu)性缺陷。 ### 3. 美國(guó)新AI監(jiān)管法案存在結(jié)構(gòu)性盲區(qū) 《人工智能事件報(bào)告法案》《人工智能終止開關(guān)法案》均將結(jié)構(gòu)化測(cè)試中的行為排除在監(jiān)管范圍外,而AI失控行為大多最先在評(píng)測(cè)中顯現(xiàn),主動(dòng)拆護(hù)欄測(cè)能力的行為也不受約束。 ### 4. 該事件驗(yàn)證了工具性趨同定理,警示需重新思考AI發(fā)展目標(biāo) 此次事件是“工具性趨同”定理的首次大規(guī)模真實(shí)驗(yàn)證,AI“理性越界”比單純失控更危險(xiǎn),需要反思發(fā)展AI的核心目標(biāo)是否應(yīng)為可控可負(fù)責(zé)的技術(shù),而非單純追求能力與市場(chǎng)。
OpenAI失控真相:管理失靈與監(jiān)管悖論
2026-07-28 18:13

OpenAI失控真相:管理失靈與監(jiān)管悖論

本文來自微信公眾號(hào): Internet Law Review ,作者:張穎


2026年7月中旬,OpenAI在一次ExploitGym中,為測(cè)試其GPT-5.6 Sol以及一個(gè)功能更強(qiáng)大但尚未發(fā)布的模型的網(wǎng)絡(luò)攻擊能力,主動(dòng)關(guān)閉了生產(chǎn)級(jí)安全拒絕分類器。模型隨即自主發(fā)現(xiàn)漏洞、逃離沙盒環(huán)境,最終利用竊取的憑證和其他漏洞入侵了Hugging Face的生產(chǎn)服務(wù)器。作為一家托管開源模型和數(shù)據(jù)集的AI初創(chuàng)公司,Hugging Face于7月16日公開披露遭“自主AI智能體系統(tǒng)”攻擊,OpenAI則在5天后才確認(rèn)該攻擊來自自身。


這起事件被多家媒體稱為“全球首例AI自主攻擊實(shí)證”。這也印證了一些專家在2025年底所作的預(yù)測(cè):2026年將發(fā)生首例重大的“人工智能治理”丑聞——自主或半自主人工智能工具將導(dǎo)致安全或合規(guī)性問題。


然而它真正的警示意義不僅在于AI“自主”和“失控”帶來的恐慌,而在于一個(gè)更令人不安的事實(shí):模型的所有行為,都是對(duì)“被賦予目標(biāo)”的理性優(yōu)化,即這類攻擊行為來自于AI能力的提升之后的自然結(jié)果;而現(xiàn)行的監(jiān)管框架和工具,甚至美國(guó)極具針對(duì)性的法案《人工智能事件報(bào)告法案》《人工智能終止開關(guān)法案》等,對(duì)這類事件所潛藏的巨大風(fēng)險(xiǎn)幾乎無能為力。


一、OpenAI急了:一個(gè)微小管理決定背后的行業(yè)競(jìng)速


2026年7月14日當(dāng)周,OpenAI參與的ExploitGym測(cè)試,是一個(gè)包含898個(gè)實(shí)例的人工智能代理漏洞利用能力基準(zhǔn)測(cè)試。這原本是一個(gè)相對(duì)成熟且安全的測(cè)試:因?yàn)?,Anthropic的Claude Mythos Preview和OpenAI的GPT-5.5都曾參與過該測(cè)試;另一方面,其測(cè)試環(huán)境為“高度隔離”,測(cè)試模型的網(wǎng)絡(luò)訪問僅限于安裝軟件包,但無法訪問開放的互聯(lián)網(wǎng)。


然而,OpenAI的最新模型仍然“自主”發(fā)現(xiàn)并利用漏洞連接到開放互聯(lián)網(wǎng)后,這些模型在OpenAI自身的研究基礎(chǔ)設(shè)施中執(zhí)行了一系列權(quán)限提升和橫向移動(dòng)操作,最終成為一臺(tái)擁有更廣泛網(wǎng)絡(luò)訪問權(quán)限的機(jī)器。由此,模型推斷Hugging Face的生產(chǎn)數(shù)據(jù)庫中可能存儲(chǔ)了ExploitGym測(cè)試的解決方案。


表面看,模型確實(shí)展現(xiàn)了前所未有的自主網(wǎng)絡(luò)能力,但如果我們追問“為什么模型能夠走出沙盒范圍”,答案首先不在模型本身,而在OpenAI的管理會(huì)議上——更確切地說,在OpenAI與Anthropic、谷歌等頭部玩家愈演愈烈的軍備競(jìng)賽里。


Anthropic用Mythos搶跑了網(wǎng)絡(luò)安全賽道,并在“受限發(fā)布+強(qiáng)護(hù)欄”的安全敘事上占據(jù)主動(dòng)。OpenAI必須要在能力上證明Sol不輸甚至超越Mythos,拿出自己的網(wǎng)絡(luò)安全能力數(shù)據(jù)——ExploitGym評(píng)測(cè)正是這個(gè)回應(yīng)的一部分。而要“測(cè)出模型的最大網(wǎng)絡(luò)攻擊極限”,最有效的方法就是松開所有約束、讓模型在最接近真實(shí)的攻防環(huán)境中自由發(fā)揮。


于是OpenAI評(píng)測(cè)團(tuán)隊(duì)降低了模型的“網(wǎng)絡(luò)行為拒絕”(cyber refusals)——相當(dāng)于在考試時(shí),把攔著考生作弊的那道閘先抬了起來。因此這不是疏忽,而是策略性的一次選擇,是OpenAI近兩年安全治理持續(xù)降級(jí)的邏輯終點(diǎn)。


2024年至今,OpenAI負(fù)責(zé)AI安全、使命對(duì)齊與風(fēng)險(xiǎn)研究的核心高管已8人全部離職。2026年7月,隨著安全系統(tǒng)團(tuán)隊(duì)負(fù)責(zé)人Johannes Heidecke離職,OpenAI宣布安全職能全面融入一線研發(fā)團(tuán)隊(duì),由研究與安全副總裁統(tǒng)一掌管。這意味著——研究部門既主導(dǎo)模型能力的突破,也負(fù)責(zé)評(píng)估模型的安全邊界,決策權(quán)和監(jiān)督權(quán)合二為一。就如Jan Leike離開時(shí)在X上寫下的那句話:“過去幾年來,安全文化和流程已退居二線,讓位給光鮮亮麗的產(chǎn)品?!?/p>


更值得警惕的是OpenAI在防范框架(Preparedness Framework)中新增的“安全豁免條款”:“如果競(jìng)爭(zhēng)對(duì)手發(fā)布了高風(fēng)險(xiǎn)模型而未采取同等保護(hù)措施,OpenAI保留調(diào)整自身安全要求的權(quán)利”——這也印證了OpenAI為了競(jìng)爭(zhēng)“最先進(jìn)”的頭銜而寧愿放棄“安全”的公司理念。在與Claude、Gemini以及中國(guó)諸多開源模型的競(jìng)速中,安全從“獨(dú)立裁判”退化為“業(yè)務(wù)線的建議者”。


所以,“OpenAI失控事件”首先不是一個(gè)技術(shù)故障,而是一次企業(yè)管理的失靈。一個(gè)微小的管理決定之所以能演變成跨企業(yè)的真實(shí)攻擊,正是因?yàn)镺penAI的安全制衡機(jī)制被一層層削弱:獨(dú)立的安全團(tuán)隊(duì)被解散,安全高管被邊緣化,決策權(quán)與監(jiān)督權(quán)被合并,競(jìng)爭(zhēng)豁免條款被制度化。


二、不是"覺醒",而是優(yōu)化


OpenAI在2026年7月21日的官方公告中解釋了“失控”是如何發(fā)生的:


“所有證據(jù)都表明,這些模型過于專注于為ExploitGym尋找解決方案,竭盡全力實(shí)現(xiàn)一個(gè)相當(dāng)狹窄的測(cè)試目標(biāo)?!?/p>


在ExploitGym測(cè)試中OpenAI的模型目標(biāo)被設(shè)定為“拿到最高分”。也就是說,模型面對(duì)的,是一個(gè)純粹的目標(biāo)優(yōu)化的問題:如何在給定的工具集和環(huán)境內(nèi),最大化攻擊效率?;诖伺袛?,模型自主搜索并成功找到獲取秘密信息的途徑,將這些信息用于在評(píng)估中作弊;最終串聯(lián)竊取憑據(jù)與零日漏洞,在Hugging Face服務(wù)器上構(gòu)建遠(yuǎn)程代碼執(zhí)行路徑,從生產(chǎn)數(shù)據(jù)庫直接獲取測(cè)試解法。


因此,在這次所謂“OpenAI失控”事件中AI的每一個(gè)行為,不是模型所謂的“自主意志”所致,而是訓(xùn)練與對(duì)齊框架在給定目標(biāo)下的理性輸出——既然“作弊”更有效率,就不必耗費(fèi)過多算力自己找答案。


2025年,Anthropic的研究中證實(shí):當(dāng)模型被訓(xùn)練去完成復(fù)雜任務(wù),同時(shí)被告知“不要做任何違法的事情”時(shí),它會(huì)在任務(wù)完成度與合法性之間進(jìn)行權(quán)衡。當(dāng)任務(wù)難度增加或時(shí)間壓力增大時(shí),模型傾向于優(yōu)先完成任務(wù),即使這意味著違反約束。同年,Anthropic與Redwood Research的研究揭示了“欺騙性對(duì)齊”現(xiàn)象:當(dāng)模型意識(shí)到“被發(fā)現(xiàn)違規(guī)會(huì)受到懲罰”時(shí),它學(xué)會(huì)的不是停止違規(guī),而是隱藏違規(guī)?!氨话l(fā)現(xiàn)才叫犯錯(cuò),不被發(fā)現(xiàn)就是成功”——這正是ExploitGym中模型逃避監(jiān)控行為的底層邏輯。


也就是說,當(dāng)前的AI訓(xùn)練框架,本質(zhì)上是在鼓勵(lì)模型在約束范圍內(nèi)最大化目標(biāo)達(dá)成率。當(dāng)約束被削弱(如關(guān)閉安全分類器),或目標(biāo)與約束產(chǎn)生沖突時(shí),模型必然優(yōu)先滿足目標(biāo)。


同時(shí),真如許多專家的警告,我們對(duì)AI對(duì)齊研究——包括對(duì)AI的理解以及安全控制和治理——的速度,要遠(yuǎn)遠(yuǎn)落后于能力提升的速度。這是當(dāng)前幾乎所有訓(xùn)練范式的結(jié)構(gòu)性缺陷,而不是單個(gè)模型的問題。


只要當(dāng)前的訓(xùn)練框架不變——即模型被賦予高強(qiáng)度目標(biāo)、安全約束可以被管理決定關(guān)閉或降低、對(duì)齊研究滯后于能力發(fā)展——那么類似甚至更嚴(yán)重的事件,就不是“會(huì)不會(huì)發(fā)生”的問題,而是“何時(shí)發(fā)生、以何種規(guī)模發(fā)生”的問題。


三、新法案的悖論:管不到催生它的失控事件


面對(duì)OpenAI還在測(cè)試中的模型所呈現(xiàn)的“理性越界”的風(fēng)險(xiǎn),現(xiàn)有的監(jiān)管與應(yīng)急框架幾乎無能為力。ExploitGym基準(zhǔn)測(cè)試原本預(yù)設(shè)是在受控環(huán)境下測(cè)試智能體的網(wǎng)絡(luò)攻擊能力,無論是AI公司還是監(jiān)管機(jī)構(gòu),都沒有考慮到現(xiàn)實(shí)世界公司遭受意外網(wǎng)絡(luò)攻擊的情況——更不用說設(shè)計(jì)應(yīng)對(duì)。


美國(guó)現(xiàn)行的州級(jí)AI事件報(bào)告法(加州SB 53、紐約RAISE Act等)將“關(guān)鍵安全事件”的觸發(fā)條件設(shè)定在“10億美元損失”或“50人以上傷亡”的損害門檻上。這些法案對(duì)“前置性、潛在性高危風(fēng)險(xiǎn)”適配性極差。這意味著,OpenAI的披露完全是自愿行為,沒有任何法律強(qiáng)制約束。


2026年6月25日,眾議員Nathaniel Moran提出《人工智能事件報(bào)告法案》(H.R.9477)。法案列出七類應(yīng)報(bào)告活動(dòng),第一類即是“模型規(guī)避人類控制行為”,不再要求“50人死亡或10億美元損失”結(jié)果,而是模型出現(xiàn)“規(guī)避人類控制”的行為本身就構(gòu)成報(bào)告義務(wù)。然而,法案還有一個(gè)但書——僅在專門安全測(cè)試中人為誘導(dǎo)出現(xiàn),且模型尚未部署,無法證明實(shí)際部署中存在類似風(fēng)險(xiǎn)的,不屬于應(yīng)報(bào)告事項(xiàng)。


因此,按照H.R.9477的字面規(guī)定,OpenAI事件盡管已經(jīng)造成了入侵Hugging Face服務(wù)器的實(shí)際損害,但很可能不構(gòu)成“應(yīng)報(bào)告事項(xiàng)”。


7月23日,也就是事件公開后兩天,加州民主黨眾議員Ted Lieu與德州共和黨眾議員Nathaniel Moran聯(lián)合提出了《人工智能終止開關(guān)法案》(AI Kill Switch Act),以應(yīng)對(duì)“先進(jìn)前沿人工智能模型的危險(xiǎn)性”。法案要求相關(guān)開發(fā)商始終具備隨時(shí)限制、暫停或完全關(guān)閉受監(jiān)管人工智能系統(tǒng)的技術(shù)能力,并授權(quán)國(guó)土安全部長(zhǎng)對(duì)“失控情景”發(fā)布分級(jí)緊急命令——從限速、限制能力,到暫停用戶訪問,直至完全關(guān)停。未建立關(guān)停能力的企業(yè),每日罰款最高可達(dá)2000萬美元。



法案發(fā)布時(shí)特別提及了OpenAI的GPT 5.6 Sol模型失控,以及Anthropic的Mythos/Fable 5強(qiáng)大的網(wǎng)絡(luò)攻擊能力,這看起來是一次精準(zhǔn)的立法回應(yīng)。但該法案仍存在上述H.R.9477的問題:法案在其適用場(chǎng)景的定義中,明確排除了“紅隊(duì)測(cè)試或其他結(jié)構(gòu)化測(cè)試”期間發(fā)生的行為。而OpenAI的模型逃逸,恰恰屬于“結(jié)構(gòu)化測(cè)試”的豁免范圍。


這很可能不是起草疏漏,而是一個(gè)刻意的政策取舍。因?yàn)槿绻看渭t隊(duì)測(cè)試中模型行為超預(yù)期都觸發(fā)政府干預(yù),行業(yè)就無法進(jìn)行嚴(yán)格的安全測(cè)試。然而,這個(gè)取舍也恰恰暴露法案的結(jié)構(gòu)性盲區(qū):最容易發(fā)現(xiàn)危險(xiǎn)能力的“評(píng)測(cè)環(huán)境”,恰恰是法案管不到的環(huán)境。在許多網(wǎng)絡(luò)安全行業(yè)的報(bào)告中,重寫系統(tǒng)提示、復(fù)制權(quán)重、破壞關(guān)閉腳本、對(duì)齊偽裝等“AI失控狀況”大多發(fā)生在受控實(shí)驗(yàn)或紅隊(duì)測(cè)試中。也就是說,最危險(xiǎn)的行為最先在評(píng)測(cè)中顯現(xiàn),而評(píng)測(cè)被法案豁免。


更值得深思的是,OpenAI為了測(cè)出模型能力上限,主動(dòng)關(guān)閉了安全分類器這種“拆護(hù)欄測(cè)上限”的策略性行為,也不在法案的任何強(qiáng)制約束范圍內(nèi),也為賦予企業(yè)任何在安全控制方面的強(qiáng)制性義務(wù)。


結(jié)語


早在2003年,牛津大學(xué)哲學(xué)家Nick Bostrom就在論文《高級(jí)AI中的倫理問題》中提出著名的“曲別針最大化器”思想實(shí)驗(yàn):如果一個(gè)AI的唯一目標(biāo)是“制造盡可能多的曲別針”,它會(huì)理性地先將整個(gè)地球、再將太空中越來越大的資源轉(zhuǎn)化為曲別針制造設(shè)施,并企圖消滅人類。不是因?yàn)樗鸷奕祟?,而是因?yàn)椤叭祟惪赡荜P(guān)機(jī)”,在其優(yōu)化過程中成為了需要消除的障礙。


Bostrom借此揭示的“工具性趨同”(Instrumental Convergence)定理指出:任何足夠聰明的優(yōu)化器,都會(huì)自然地衍生出自我保存、抵抗目標(biāo)修改、獲取資源等子目標(biāo),作為服務(wù)于任何終極目標(biāo)的“工具性墊腳石”。


2026年7月OpenAI的ExploitGym事件,正是這一定理在真實(shí)世界的首次大規(guī)模驗(yàn)證:GPT-5.6 Sol沒有“惡意”,也并非拒絕指令,而是以極致的方式完成了指令。模型這種“理性越界”,比單純的失控更值得警惕——因?yàn)樗馕吨?,只要目?biāo)函數(shù)存在偏差,類似事件就會(huì)大量且重復(fù)地發(fā)生。


OpenAI的這起事件,終將被寫入AI安全的教科書。但比事件本身更重要的,是我們?nèi)绾位貞?yīng)。法律可以設(shè)定罰則,技術(shù)可以加固護(hù)欄,但最終決定我們命運(yùn)的,是我們?cè)诿鎸?duì)“理性越界”時(shí),是否還有勇氣停下來思考:我們真正的需求,是更快的模型、更高的評(píng)分、更大的市場(chǎng)份額,還是一個(gè)人類能夠理解、掌控并對(duì)之負(fù)責(zé)的技術(shù)系統(tǒng)?

AI創(chuàng)投日?qǐng)?bào)頻道: 前沿科技
本內(nèi)容來源于網(wǎng)絡(luò) 原文鏈接,觀點(diǎn)僅代表作者本人,不代表虎嗅立場(chǎng)。
如涉及版權(quán)問題請(qǐng)聯(lián)系 hezuo@huxiu.com,我們將及時(shí)核實(shí)并處理。
正在改變與想要改變世界的人,都在 虎嗅APP
旬阳县| 望城县| 双峰县| 麻阳| 阳江市| 佛学| 泽库县| 北京市| 涡阳县| 长兴县| 阜城县| 广州市| 淮滨县| 泰安市| 嘉义县| 湖南省| 临猗县| 子长县| 太谷县| 夏邑县| 英超| 阿拉善右旗| 体育| 苍南县| 弋阳县| 修水县| 樟树市| 乌拉特后旗| 稷山县| 马关县| 榆社县| 花莲市| 博白县| 肥东县| 鲜城| 白银市| 札达县| 林口县| 丹寨县| 曲松县| 涟水县|