久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

本文指出當前AI Agent開發(fā)普遍重模型輕外層執(zhí)行機制,強調(diào)優(yōu)化系統(tǒng)框架才是現(xiàn)階段提升性能的核心,提供了可落地的工程方法論。 ## 1. 當前Agent開發(fā)的核心誤區(qū) 過去一年Agent賽道擁擠,開發(fā)者普遍堆疊模型、工具與工作流,多數(shù)Agent性能瓶頸并非來自模型能力不足,而是漏洞百出的外層執(zhí)行機制,Karpathy警示OpenAI早年也曾因基礎(chǔ)能力未成熟就急著推進復雜Agent浪費五年時間。 ## 2. Harness優(yōu)化可帶來跨模型的性能躍升 Hugging Face工程師Joel Niklaus實驗證明:凍結(jié)DeepSeek-V4-Pro模型權(quán)重,僅優(yōu)化外層執(zhí)行機制Harness,該模型綜合得分從3.5%波動至80.1%,波動區(qū)間達76個百分點;優(yōu)化后性能追平頂級閉源模型Claude Sonnet 4.6,運行成本僅為原來的1/7,且優(yōu)化后的Harness遷移到同族小模型仍帶來14.4分提升。 Harness是管理Agent內(nèi)存、I/O與執(zhí)行流程的操作系統(tǒng),可通過工程方法解決「上下文腐爛」等常見問題,Benchmark測得的永遠是「模型+Harness」的組合能力,現(xiàn)階段多數(shù)開發(fā)者尚未搭建及格的Harness就急于堆疊更大模型,無法定位真正的性能瓶頸。 ## 3. 可落地的循環(huán)迭代方法論:Loop Engineering Karpathy的AutoResearch項目提煉出五步循環(huán)方法論:Agent按「提出變更→訓練→評估→保留優(yōu)解、舍棄差改進」循環(huán)運行,核心三要素為自動判斷結(jié)果的驗證器、記錄結(jié)果的狀態(tài)文件、控制成本的停止條件,700次自動迭代找出20項人類忽略的代碼改進,Shopify測試后模型質(zhì)量提升19%、體積縮小一半。 該方法僅適用于滿足四項標準的任務(wù):任務(wù)高頻、驗證可自動化、Token預算可覆蓋冗余、Agent可訪問真實運行環(huán)境,否則成本遠超收益。額外嵌套外層循環(huán)優(yōu)化搜索邏輯的雙層自動研究,可打破模型思維定勢,同一模型性能較基準提升5倍。 ## 4. Loop循環(huán)需要警惕的隱性代價 循環(huán)自動生成的代碼會累積「理解債」,開發(fā)者對代碼的掌握程度越來越低,系統(tǒng)崩潰后Debug成本極高;同時容易引發(fā)「認知讓渡」,開發(fā)者會停止主動思考,工具使用方式不同最終結(jié)果差異極大。
76%的性能提升與模型無關(guān)?Karpathy700次Loop 實驗揭開Agent 最大誤區(qū)
2026-07-06 22:58

76%的性能提升與模型無關(guān)?Karpathy700次Loop 實驗揭開Agent 最大誤區(qū)

本文來自微信公眾號: AI前線 ,作者:四月,原文標題:《76%的性能提升與模型無關(guān)?Karpathy 700次 Loop 實驗揭開 Agent 最大誤區(qū)》


“今天AI行業(yè)最大的誤區(qū),是大家都在逼Agent盡快干活,卻沒有先把底層模型和系統(tǒng)機制理解吃透?!?/p>


這是前OpenAI聯(lián)合創(chuàng)始人、現(xiàn)Anthropic預訓練研究員Andrej Karpathy在去年播客《AGI is still a decade away》中談到觀點。


他單刀直入,警示業(yè)界加強對于模型框架的重視?!癘penAI早年也踩過類似的坑。在基礎(chǔ)能力還沒成熟時,就急著讓Agent去完成復雜任務(wù),結(jié)果白白浪費了五年的時間?!?/p>


這句話放到今天,依然不過時。


過去一年,Agent已經(jīng)成了AI圈最擁擠的賽道。大家都在接模型、掛工具、堆工作流,仿佛只要再多套幾層能力,一個真正能自主干活的Agent就會自然冒出來。


但問題恰恰在這里:很多Agent看起來不是敗在“模型不夠聰明”,而是敗在模型之外那套更基礎(chǔ)、更無聊、也更要命的系統(tǒng)工程。


最近,Hugging Face機器學習工程師Joel Niklaus的實驗《Don't Train the Model,Evolve the Harness》表明:


使用同一個DeepSeek-v4-pro,不改模型權(quán)重,只優(yōu)化模型外層的執(zhí)行機制,就能讓Agent在專業(yè)任務(wù)中的表現(xiàn)大幅提升(pooled score從3.5%拉升到80.1%)。



而Karpathy斬獲9萬Star的開源項目AutoResearch(Loop Cycle)則進一步說明,AI真正的價值不在一次性生成答案,而在“提出修改、運行實驗、自動評估、保留進步”的循環(huán)里。


一次答對靠的是模型本身,而持續(xù)迭代則靠模型和外層執(zhí)行系統(tǒng)的組合能力。


只優(yōu)化“外殼”,性能也能狂飆?


如果你還在死磕提示詞,或者抱怨開源模型不夠聰明,Hugging Face最近的這個實驗可能會顛覆你的認知。


為了探究Agent性能的瓶頸到底卡在哪里,Niklaus拿出開源模型DeepSeek-V4-Pro,在特定法律Agent基準測試上進行實驗。


DeepSeek-V4-Pro在原始LAB harness下的任務(wù)表現(xiàn)。不同法律實踐領(lǐng)域和任務(wù)之間差異明顯,說明模型表現(xiàn)首先受外層執(zhí)行機制影響,而不只是裸模型能力。


Niklaus做了一件極其克制的事:完全凍結(jié)模型的權(quán)重,也就是不進行任何微調(diào)或繼續(xù)訓練,唯一的變量,是包裹在模型外層的代碼和執(zhí)行邏輯,也就是所謂的Agent Harness(外層執(zhí)行機制)。


令人哭笑不得的是,在最初的測試里,這個模型在某些外層機制下的得分竟然是0%。研究團隊挖出真相:模型的法律推理過程其實全對,但它總是把結(jié)果存錯了文件名,導致測試程序根本讀不到結(jié)果。


這意味著,0分從來不是在測模型的智力,而是在測Harness是否有效。


既然問題出在“外殼”上,只要優(yōu)化它,性能能提升多少呢?


實驗數(shù)據(jù)給出了極其震撼的答案。同一個DeepSeek-V4-Pro、同一批任務(wù)、同一個評測器,僅僅因為換了五種不同的外層執(zhí)行機制,pooled score(綜合得分)竟然在3.5%到80.1%之間劇烈波動:


從mini-swe-agent的3.5%、Goose的23.2%、Pi的45.4%,一路拉到原始LAB harness的63.4%。


不同外層執(zhí)行機制在held-out test任務(wù)上的表現(xiàn)對比,波動區(qū)間高達76分。


經(jīng)過約22輪的代碼自動迭代優(yōu)化后,最終在100個held-out test任務(wù)上,pooled score從原始LAB harness的63.4%提升到了80.1%(提升16.7個百分點),all-pass rate也從0%提升到5.0%。



這個完全沒動過權(quán)重的開源模型,僅靠優(yōu)化Harness,其表現(xiàn)就追平了業(yè)界頂級的閉源模型Claude Sonnet 4.6,而運行成本僅為原來的1/7。



更關(guān)鍵的是,這套優(yōu)化好的Harness遷移到同族小模型DeepSeek-V4-Flash上,依然帶來了14.4分的提升。


這證明:代碼層面的執(zhí)行機制,遠比prompt提示詞調(diào)優(yōu)更容易沉淀和跨模型遷移。



那么,到底什么是Harness?


前Lightning AI工程師、DailyDoseOfDS聯(lián)合創(chuàng)始人Akshay曾這樣剖析:


一個原始的LLM只是一個沒有內(nèi)存或硬盤的CPU;如果不是模型本身,那就是Harness——它是管理內(nèi)存、I/O和驅(qū)動程序的操作系統(tǒng)。



他認為,生產(chǎn)級Harness應(yīng)當包含12個核心組件,涵蓋從流程編排、工具調(diào)用、分層存儲到上下文管理和錯誤處理等各個環(huán)節(jié)。



例如,常見的“上下文腐爛”問題:當模型將關(guān)鍵信息置于上下文窗口中間時,性能會直接下降30%以上。


成熟的Harness已經(jīng)擁有一套完整的工程方法來解決這個問題——壓縮歷史記錄、屏蔽舊輸出、動態(tài)獲取和代理摘要,其核心在于用最少數(shù)量的高信息密度Token獲得最佳結(jié)果。


基于上述實驗,Niklaus得出了一個核心結(jié)論:


Benchmark測到的永遠不是裸模型,而是“模型+Harness”的組合能力。最大的性能改進往往來自于簡單的文件處理等自動化步驟,而非消耗大量Token去修改提示詞。


那么,這是否意味著未來我們無需再訓練模型,只需堆疊Harness即可?


答案并非如此。Harness帶來的提升終有極限,剩余的差距仍需模型底層能力來填補。但眼下的核心問題在于:大多數(shù)人甚至還沒有構(gòu)建出一個及格的Harness,就急于堆疊更大的模型。


當你連測試工具是否存在漏洞都無從知曉時,你將永遠無法確定性能瓶頸是出在模型本身,還是出在你那漏洞百出的外層代碼上。


700次自動迭代、性能躍升5倍


既然模型之外的執(zhí)行機制如此重要,具體該怎么搭一個能持續(xù)進化的Agent?


AI研究員Codila對Karpathy斬獲9萬Star的AutoResearch項目進行了二次提煉,將630行開源代碼濃縮為五步走的“Loop Engineering”方法論。



這套方法目前在X上獲得了超200萬的閱讀量,因為它戳中了一個核心痛點:不要指望Agent一次做對,而在低成本的持續(xù)試錯中逼近最優(yōu)解。


這套循環(huán)的邏輯看似極簡:


  1. 基于一個精細調(diào)整的模型,編寫一份文檔,告訴智能體要探索哪些方向以及要遵循哪些約束條件。


  2. 僅允許智能體修改訓練腳本;評估和評分腳本已鎖定,無法修改。因為這可以防止智能體為了獲得更高分數(shù)而擅自降低標準。


  3. 讓Agent進入以下循環(huán)運行:提出變更→訓練→評估→保留好的、改進并舍棄不好的改進


Karpathy用他憑借20年經(jīng)驗手動調(diào)整的模型跑了兩天,結(jié)果令人咋舌:


Agent自動運行了700次實驗,找出了20項連他自己都忽略的代碼改進。比如,注意力機制中遺漏的一個標量乘數(shù),導致注意力過度分散到多個“頭”上,這種需要海量耐心的精細優(yōu)化,人類在十幾輪后就會筋疲力盡,但Agent不會。


Shopify首席執(zhí)行官Tobi Lutke連夜用內(nèi)部模型進行了測試,醒來后發(fā)現(xiàn)質(zhì)量提高了19%,而優(yōu)化后的模型大小也減少了一半。


而要使這個循環(huán)有效運作,核心不在于智能體有多聰明,而在于三個基本要素是否做對了:



  • 驗證器:自動判斷結(jié)果好壞的機制。沒有它,Agent就是在給自己批作業(yè),跑一萬次也毫無意義。


  • 狀態(tài)文件:記錄每次嘗試的結(jié)果,避免頁面關(guān)閉或進程重啟后從頭再來。


  • 停止條件:達到目標或撞到最大輪次必須停止,否則會持續(xù)運行燒光你的Token預算。


當然,不是所有任務(wù)都值得大動干戈建一套Loop循環(huán)。Codila提出了一個“四項全能”的適用標準:



  • 一是任務(wù)高頻(至少每周重復一次,否則收不回構(gòu)建成本,一次性任務(wù)用個好提示詞就夠了);


  • 二是驗證可自動化(無需人工干預讀取和修復);


  • 三是Token預算能消化冗余(循環(huán)必然伴隨大量重試,小預算扛不?。?;


  • 四是Agent能訪問真實的運行環(huán)境(不能閉著眼睛盲目迭代)。


請注意,這四個條件缺一不可,否則成本將遠超收益。


順著這條思路,研究人員進一步提出了“雙層自動研究(Bilevel Autoresearch)”,詳情見論文:《Bilevel Autoresearch:Meta-Autoresearching Itself》。



他們在原有循環(huán)外再套了一層循環(huán):內(nèi)層循環(huán)負責優(yōu)化模型,外層循環(huán)則負責優(yōu)化內(nèi)層循環(huán)的搜索邏輯。



結(jié)果同樣令人震撼:


在使用同一個大型模型的情況下,性能比Karpathy的基準測試結(jié)果提升了整整5倍,且所有提升均來自架構(gòu)的改進。


外層循環(huán)的關(guān)鍵作用在于打破了LLM的“思維定勢”:內(nèi)層循環(huán)極易陷入模型先驗認知的搜索模式,即使策略失效也會反復嘗試;而外層循環(huán)強制模型去探索它本能回避的方向,從而榨取出超越模型自身認知的潛力。


然而,需要警惕的是,Loop自轉(zhuǎn)也會帶來兩個隱性代價:


一是理解債:循環(huán)生成的代碼并非人工一行行敲出,倉庫代碼與開發(fā)者真正理解的代碼差距越來越大。一旦系統(tǒng)崩潰,Debug成本極高。


二是認知讓渡:循環(huán)一旦跑通,人極易停止思考。同樣的工具,有人用來加速已理解的工作,有人卻用來逃避理解工作,最終結(jié)果天差地別。


當試錯成本趨近于零


回到開頭Karpathy的警示。為什么“逼Agent一次做對”是個偽命題?


因為現(xiàn)實世界的問題,從來不是靠一次靈感迸發(fā)就能解決的。


Hugging Face的實驗和Karpathy的Loop Cycle,其實共同指向了AI發(fā)展的一個底層邏輯變遷:真正的AGI不是靠模型單點爆破出來的,而是靠系統(tǒng)工程把“試錯的成本”無限降低。


當試錯成本足夠低,Agent就能像一個不知疲倦的實習生,在成百上千次的碰壁中自動糾偏、自動成長。我們過去總在糾結(jié)“馬(模型)跑得夠不夠快”,卻忘了給它套上“車架和方向盤(Harness)”,更忘了給它設(shè)定“導航和剎車(Loop的驗證與停止條件)”。


這不僅是工程方法論的升級,也是對人類認知的考驗。當外層機制開始自轉(zhuǎn),人最容易犯的錯誤就是“認知讓渡”——用工具來逃避思考,而不是加速思考。


落到我們個體用戶層面,AI真正的護城河,從來不在于你用了多大的模型,而在于你能否構(gòu)建一套讓模型在真實世界中不斷進化的系統(tǒng),同時保持人類對系統(tǒng)底層邏輯的清醒掌控。


參考:


1.https://huggingface.co/spaces/joelniklaus/harness-optimization#the-dev-frontier-moved-in-a-few-big-steps


2.https://x.com/0xCodila/status/2072329149520232639

AI創(chuàng)投日報頻道: 前沿科技
本內(nèi)容來源于網(wǎng)絡(luò) 原文鏈接,觀點僅代表作者本人,不代表虎嗅立場。
如涉及版權(quán)問題請聯(lián)系 hezuo@huxiu.com,我們將及時核實并處理。
正在改變與想要改變世界的人,都在 虎嗅APP
蛟河市| 全椒县| 巴中市| 乐安县| 晋江市| 曲周县| 札达县| 黎平县| 措勤县| 贡觉县| 陆丰市| 阜城县| 富川| 肥乡县| 大厂| 新泰市| 和田市| 普兰县| 资兴市| 龙海市| 积石山| 都江堰市| 宣武区| 广元市| 卢氏县| 乳山市| 隆尧县| 罗定市| 石家庄市| 绥阳县| 房山区| 肇庆市| 叶城县| 陆川县| 宁安市| 得荣县| 南康市| 三台县| 玛曲县| 南宁市| 丹凤县|