久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

本文介紹Anthropic新模型Claude Opus 5的定位與性能,分析其能否替代高端旗艦Fable 5,梳理了Anthropic的分級產(chǎn)品策略。 ## 1. 登頂?shù)谌桨駟蔚葱纬蓴鄬觾?yōu)勢 Opus 5定位為兼顧性能與成本的日常高頻使用模型,是個(gè)人訂閱用戶可調(diào)用的最強(qiáng)Claude模型,高端模型Fable 5個(gè)人額度有限。第三方榜單中Opus 5 max以61分排第一,僅領(lǐng)先Fable 5 1分;多項(xiàng)測試中Opus 5性能逼近Fable 5,成本僅為其一半左右,但純基礎(chǔ)能力仍略遜于Fable 5。 ## 2. 實(shí)際體驗(yàn)評價(jià)分化,適配日常高頻任務(wù) Opus 5在編程、快速產(chǎn)品原型制作等領(lǐng)域表現(xiàn)突出,新增的動(dòng)態(tài)調(diào)整工具、自動(dòng)回退兩項(xiàng)Beta功能明顯改善了Agent開發(fā)體驗(yàn)。部分用戶反饋Opus 5存在高思考檔位過度思考、偏離任務(wù)、Token消耗大的問題,目前更適合完成邊界清晰的工作,復(fù)雜長周期任務(wù)仍以Fable 5表現(xiàn)更好。 ## 3. 契合Anthropic分級開放的產(chǎn)品策略 不到兩個(gè)月內(nèi)Anthropic完成Claude全主要產(chǎn)品線更新,堅(jiān)持閉源、分級開放和風(fēng)險(xiǎn)管控的路線,此前高端能力的Mythos 5因監(jiān)管僅向獲批機(jī)構(gòu)開放。Opus 5攻擊能力受限,更符合合規(guī)要求,填補(bǔ)了“低成本接近旗艦?zāi)芰Α钡氖袌隹瞻祝嫦蛉粘i_發(fā)者和知識(shí)工作者。Fable 5仍作為Anthropic公開可用的能力上限,承擔(dān)復(fù)雜長周期任務(wù),不會(huì)被Opus 5替代。
Opus 5沖上第一,還需要Fable 5嗎?
2026-07-25 21:00

Opus 5沖上第一,還需要Fable 5嗎?

本文來自微信公眾號(hào): AIX財(cái)經(jīng) ,作者:AIX財(cái)經(jīng)團(tuán)隊(duì),編輯:金玙璠,原文標(biāo)題:《Opus 5沖上第一,還需要Fable 5嗎?》


Opus 5拿下榜首,卻只領(lǐng)先1分。


AIX財(cái)經(jīng)(AIXcaijing)原創(chuàng)


7月的模型圈很熱鬧。


25日凌晨,Anthropic正式推出了新模型Claude Opus 5。


這一次,Anthropic沒有強(qiáng)調(diào)“最強(qiáng)模型”,而是給出更務(wù)實(shí)的定位:Opus 5在復(fù)雜任務(wù)上更少遺漏步驟、更傾向主動(dòng)驗(yàn)證中間結(jié)果,在多項(xiàng)評測中兼顧性能與成本,適合日常高頻使用。


定位的變化也直接體現(xiàn)在產(chǎn)品里,目前Opus 5成為Claude Max的默認(rèn)模型,也是面向個(gè)人訂閱用戶(Max/Pro)可調(diào)用的最強(qiáng)模型;能力更高的Fable 5主要面向API與企業(yè)客戶,個(gè)人訂閱用戶雖然可用,但額度相當(dāng)有限。


從官方公布的成績來看,Opus 5重點(diǎn)提升了編程、知識(shí)工作和智能體任務(wù)的完成效率,在多項(xiàng)軟件工程、商業(yè)流程和電腦操作評測中位居前列;在最高思考檔位下,部分成績已經(jīng)逼近甚至超過Fable 5。不過,在進(jìn)攻性網(wǎng)絡(luò)利用和長周期自主生物研究等高風(fēng)險(xiǎn)場景中,受限的Mythos 5仍然更強(qiáng)。


Opus 5提供了可調(diào)節(jié)的effort(思考檔位),用戶可按任務(wù)難度調(diào)整推理資源投入。檔位越高,處理復(fù)雜問題的能力越強(qiáng),但速度更慢、Token消耗也更多;調(diào)低則省時(shí)省錢。


目前,Opus 5已在全平臺(tái)上線,API價(jià)格為每百萬Token輸入5美元、輸出25美元,與Opus 4.8持平,約為Fable 5的一半;追求速度可開Fast模式,以約兩倍價(jià)格換2.5倍速度。


Anthropic同時(shí)上線了兩項(xiàng)Beta功能:動(dòng)態(tài)調(diào)整工具與自動(dòng)回退,用于降低Agent任務(wù)因緩存失效抬升成本、或因安全攔截中斷的風(fēng)險(xiǎn)。


性能逼近、價(jià)格減半,那Opus 5能替代Fable 5嗎?


01.登上榜首,但不是斷層領(lǐng)先


我們先來看官方給出的成績單。


為了突出模型的領(lǐng)先性,Opus 5的對比對象選的是當(dāng)前能力最強(qiáng)的幾款模型:上一代Opus 4.8、公開旗艦Fable?5,以及OpenAI剛發(fā)布的旗艦?zāi)P虶PT-5.6 Sol。



軟件工程是最突出的方面。在Frontier-Bench v0.1測試中,Opus 5超過所有參測模型,成績相比Opus 4.8提高一倍以上,單項(xiàng)任務(wù)成本反而更低。在CursorBench 3.2測試中,開啟max effort后,兩者成績相差不到0.5%,每項(xiàng)任務(wù)成本約為后者一半。


類似優(yōu)勢也出現(xiàn)在需要模型連續(xù)操作的任務(wù)中。在Zapier AutomationBench測試中,按相同的單項(xiàng)任務(wù)成本計(jì)算,Opus 5通過率約為第二名(Fable 5)的1.5倍。在OSWorld 2.0測試中,它僅用Fable 5單項(xiàng)任務(wù)成本的略多于三分之一,超過了后者最好成績。


這些項(xiàng)目的共同點(diǎn)在于,測試的不只是模型能否答對一道題,還包括它能否調(diào)用工具、跨越多個(gè)步驟、發(fā)現(xiàn)錯(cuò)誤并繼續(xù)推進(jìn)。



ARC-AGI 3主要考察模型處理陌生規(guī)則和新問題的能力。Opus 5得到30.2%,此前榜首是GPT-5.6 Sol的7.8%。不過該成績?nèi)∽詇igh檔而非max檔,max檔結(jié)果尚未公布。至少在此設(shè)定下,Opus 5展現(xiàn)了較強(qiáng)的規(guī)則歸納、觀察與試錯(cuò)能力。


不過,Opus 5并非在所有項(xiàng)目中都領(lǐng)先。在Anthropic公布的十余項(xiàng)對比中,有四項(xiàng)落后其他模型。


在Humanity’s Last Exam測試中,不用工具時(shí),Opus 5得56.3%,略低于Fable 5的56.5%;開放工具后Opus 5升至64.7%,反超F(xiàn)able 5的63.9%。這更能說明兩者差別:Fable 5仍有更強(qiáng)的純模型能力,Opus 5更擅長搜索、調(diào)用工具、檢查結(jié)果并持續(xù)推進(jìn)任務(wù)。


Anthropic披露的案例也符合這一特點(diǎn)。Opus 5在沒有圖像查看工具的情況下,自行編寫計(jì)算機(jī)視覺程序,從機(jī)械圖紙的原始像素中提取數(shù)據(jù);在缺少實(shí)時(shí)行情的情況下,主動(dòng)搭建測試環(huán)境驗(yàn)證交易所數(shù)據(jù)接口是否正確。


從這些表現(xiàn)來看,Opus 5此次升級的重點(diǎn),與其說是純模型能力的躍升,不如說是執(zhí)行、驗(yàn)證和糾錯(cuò)能力變得更成熟。


當(dāng)然,官方跑分需要謹(jǐn)慎看待。以Frontier-Bench測試為例,結(jié)果是在特定智能體框架下進(jìn)行五次測試后取平均值,觸發(fā)安全分類器時(shí)還會(huì)由Opus 4.8接管,說明工具配置、提示詞和運(yùn)行環(huán)境發(fā)生變化,結(jié)果也可能變化。


我們再來看看第三方榜單。


截至7月25日,Artificial Analysis的智能指數(shù)榜單上,Opus 5 max以61分排在第一位,僅高于第二名的Fable 5一分。該榜單綜合9項(xiàng)評測,比單看某個(gè)優(yōu)勢項(xiàng)目更能反映綜合能力。



到這里可以得出兩個(gè)結(jié)論。第一,Opus 5進(jìn)入當(dāng)前第一梯隊(duì),而且在最高思考檔位下暫時(shí)排在榜首。第二,在各項(xiàng)測試中,Opus 5并沒有和其他模型拉開明顯差距,沒有形成斷層優(yōu)勢。


所以,Opus 5只是當(dāng)前榜單上的領(lǐng)先者。跑分給出了能力上限,真實(shí)使用中的穩(wěn)定性、Token消耗和最終交付質(zhì)量,才決定性價(jià)比究竟高不高。


02.跑分更高,不等于活干得更好


模型上線后,評價(jià)很快兩極分化。


正面評價(jià)集中在編程和可交互內(nèi)容生成。有網(wǎng)友在X上分享Opus 5生成的可交互3D黑洞可視化器,還能實(shí)時(shí)合成一段電子音樂,代碼、視覺效果和聲音被整合進(jìn)同一個(gè)成品,說明它快速制作產(chǎn)品原型的能力很強(qiáng)。



也有網(wǎng)友將Opus 5和Fable 5、GPT-5.6、Kimi K3對比,認(rèn)為它在3D的制作上效果更好。



但也有開發(fā)者認(rèn)為,Opus 5在部分任務(wù)中過度思考,推理過程很長,做到后面甚至?xí)拔倚形宜亍?,偏離最初目標(biāo)。有網(wǎng)友測試后稱,模型消耗了大量Token,并占用了較多上下文空間,卻沒有嚴(yán)格按照要求執(zhí)行,更高的effort并不一定帶來更好的結(jié)果。



更系統(tǒng)的測試來自代碼審查平臺(tái)CodeRabbit。它的結(jié)論是,Opus 5更適合寫代碼,而不是獨(dú)立承擔(dān)全部代碼審查工作。它處理開放式、設(shè)計(jì)導(dǎo)向的任務(wù)時(shí)效果更好,但在邏輯錯(cuò)誤、競態(tài)條件和API誤用等問題上仍可能漏檢。



獨(dú)立開發(fā)者李默將Opus 5形容為一個(gè)“做事靠譜,但略有個(gè)性的同事”。實(shí)際體驗(yàn)中,其調(diào)試能力很強(qiáng),整體遠(yuǎn)高于Opus 4.8,也是Fable 5額度耗盡后的合適替代品。但Opus 4時(shí)代形成的工作流和提示詞不能直接遷移到Opus 5,想獲得明顯提升,得了解新模型習(xí)慣,調(diào)整任務(wù)拆分、effort檔位和驗(yàn)證方法。


李默提到,實(shí)用的是兩個(gè)Beta功能直接改善了Agent開發(fā)體驗(yàn):過去改一次工具列表整段緩存就作廢,現(xiàn)在對話中途換工具也不會(huì)失效;API還可啟用自動(dòng)降級,被安全分類器攔截的請求會(huì)自動(dòng)轉(zhuǎn)交其他模型。


綜合來看,Opus 5目前更像一名執(zhí)行力強(qiáng)、愿意自查,但還需要磨合的同事。它適合生成代碼、修復(fù)問題和完成邊界清楚的工作,但在復(fù)雜規(guī)劃、長周期自主任務(wù)和部分文字表達(dá)上,F(xiàn)able 5仍有優(yōu)勢。


03.Anthropic需要一款更日常的旗艦?zāi)P?/h2>


Anthropic最近在加快模型更新速度。


5月29日,發(fā)布Opus 4.8;6月10日,發(fā)布Fable 5和Mythos 5;7月1日,上線Sonnet 5;7月25日,發(fā)布Opus 5,不到兩個(gè)月,Claude的主要產(chǎn)品線幾乎更新了一遍。


在密集發(fā)布模型的情況下,行業(yè)對模型應(yīng)該如何開放的分歧也在擴(kuò)大。7月16日,月之暗面發(fā)布開放權(quán)重模型Kimi K3,性能被認(rèn)為已接近前沿。幾天后,OpenAI戰(zhàn)略負(fù)責(zé)人在X上預(yù)測,華盛頓會(huì)圍繞中國開放權(quán)重模型制造“監(jiān)管風(fēng)險(xiǎn)”,這番話被廣泛解讀為對開源陣營的施壓。


Opus 5發(fā)布當(dāng)天,英偉達(dá)、Meta、微軟等25家公司和機(jī)構(gòu)聯(lián)合發(fā)表公開信,呼吁美國政府不要過早限制開放權(quán)重模型,OpenAI、Anthropic和Google沒有出現(xiàn)在簽署名單中。


缺席不等于明確反對開放權(quán)重,但與開放權(quán)重相比,Anthropic確實(shí)更強(qiáng)調(diào)閉源、分級開放和風(fēng)險(xiǎn)控制。6月12日,美國政府對Fable 5和Mythos 5實(shí)施管制,兩款模型一度全面下線。限制解除后,F(xiàn)able 5恢復(fù)公開服務(wù),安全限制更少的Mythos 5仍只向部分獲批機(jī)構(gòu)開放。


Opus 5的定位,正嵌在Anthropic這套“模型該如何開放”的策略里。它發(fā)現(xiàn)源代碼漏洞的能力接近Mythos 5,將漏洞轉(zhuǎn)化為實(shí)際攻擊工具的能力卻明顯較弱。對Anthropic而言,它不只是更便宜的Fable 5替代品,也是一個(gè)更容易在合規(guī)框架下向普通用戶和企業(yè)開放的選項(xiàng)。


與此同時(shí),Anthropic還在擴(kuò)充算力。Opus 5發(fā)布前兩天,公司宣布將部署最高2吉瓦規(guī)模的AMD Instinct MI450系列GPU和Helios機(jī)架級系統(tǒng),首批1吉瓦計(jì)劃于2027年上半年開始部署。AMD還承諾未來向Anthropic進(jìn)行最高50億美元的戰(zhàn)略股權(quán)投資。


從密集發(fā)布模型,到擴(kuò)充芯片供給,再到精簡系統(tǒng)提示詞,Anthropic做的不僅是提高跑分,而是把模型能力拆分到不同價(jià)格、風(fēng)險(xiǎn)和使用場景中:Fable 5負(fù)責(zé)更復(fù)雜、更長周期的任務(wù),Sonnet 5承接成本敏感的普遍需求,Opus 5則試圖成為開發(fā)者和知識(shí)工作者的日常默認(rèn)選擇。


所以,Opus 5沒有讓Fable 5失去意義。后者仍代表Anthropic公開可用的模型能力上限,Opus 5解決的是如何以更低成本,把接近旗艦的能力交給更多用戶。它的競爭力在于能否以更穩(wěn)定的表現(xiàn)、更少的人工接管和可以控制的成本,把一項(xiàng)工作真正完成。


*題圖來源于Anthropic官網(wǎng)。應(yīng)受訪者要求,李默為化名。

AI創(chuàng)投日報(bào)頻道: 前沿科技
本內(nèi)容由作者授權(quán)發(fā)布,觀點(diǎn)僅代表作者本人,不代表虎嗅立場。
如對本稿件有異議或投訴,請聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
拉孜县| 旬邑县| 扎鲁特旗| 栖霞市| 家居| 沭阳县| 儋州市| 马公市| 宁武县| 蒙城县| 宁武县| 双桥区| 凤翔县| 含山县| 台南县| 峨边| 桐柏县| 汶上县| 宝应县| 友谊县| 高阳县| 独山县| 呼和浩特市| 唐山市| 金川县| 平山县| 兴化市| 磐石市| 开化县| 桦甸市| 平潭县| 靖宇县| 彰武县| 武城县| 津南区| 都安| 舟山市| 涞水县| 湖州市| 阜宁县| 岳普湖县|