久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

作者因官方賬號被封被迫使用Claude API中轉(zhuǎn)站,自研驗(yàn)證工具測試后發(fā)現(xiàn)高價中轉(zhuǎn)模型摻水嚴(yán)重,行業(yè)透明度極低。 ## 1. 困境:剛需Claude但官方賬號接連被封 作者深度使用后確認(rèn)Claude在長文邏輯處理等能力上遠(yuǎn)超其他模型,屬于不可替代的剛需,但4個原價Max賬號接連被封,新Mac mini賬號也被秒封,只能轉(zhuǎn)用第三方API中轉(zhuǎn)站。 ## 2. 行業(yè)現(xiàn)狀:中轉(zhuǎn)模型完全黑盒,高價也無法保真 市面中轉(zhuǎn)站標(biāo)注倍率從0.3倍到2.0倍,普遍認(rèn)為0.3倍是逆向模型,2.0倍是正經(jīng)Claude Max號池貨源,價格差距極大:一次文書工作0.3倍僅需約5毛錢,2.0倍需要15-30元。但高價2.0倍模型體驗(yàn)飄忽不定,效果時好時壞,無法確認(rèn)背后是否為真Claude,用戶花高價仍要擔(dān)心交智商稅。 ## 3. 市面驗(yàn)證方法全部失效 目前社區(qū)常用的三種驗(yàn)證方法都靠不?。褐苯訂柲P蜕矸荩S便換個系統(tǒng)提示詞就能造假;用特殊提示詞套特征,當(dāng)前中轉(zhuǎn)站已經(jīng)可以輕松應(yīng)對,方法早已失效;號稱能檢測的在線網(wǎng)站15秒就能跑完檢測,原理上根本不可能測出模型的知識正確率和綜合能力。 ## 4. 自研驗(yàn)證工具的設(shè)計(jì)思路 作者不追求直接判定真假,改為用公開舊題庫做對照測試:找10個GitHub高星項(xiàng)目整合出726道覆蓋高考題、推理、數(shù)學(xué)、語言、編程的測試題,支持OpenAI和Anthropic兩種接口,答題后自動判分輸出加權(quán)的MCS分?jǐn)?shù),還支持AI自動重答被截斷的題目,避免格式問題導(dǎo)致評分失真。 ## 5. 測試結(jié)果:高價中轉(zhuǎn)模型分?jǐn)?shù)不如更便宜的DeepSeek V4 Pro 穩(wěn)定靠譜的DeepSeek V4 Pro最終得分為66.76分,跑完全部726道題成本不到10元,耗時不到1小時。兩家被推薦的、自稱正經(jīng)Claude Opus 4.8的中轉(zhuǎn)站,2.0倍倍率模型得分分別為59.73分和51.55分,推理、數(shù)學(xué)、編程能力得分遠(yuǎn)低于DeepSeek V4 Pro,跑題成本分別為35元以上和近20元,因?yàn)锳PI不穩(wěn)定耗時近2小時,再次印證了十幾秒檢測的在線工具完全不靠譜。 ## 6. 工具說明與行業(yè)痛點(diǎn) 這個初級版本工具僅能做參考,無法100%判定模型真假,因?yàn)楣俜胶诵念}庫不對外公開,且驗(yàn)證需要花費(fèi)1小時以上、30-50元成本,普通用戶門檻很高,但當(dāng)前Claude中轉(zhuǎn)行業(yè)連初級驗(yàn)證標(biāo)準(zhǔn)都沒有,消費(fèi)者花真金白銀卻無法確認(rèn)買到的模型是什么,這本身是極不合理的現(xiàn)狀。
我做了個測試Claude API 中轉(zhuǎn)站的Skill,測完發(fā)現(xiàn)水太深了
2026-06-05 18:57

我做了個測試Claude API 中轉(zhuǎn)站的Skill,測完發(fā)現(xiàn)水太深了

本文來自微信公眾號: AI Humanist by杉森楠 ,作者:杉森楠,原文標(biāo)題:《我做了個測試 Claude API 中轉(zhuǎn)站的 Skill,測完發(fā)現(xiàn)水太深了》


昨天一個朋友給我起了個稱號,叫「Claude科學(xué)家」。



這個稱號的獲得,說出來nm一把辛酸淚。我的Claude官方訂閱已經(jīng)被封了四個原價的Max賬號,最近又新買了一臺Mac mini,剛用幾天又被秒封。


封號封到我懷疑人生。


但問題是,Claude確實(shí)沒法替代。你只要深度用過一段時間,就會發(fā)現(xiàn)它在文字質(zhì)量、上下文理解、尤其是一篇長文章的邏輯處理上,遠(yuǎn)超其他模型。這種差別,真不是玄學(xué)。


所以就陷入了一個困境:我必須用Claude,但我已經(jīng)徹底用不了Claude。


怎么辦?只能去找中轉(zhuǎn)站。


中轉(zhuǎn)站我用了兩個月。過程中發(fā)現(xiàn)一件事:這東西完全是黑盒。你根本不知道接入的模型,背后到底是哪個。然后,我就被當(dāng)狗騙了。



市面上有一些推薦中轉(zhuǎn)站的網(wǎng)站,倍率標(biāo)注得清清楚楚。低的0.3倍,高的1.8倍、2.0倍,看上去很透明。但你根本看不懂這倍率到底代表什么。



根據(jù)我長期使用的觀察,0.3倍率說是用Kiro逆向出來的Claude,2.0倍率說是正經(jīng)Claude Max號池接出來的。聽起來后者肯定更靠譜。


我一開始也這么想的。畢竟倍率差了快七倍,價格擺在那,總不至于拿假貨糊弄人吧。


我日常完成一件文書類型工作,走完一套工作流,用0.3倍率的平臺,大概要花5毛錢,但是走2.0倍率的平臺,一次就要花15到30塊錢。而2.0倍率的Claude API,一般意義上,大家會有個共識,那就是正經(jīng)的Claude Max號池接出來的API。


但用了一段時間之后,我發(fā)現(xiàn)了一件很微妙的事。有時候覺得挺聰明的,有時候又覺得不太行,心里始終沒底。這種飄忽不定的體驗(yàn),讓我越來越想知道一件事:這玩意兒背后到底是哪個模型?


花了這么多錢,按理說心里應(yīng)該踏實(shí)了。但偏偏相反,我反而更虛了。因?yàn)樾Ч耆淮_定,有時候感覺還行,有時候明顯不對勁。


有種,你都不知道自己是不是交了智商稅的錯覺。


這就很讓人難受了。你說它假吧,有時候確實(shí)挺聰明;你說它真吧,關(guān)鍵時刻掉鏈子。這種反復(fù)橫跳的體驗(yàn),比直接用個明知是假的模型更折磨人。


因?yàn)槟銢]有辦法做一個確定的判斷。


所以我決定自己動手,把這事搞清楚。從今年1月開始,我花了幾個月時間,研究怎么系統(tǒng)地驗(yàn)證一個API背后模型的能力,將所有流程封裝成了一個Skill。


先說結(jié)論:


信中轉(zhuǎn)站,你真的還不如路邊拜個野佛。


你怎么知道中轉(zhuǎn)站的Claude是真是假?


這個時候,很多人包括我自己都在想一個問題:中轉(zhuǎn)站的模型,到底是不是正經(jīng)的Claude?


你心里不踏實(shí),就會想找辦法驗(yàn)證。目前市面和各種社區(qū)里的方法,基本就這幾種。


第一種:直接問。


你上去就問API:「你是不是Claude?」


說實(shí)話,通過API接口寫一個完整的系統(tǒng)提示詞,這種方式根本識別不出來。太好造假了。背后給你接一個DeepSeek,改個名字說自己是Claude Opus 4.8,API驗(yàn)證層面一點(diǎn)辦法都沒有。


第二種:稀奇古怪的提示詞工程。


用各種稀奇古怪的提示詞去套模型,看輸出質(zhì)量,或者看某些奇奇怪怪的輸出結(jié)果,比如下面這個:


這種方法在2024年可能還行,但都兩年過去了,中轉(zhuǎn)站連這套都不需要做多復(fù)雜的系統(tǒng)提示詞就能應(yīng)對,基本已經(jīng)徹底失效。這種方法屬于是中轉(zhuǎn)站看了都要笑的程度。


第三種:在線檢測網(wǎng)站。


有些網(wǎng)站號稱能檢測API中轉(zhuǎn)站是否摻水。我試過,發(fā)現(xiàn)整個檢測流程在15秒以內(nèi)就跑完了。



這從原理上就不可能。


正常答一道題,模型本身就要花幾秒。更重要的是,中轉(zhuǎn)站的token輸出速度和API路徑的穩(wěn)定性本來就有問題。接入量一大,延遲和截斷都是家常便飯。15秒能測什么?測一道題的格式對不對還行,測模型的知識正確率和綜合能力,天方夜譚。


那到底怎么辦?


我的思路:不測真假,測差距


從今年1月開始,我就在研究怎么驗(yàn)證一個模型的能力。


最開始想到的當(dāng)然是Benchmark。但調(diào)研了一圈發(fā)現(xiàn),這個問題的答案比我想的復(fù)雜得多。


一方面,Claude官方曬出來的那些分?jǐn)?shù),背后用的數(shù)據(jù)集確實(shí)是內(nèi)部私有的。比如Claude Sonnet 4.6的System Card里明確提到,他們測Terminal-Bench 2.0時用的是Terminus-2 harness,思考模式關(guān)閉,資源分配做了特殊處理。SWE-bench Multimodal干脆直接說用了「internal implementation」,分?jǐn)?shù)不跟公開榜單可比。你拿到手的只是一個最終數(shù)字,題庫本身根本不公開。



另一方面,大量公開Benchmark其實(shí)一直都存在。像SWE-bench Verified、GAOKAO-Bench、C-Eval、GSM8K、MMLU等等,這些數(shù)據(jù)集都是開源的,題庫穩(wěn)定,任何人都能測。CAICT 2024年的一份報告里統(tǒng)計(jì)過,當(dāng)前主流評測數(shù)據(jù)集中,開源的大概占69%,閉源只占31%。


所以問題是:怎么用好這些現(xiàn)成的公開數(shù)據(jù)集來驗(yàn)證中轉(zhuǎn)站?


調(diào)研到這里,我換了個思路。


不一定非要用最新的Benchmark??!既然這么難到手。


這里有一個我夜深人靜思考時突然想明白的、反直覺的點(diǎn):每次Claude或者OpenAI推出新模型,前半個月到一個月,這個模型本身就是降智的。但無論怎么降智,它肯定還是比很多國產(chǎn)模型強(qiáng)。所以大家的默認(rèn)認(rèn)知是:新模型發(fā)布之后,默認(rèn)它已經(jīng)比上一代強(qiáng)很多,舊Benchmark根本沒有測試的必要了。


這個認(rèn)知是大錯特錯的。


新模型確實(shí)比舊模型強(qiáng),但強(qiáng)歸強(qiáng),舊題庫它未必能全做對。而且Benchmark的數(shù)據(jù)集本身是公開的、相對穩(wěn)定的,用它來做對比驗(yàn)證,反而是最靠譜的方式。


所以我的思路變成了:不追求給出「yes or no」的答案,而是找一個參照物做對比。


找一個基礎(chǔ)模型,用同一套題庫測出分?jǐn)?shù),再測你的API分?jǐn)?shù),兩個分?jǐn)?shù)一對比,就知道這個API到底是摻了水、還是真貨。


Skill是怎么做出來的?


于是,說干就干,我做了一個完整的驗(yàn)證中轉(zhuǎn)站API知識能力的Skill,并做出了一套打分機(jī)制。


具體來說,我找GitHub上10個高Star數(shù)的項(xiàng)目,每個項(xiàng)目里都有對應(yīng)的Benchmark數(shù)據(jù)集和驗(yàn)證腳本。




這些數(shù)據(jù)集來源非常多樣,有中文高考題、推理題、數(shù)學(xué)題、語言題、編程題,覆蓋面挺廣。


Skill的設(shè)計(jì)邏輯是這樣的:


第一步,做API兼容性??梢越覱penAI接口,也可以接Anthropic接口。


第二步,從這10個項(xiàng)目里構(gòu)建一個完整的manifest,等于把數(shù)據(jù)集統(tǒng)一整合起來。


第三步,按順序用這些題去請求目標(biāo)API。每答完一題就寫入JSONL文件。


第四步,用打分器判分。有些項(xiàng)目自帶打分器,直接用;有些需要自己寫。


第五步,所有題跑完之后,把結(jié)果聚合成一個加權(quán)MCS分?jǐn)?shù)。


在實(shí)際使用中,我發(fā)現(xiàn)中轉(zhuǎn)站API非常不穩(wěn)定,經(jīng)常會出現(xiàn)截斷。這個Skill設(shè)計(jì)了一個關(guān)鍵能力:用Claude Code或Codex跑的時候,AI本身會接入能力,當(dāng)API答題被截斷時,可以讓AI幫忙重新做一遍這道題。這樣最終評分不會因?yàn)楦袷絾栴}出現(xiàn)大面積零分。


做完之后,這個Skill共有726道題,從10個項(xiàng)目里挑出來的精華部分。每個題目都有一個索引。




每題會得到一個item_score,通常是0或1,少數(shù)instruction-following題目可以是0.5。



MCS計(jì)算方式是這樣的:


MCS=各能力維度分?jǐn)?shù)×權(quán)重后的加權(quán)平均


測完數(shù)據(jù),結(jié)果讓我心態(tài)崩了


先說基準(zhǔn)模型。DeepSeek V4 Pro這個模型本身效果不錯,大家關(guān)注度也高。而且DeepSeek官方API比較穩(wěn)定,用起來放心。


最終得分:66.76分,滿分100。在推理、數(shù)學(xué)、中文、編程幾個維度上表現(xiàn)都還行。



然后就是重頭戲了。我一直用的那幾家平臺,Claude Opus 4.8的API。這幾家平臺是某檢測中轉(zhuǎn)站的網(wǎng)站里推薦的,我用了挺長時間,用的時候心里一直犯嘀咕。有時候感覺挺聰明,有時候又覺得不太行。


跑完整個題庫之后,心態(tài)直接崩了。


您猜猜花了這么多錢買的模型,最后得分多少?


59.73分。


不如DeepSeek V4 Pro(當(dāng)然這里不是在說DeepSeek V4 Pro的模型不行)


這家平臺在一些結(jié)構(gòu)性數(shù)據(jù)題目上可能確實(shí)不太占優(yōu)勢,但DeepSeek V4 Pro同樣不占優(yōu)勢。去掉Data Structure這一項(xiàng),它的數(shù)學(xué)推理、Coding能力,得分也都低得離譜。



到這一步我人已經(jīng)麻了。光是一次日常行政任務(wù)潤色,一次就要花近30塊錢,結(jié)果買了個這。


我不死心,又測了另一家。


這家倍率是2.0倍率。在懂行的人眼里,2.0倍率算是正經(jīng)Claude的基準(zhǔn)線。低于1.5倍率大家會覺得太便宜不像真的,2.0倍率大家普遍覺得應(yīng)該是真貨。


我再跑了一遍。


51.55分。


推理、數(shù)學(xué)、編程分?jǐn)?shù)跌得更慘。



到這里,我人整個已經(jīng)麻了,麻的透透的。


最離譜的是成本。DeepSeek V4 Pro跑完整套題,用了不到100萬token,**花了9塊9毛7。



兩家自稱正經(jīng)Claude Opus 4.8的中轉(zhuǎn)站,一個花了35塊以上,一個花了近20塊。



這還是726道舊題,跑起來DeepSeek V4 Pro大概不到一小時就跑完了,但中轉(zhuǎn)站API不穩(wěn)定,跑了將近兩小時。


你就知道那些號稱十幾秒就能測出模型知識能力的在線檢測,有多不靠譜了。


再簡單說下,如何跑這個Skill,我們需要用Codex或者Claude Code,因?yàn)樗旧硪蕾嘇I能力來處理截斷和異常。如果50道題全是零分,問題大概率不在API,而是打分器或格式出了固定bug,需要人工介入修復(fù)。


疊甲時間


這個Skill還是非常初級的版本,用的數(shù)據(jù)集也比較舊。它只能作為一個小參考,不能拿來判定某個API到底是不是正經(jīng)Claude。因?yàn)楣俜紹enchmark你基本拿不到,所以也沒辦法給出更精準(zhǔn)的答案。


當(dāng)然了,如果有人能非常便捷地測出一個API是不是正經(jīng)Claude,那中轉(zhuǎn)站這個生意就沒法做了,對吧?


但問題是,這個行業(yè)連"初級"的驗(yàn)證標(biāo)準(zhǔn)都沒有。消費(fèi)者花著真金白銀,連自己買的到底是不是Claude都不知道。


這事兒本身就不對。這事兒本身就不對。這事兒本身就不對。(重要事情說三遍)


如果只靠這個Skill,你依然需要花費(fèi)1h以上的時間去驗(yàn)證,甚至要花30-50塊錢,這個門檻對驗(yàn)證中轉(zhuǎn)站API來說依舊不現(xiàn)實(shí)。


如果大家還有什么其他好的驗(yàn)證中轉(zhuǎn)站API的想法,歡迎在評論區(qū)留言!


最后希望大家玩得開心。

AI創(chuàng)投日報頻道: 前沿科技
本內(nèi)容由作者授權(quán)發(fā)布,觀點(diǎn)僅代表作者本人,不代表虎嗅立場。
如對本稿件有異議或投訴,請聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
太康县| 崇礼县| 始兴县| 佳木斯市| 玛多县| 云梦县| 海林市| 田阳县| 比如县| 石阡县| 达日县| 沾益县| 南涧| 涿州市| 云林县| 乌鲁木齐县| 额尔古纳市| 富顺县| 汕头市| 锡林郭勒盟| 瑞昌市| 盖州市| 红原县| 乐安县| 扬中市| 河东区| 广水市| 漳浦县| 侯马市| 昭苏县| 涟水县| 图片| 会理县| 永济市| 吴旗县| 广饶县| 杭锦后旗| 安陆市| 应用必备| 安西县| 封丘县|