本文來自微信公眾號: AI Humanist by杉森楠 ,作者:杉森楠,原文標(biāo)題:《我做了個測試 Claude API 中轉(zhuǎn)站的 Skill,測完發(fā)現(xiàn)水太深了》
昨天一個朋友給我起了個稱號,叫「Claude科學(xué)家」。

這個稱號的獲得,說出來nm一把辛酸淚。我的Claude官方訂閱已經(jīng)被封了四個原價的Max賬號,最近又新買了一臺Mac mini,剛用幾天又被秒封。
封號封到我懷疑人生。
但問題是,Claude確實(shí)沒法替代。你只要深度用過一段時間,就會發(fā)現(xiàn)它在文字質(zhì)量、上下文理解、尤其是一篇長文章的邏輯處理上,遠(yuǎn)超其他模型。這種差別,真不是玄學(xué)。
所以就陷入了一個困境:我必須用Claude,但我已經(jīng)徹底用不了Claude。
怎么辦?只能去找中轉(zhuǎn)站。
中轉(zhuǎn)站我用了兩個月。過程中發(fā)現(xiàn)一件事:這東西完全是黑盒。你根本不知道接入的模型,背后到底是哪個。然后,我就被當(dāng)狗騙了。

市面上有一些推薦中轉(zhuǎn)站的網(wǎng)站,倍率標(biāo)注得清清楚楚。低的0.3倍,高的1.8倍、2.0倍,看上去很透明。但你根本看不懂這倍率到底代表什么。

根據(jù)我長期使用的觀察,0.3倍率說是用Kiro逆向出來的Claude,2.0倍率說是正經(jīng)Claude Max號池接出來的。聽起來后者肯定更靠譜。
我一開始也這么想的。畢竟倍率差了快七倍,價格擺在那,總不至于拿假貨糊弄人吧。
我日常完成一件文書類型工作,走完一套工作流,用0.3倍率的平臺,大概要花5毛錢,但是走2.0倍率的平臺,一次就要花15到30塊錢。而2.0倍率的Claude API,一般意義上,大家會有個共識,那就是正經(jīng)的Claude Max號池接出來的API。
但用了一段時間之后,我發(fā)現(xiàn)了一件很微妙的事。有時候覺得挺聰明的,有時候又覺得不太行,心里始終沒底。這種飄忽不定的體驗(yàn),讓我越來越想知道一件事:這玩意兒背后到底是哪個模型?
花了這么多錢,按理說心里應(yīng)該踏實(shí)了。但偏偏相反,我反而更虛了。因?yàn)樾Ч耆淮_定,有時候感覺還行,有時候明顯不對勁。
有種,你都不知道自己是不是交了智商稅的錯覺。
這就很讓人難受了。你說它假吧,有時候確實(shí)挺聰明;你說它真吧,關(guān)鍵時刻掉鏈子。這種反復(fù)橫跳的體驗(yàn),比直接用個明知是假的模型更折磨人。
因?yàn)槟銢]有辦法做一個確定的判斷。
所以我決定自己動手,把這事搞清楚。從今年1月開始,我花了幾個月時間,研究怎么系統(tǒng)地驗(yàn)證一個API背后模型的能力,將所有流程封裝成了一個Skill。
先說結(jié)論:
信中轉(zhuǎn)站,你真的還不如路邊拜個野佛。
你怎么知道中轉(zhuǎn)站的Claude是真是假?
這個時候,很多人包括我自己都在想一個問題:中轉(zhuǎn)站的模型,到底是不是正經(jīng)的Claude?
你心里不踏實(shí),就會想找辦法驗(yàn)證。目前市面和各種社區(qū)里的方法,基本就這幾種。
第一種:直接問。
你上去就問API:「你是不是Claude?」
說實(shí)話,通過API接口寫一個完整的系統(tǒng)提示詞,這種方式根本識別不出來。太好造假了。背后給你接一個DeepSeek,改個名字說自己是Claude Opus 4.8,API驗(yàn)證層面一點(diǎn)辦法都沒有。
第二種:稀奇古怪的提示詞工程。
用各種稀奇古怪的提示詞去套模型,看輸出質(zhì)量,或者看某些奇奇怪怪的輸出結(jié)果,比如下面這個:
這種方法在2024年可能還行,但都兩年過去了,中轉(zhuǎn)站連這套都不需要做多復(fù)雜的系統(tǒng)提示詞就能應(yīng)對,基本已經(jīng)徹底失效。這種方法屬于是中轉(zhuǎn)站看了都要笑的程度。
第三種:在線檢測網(wǎng)站。
有些網(wǎng)站號稱能檢測API中轉(zhuǎn)站是否摻水。我試過,發(fā)現(xiàn)整個檢測流程在15秒以內(nèi)就跑完了。

這從原理上就不可能。
正常答一道題,模型本身就要花幾秒。更重要的是,中轉(zhuǎn)站的token輸出速度和API路徑的穩(wěn)定性本來就有問題。接入量一大,延遲和截斷都是家常便飯。15秒能測什么?測一道題的格式對不對還行,測模型的知識正確率和綜合能力,天方夜譚。
那到底怎么辦?
我的思路:不測真假,測差距
從今年1月開始,我就在研究怎么驗(yàn)證一個模型的能力。
最開始想到的當(dāng)然是Benchmark。但調(diào)研了一圈發(fā)現(xiàn),這個問題的答案比我想的復(fù)雜得多。
一方面,Claude官方曬出來的那些分?jǐn)?shù),背后用的數(shù)據(jù)集確實(shí)是內(nèi)部私有的。比如Claude Sonnet 4.6的System Card里明確提到,他們測Terminal-Bench 2.0時用的是Terminus-2 harness,思考模式關(guān)閉,資源分配做了特殊處理。SWE-bench Multimodal干脆直接說用了「internal implementation」,分?jǐn)?shù)不跟公開榜單可比。你拿到手的只是一個最終數(shù)字,題庫本身根本不公開。

另一方面,大量公開Benchmark其實(shí)一直都存在。像SWE-bench Verified、GAOKAO-Bench、C-Eval、GSM8K、MMLU等等,這些數(shù)據(jù)集都是開源的,題庫穩(wěn)定,任何人都能測。CAICT 2024年的一份報告里統(tǒng)計(jì)過,當(dāng)前主流評測數(shù)據(jù)集中,開源的大概占69%,閉源只占31%。
所以問題是:怎么用好這些現(xiàn)成的公開數(shù)據(jù)集來驗(yàn)證中轉(zhuǎn)站?
調(diào)研到這里,我換了個思路。
不一定非要用最新的Benchmark??!既然這么難到手。
這里有一個我夜深人靜思考時突然想明白的、反直覺的點(diǎn):每次Claude或者OpenAI推出新模型,前半個月到一個月,這個模型本身就是降智的。但無論怎么降智,它肯定還是比很多國產(chǎn)模型強(qiáng)。所以大家的默認(rèn)認(rèn)知是:新模型發(fā)布之后,默認(rèn)它已經(jīng)比上一代強(qiáng)很多,舊Benchmark根本沒有測試的必要了。
這個認(rèn)知是大錯特錯的。
新模型確實(shí)比舊模型強(qiáng),但強(qiáng)歸強(qiáng),舊題庫它未必能全做對。而且Benchmark的數(shù)據(jù)集本身是公開的、相對穩(wěn)定的,用它來做對比驗(yàn)證,反而是最靠譜的方式。
所以我的思路變成了:不追求給出「yes or no」的答案,而是找一個參照物做對比。
找一個基礎(chǔ)模型,用同一套題庫測出分?jǐn)?shù),再測你的API分?jǐn)?shù),兩個分?jǐn)?shù)一對比,就知道這個API到底是摻了水、還是真貨。
Skill是怎么做出來的?
于是,說干就干,我做了一個完整的驗(yàn)證中轉(zhuǎn)站API知識能力的Skill,并做出了一套打分機(jī)制。
具體來說,我找GitHub上10個高Star數(shù)的項(xiàng)目,每個項(xiàng)目里都有對應(yīng)的Benchmark數(shù)據(jù)集和驗(yàn)證腳本。


這些數(shù)據(jù)集來源非常多樣,有中文高考題、推理題、數(shù)學(xué)題、語言題、編程題,覆蓋面挺廣。
Skill的設(shè)計(jì)邏輯是這樣的:
第一步,做API兼容性??梢越覱penAI接口,也可以接Anthropic接口。
第二步,從這10個項(xiàng)目里構(gòu)建一個完整的manifest,等于把數(shù)據(jù)集統(tǒng)一整合起來。
第三步,按順序用這些題去請求目標(biāo)API。每答完一題就寫入JSONL文件。
第四步,用打分器判分。有些項(xiàng)目自帶打分器,直接用;有些需要自己寫。
第五步,所有題跑完之后,把結(jié)果聚合成一個加權(quán)MCS分?jǐn)?shù)。
在實(shí)際使用中,我發(fā)現(xiàn)中轉(zhuǎn)站API非常不穩(wěn)定,經(jīng)常會出現(xiàn)截斷。這個Skill設(shè)計(jì)了一個關(guān)鍵能力:用Claude Code或Codex跑的時候,AI本身會接入能力,當(dāng)API答題被截斷時,可以讓AI幫忙重新做一遍這道題。這樣最終評分不會因?yàn)楦袷絾栴}出現(xiàn)大面積零分。
做完之后,這個Skill共有726道題,從10個項(xiàng)目里挑出來的精華部分。每個題目都有一個索引。


每題會得到一個item_score,通常是0或1,少數(shù)instruction-following題目可以是0.5。

MCS計(jì)算方式是這樣的:
MCS=各能力維度分?jǐn)?shù)×權(quán)重后的加權(quán)平均
測完數(shù)據(jù),結(jié)果讓我心態(tài)崩了
先說基準(zhǔn)模型。DeepSeek V4 Pro這個模型本身效果不錯,大家關(guān)注度也高。而且DeepSeek官方API比較穩(wěn)定,用起來放心。
最終得分:66.76分,滿分100。在推理、數(shù)學(xué)、中文、編程幾個維度上表現(xiàn)都還行。

然后就是重頭戲了。我一直用的那幾家平臺,Claude Opus 4.8的API。這幾家平臺是某檢測中轉(zhuǎn)站的網(wǎng)站里推薦的,我用了挺長時間,用的時候心里一直犯嘀咕。有時候感覺挺聰明,有時候又覺得不太行。
跑完整個題庫之后,心態(tài)直接崩了。
您猜猜花了這么多錢買的模型,最后得分多少?
59.73分。
不如DeepSeek V4 Pro(當(dāng)然這里不是在說DeepSeek V4 Pro的模型不行)
這家平臺在一些結(jié)構(gòu)性數(shù)據(jù)題目上可能確實(shí)不太占優(yōu)勢,但DeepSeek V4 Pro同樣不占優(yōu)勢。去掉Data Structure這一項(xiàng),它的數(shù)學(xué)推理、Coding能力,得分也都低得離譜。

到這一步我人已經(jīng)麻了。光是一次日常行政任務(wù)潤色,一次就要花近30塊錢,結(jié)果買了個這。
我不死心,又測了另一家。
這家倍率是2.0倍率。在懂行的人眼里,2.0倍率算是正經(jīng)Claude的基準(zhǔn)線。低于1.5倍率大家會覺得太便宜不像真的,2.0倍率大家普遍覺得應(yīng)該是真貨。
我再跑了一遍。
51.55分。
推理、數(shù)學(xué)、編程分?jǐn)?shù)跌得更慘。

到這里,我人整個已經(jīng)麻了,麻的透透的。
最離譜的是成本。DeepSeek V4 Pro跑完整套題,用了不到100萬token,**花了9塊9毛7。

兩家自稱正經(jīng)Claude Opus 4.8的中轉(zhuǎn)站,一個花了35塊以上,一個花了近20塊。

這還是726道舊題,跑起來DeepSeek V4 Pro大概不到一小時就跑完了,但中轉(zhuǎn)站API不穩(wěn)定,跑了將近兩小時。
你就知道那些號稱十幾秒就能測出模型知識能力的在線檢測,有多不靠譜了。
再簡單說下,如何跑這個Skill,我們需要用Codex或者Claude Code,因?yàn)樗旧硪蕾嘇I能力來處理截斷和異常。如果50道題全是零分,問題大概率不在API,而是打分器或格式出了固定bug,需要人工介入修復(fù)。
疊甲時間
這個Skill還是非常初級的版本,用的數(shù)據(jù)集也比較舊。它只能作為一個小參考,不能拿來判定某個API到底是不是正經(jīng)Claude。因?yàn)楣俜紹enchmark你基本拿不到,所以也沒辦法給出更精準(zhǔn)的答案。
當(dāng)然了,如果有人能非常便捷地測出一個API是不是正經(jīng)Claude,那中轉(zhuǎn)站這個生意就沒法做了,對吧?
但問題是,這個行業(yè)連"初級"的驗(yàn)證標(biāo)準(zhǔn)都沒有。消費(fèi)者花著真金白銀,連自己買的到底是不是Claude都不知道。
這事兒本身就不對。這事兒本身就不對。這事兒本身就不對。(重要事情說三遍)
如果只靠這個Skill,你依然需要花費(fèi)1h以上的時間去驗(yàn)證,甚至要花30-50塊錢,這個門檻對驗(yàn)證中轉(zhuǎn)站API來說依舊不現(xiàn)實(shí)。
如果大家還有什么其他好的驗(yàn)證中轉(zhuǎn)站API的想法,歡迎在評論區(qū)留言!
最后希望大家玩得開心。
