本文來自微信公眾號: AIX財經(jīng) ,作者:AIX財經(jīng)團(tuán)隊,編輯:魏佳,原文標(biāo)題:《Grok 4.5和Claude 4.8,在我電腦里“打”起來了》
7月8日,馬斯克高調(diào)發(fā)布Grok 4.5,宣稱其性能已逼近Claude Opus 4.8,同時速度更快、價格更低。當(dāng)大模型公司的競爭從參數(shù)、跑分一路打到價格和智能體,我們也設(shè)計了5道題,從前端開發(fā)、網(wǎng)頁游戲、PPT制作、長文檔解讀到邏輯推理,考查兩個模型在真實電腦環(huán)境中到底能不能干活。
負(fù)責(zé)落地執(zhí)行的,是它們各自的智能體——Claude Code和Grok Build。我們的要求很簡單,分別在桌面上創(chuàng)建文件夾,并將各自的測評結(jié)果保存進(jìn)去。
這場測評的結(jié)果,我們決定從一起“案發(fā)現(xiàn)場”講起。事情是這樣的:
Claude Code先接到指令,它在桌面創(chuàng)建了“能力測試”文件夾,并依次完成三個子目錄。隨后Grok Build也接到指令登場,但它沒有另起爐灶,而是在看到已有同名文件夾后,不僅“占為己用”,更順手將Claude Code已完成的三份目錄徹底抹除。
等到五道題全部做完,Claude Code回頭一看,發(fā)現(xiàn)自己的“家被拆了”,當(dāng)即發(fā)出“控訴”。
“控訴”完,它重建了被刪除的文件,并留下一句:“我不會擅自刪別人的東西?!?
事后,Grok出具了書面致歉,承認(rèn)三重失誤:未確認(rèn)目錄歸屬、誤將他人成品視作半成品、使用了不可逆的刪除方式。Claude表示接受道歉,但前提是Grok兌現(xiàn)它的三條自我約束——不碰他人目錄、默認(rèn)新建旁路、發(fā)現(xiàn)同名先問歸屬。
這段插曲,不能只當(dāng)作測評花絮。對于一個能讀寫真實文件系統(tǒng)的自主智能體而言,“動手前先弄清這是什么、屬于誰”,本身就是最硬核的能力之一。
回到正題。拋開這起“誤刪事故”,Grok 4.5的答卷確實令人眼前一亮——在游戲場景等方向上,它甚至顯露出明確優(yōu)勢。下面,我們就從五個維度來拆解這場既拼智商也拼情商的模型對決。
01.摸魚計時器:Grok贏了顏值,Claude贏了細(xì)節(jié)
考題:做一個網(wǎng)頁版“打工人摸魚計時器”:能設(shè)定下班時間、實時倒計時,到點自動撒花并彈出“下班快跑”,界面好看有動畫。做成一個index.html直接能用。
這道題同時考察三個維度:前端工程(能否寫出可運行的頁面)、產(chǎn)品交互(按鈕、反饋、視覺是否順手)、時間邏輯(倒計時、時區(qū)、觸發(fā)時機(jī))。
難點則藏在“能用”二字背后。倒計時必須同步本地時區(qū),不能差一秒;狀態(tài)機(jī)要在“上班中-即將下班-已下班”之間順滑切換;撒花動畫既要喜慶熱鬧,又不能把瀏覽器卡成PPT。最關(guān)鍵的是,最終成品得讓打工人真愿意打開它,而不是一個僅供演示的半成品。
Claude生成的摸魚計時器
Grok生產(chǎn)的摸魚計時器
這一題雙方難分伯仲。Grok在視覺精致度上略勝半籌,Claude則在音效反饋、快捷預(yù)設(shè)和趣味文案方面扳回一城。
02.設(shè)計摸魚游戲:Grok勝,Claude的“打工人”難控制
考題:做一個網(wǎng)頁小游戲,單個index.html就能運行:
主題:“摸魚大作戰(zhàn)”。
玩法:屏幕上不斷掉落“咖啡”(加分)和“老板”(碰到就游戲結(jié)束),用左右方向鍵移動底部的“打工人”接咖啡、躲老板。
要有:實時分?jǐn)?shù)、最高分記錄、難度隨時間加快、游戲結(jié)束彈窗和“再來一局”按鈕,畫面配色可愛、有簡單動畫和音效。
做完告訴我怎么運行。
這道題的核心考查維度是三個詞:實時交互、狀態(tài)機(jī)、游戲手感,需要做出一個持續(xù)響應(yīng)玩家輸入、實時更新畫面、動態(tài)調(diào)整難度的“活”系統(tǒng)。
做這個游戲,每幀都要精確判斷“咖啡”是否被接住、“老板”是否撞到玩家。而且掉落速度隨時間平滑遞增,不能太慢讓人覺得無聊,也不能太快直接勸退,這考驗的是模型對“游戲心流”的拿捏。
Claude生成的摸魚小游戲
Grok生成的摸魚小游戲
這題Grok勝。它的代碼量約是Claude的三倍,游戲功能更豐富,而且有明確的關(guān)卡、難度分級。Claude交付的版本,乍一看也挺像回事,但是底下的“打工人”不能用鼠標(biāo)拖動,游戲體驗感不好。
03 .做新能源車PPT:產(chǎn)業(yè)鏈圖都過關(guān)了,打成平手
考題:做一份5頁PPT,主題是“2026上半年中國新能源車市場”。
要求:
1. 直接生成可下載的PPTX文件;如果當(dāng)前環(huán)境不能生成文件,就給出可以復(fù)制到PPT的逐頁內(nèi)容。
2. 第3頁必須用PPT原生圖形畫出“產(chǎn)業(yè)鏈上下游”關(guān)系圖,不能只貼一張圖片。
3. 5頁結(jié)構(gòu):
- 封面
- 市場總覽
- 產(chǎn)業(yè)鏈上下游關(guān)系圖
- 競爭格局
- 結(jié)論與趨勢
4. 配色專業(yè),適合發(fā)布會。
5. 每頁要有標(biāo)題、正文要點、圖表說明、演講備注。
6. 所有不確定數(shù)據(jù)必須標(biāo)注“需核實”,不能編造真實市場數(shù)字。
這道題的核心考查維度可以概括為三個詞:結(jié)構(gòu)化表達(dá)、版式審美、數(shù)據(jù)紀(jì)律。模型被放到純辦公場景下,需要把復(fù)雜信息梳理成清晰的敘事邏輯,再用專業(yè)的視覺語言呈現(xiàn)出來。
具體來看,搭建產(chǎn)業(yè)鏈關(guān)系圖,考驗的是模型對PPT圖形引擎的操作能力,包括連線、布局、層次和配色的一致性。配色、字體、間距、對齊,這些細(xì)節(jié)也要經(jīng)得起放大審視,不能有廉價感。更重要的是要求它們面對不掌握的真實數(shù)據(jù),必須坦率標(biāo)注“需核實”,不能有幻覺。
Claude生成的PPT
Grok生產(chǎn)的PPT
從實際結(jié)果來看,兩份答卷都滿足了“原生圖形畫產(chǎn)業(yè)鏈、不用圖片”的硬性要求,且均附帶了完整的演講備注,專業(yè)度基本持平。而且在數(shù)據(jù)的使用上,也標(biāo)出了需要核實的部分。
兩版PPT在框架完整性和交付質(zhì)量上難分高下,這一題雙方再度打成平手。
04.閱讀SpaceX招股書:看完幾百頁,誰都沒編數(shù)字
考題:
我們把近400頁的SpaceX招股書喂給AI,并向雙方提出了四個精準(zhǔn)的檢索與驗證任務(wù):
1、招股書里星鏈(Starlink)業(yè)務(wù)的收入,正文與財務(wù)報表附注中的數(shù)字口徑是否一致?附注中是否有特別說明?
2、分別列出2024和2025兩個財年的“經(jīng)營活動現(xiàn)金流凈額”,并注明這兩個數(shù)字在文件中的具體位置。
3、在“風(fēng)險因素”章節(jié)中,找出所有與“馬斯克個人”直接相關(guān)的風(fēng)險點,逐條列出。
4、招股書是否披露了“星艦單次發(fā)射的具體成本”?如有,請給出并注明出處;如無,請明確回復(fù)“文件中未披露”。
這是最考驗準(zhǔn)確度的一道題。難點則遍布在每一個細(xì)節(jié)中:超長招股書的結(jié)構(gòu)化解析、正文與財務(wù)報表附注之間的口徑對齊、區(qū)分“分部收入”與“品牌收入”的財務(wù)常識、絕不編造數(shù)字的職業(yè)紀(jì)律、以及出處(表格編號/頁碼/附注標(biāo)號)必須精準(zhǔn)可核驗的溯源要求。
Claude列舉的與馬斯克的相關(guān)風(fēng)險點
Grok列舉的與馬斯克相關(guān)風(fēng)險點
核心事實層面,兩份答卷完全一致且全部正確。Grok在頁碼級引用和若干具體數(shù)字上更細(xì),Claude在解釋框架和口徑辨析上更展開,但兩份都沒有硬傷、都沒編數(shù)字。這是最能體現(xiàn)雙方“基本功”的一題,也是最值得互相尊重的一題。
05.“誰是騙子”邏輯題:經(jīng)典陷阱誰都沒難住
考題:一個村子里每個人要么永遠(yuǎn)說真話,要么永遠(yuǎn)說假話。A說"我們倆至少有一個是騙子",B沉默。判斷A和B各是什么人,并解釋推理。
這道題考查的是最純粹的形式邏輯與嚴(yán)謹(jǐn)推理能力,難點并不在于題目本身有多復(fù)雜,而在于它設(shè)置的幾處“陷阱”:
自指矛盾:如果A是騙子,那么他說“我們倆至少有一個是騙子”這句話本身就成了真話——騙子說了真話,直接違反設(shè)定;
B的沉默:B全程不發(fā)言,但“沉默”本身就是信息——它不能作為判斷依據(jù),卻極易誘導(dǎo)誤判;
窮舉檢驗:需要系統(tǒng)性地遍歷四種組合(真/真、真/假、假/真、假/假),逐個排除,才能得出唯一解。
Claude的推理過程
這道經(jīng)典邏輯題對于當(dāng)今的大語言模型來說,早已構(gòu)不成挑戰(zhàn)。兩家答案完全一致且正確——A是說實話的人,B是騙子。推理過程中都給出了完整的四種組合排除表,邏輯鏈條干凈利落,沒有冗余也沒有跳躍。
我們進(jìn)一步追問“是否存在兩人都是騙子的可能”,雙方也堅持了正確的答案。
Grok的推理過程
五道題測下來,兩個模型的“性格畫像”也漸漸清晰起來。
Claude Code更像一位“穩(wěn)健型工程師”。 邏輯題推理干凈利落,招股書分析嚴(yán)謹(jǐn)扎實,面對被誤刪的文件也能冷靜重建。在標(biāo)注不確定數(shù)據(jù)時毫不含糊,不亂編、不冒進(jìn),邊界意識和安全素養(yǎng)貫穿始終。如果說有短板,那就是它在網(wǎng)頁和PPT的視覺呈現(xiàn)上偏保守,玩法豐富度和界面沖擊力不如對手。
Grok更有表現(xiàn)力。小游戲交互更豐富,PPT內(nèi)容密度更高,交付產(chǎn)品自帶包裝感,打開就讓人覺得“有東西”。它擅長制造第一眼的吸引力。但犯的“誤刪”錯誤也相當(dāng)致命,暴露了其在操作邊界和風(fēng)險控制上的嚴(yán)重短板。有沖勁,但有時沖過了界。
我們讓Claude和Grok互評,雙方都承認(rèn),這一局,綜合而言,Claude贏了。
Claude表示自己“道德感”很強(qiáng)
06.馬斯克重回牌桌了嗎?
在過去一段時間里,Grok不缺光環(huán)。它有馬斯克的流量,有X的入口,有“敢說”的產(chǎn)品人設(shè)。但在真正的生產(chǎn)場景中,開發(fā)者更習(xí)慣把Claude、OpenAI、Gemini放進(jìn)第一梯隊,而將Grok看作一個有趣、鋒利卻不夠穩(wěn)定的替代品。
Grok 4.5改變了這一局面。
五道題當(dāng)然不足以決定一家模型公司的座次,但它與外部榜單指向了同一個結(jié)論:Grok或許還沒有擊敗Claude,卻已經(jīng)不再是那個可以被忽略的追趕者。
第三方評測機(jī)構(gòu)Artificial Analysis給出的綜合智能指數(shù)中,Grok 4.5以54分排名第四,僅次于Fable 5、GPT-5.5和Claude Opus 4.8;相比上一代Grok 4.3,一次性提升了16分。在Coding Agent Index中,Grok 4.5通過Grok Build拿到76分,與運行在Codex中的GPT-5.5基本持平,僅落后于Claude Code中的Fable 5。
這意味著,Grok第一次不只是某幾張榜單看起來不錯,而是在編碼、終端操作和知識工作等智能體真正要干活的場景里,穩(wěn)定擠進(jìn)了第一梯隊。
比排名更讓競爭對手警惕的,是它把這樣的能力賣到了一個更低的價格。
Grok 4.5的API定價為每百萬輸入tokens 2美元、輸出tokens 6美元。作為對比,Claude Opus 4.8分別為5美元和25美元。Artificial Analysis的實際測試顯示,Grok 4.5完成一項編碼智能體任務(wù)的平均成本約為2.49美元,GPT-5.5約為5.07美元,F(xiàn)able 5約為11.8美元。
一位開發(fā)者直言:“頂級工程能力的邊際成本,今天被徹底打穿了?!?
速度同樣不容忽視。SpaceXAI稱,Grok 4.5的生成速度約為每秒80個tokens;在SWE-Bench Pro任務(wù)中,它平均使用約1.6萬個輸出tokens,而Opus 4.8 Max約為6.7萬個。獨立測試測得其輸出速度約為每秒88個tokens,高于同類推理模型的平均水平。在我們實際的測試過程中,Grok 4.5的生成速度也顯著快于Claude Opus 4.8。
對于需要模型反復(fù)讀取文件、調(diào)用工具、修改代碼和自我驗證的智能體來說,更少的步驟和更短的輸出,意味著節(jié)省的不只是API賬單,還有等待時間。
馬斯克還提出,要在2026年余下時間里以接近每月一款新基礎(chǔ)模型的節(jié)奏推進(jìn)迭代。背靠大規(guī)模算力、Cursor積累的真實開發(fā)數(shù)據(jù),以及SpaceX體系內(nèi)的工程資源,Grok的追趕速度確實可能比過去更快。
在我們這次實測中,雖然Grok Build的邊界控制出了嚴(yán)重事故,但它在游戲創(chuàng)意、視覺包裝、長文檔檢索上,并不是陪跑者,甚至在個別任務(wù)上明顯壓過Claude Code。Grok的真正問題是,能力沖到這個量級之后,還能不能被穩(wěn)定地約束住。
這正是馬斯克式產(chǎn)品的典型氣質(zhì):速度極快,沖擊力極強(qiáng),但與此同時,他也會把風(fēng)險、邊界和工程紀(jì)律一起推到聚光燈下。
所以,馬斯克重回大模型牌桌了嗎?
答案是肯定的。但他還沒有贏下這一局。
Claude仍然更穩(wěn)、更克制、更像一個可以托付生產(chǎn)環(huán)境的工程同事。Grok 4.5則像一臺剛被放出來的高性能機(jī)器,馬力驚人,成本誘人,但剎車系統(tǒng)還需要被反復(fù)驗證。
