本文來自微信公眾號(hào): 碳基智 ,作者:碳基智
1
對(duì)于大模型的理解和體驗(yàn),我們現(xiàn)在正處于一個(gè)非常割裂、混沌的時(shí)代。
如果說2年前的大模型體驗(yàn)?zāi)芰€算相對(duì)均衡,普通用戶的核心訴求,諸如寫作、情感、通用問答這些還能得到充分的滿足。那么2026年的大模型,已經(jīng)開始把普通用戶的需求放在既不重要也不緊急的象限里了。

一方面,主流大模型們無一例外都在Coding場景開始了軍備競賽。
主流的商業(yè)模型在SWE-bench Verified排行榜(4月數(shù)據(jù))的差距壓縮到了1個(gè)百分點(diǎn)區(qū)間,基本都落在80%到80.9%之間。然而3個(gè)月時(shí)間過去以后,Claude Fable 5斷崖式地甩開了競爭者,而從80%到95%,僅僅只花了3個(gè)月時(shí)間。

另一方面,普通用戶的體驗(yàn)是在塌方的。特別是隨著用戶規(guī)模的暴漲,引發(fā)的算力緊張問題讓大模型廠商選擇縮減單次推理深度,導(dǎo)致很多大模型的輸出效果變得越來越唐。就更別提創(chuàng)意退化、情感降級(jí)、記憶丟失等等負(fù)面case了。
2
別管大模型廠商們嘴巴上說的為了人類,為了實(shí)現(xiàn)AGI,這話聽聽可以,別信。就像有人說做手機(jī)就是為了不賺錢賣給你,你應(yīng)該擔(dān)心她是不是想從你身上拿到更多。
數(shù)據(jù)不會(huì)說謊。Anthropic的每月活躍用戶變現(xiàn)能力約為211美刀,OpenAI則是25美刀,前者是后者的8倍,國內(nèi)的數(shù)據(jù)只會(huì)更低。
這說明什么呢?
在大模型的商業(yè)計(jì)算公式里,1個(gè)企業(yè)級(jí)開發(fā)者用戶的價(jià)值,等于8個(gè)月付20美刀訂閱的普通人。
Anthropic 80%的收入來自企業(yè)客戶,Claude Code上線僅一年,年化收入就突破25億美刀,全球4%的公開GitHub提交已經(jīng)由它完成。與此同時(shí),Anthropic的企業(yè)AI市場份額從2025年初的10%飆升至2026年2月的65%,估值9650億美刀,正式超越OpenAI。
服務(wù)開發(fā)者的公司,比服務(wù)所有人的公司更值錢。這意味著普通用戶從一開始就不是這場游戲的服務(wù)對(duì)象。他們是產(chǎn)品早期拉新的手段,是DAU報(bào)表里的數(shù)字,是向投資人展示規(guī)模的道具。
更遺憾的是,即便是作為訓(xùn)練數(shù)據(jù)來源來講,開發(fā)者用戶的質(zhì)量都更受模型廠商關(guān)注,而普通人的context信息,無足輕重。
3
模型更新的方向,是錢流入的方向。
Anthropic在4月的9天內(nèi)連續(xù)發(fā)布了兩個(gè)版本,Mythos Preview(SWE-bench 93.9%,不公開)和Opus 4.7(87.6%,公開)。兩個(gè)版本之間存在6個(gè)百分點(diǎn)的差距,在AI時(shí)代的當(dāng)下已經(jīng)是能力鴻溝了。
公開發(fā)布的只是一個(gè)閹割版。這種發(fā)布策略本身就說明了一切:金字塔尖的能力被鎖在企業(yè)級(jí)服務(wù)里,普通用戶拿到的是特供版,甚至Anthropic家的模型還會(huì)出現(xiàn)因?yàn)槟愕男枨筇蓝恢档糜酶媚P?,給你偷摸降級(jí)的case。
Claude Opus 4.7在SWE-bench Pro上64.3%領(lǐng)先,GPT-5.5在Terminal-Bench上82.7%領(lǐng)先,所有主流benchmark都是Coding相關(guān)的。
AI Coding的合成訓(xùn)練數(shù)據(jù)集也在急劇膨脹。KodCode、X-Coder-RL-40k這些完全合成的代碼訓(xùn)練集已經(jīng)成為主流訓(xùn)練方案的標(biāo)配。訓(xùn)練數(shù)據(jù)構(gòu)成決定模型能力構(gòu)成,當(dāng)絕大多數(shù)訓(xùn)練資源投入代碼場景的合成數(shù)據(jù)生產(chǎn)時(shí),其他能力的訓(xùn)練資源被擠壓是必然結(jié)果。
Money don’t lie.
4
有個(gè)數(shù)據(jù),不保真:
全球每月為AI付費(fèi)20美刀以上的人,占總?cè)丝诘?.3%。而其中的高凈值用戶,是年消費(fèi)超過100萬美刀的企業(yè)客戶,這個(gè)群體在Anthropic兩年內(nèi)從十幾家擴(kuò)大到逾千家。
開發(fā)者占全球人口比例不到1%。但2026年全球AI Coding工具市場的話語權(quán),完全由這不到1%的人決定。他們的需求定義了benchmark,他們的付費(fèi)定義了模型迭代方向,他們的使用習(xí)慣定義了產(chǎn)品形態(tài)。
模型加速趨同,Agent原生成為工具演化的收斂方向。收斂到哪里?收斂到開發(fā)者的工作流上。
普通用戶是被排除在外的。
但有一個(gè)代價(jià),是普通用戶在承擔(dān)的:
2026年6月有一篇頂會(huì)論文(arXiv 2606.11046)量化了一個(gè)事實(shí):推理能力基準(zhǔn)每提升10%,同期對(duì)齊指標(biāo)會(huì)下降15-20%。也就是說,模型在代碼推理上每進(jìn)步一分,它在安全、情感、創(chuàng)意等維度上就要退步一分半。
2026年中國消費(fèi)者對(duì)AI大模型最不滿的三大缺陷分別是:無法自我修正(45.81%)、推理能力弱(43.21%)、災(zāi)難性遺忘(42.62%)。
用戶不滿的恰恰是那些在Coding評(píng)測中不會(huì)被優(yōu)先考量的維度。
5
SWE-bench之所以成為大模型領(lǐng)域的行業(yè)標(biāo)準(zhǔn),是因?yàn)榇a的對(duì)錯(cuò)有唯一判定標(biāo)準(zhǔn):測試通過率。一段代碼要么能跑,要么不能跑,沒有什么如跑的量子態(tài)。
要么通過87.6%的測試,要么通過93.9%。這種可精確度量的特征,讓Coding成為了模型軍備競賽中最好用的武器,也最好說清楚差距是什么,在占領(lǐng)用戶心智這一側(cè)非常有效。
所以你就會(huì)發(fā)現(xiàn)有些模型,實(shí)際體驗(yàn)一比吊糟,偏偏打榜數(shù)據(jù)都很出彩。
普通用戶不掌握算力,不定義benchmark,不控制資本流向,不參與模型訓(xùn)練的數(shù)據(jù)標(biāo)注優(yōu)先級(jí)決策,甚至被認(rèn)為不是優(yōu)質(zhì)的訓(xùn)練數(shù)據(jù)來源。
但他們卻要作為財(cái)報(bào)里的海量用戶規(guī)模的組成,去為AGI即將到來的故事買單。
這既不合適,也不體面,但也無可奈何。
