久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

當(dāng)前大模型賽道高度聚焦付費(fèi)能力更強(qiáng)的企業(yè)開發(fā)者需求,擠壓普通用戶體驗(yàn)資源,普通用戶已被大模型廠商邊緣化。 ## 1. 大模型賽道發(fā)展走向極端分化 當(dāng)前大模型發(fā)展呈現(xiàn)割裂狀態(tài),2026年主流大模型均在Coding場景展開軍備競賽,Claude Fable 5僅用3個(gè)月就將SWE-bench Verified得分從80%區(qū)間提升至95%,大幅甩開對(duì)手;而普通用戶體驗(yàn)持續(xù)塌方,算力緊張導(dǎo)致廠商縮減推理深度,出現(xiàn)輸出混亂、創(chuàng)意退化、記憶丟失等諸多問題。 ## 2. 商業(yè)價(jià)值導(dǎo)向決定服務(wù)優(yōu)先級(jí) 開發(fā)者用戶商業(yè)價(jià)值遠(yuǎn)高于普通用戶:Anthropic月活用戶變現(xiàn)能力約211美元,是OpenAI的8倍,其80%收入來自企業(yè)客戶,Claude Code年化收入突破25億美元,占全球4%公開GitHub提交,企業(yè)AI市場份額從2025年初的10%飆升至2026年2月的65%,估值達(dá)9650億美元超越OpenAI。普通用戶只是廠商早期拉新道具、規(guī)模展示數(shù)據(jù),甚至其數(shù)據(jù)作為訓(xùn)練素材的價(jià)值也遠(yuǎn)低于開發(fā)者。 ## 3. 迭代資源向代碼場景高度傾斜 模型更新方向跟隨資金流向,頂尖能力被鎖定在企業(yè)服務(wù),普通用戶只能拿到閹割版,Anthropic甚至?xí)?duì)普通用戶的低價(jià)值需求偷偷降級(jí)。目前主流評(píng)測基準(zhǔn)均為Coding相關(guān),合成代碼訓(xùn)練集已成為訓(xùn)練標(biāo)配,其他能力的訓(xùn)練資源被持續(xù)擠壓。 ## 4. 普通用戶被動(dòng)承擔(dān)能力降級(jí)代價(jià) 全球每月為AI付費(fèi)20美元以上的用戶僅占總?cè)丝?.3%,決定大模型迭代方向的是占全球人口不到1%的開發(fā)者群體,普通用戶被排除在規(guī)則制定之外。頂會(huì)論文量化顯示:模型代碼推理能力每提升10%,安全、情感、創(chuàng)意等對(duì)齊指標(biāo)會(huì)下降15-20%,普通用戶需要承擔(dān)這種能力降級(jí)的負(fù)面影響,中國消費(fèi)者對(duì)大模型不滿的Top3缺陷恰恰是Coding評(píng)測不關(guān)注的維度。
大模型已經(jīng)拋棄了普通用戶
2026-07-14 10:08

大模型已經(jīng)拋棄了普通用戶

本文來自微信公眾號(hào): 碳基智 ,作者:碳基智


1


對(duì)于大模型的理解和體驗(yàn),我們現(xiàn)在正處于一個(gè)非常割裂、混沌的時(shí)代。


如果說2年前的大模型體驗(yàn)?zāi)芰€算相對(duì)均衡,普通用戶的核心訴求,諸如寫作、情感、通用問答這些還能得到充分的滿足。那么2026年的大模型,已經(jīng)開始把普通用戶的需求放在既不重要也不緊急的象限里了。



一方面,主流大模型們無一例外都在Coding場景開始了軍備競賽。


主流的商業(yè)模型在SWE-bench Verified排行榜(4月數(shù)據(jù))的差距壓縮到了1個(gè)百分點(diǎn)區(qū)間,基本都落在80%到80.9%之間。然而3個(gè)月時(shí)間過去以后,Claude Fable 5斷崖式地甩開了競爭者,而從80%到95%,僅僅只花了3個(gè)月時(shí)間。



另一方面,普通用戶的體驗(yàn)是在塌方的。特別是隨著用戶規(guī)模的暴漲,引發(fā)的算力緊張問題讓大模型廠商選擇縮減單次推理深度,導(dǎo)致很多大模型的輸出效果變得越來越唐。就更別提創(chuàng)意退化、情感降級(jí)、記憶丟失等等負(fù)面case了。


2


別管大模型廠商們嘴巴上說的為了人類,為了實(shí)現(xiàn)AGI,這話聽聽可以,別信。就像有人說做手機(jī)就是為了不賺錢賣給你,你應(yīng)該擔(dān)心她是不是想從你身上拿到更多。


數(shù)據(jù)不會(huì)說謊。Anthropic的每月活躍用戶變現(xiàn)能力約為211美刀,OpenAI則是25美刀,前者是后者的8倍,國內(nèi)的數(shù)據(jù)只會(huì)更低。


這說明什么呢?


在大模型的商業(yè)計(jì)算公式里,1個(gè)企業(yè)級(jí)開發(fā)者用戶的價(jià)值,等于8個(gè)月付20美刀訂閱的普通人。


Anthropic 80%的收入來自企業(yè)客戶,Claude Code上線僅一年,年化收入就突破25億美刀,全球4%的公開GitHub提交已經(jīng)由它完成。與此同時(shí),Anthropic的企業(yè)AI市場份額從2025年初的10%飆升至2026年2月的65%,估值9650億美刀,正式超越OpenAI。


服務(wù)開發(fā)者的公司,比服務(wù)所有人的公司更值錢。這意味著普通用戶從一開始就不是這場游戲的服務(wù)對(duì)象。他們是產(chǎn)品早期拉新的手段,是DAU報(bào)表里的數(shù)字,是向投資人展示規(guī)模的道具。


更遺憾的是,即便是作為訓(xùn)練數(shù)據(jù)來源來講,開發(fā)者用戶的質(zhì)量都更受模型廠商關(guān)注,而普通人的context信息,無足輕重。


3


模型更新的方向,是錢流入的方向。


Anthropic在4月的9天內(nèi)連續(xù)發(fā)布了兩個(gè)版本,Mythos Preview(SWE-bench 93.9%,不公開)和Opus 4.7(87.6%,公開)。兩個(gè)版本之間存在6個(gè)百分點(diǎn)的差距,在AI時(shí)代的當(dāng)下已經(jīng)是能力鴻溝了。


公開發(fā)布的只是一個(gè)閹割版。這種發(fā)布策略本身就說明了一切:金字塔尖的能力被鎖在企業(yè)級(jí)服務(wù)里,普通用戶拿到的是特供版,甚至Anthropic家的模型還會(huì)出現(xiàn)因?yàn)槟愕男枨筇蓝恢档糜酶媚P?,給你偷摸降級(jí)的case。


Claude Opus 4.7在SWE-bench Pro上64.3%領(lǐng)先,GPT-5.5在Terminal-Bench上82.7%領(lǐng)先,所有主流benchmark都是Coding相關(guān)的。


AI Coding的合成訓(xùn)練數(shù)據(jù)集也在急劇膨脹。KodCode、X-Coder-RL-40k這些完全合成的代碼訓(xùn)練集已經(jīng)成為主流訓(xùn)練方案的標(biāo)配。訓(xùn)練數(shù)據(jù)構(gòu)成決定模型能力構(gòu)成,當(dāng)絕大多數(shù)訓(xùn)練資源投入代碼場景的合成數(shù)據(jù)生產(chǎn)時(shí),其他能力的訓(xùn)練資源被擠壓是必然結(jié)果。


Money don’t lie.


4


有個(gè)數(shù)據(jù),不保真:


全球每月為AI付費(fèi)20美刀以上的人,占總?cè)丝诘?.3%。而其中的高凈值用戶,是年消費(fèi)超過100萬美刀的企業(yè)客戶,這個(gè)群體在Anthropic兩年內(nèi)從十幾家擴(kuò)大到逾千家。


開發(fā)者占全球人口比例不到1%。但2026年全球AI Coding工具市場的話語權(quán),完全由這不到1%的人決定。他們的需求定義了benchmark,他們的付費(fèi)定義了模型迭代方向,他們的使用習(xí)慣定義了產(chǎn)品形態(tài)。


模型加速趨同,Agent原生成為工具演化的收斂方向。收斂到哪里?收斂到開發(fā)者的工作流上。


普通用戶是被排除在外的。


但有一個(gè)代價(jià),是普通用戶在承擔(dān)的:


2026年6月有一篇頂會(huì)論文(arXiv 2606.11046)量化了一個(gè)事實(shí):推理能力基準(zhǔn)每提升10%,同期對(duì)齊指標(biāo)會(huì)下降15-20%。也就是說,模型在代碼推理上每進(jìn)步一分,它在安全、情感、創(chuàng)意等維度上就要退步一分半。


2026年中國消費(fèi)者對(duì)AI大模型最不滿的三大缺陷分別是:無法自我修正(45.81%)、推理能力弱(43.21%)、災(zāi)難性遺忘(42.62%)。


用戶不滿的恰恰是那些在Coding評(píng)測中不會(huì)被優(yōu)先考量的維度。


5


SWE-bench之所以成為大模型領(lǐng)域的行業(yè)標(biāo)準(zhǔn),是因?yàn)榇a的對(duì)錯(cuò)有唯一判定標(biāo)準(zhǔn):測試通過率。一段代碼要么能跑,要么不能跑,沒有什么如跑的量子態(tài)。


要么通過87.6%的測試,要么通過93.9%。這種可精確度量的特征,讓Coding成為了模型軍備競賽中最好用的武器,也最好說清楚差距是什么,在占領(lǐng)用戶心智這一側(cè)非常有效。


所以你就會(huì)發(fā)現(xiàn)有些模型,實(shí)際體驗(yàn)一比吊糟,偏偏打榜數(shù)據(jù)都很出彩。


普通用戶不掌握算力,不定義benchmark,不控制資本流向,不參與模型訓(xùn)練的數(shù)據(jù)標(biāo)注優(yōu)先級(jí)決策,甚至被認(rèn)為不是優(yōu)質(zhì)的訓(xùn)練數(shù)據(jù)來源。


但他們卻要作為財(cái)報(bào)里的海量用戶規(guī)模的組成,去為AGI即將到來的故事買單。


這既不合適,也不體面,但也無可奈何。

AI創(chuàng)投日?qǐng)?bào)頻道: 前沿科技
本內(nèi)容來源于網(wǎng)絡(luò) 原文鏈接,觀點(diǎn)僅代表作者本人,不代表虎嗅立場。
如涉及版權(quán)問題請(qǐng)聯(lián)系 hezuo@huxiu.com,我們將及時(shí)核實(shí)并處理。
正在改變與想要改變世界的人,都在 虎嗅APP
合江县| 苍山县| 泗洪县| 宜君县| 浦江县| 丰县| 格尔木市| 广德县| 舞钢市| 盐城市| 闽清县| 栾川县| 喜德县| 三门峡市| 南岸区| 罗山县| 平武县| 利辛县| 老河口市| 庆云县| 灵山县| 息烽县| 信阳市| 阿城市| 方城县| 伊川县| 溆浦县| 新源县| 米林县| 长岛县| 新乡市| 五台县| 汽车| 清丰县| 咸丰县| 旌德县| 新乐市| 桐梓县| 沅江市| 南京市| 黄山市|