久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

本文提出「token不經(jīng)濟」現(xiàn)象,分析其成因與風險,提出從供需兩端優(yōu)化,實現(xiàn)token凈收益轉(zhuǎn)正的落地路徑。 ## 1. token市場整體價格上行,推高下游使用成本 目前token市場呈現(xiàn)高端定價格局固化、中端量價齊升、經(jīng)濟型跟隨追漲的整體抬升趨勢:Anthropic憑借編碼能力優(yōu)勢建立行業(yè)最強定價權(quán),通過三維分層定價策略實現(xiàn)溢價,2024年底到2026年5月ARR從約10億美元飆升至約450億美元;OpenAI、Google雖加速追趕,短期仍需以價換量。 即便是經(jīng)濟型token市場,過去兩年價格中樞也悄然上移:Haiku 4.5定價較Haiku 3.5上浮20%,Gemini 2.5 Flash百萬token輸出定價較2.0 Flash翻6倍以上,開源/半開源模型也普遍提價,核心原因是經(jīng)濟型token消費量爆炸式增長,競爭邏輯已從比價格轉(zhuǎn)向比性價比。 ## 2. 智能體架構(gòu)存在多重結(jié)構(gòu)性浪費,放大token損耗 token消耗存在多維度技術(shù)層面的隱形浪費,且損耗呈乘積性指數(shù)增長,對普通非技術(shù)用戶更不友好:一是上下文陷阱,Agent反復帶入歷史信息,ChatDev框架代碼審查階段近四成token消耗在傳遞已有信息,而非生成新內(nèi)容;二是分詞器黑箱,閉源模型分詞器調(diào)整往往帶來token數(shù)膨脹,Anthropic Opus 4.7新分詞器實測讓技術(shù)文檔平均token膨脹47%,高分辨率圖片膨脹201%;三是技能無意義調(diào)用,79.6%的公開軟件工程技能無法提升通過率,token開銷最高增加451%,平均通過率僅提升1.2個百分點,盲目調(diào)用只會徒增成本;四是多Agent溝通稅與長任務熵稅,超過一半token消耗在內(nèi)部協(xié)調(diào)與自我糾偏,系統(tǒng)越復雜熵稅增長越快。 ## 3. token有效應用場景局限,難以落地產(chǎn)生真實價值 當前純語言模型范式與現(xiàn)實世界存在結(jié)構(gòu)性鴻溝,token應用仍局限在少數(shù)高數(shù)字化場景:編程是具備通用性的特例,可依托自動反饋閉環(huán)快速迭代,但這一條件在多數(shù)其他場景不成立——法律AI僅能做初審,資深律師復核時間幾乎等同于從頭審閱,反饋成本遠高于編程場景。 向物理世界拓展更面臨驗證成本不對稱的難題,人形機器人等具身智能仍受虛擬與現(xiàn)實鴻溝限制,OpenAI早年靈巧手項目即便完成海量仿真訓練,落地真實環(huán)境仍魯棒性不足,驗證成本比虛擬世界高出幾個數(shù)量級。若token有效射程無法拓展,token不經(jīng)濟可能持續(xù)很長時間。 ## 4. token不經(jīng)濟的風險溢出與破局路徑 當前AI產(chǎn)業(yè)鏈風險不均衡,上游硬件賺得盆滿缽滿,中游模型廠商虧損,下游用戶開始控本,風險向中游聚集;部分中游廠商與上游形成循環(huán)融資,風險藏在不透明的私人信貸市場,泡沫破裂股債雙殺風險高;同時算力擴張極度消耗水電資源,已推高部分算力節(jié)點居民用電成本,擠壓民生需求。 破局需從供需兩端發(fā)力:供給側(cè)通過語義上下文壓縮、技能精簡優(yōu)化、自適應模型路由、帶預算約束的主持人架構(gòu)等精細化技術(shù),堵住跑冒滴漏壓低單位token成本;需求側(cè)強化企業(yè)AI成本治理,在傳統(tǒng)行業(yè)尋找驗證成本適中的中間場景,作為token經(jīng)濟從數(shù)字沙盒走向真實世界的橋梁。 最終行業(yè)需從炫技轉(zhuǎn)向精實,讓token回歸ROI金標準,用最少token完成任務才能實現(xiàn)凈收益轉(zhuǎn)正。
Token不經(jīng)濟
2026-06-30 06:30

Token不經(jīng)濟

本文來自微信公眾號:騰訊研究院,作者:李剛,頭圖來自:AI生成


近期部分媒體爆出微軟收回內(nèi)部Claude Code許可1。Claude Code是Anthropic推出的AI編程工具,在微軟內(nèi)部開放僅6個月就成為最受歡迎的輔助開發(fā)軟件之一,隨之而來的是token消耗劇增,成本暴漲,但產(chǎn)出質(zhì)量不盡如人意。多重考慮下,微軟踩下剎車,將員工導向自家的Copilot CLI。


Token消耗與實際產(chǎn)出不成比例的現(xiàn)象在其他平臺企業(yè)也普遍存在。Uber僅用4個月就耗盡了2026全年AI編程工具預算;亞馬遜部分員工無意義消耗token;Meta悄悄撤下內(nèi)部員工的Tokenmaxxing排行榜,不再鼓勵無產(chǎn)出的token消耗2。人人都在擁抱AI,但還沒有找到正確的姿勢;企業(yè)都在強調(diào)AI原生,但(暫時)沒看到收益,只看到越來越長的賬單。我稱之為“token不經(jīng)濟”。


Token不經(jīng)濟是企業(yè)內(nèi)部管控不力、token使用回報有限、Agent本身的架構(gòu)設(shè)計(如Skill重復調(diào)用、長程任務的內(nèi)耗、多智能體協(xié)同成本)等多重因素互相疊加的結(jié)果。未來,這些問題可能會隨著內(nèi)控的精進、技術(shù)面消耗不斷優(yōu)化而逐步緩解。但若要將token凈收益轉(zhuǎn)正,則不僅需要從供給端入手優(yōu)化Token成本,還需要從需求端入手,解決如何讓Token消耗在廣泛的產(chǎn)業(yè)場景中產(chǎn)生實際價值的難題。


一、好貨不便宜


過去兩年,主流大模型快速迭代,開發(fā)企業(yè)根據(jù)自身市場定位采取不同產(chǎn)品組合策略,API調(diào)用價格($每百萬token)隨之改變。模型性能大幅提升,但好貨不便宜,同一分層產(chǎn)品的調(diào)用價格也在悄悄提升,成為推高下游使用者token消耗成本的重要原因。


領(lǐng)導者的分層策略


Anthropic 是閉源模型廠商中最早認識到編程是token變現(xiàn)核心場景的公司。大模型的主要付費用戶是開發(fā)者和企業(yè)技術(shù)團隊,他們對價格不敏感,更看重模型的編碼效率和質(zhì)量。掌握編程這一商業(yè)場景的先機,就可以實現(xiàn)token溢價。


因此Anthropic在研發(fā)上專注編程。在確立編程能力優(yōu)勢后,自2024年初推出 Claude 3 系列起,在業(yè)內(nèi)率先采用旗艦-中端-輕量的立體產(chǎn)品組合,實現(xiàn)同代模型分層定價,同時搶占高端和大眾市場。Opus系列定位為編程業(yè)內(nèi)標桿,以 $15/$75(輸入/輸出百萬token價格,下同)的定價錨定高端市場;Sonnet系列($3/$15)為日常編程和辦公任務提供高性價比選擇;Haiku系列($1/$5)面向輕量、快捷互動場景,價格親民。這種精細的層級劃分使 Anthropic 能夠在每一價格帶最大化利潤提取,同時保護市場份額。


這一定價策略讓作為技術(shù)領(lǐng)導者的Anthropic的競爭手段更多、操作更靈活。例如,在覺察到與競品性能差距快速縮小后,借Opus4.5發(fā)布大幅降價,擠壓競品市場空間。再如,隨著新一代模型Mythos Preview($25/$125)發(fā)布,在Opus上置入新的超高端分層,抬升了旗艦產(chǎn)品價格,逆轉(zhuǎn)之前高端產(chǎn)品不斷降價的趨勢。


隨后發(fā)布的 Fable 5 采用同一底層架構(gòu),以安全為由對部分功能進行限制,采用 $10/$50 的價格(仍是Opus系列的兩倍)面向更廣泛市場。不僅按性能定價,更按安全約束的松緊程度定價,形成能力分層、風險分層、定價分層的三維定價策略,重新拿回溢價市場。


這一定位策略的效果在2025年至2026年間得到了充分驗證。Anthropic 的年度經(jīng)常性收入(ARR)從2024年底的約10億美元飆升至2026年5月的約450億美元3。更重要的是,這一策略充分保護了作為產(chǎn)品力領(lǐng)導者的市場溢價,依靠性能優(yōu)勢跳出卷價格的窠臼,完成好貨不便宜的價值閉環(huán)。


追趕者的價格拉扯


相比之下,OpenAI 和 Google 在大模型商業(yè)化的早期階段選擇了與Anthropic不同的多元化路徑。OpenAI 在2024年曾將大量資源投入 Sora等多模態(tài)項目;Google 則圍繞 Gemini 構(gòu)建了覆蓋搜索、云服務、Workspace 等多條產(chǎn)品線的生態(tài)策略。這些投資雖然拓展了技術(shù)版圖,卻因資源被分散,在辦公和編程場景上表現(xiàn)相對并不突出。當意識到編程才是模型能力變現(xiàn)的主戰(zhàn)場,返身再來追趕時,已經(jīng)失去先手優(yōu)勢。


OpenAI 的返身非常堅決。一方面重新聚焦編碼和 Agent 能力,砍掉 Sora等消耗巨大項目;另一方面,跟隨Anthropic建立自己的分層產(chǎn)品矩陣,一對一緊逼盯人,同時刻意拉大旗艦模型和輕量模型的價差,旗艦高價守住領(lǐng)先模型的招牌,輕量低價搶奪市場份額。GPT 5.5 的定價($5/$30)與Opus 4.7/4.8($5/$25)看齊,建立與 Claude Opus 同等的高端價格錨點,次級模型GPT 5.4 mini($0.75/$4.50)和nano($0.20/$1.25),大幅低于同級 Claude Haiku 4.5($1.00/$5.00),以價格換市場。


Google 是安卓生態(tài)體系的核心,已經(jīng)有完整的商業(yè)閉環(huán),需要處理的關(guān)系更為復雜,動作也更謹慎。Gemini 需同時服務于 Google Cloud 的企業(yè)客戶、Workspace 的生產(chǎn)力用戶、以及搜索產(chǎn)品的消費者體驗。即便意識到編程的重要性,也無法決然將資源全部聚焦于編程和辦公,還是要走多模態(tài)、多元化路線。


Google也是緊隨Anthropic從1.5代 Gemini開始將產(chǎn)品分為旗艦Pro系列和輕量Flash系列,但產(chǎn)品迭代速度相對較慢,價格定位更低。2024年初的旗艦模型Gemini 1.5 Pro在短prompt(<128k)情形下輸出百萬token價格僅為5美元,是同期GPT-4o的三分之一,Opus 3的十五分之一。


2026年2月發(fā)布的Gemini 3.1 Pro百萬token輸出價格提升至12美元,顯著低于同期GPT 5.4的15美元和Opus 4.6/4.7的25美元。不僅如此,Google還搞了一個反向操作,在輕量產(chǎn)品線Flash下面加入超輕量產(chǎn)品線Flash-Lite,將調(diào)用價格壓到與開源模型同樣的水平線,這是典型的以價換量。


而被市場殷切期盼的 Gemini 3.5 Pro 遲遲未能正式發(fā)布,也反映出 Google 在平衡性能、安全性和生態(tài)適配方面面臨的內(nèi)部博弈。新一代旗艦模型的定價策略,也被市場高度關(guān)注。


圖1:旗艦模型定價變化趨勢Claude 系列及 GPT-4o/4.1/5.4 的定價來自官方定價頁;GPT-5.5 系列、Gemini 3.5 Flash 的定價來自 OpenAI/Google 平臺及第三方匯總;GLM 系列定價基于海外 Z.ai 平臺,具體價格受匯率波動和雙軌定價影響。繪圖:Codebuddy


次級/輕量和開源/半開源模型市場在需求爆發(fā)中默默漲價


旗艦模型拼性能,次級/輕量模型卷價格,是市場競爭理所應當?shù)恼_姿勢。面對激烈的市場競爭,一般預期是市場價格中樞會不斷下降。但實際情況卻恰恰相反,由次級/輕量-開源/半開源模型構(gòu)成的經(jīng)濟型token市場,價格中樞在過去兩年悄然上移,而token市場價格地板的真正抬升正是在這樣的上移中完成的。


表面上看,這是一片殺瘋了的紅海。Sonnet、mini、Flash等收費低廉的次級/輕量模型是主流閉源模型面向大眾市場的經(jīng)濟實惠裝,主要目標是搶奪市場份額。與此同時,DeepSeek、Qwen 和 GLM 等開源或半開源模型迅速崛起,普遍采用旗艦定位、次級/輕量定價的策略,給次級/輕量閉源模型市場帶來持續(xù)的價格壓力。


2024年底,DeepSeek V3 以約 $0.27/$1.10 的定價切入市場,遠低于同級閉源模型。稍后推出的R1 以 $0.55/$2.19 的價格提供推理增強能力,直接壓縮了 GPT-4.1 mini 和 Claude Haiku 的定價空間。GLM-4 Plus 以僅 $0.69/$0.35 的價格提供接近 GPT-4 級別的能力,對價格敏感的開發(fā)者群體構(gòu)成了極大的吸引力。卷價格似乎是這一分層市場的常態(tài)。


但另一方面,每一代次級/輕量和開源/半開源模型的推出,都伴隨著價格地板的抬升。例如2024年10月推出的Haiku 3.5,輸入/輸出定價為$0.80/$4.00;一年后Haiku 4.5的定價上浮20%到$1.00/$5.00。


差不多同一時間,GPT mini系列定價幾乎翻番,從 4o mini的$0.15/$0.60上浮至4.1 mini的$0.40/$1.60。Gemini Flash系列也同樣,從2.0 Flash的$0.10/$0.40超低定價,上浮至2.5 Flash的$0.30/$2.50,百萬token輸出定價翻了6倍還多。


開源/半開源模型如GLM 系列,GLM-5 在海外市場的定價較 GLM-4.7 提升了約67%到100%。用智譜自己的話,這次大幅提價,顯示出國產(chǎn)模型的技術(shù)能力和市場競爭力正在快速提升。


產(chǎn)生這一現(xiàn)象的根本原因是經(jīng)濟型token消費量的爆炸式增長。大多數(shù)日常編碼任務、文檔處理和自動化流程并不需要 Opus 或 GPT-5.5 級別的能力,而是由 Sonnet、mini、Flash 等模型承擔,或交由開源/半開源模型完成。隨著 AI 編碼助手、Agent 工作流和企業(yè)級 AI 應用的普及,這些次級/輕量-開源/半開源模型的調(diào)用量激增,遠超旗艦模型。


一方面,這使得經(jīng)濟型模型消耗快速上升,燒現(xiàn)金維持低價的游戲無法持續(xù);另一方面,這也為廠商開拓了提價空間,漲價的同時需求仍在快速增長。因此,即便是在經(jīng)濟型token市場,競爭邏輯也從哪家token更便宜轉(zhuǎn)向哪家token性價比更高。不論是Claude Sonnet/Haiku、GPT mini/nano、Gemini Flash,亦或是DeepSeek、Qwen、GLM系列,都出現(xiàn)定價中樞抬升的趨勢。


從上面的分析大概可以看到,token市場正在經(jīng)歷一個高端定價格局固化、中端量價齊升、經(jīng)濟型跟隨追漲的整體抬升過程。Anthropic 憑借編碼能力領(lǐng)先建立了行業(yè)最強的定價權(quán),OpenAI 和 Google 正在加速追趕但短期內(nèi)仍需以價換量,而開源/半開源模型在持續(xù)抬升定價地板的同時也開始分享市場增長的紅利。


這一格局的演變將深刻影響整個 AI 產(chǎn)業(yè)的利潤分配和競爭態(tài)勢。在消耗大增、單價上漲的token 市場,與模型廠商收入爆發(fā)相對應的,必然是下游token使用者的成本攀升,是終端消費token不經(jīng)濟的底層原因。


圖2:次級/輕量和開源/半開源模型定價趨勢。Claude 系列及 GPT-4o/4.1/5.4 的定價來自官方定價頁;GPT-5.5 系列、Gemini 3.5 Flash 的定價來自 OpenAI/Google 平臺及第三方匯總;GLM 系列定價基于海外 Z.ai 平臺,具體價格受匯率波動和雙軌定價影響。繪圖:Codebuddy


二、智能體的隱形消耗


token越來越貴固然傷及荷包,更讓人心疼的是不少token在調(diào)用智能體(Agent)干活時被系統(tǒng)性地浪費掉了。上下文陷阱(Context Trap)、分詞器黑箱(Tokenizer Black Box)、技能冗余(Skill Redundancy)、以及多Agent協(xié)同中的溝通稅與長程熵增(Communication Tax and Entropy Drift),這些結(jié)構(gòu)性的跑冒滴漏疊加在一起,構(gòu)成了token不經(jīng)濟的內(nèi)部技術(shù)根源。


上下文陷阱


模型推理需計算每個token和其他token的關(guān)系,因此上下文越長,計算負擔越重,token消耗越多。同樣一個問題,沒有頭尾的丟給Agent,消耗不了幾個token。但如果是帶著歷史對話、工具日志、代碼文件、報錯信息和多輪討論,輸入token的消耗可能多出幾個數(shù)量級。


而Agent架構(gòu)天然放大長文本陷阱。智能體會將問題拆解,規(guī)劃調(diào)用工具,讀文件,檢查反饋,修改方案,再調(diào)用工具,循環(huán)往復,每一步都可能把歷史記錄重新帶進上下文。同一批信息被反復讀取,同一個任務被反復計費。


Salim et al.,(2026)對ChatDev框架的分析發(fā)現(xiàn),代碼審查階段(Code Review)消耗的token平均占總消耗的39.5%,是所有開發(fā)階段中最高的4,這意味著近四成的token花費在了Agent之間反復傳遞已有信息的過程中,而非真正生成新內(nèi)容。


圖3:對ChatDev框架30個任務中各階段Token消耗占比的分析。Salim, et al., (2026). Tokenomics: Quantifying Where Tokens Are Used in Agentic Software Engineering. Proceedings of the Mining Software Repositories Conference (MSR).


分詞器黑箱


分詞器(Tokenizer)是大模型訓練的基礎(chǔ),決定同等參數(shù)量下模型的信息密度上限、有效上下文長度下限和邊緣case(數(shù)字/代碼/多語種)的可靠性。分詞越合理,模型訓練和推理就越高效、穩(wěn)定。開源/半開源模型的分詞器和權(quán)重通常是公開的,而閉源模型的分詞器是“黑箱”,分詞器的更新?lián)Q代往往伴隨著token密度的變化。


2026年4月Anthropic發(fā)布Opus 4.7的同時,更換了底層分詞器。根據(jù)Anthropic官方文檔披露,分詞器調(diào)整主要考慮模型訓練的實際需求,為提升性能采用更細粒度的子詞分割方案,副作用是同樣長度的文本,token數(shù)量膨脹了1.0倍至1.35倍13。多家獨立測試機構(gòu)的結(jié)果顯示實際膨脹倍數(shù)更高。


企業(yè)AI成本管理平臺Finout針對真實企業(yè)prompt的加權(quán)實測顯示,技術(shù)文檔與英文密集代碼文件的平均膨脹率達到1.47倍(+47%)14;ClaudeCodeCamp對七種真實文件類型的綜合測試結(jié)果為平均1.325倍(+32.5%)15;開發(fā)者Simon Willison通過API直接比對發(fā)現(xiàn),同一份系統(tǒng)提示詞在新分詞器下從5,039 tokens膨脹至7,335 tokens(+46%),而高分辨率圖片的token膨脹更是高達3.01倍(+201%)16。


更早之前,OpenAI在發(fā)布GPT-4o時將分詞器從cl100k_base升級為o200k_base,詞表規(guī)模擴大了近一倍,官方說明此舉旨在提高壓縮率并增強多語言處理能力17。然而,詞表膨脹本身并不意味著同等文本的token計數(shù)減少,實際上對于非英語內(nèi)容(尤其是中文、日文等CJK字符),新分詞器的切割粒度變化可能導致token數(shù)不減反增。


關(guān)于更細顆粒度的分詞是否能提升模型表現(xiàn),目前尚缺乏來自模型廠商的系統(tǒng)性公開論證。Anthropic在Opus 4.7的變更文檔中將新分詞器歸入Breaking Changes條目,僅描述了事實層面的變更(更細粒度的子詞分割),未詳細解釋技術(shù)動因或性能收益。


社區(qū)中有研究者指出,更細的分詞理論上可以豐富模型的詞匯表征能力,尤其有利于代碼理解和結(jié)構(gòu)化數(shù)據(jù)處理(JSON、XML等格式在Opus 4.7中觸及了最高的1.35倍膨脹上限),但這種潛在的性能增益是否足以合理化近50%的成本增幅,是一個懸而未決的問題13。


分詞器迭代頻率明顯低于模型更新,但事關(guān)token的最基本計費標準,且變化隱藏在技術(shù)細節(jié)之中,普通使用者幾乎不可能察覺。閉源模型對分詞器更是諱莫如深,有可能成為加重token不經(jīng)濟的原因之一。


技能的無意義調(diào)用


技能(Skill)是讓Agent架構(gòu)更專業(yè)的關(guān)鍵工具之一。有人把技能看成是長一點的markdown,有人把技能當成一個裝了各類參考文獻和操作說明的文件夾,也有人把技能理解為一段超長的結(jié)構(gòu)化prompt。在實際的推理和Agent任務中,很多技能過長過雜,加大了token消耗。


Gao et al.,(2026)對55,315個公開技能的大規(guī)模實證研究揭示了技能的無效加載是如何浪費token的5。在路由層面(即Agent決定是否調(diào)用某個技能的環(huán)節(jié)),高達26.4%的技能完全沒有路由描述,像一本本沒有目錄的工具手冊,大大增加被Agent無效加載的概率。


在正文層面,超過60%的技能內(nèi)容不是可直接執(zhí)行的操作規(guī)則,而是背景解釋或示例文本,使用技能的大部分token花在了閱讀說明書而非干活上。更嚴重的是,部分技能會密集引用文件,單次調(diào)用就會注入數(shù)萬乃至十余萬token,其中可能只有很小比例與當前任務相關(guān)。


Han et al.,(2026)的SWE-Skills-Bench基準測試進一步證實了技能效用的有限性6。該研究在真實GitHub項目上測試了49個公開軟件工程技能,結(jié)果顯示39個技能(79.6%)沒有帶來通過率的任何提升(有技能和無技能的Pass率相同),全部49個技能的平均效用增量僅為可憐的1.2個百分點,然而token開銷最高增加了451%。


僅有在編碼特定領(lǐng)域?qū)I(yè)知識的7個技能(如金融風控公式、云原生流量管理、GitLab CI模式)帶來了有意義的性能提升(最高提升30個百分點);更有3個技能因版本沖突導致性能下降(最高下降10個百分點)。這說明技能的效用高度依賴場景匹配度,盲目調(diào)用只會徒增成本。


多Agent的廢話與長任務的跑偏


多Agent是目前受青睞的工作方式,讓使用者一個人領(lǐng)導一個由AI構(gòu)成的團隊,寫代碼的、審查的、測試的、修復的,多個Agent各司其職,互相監(jiān)督,在很多情況下確實提高了輸出質(zhì)量。但機器之間也會開無效會議,對話中不斷重復已經(jīng)討論過的任務背景、之前的結(jié)論、格式化套話,每重復一次,就再消耗一遍token,Salim et al.,(2026)稱之為多Agent系統(tǒng)的溝通稅(communication tax)4。


此外,將復雜的長程任務(long task)交由多Agent系統(tǒng)完成,正在成為編程和辦公的主流做法,并逐漸擴展到餐飲、出行等日常生活的場景。長程任務本身就存在容易跑偏的問題。此類任務的上下文里塞滿工具輸出、報錯、草稿、日志,很容易造成模型推理逐漸偏離目標。


為了糾偏,開發(fā)者往往會要增加摘要、記憶、檢查、回滾等機制,帶來更多token消耗。Luo et al.,(2026)在對TabTracer研究中觀察到,傳統(tǒng)鏈式推理在路徑過長時容易陷入循環(huán)狀態(tài),對抗性注入可以故意觸發(fā)這種循環(huán),使Agent在錯誤路徑上反復消耗token而不自知7。


這種維持穩(wěn)定所需的額外消耗通常被稱為熵稅(entropy tax),系統(tǒng)越復雜,Agent越自由,越需要監(jiān)督,任務越長,上下文越大,熵稅增長越快。一個看似高效的Agent團隊,token賬單中可能有超過一半花在了內(nèi)部協(xié)調(diào)與自我糾偏上。


上下文陷阱、分詞器黑箱、技能的無意義調(diào)用、廢話文學和長任務跑偏,這些因素疊加在一起,對token消耗的效果不是簡單的加和,而是乘積性的指數(shù)增長。更值得注意的是,這些技術(shù)性損耗對不同使用者的影響是不對稱的。


具備技術(shù)背景的開發(fā)者可以通過調(diào)整系統(tǒng)提示詞(System Prompt)、裁剪技能內(nèi)容、設(shè)置上下文窗口管理策略等方式在一定程度上緩解這些問題,但對于缺乏技術(shù)背景的普通企業(yè)用戶而言,他們既不理解Agent內(nèi)部的token流轉(zhuǎn)機制,也無法有效干預其行為模式,只看到賬單上的數(shù)字在不斷增長,卻不知道錢究竟花在哪里、為什么花了那么多。


在這個意義上,token不經(jīng)濟不僅是一個技術(shù)效率問題,更是一個技術(shù)平權(quán)問題。AI工具的使用門檻,從會不會寫代碼變成了能不能理解Agent架構(gòu)的成本動力學。現(xiàn)實中大多數(shù)智能體的使用者并不具備相關(guān)技術(shù)背景,被置于結(jié)構(gòu)性劣勢之中。


三、尋找真實的需求


比起定價、無效消耗等種種供給端的問題,應用端的局限性是造成token不經(jīng)濟的更重要的原因。盡管模型性能在過去兩年取得了令人矚目的進展,但token的通用性仍然相當有限。目前的token的使用大都局限在數(shù)字化水平較高的場景中,比如編程輔助、文檔處理、數(shù)據(jù)分析。


跳出這些優(yōu)勢部分,大模型性能會隨著應用場景數(shù)字化水平下降而急劇衰減。到了數(shù)字化程度極低的線下服務業(yè)態(tài),如餐飲、家政、零售終端、現(xiàn)場維修,token能夠獨立完成的任務都局限在已經(jīng)高度數(shù)字化的流程管理部分,很難實際參與現(xiàn)場操作。


這不是說AI永遠無法進入這些領(lǐng)域,而是說當前的純語言模型范式(token-in, token-out)與現(xiàn)實世界之間存在著一條結(jié)構(gòu)性鴻溝。這一問題在移動互聯(lián)網(wǎng)時代就存在,是數(shù)字技術(shù)未能從根本上改變第一和第二產(chǎn)業(yè)的根本原因。


人工智能的發(fā)展為跨越這條鴻溝提供新的可能,科學智能(AI for Science)、世界模型(World Model)、機器人系統(tǒng)等基礎(chǔ)性研究正在取得進展。過去兩年諾貝爾物理學獎和化學獎被授予人工智能科學家,F(xiàn)igure、Tesla Optimus、宇樹等人形機器人取得顯著進展。但在這些前沿領(lǐng)域目前仍處在實驗室階段,在取得劃時代的應用層突破之前,token大概會持續(xù)困在高度數(shù)字化場景中。


編程是通用的特例


編程是目前大語言模型表現(xiàn)最好的應用場景,但這一場景并不具有普遍的代表性,更準確的描述是具有通用性的特例。


通用性是說,編程輸出的是Agent的通用語言,可以在數(shù)字化基礎(chǔ)較好(流程和文件已經(jīng)數(shù)字化并由算法驅(qū)動)的場景中,直接驅(qū)動不同類型的Agent協(xié)助完成多種多樣的任務。從這個角度看,Anthropic專攻編程的Claude Code,以及Open AI的GPT Codex成為目前市場上最受歡迎的Agent產(chǎn)品并非偶然。


特例是指編程場景在模型的后訓練環(huán)節(jié)具備極大優(yōu)勢,一是確定的信號反饋,模型生成的代碼跑一遍,編譯器、解釋器、單元測試立刻可以給出精準、結(jié)構(gòu)化、毫無歧義的對錯判斷,二是在這樣的自動信號反饋基礎(chǔ)上,可以高效形成自動的后訓練閉環(huán),將反饋毫無阻礙地接進強化學習回路,智能體在數(shù)字沙盒里高速生成、報錯、自我修正。這樣的自主訓練環(huán)境在其他場景中很少見,甚至基本不可能形成。


一旦離開編程,模型訓練的效率會大幅降低。在數(shù)字化程度相對較低、無法形成自動后訓練閉環(huán)的傳統(tǒng)商業(yè)世界,如管理決策、法律談判、臨床醫(yī)療、供應鏈物流,數(shù)據(jù)采集和結(jié)果驗證成本會吃掉任何token經(jīng)濟。拿不到低成本的反饋信號的智能體,也就無法完成指數(shù)級自我進化,難以重復其在編程上的巨大成功。


2023年2月,A&O Shearman(原Allen & Overy)率先與法律領(lǐng)域的垂直大模型公司Harvey AI達成獨家戰(zhàn)略合作,將后者開發(fā)的AI法律助手部署在前者遍布全球43個辦公室18。在為期數(shù)月的試用期內(nèi),A&O Shearman在全球的3,500余名律師向Harvey提交了約40,000次查詢請求,涵蓋合同起草、法規(guī)檢索、盡職調(diào)查等多項法律工作流程,確實提高了工作效率19


硬幣的另一面,A&O Shearman在其官方新聞稿中明確指出,Harvey AI生成的所有輸出都需要經(jīng)過執(zhí)業(yè)律師的仔細審查后方可使用18。AI并未真正替代律師的專業(yè)判斷,僅在原有工作流程之上新增了一個AI初審環(huán)節(jié)。資深合伙人在接受AI標注后的合同草案時,投入的復核時間幾乎等同于從頭審閱原始合同所需的時間。


當然,人工審核的結(jié)果反饋是后續(xù)模型訓練的高價值數(shù)據(jù),但這樣的反饋成本顯然較編程這樣的自動閉環(huán)高出太多。不能排除未來當反饋數(shù)據(jù)積累到某一臨界點,智能體在現(xiàn)實場景的表現(xiàn)會大幅提升,逼近甚至超越專業(yè)人士的水平。但與編程相比,這一臨界點的來臨還有相當長的路要走。


向物理世界的艱難跨越


法律工作任務的主要內(nèi)容仍然是大量文字處理,是一個數(shù)字化水平較高且肯定會被高度數(shù)字化的場景。當工作任務中可被數(shù)字化、可以從數(shù)字世界中直接控制和操作的成分降低,智能體能夠完成的任務比例也會隨之降低。雖然現(xiàn)實世界的設(shè)施大多由軟件驅(qū)動,但單純依靠智能體寫代碼來控制物理世界,仍然面臨巨大的障礙。


以人形機器人(humanoid robot)的發(fā)展為例,雖然已經(jīng)在馬拉松比賽中超越了人類最好成績,但人形機器人在大部分現(xiàn)實世界的任務仍在艱難掙扎。清潔、搬運、開門、穿越雜亂場景,這些對人類來說輕而易舉的動作,對機器人而言卻是巨大挑戰(zhàn)。


所以Moravec(1988)講“讓計算機在智力測驗或下跳棋中表現(xiàn)出成人水平的成績相對容易,而要賦予它們一歲幼兒的感知與行動能力卻極其困難,甚至不可能?!?span id="fe2iclqy7" class="text-remarks" label="備注">(It is comparatively easy to make computers exhibit adult-level performance on intelligence tests or playing checkers, and difficult or impossible to give them the skills of a one-year-old when it comes to perception and mobility),接近四十年后的今天,這句話的含金量仍在上升23。


李飛飛在長文《From Words to Worlds》中,把空間智能與具身智能列為需要更長時間才能成熟的中期目標8。原因在于,現(xiàn)實世界沒有編譯器,物理世界不接受迭代,只接受驗證,而驗證的成本永遠比生成的成本高。


曾被寄予厚望的仿真技術(shù)雖然起到一定效果,但要實現(xiàn)類似Agent自適應在編程場景中的效能,還有很長的路要走。仿真技術(shù)是為繞開物理世界沒有編譯器的難題,用數(shù)字孿生和物理引擎搭一個虛擬驗證空間。但具身智能發(fā)展還是撞上了虛擬與現(xiàn)實鴻溝(Sim-to-Real Gap),在簡化沙盒里靠海量Token練出的最優(yōu)控制軌跡,一碰上真實世界的摩擦、材料疲勞和環(huán)境噪聲,立刻變得極其脆弱。


Aljalbout et al.,(2025)認為仿真到現(xiàn)實的差距并非單一問題,而是由動力學差異、感知失真、執(zhí)行器非線性、系統(tǒng)設(shè)計缺陷等多個子差距疊加而成,完美仿真器在計算上不可行20。


此外,仿真訓練策略往往會利用建模中不準確但確定的邊界條件獲得虛高的性能表現(xiàn)。但若部署到真實環(huán)境,這些策略往往并不可靠,甚至會帶來風險。例如OpenAI的Dactyl靈巧手項目,用64塊NVIDIA V100 GPU和920臺32核CPU服務器在仿真中累計了相當于13,000年工作量的訓練經(jīng)驗,使機械手操作方塊達到極高的成功率21。


但靈巧手在面對真實世界中非預設(shè)的材質(zhì)、溫度和磨損變化時,魯棒性迅速下降。2021年,OpenAI解散了整個機器人團隊。聯(lián)合創(chuàng)始人Wojciech Zaremba在解釋這一決定時表示,資源需要轉(zhuǎn)移到更容易取得成就的領(lǐng)域22。盡管官方未將Sim-to-Real Gap列為主因,但行業(yè)普遍認為,仿真訓練的高昂算力成本與真實部署的不確定性之間的矛盾,是促使OpenAI放棄機器人方向的重要因素之一。


在真實的物理世界驗證模型表現(xiàn),時間和資本成本比虛擬世界高出幾個數(shù)量級,而這樣的真實測試是無法被取代的。這種非對稱的驗證成本從一個側(cè)面說明了編程場景的特殊性,算法不是萬能的,token也不是。


如果token的有效應用范圍長期局限于編程和少數(shù)數(shù)字場景,始終無法跨越從數(shù)字世界到物理世界的鴻溝,AI產(chǎn)業(yè)化和產(chǎn)業(yè)AI化的可持續(xù)性就要打一個大大的問號。Token經(jīng)濟的未來,取決于我們能否把token的有效射程從數(shù)字孤島拓展到更廣闊的真實世界。在物理世界的真實需求爆發(fā)之前,token不經(jīng)濟可能會持續(xù)很長時間。


四、Token不經(jīng)濟的溢出風險


Token不經(jīng)濟在整個AI產(chǎn)業(yè)鏈條上的分布并不均衡。上游基礎(chǔ)設(shè)施和硬件廠商在當下的固定資產(chǎn)投資熱潮中賺得盆滿缽滿;中游的模型廠商仍在比拼產(chǎn)品性能,高昂的資本支出擠壓現(xiàn)金流;下游應用效果因人而異,因場景而異,大部分企業(yè)仍在持幣觀望。產(chǎn)業(yè)鏈風險在向中游聚集,而中游的模型廠商正在資本市場建立起一個個循環(huán)融資的小圈子。持續(xù)累積的token不經(jīng)濟風險一旦爆發(fā),必然會牽動金融市場,甚至影響民生穩(wěn)定。


產(chǎn)業(yè)鏈風險的不均衡分布


Token-Agent熱潮拉動巨額資金投向上游的數(shù)據(jù)中心、網(wǎng)絡(luò)和芯片制造,以及電力和能源基礎(chǔ)設(shè)施。臺積電2026年資本支出預計達520至560億美元9,微軟、Alphabet、亞馬遜與Meta在2025至2026年的AI基建投入合計遠超3000億美元并向逼近7000億美元的量級攀升10。


中游的大模型廠家是本輪AI投資浪潮的發(fā)動機、所有有關(guān)AI樂觀預期的錨點、“全村的希望”。但主要廠商雖然營收爆發(fā)增長但仍深陷虧損,算力采購成本居高不下。OpenAI預計要到2030年前后才可能盈利11。而下游真正在用Agent干活、真正在燒token的企業(yè)用戶已經(jīng)開始控成本。畢竟尚未看到合理回報,那么為token設(shè)預算上限、做成本歸因、收緊使用許可,都是順理成章的管理動作。


我們對比了AI產(chǎn)業(yè)鏈上下游具有代表性的上市公司過去兩年的自由現(xiàn)金流(FCF=經(jīng)營性現(xiàn)金流 - 資本支出)變化和最近一年的凈利潤率(圖4)。2025年,處于產(chǎn)業(yè)鏈上游的臺積電(44.5%)和英偉達(55.6%)不僅凈利潤率更高,自由現(xiàn)金流更取得14.5%和58.8%的高速增長。


相比之下,處于產(chǎn)業(yè)鏈下游的亞馬遜、微軟和Meta雖然凈利潤率與往年持平甚至有所提升,但自由現(xiàn)金流分別下降了76.6%、14.8%和3.4%,主要是受到資本支出大幅上升的影響。Token金礦尚未探明,挖金子的還在投錢,而賣鏟子的已經(jīng)賺得盆滿缽滿。


這樣的情況在歷史上多次重演。產(chǎn)業(yè)革命初期,隨著新技術(shù)興起,需求先在投資端和產(chǎn)業(yè)上游爆發(fā),中游巨額資本支出變成上游的巨大利潤,而下游的最終消費方興未艾,尚不足以支撐中游企業(yè)的產(chǎn)能擴張。風險向產(chǎn)業(yè)中游匯聚,資本與產(chǎn)能跑在真實付費需求之前。


短期看,估值回調(diào)、產(chǎn)能閑置、部分參與者出局幾乎難以避免;長期看,只要底層需求最終成形,超前建造的數(shù)據(jù)中心、芯片與網(wǎng)絡(luò)還是會有用武之地,成為支撐經(jīng)濟增長的生產(chǎn)力底座。對于社會大眾和監(jiān)管者來說,需要防范產(chǎn)業(yè)鏈風險通過金融市場向外傳導,風險外溢導致的經(jīng)濟大幅波動。


圖4:AI產(chǎn)業(yè)鏈上下游自由現(xiàn)金流增速與凈利潤率對比(FY2025—2026) 數(shù)據(jù)來源,各公司年報,10-k SEC filing。繪圖:Codebuddy


循環(huán)融資與影子信貸


產(chǎn)業(yè)鏈風險向中游模型廠商集中,而部分中游的模型廠商與上游硬件企業(yè)玩起循環(huán)融資(circular financing),讓人看不透到底是技術(shù)驅(qū)動的真實增長,還是資本自循環(huán)支撐的估值游戲。


例如OpenAI與英偉達、甲骨文組建的“AI永動機”,先由Open AI接受英偉達戰(zhàn)略投資(原本承諾投資1000億美元,后轉(zhuǎn)為OpenAI新一輪融資的參與者,投資額也大幅縮減),再由OpenAI用融得資金向甲骨文購買云服務(兩家簽署為期5年總價值約 3000億美元的算力購買合同),最后甲骨文把OpenAI的付款承諾用于增信,發(fā)債融資向英偉達購買GPU用于算力中心建設(shè),完成資金閉環(huán)。每一步似乎都有合理的商業(yè)邏輯,但每一步都讓人覺得過于“超前”。


OpenAI的算力采購框架加總起來已突破1萬億美元,與其當下330億美元的年化營收(截至2026年5月ARR)不匹配,完全是基于對未來高增長的預期26。一旦下游token終端消費不能帶來模型廠商收入的指數(shù)級增長,“承諾”就會變成“泡沫”。


而token終端消費的預期似乎并不樂觀,據(jù)Bain & Company的測算,要消化掉到2030年新增的200GW算力,終端消費需要創(chuàng)造出每年約2萬億美元的新增營收。但即便算上AI帶來的成本節(jié)約,仍有約8000億美元的缺口12。


這樣的循環(huán)融資游戲在世紀之交的互聯(lián)網(wǎng)泡沫時代也出現(xiàn)過,但今天的估值泡沫有一半藏在不透明的私人信貸(private credit)市場里,更難確切掌握潛在風險。美聯(lián)儲加息抬高初創(chuàng)企業(yè)、杠桿收購等高風險債券市場利息,銀行在巴塞爾協(xié)議要求下不得不退出這一市場,為私募機構(gòu)留下空間,最終催生出一個規(guī)模約3萬億美元的美國私人信貸市場。


Apollo、Ares、Blue Owl、KKR、Blackstone等資管機構(gòu)用BDC(商業(yè)發(fā)展公司)和直接貸款為數(shù)據(jù)中心建設(shè)提供20-30年期的杠桿融資。這些貸款往往是通過私下談判達成,用模型來定價的(mark-to-model),可能出現(xiàn)期限錯配(為LLM這樣按月迭代的技術(shù)匹配未來30年現(xiàn)金流),同時因模型廠商缺現(xiàn)金,因此往往是實物支付利息(PIK,利息直接滾入本金),風險疊加且不易覺察。


國際清算銀行的一份報告講到,目前在股權(quán)一級和二級市場已經(jīng)把AI產(chǎn)業(yè)鏈的上行空間充分定價,但債務市場還沒把下行風險定價進去25。一旦下游需求釋放緩慢,營收不及預期,循環(huán)融資的估值邏輯將瓦解(股權(quán)壓縮),私人信貸里的模型被迫重估(信貸減值),泡沫破裂、股債雙殺的風險驟增。


資源饑渴擠壓其他需求


Token消耗催生的算力擴張,算力中心對水、電等資源極度饑渴,往往在短期內(nèi)制造出巨大的供給缺口,對所在地的民生用水用電產(chǎn)生擠壓效應。


美國弗吉尼亞州北部的數(shù)據(jù)中心巷(Data Center Alley)集中了全球密度最高的數(shù)據(jù)中心集群,承載了約70%的全球互聯(lián)網(wǎng)流量。由于地方電網(wǎng)容量被科技公司用長期躉售協(xié)議提前鎖定,居民和傳統(tǒng)商業(yè)的能源配額被嚴重壓縮。


據(jù)弗吉尼亞州聯(lián)合立法審計與審查委員會(JLARC)2024年12月發(fā)布的報告,數(shù)據(jù)中心的耗電量已經(jīng)超過了弗吉尼亞州最大核電站發(fā)電量的兩倍以上,僅滿足勞登縣(Loudoun County)已規(guī)劃或在建數(shù)據(jù)中心的能源需求,就需要在2030年前向電網(wǎng)增加相當于數(shù)座核電站的發(fā)電能力。


數(shù)據(jù)中心對高壓輸電線路和清潔能源的瘋狂搶購,迫使地方公用事業(yè)公司斥巨資升級電網(wǎng)。Dominion Energy計劃在未來十五年內(nèi)投資數(shù)十億美元用于電網(wǎng)擴容。這筆巨額基建成本最終將以電網(wǎng)維護費、容量費用等形式攤派到居民月度賬單上。


Dominion服務區(qū)域內(nèi)的容量拍賣價格已從29美元/MW-天飆升至444美元/MW-天,漲幅超過1400%,直接反映了電網(wǎng)發(fā)電和輸電容量的嚴重稀缺24。皮德蒙特環(huán)境委員會(PEC)對Dominion Energy綜合資源計劃(IRP)的分析顯示在該計劃覆蓋期內(nèi),普通居民的電費賬單可能翻倍。


算力擴張對日常需求的擠出效應不僅限于弗吉尼亞,愛爾蘭都柏林、新加坡裕廊、我國貴州等全球主要算力節(jié)點都曾經(jīng)歷過類似矛盾。從這個意義上說,token不經(jīng)濟不僅存在于數(shù)字世界,在現(xiàn)實生活中也投下長長的陰影。


五、尋找Token價值方程式


Token是智能時代的最基本的生產(chǎn)要素之一。與其他所有生產(chǎn)要素如土地、數(shù)據(jù)、資本、人力一樣,只要存在資源錯配、要素浪費,就必然會有所謂“不經(jīng)濟”的存在。從這個意義上說,token不經(jīng)濟不會只是AI產(chǎn)業(yè)鏈爆發(fā)初期的暫時現(xiàn)象,而是與token經(jīng)濟并存,貫穿在智能經(jīng)濟發(fā)展的始終。在具體的當下,token經(jīng)濟尚未完全展現(xiàn),因此token不經(jīng)濟相對較為突出。


始終存在并不意味著要放任自流,可以從供給和需求兩端施力,降低token不經(jīng)濟,強化token經(jīng)濟,讓技術(shù)的發(fā)展真正轉(zhuǎn)化為實在的經(jīng)濟價值。供給側(cè)可以通過精細化技術(shù)手段降低單位token成本,堵住跑冒滴漏,防止風險擴散;需求側(cè)可以通過不斷發(fā)掘新的應用場景讓 token花出價值來。當供給端的成本下行曲線與需求端的價值上行曲線形成交叉,token經(jīng)濟和不經(jīng)濟互相抵消后的凈收益便可由負轉(zhuǎn)正。


技術(shù)面的精細化變革


上下文緩存與語義壓縮。上下文緩存(Context Caching)已經(jīng)成為模型廠商的通用做法,當多智能體流水線頻繁命中歷史緩存時,輸入token的計費大幅壓減。但這一做法也有局限性,在復雜企業(yè)級部署中,由于Agent路徑高度分叉導致的緩存色散失效,實際成本節(jié)省的效果相對有限。


更根本的解法在于上下文壓縮,不是簡單地滑動截斷歷史信息,而是進行語義層面的主動壓縮,保留關(guān)鍵指令和推理鏈路,去掉重復與冗余。這種語義上下文壓縮(Semantic Context Compression)能夠在保護指令遵循率的同時,顯著減少輸入Token的消耗。


技能優(yōu)化與減法思維。Gao et al.,(2026)的SkillReducer研究提供了技能優(yōu)化的兩條路徑。一是描述壓縮,為缺少路由描述的技能補充精簡信息,壓縮冗余的背景解釋和示例;二是漸進式加載,不一次性把完整技能塞入上下文,而是按需加載,可實現(xiàn)39%的技能體壓縮5。


兩者疊加后,在大幅壓減技能調(diào)用的token消耗的同時,模型功能質(zhì)量反而提升2.8%。從中可以看出,Agent技能調(diào)用不是越多越好,必要時做減法的收益要遠大于做加法。減少上下文中的無效信息,不僅可以降低token消耗,還能提升模型輸出的準確性。Less is more在此處不僅符合代碼之美,也讓token更經(jīng)濟。


模型路由與任務分流。大模型殺雞用牛刀,是token浪費的重要原因之一。按任務復雜度做自適應模型路由(Model Routing),把簡單、高頻的子任務甩給具備特定領(lǐng)域能力的開源輕量模型,只在關(guān)鍵決策點才動用昂貴的Frontier模型。這樣分層調(diào)用,能大幅壓低單位任務的平均token成本,又不犧牲關(guān)鍵環(huán)節(jié)的質(zhì)量。


多Agent預算硬約束與主持人架構(gòu)。沒有分工、預算上限和明確停止條件的多Agent系統(tǒng),演變成馬拉松式的茶話會的概率大大增加。解決的路徑是在多智能體協(xié)同網(wǎng)絡(luò)中設(shè)計具備硬性預算約束(Hard Budget Constraints)與異步仲裁機制的主持人架構(gòu)。


Luo et al.,(2026)提出的蒙特卡洛樹搜索方法,在多智能體流程中加入中間步驟的工具驗證,保存候選狀態(tài),必要時回滾。可以將這種思路從推理層面提升到架構(gòu)層面,為每個子任務設(shè)定token預算上限,由主持人Agent監(jiān)控全局消耗,在預算耗盡前強制終止無效循環(huán)7。這不僅能防止財務失控,往往也會同時提升系統(tǒng)的整體效率。


商業(yè)面的價值錨定


Token治理與成本紀律。微軟限制Claude Code、Meta撤下token消耗排行榜,大廠已經(jīng)從對token消耗的單純鼓勵轉(zhuǎn)向強調(diào)token產(chǎn)出和成本紀律性1,2。配額、審批、模型路由、成本歸因、團隊賬單,未來這些措施大概率會成為企業(yè)AI治理的基本方式。


這是AI進入生產(chǎn)系統(tǒng)后的必經(jīng)階段,即便AI是促進創(chuàng)新和加速生產(chǎn)的有力工具,也必須把賬算清楚。用了多少token,產(chǎn)生了多少可驗證產(chǎn)出,造成多少返工,都要被計量。沒有計量就沒有管理,沒有上限就沒有紀律。真正先進的公司考核的不是用AI最多,而是用最少的token完成最多的工作。


配給制會成為常態(tài)。企業(yè)不會無限供給Token,而是像管理云計算資源一樣,設(shè)定預算池和審批流程。這種治理并不與技術(shù)創(chuàng)新對立,恰恰相反,配給制會倒逼架構(gòu)師設(shè)計更高效的Agent系統(tǒng),將成本約束內(nèi)化。


找到token大規(guī)模商業(yè)應用的現(xiàn)實場景。這是實現(xiàn)從token凈收益轉(zhuǎn)正的根本。編程和智能體架構(gòu)只是邁向token經(jīng)濟的一小步,尋找到可以產(chǎn)生巨大生產(chǎn)力躍遷的商業(yè)場景,是進入到token經(jīng)濟發(fā)展快車道、實現(xiàn)巨大經(jīng)濟價值創(chuàng)造的前提條件。目前在真實的商業(yè)場景中大規(guī)模應用智能體架構(gòu)并帶來巨大收益的案例仍然較少,且多為個案。能廣泛應用于其他企業(yè)、其他行業(yè)的通用性解決方案仍在醞釀中。


具身智能和數(shù)字孿生是拓展方向之一,但必須正視Sim-to-Real Gap帶來的非對稱驗證成本。更務實的路徑是在傳統(tǒng)行業(yè)中尋找具備弱確定性反饋的中間地帶,如輔助診斷中的影像篩查(有影像學標準可參照)、供應鏈中的需求預測(有歷史數(shù)據(jù)可回測)、法律領(lǐng)域中的合同初篩(有條款模板可比對)。


這些場景的驗證成本雖不如編譯器趨近于零,但遠低于純粹的物理世界驗證,有望成為token經(jīng)濟從數(shù)字沙盒走向真實世界的橋梁。OpenAI近期重新開始進行機器人研究,說明具身智能雖難,但始終無法繞開。


回歸ROI


任何所創(chuàng)造價值超過所花費成本的投入,無論技術(shù)多么先進,終將不可持續(xù)。Token不經(jīng)濟不是技術(shù)失敗,而是技術(shù)走向大規(guī)模生產(chǎn)時經(jīng)常遭遇的暫時困境。正如工業(yè)革命初期的蒸汽機,效率低下、煤耗驚人,但這并不能否定蒸汽機代表生產(chǎn)力發(fā)展的未來方向。通過不斷改良熱效率、拓展應用場景,蒸汽動力最終成為驅(qū)動第一階段工業(yè)革命的最根本力量。


今天的token和Agent架構(gòu)正如早期的蒸汽機,噪音大、油耗高,但在特定場景下已展現(xiàn)出遠超人力的潛力,其后續(xù)發(fā)展必然是一場接一場的從粗放到精細的技術(shù)革新,未來更有價值的Agent,不是思維鏈最復雜的Agent,而是用最少token把事做成的Agent。


當行業(yè)從以多為榮的炫技階段進入以精為貴的生產(chǎn)階段,當每一枚token的消耗都必須回答產(chǎn)出有何價值,token回歸ROI的金標準,智能體時代就找到了自己的價值方程式。


本文為騰訊研究院“寫作者的夏天”活動征文


參考文獻:

[1] Angelo, J. (2026, May 22). Microsoft reports expose AI’s cost problem: The tech is more expensive than paying human employees. Fortune.

[2] Morales, J. (2026, May 23). AI cost crisis hits tech giants as employee tokenmaxxing backfires. Tom’s Hardware.

[3] Semi Analysis. (2026, May). Anthropic revenue analysis: ARR reaches $44 billion. Semi Analysis.

[4] Salim, M., Latendresse, J., Khatoonabadi, S. H., & Shihab, E. (2026). Tokenomics: Quantifying where tokens are used in agentic software engineering. Proceedings of the Mining Software Repositories Conference (MSR).

[5] Gao, Y., Li, Z., Yuan, Y., Ji, Z., Ma, P., & Wang, S. (2026, March). SkillReducer: Optimizing LLM agent skills for token efficiency. arXiv preprint.

[6] Han, T., Zhang, Y., Song, W., Fang, C., Chen, Z., Sun, Y., & Hu, L. (2026, March). SWE-Skills-Bench: Do agent skills actually help in real-world software engineering? arXiv preprint.

[7] Luo, Z., et al.(2026, February). TabTracer: Monte Carlo tree search for complex table reasoning with large language models. arXiv preprint.

[8] Li, F.-F. (2025, November). From words to worlds: Spatial intelligence is AI’s next frontier.

[9] Butts, D. (2026, January 15). TSMC extends record quarter, profit jumps 35% on robust AI chip demand. CNBC.

[10] Microsoft Corporation. (2025–2026). Annual reports and 10-K SEC filings; Alphabet Inc. (2025–2026). Annual reports and 10-K SEC filings; Amazon.com, Inc. (2025–2026). Annual reports and 10-K SEC filings; Meta Platforms, Inc. (2025–2026). Annual reports and 10-K SEC filings.

[11] Muppidi, S. (2026, May 22). OpenAI financials detail Q1 margins and revenue trajectories. The Information.

[12] Bain & Company. (2025, September 23). $2 trillion in new revenue needed to fund AI’s scaling trend—Bain & Company’s 6th annual global technology report.

[13] Anthropic. (2026, April). Opus 4.7 breaking changes: Tokenizer update documentation.

[14] Finout. (2026, April). Anthropic Opus 4.7 tokenizer change: Enterprise prompt impact analysis. Finout.

[15] ClaudeCodeCamp. (2026, April). Opus 4.7 tokenizer: Seven file type comprehensive test results.

[16] Willison, S. (2026, April). Opus 4.7 tokenizer comparison via API. Simon Willison’s Blog.

[17] OpenAI. (2024, May). GPT-4o model card and o200k_base tokenizer release notes.

[18] A&O Shearman. (2023, February 15). A&O announces exclusive launch partnership with Harvey [Press release].

[19] 36氪. (2024, October 15). 1.5萬家律所排隊一年,獨角獸Harvey如何掀起法律AI革命?

[20] Aljalbout, E., Xing, J., Romero, A., et al.(2026). The reality gap in robotics: Challenges, solutions, and best practices. Annual Review of Control, Robotics, and Autonomous Systems, 9. arXiv:2510.20808

[21] OpenAI. (2018). Learning dexterous in-hand manipulation. arXiv:1808.00177.

[22] Vincent, J. (2021, June). OpenAI disbands its robotics team. VentureBeat.

[23] Moravec, H. (1988). Mind children: The future of robot and human intelligence. Harvard University Press.

[24] Jack Kemp Foundation. (2024, December). Report claims data centers could cause Virginia energy prices to rise 75 percent this decade.

[25] Aldasoro, I., Doerr, S., & Rees, D. (2026, January 7). Financing the AI boom: From cash flows to debt (BIS Bulletin No. 120). Bank for International Settlements.

[26] Sherwood News. (2026, May). Anthropic revenue surpasses OpenAI.


本文來自微信公眾號:騰訊研究院,作者:李剛

頻道: 金融財經(jīng)
本內(nèi)容由作者授權(quán)發(fā)布,觀點僅代表作者本人,不代表虎嗅立場。
如對本稿件有異議或投訴,請聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
莱阳市| 巧家县| 北票市| 宜章县| 冕宁县| 莱阳市| 深泽县| 承德市| 宜兰市| 邻水| 台中县| 峨山| 大渡口区| 浠水县| 翁牛特旗| 金昌市| 卫辉市| 察哈| 招远市| 荆州市| 阳曲县| 东明县| 普兰县| 磴口县| 新泰市| 镇坪县| 宁武县| 开平市| 白河县| 克东县| 新建县| 汉寿县| 双峰县| 成安县| 六安市| 信丰县| 嘉祥县| 宁蒗| 和硕县| 福海县| 板桥市|