久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

本文圍繞token范式的結(jié)構(gòu)性缺陷展開,討論大語(yǔ)言模型通往AGI的路徑迭代,梳理了學(xué)術(shù)界與產(chǎn)業(yè)界的全新探索及范式轉(zhuǎn)移影響。 ## 1. token范式存在通往AGI的結(jié)構(gòu)性天花板 人類語(yǔ)言是大腦為適配帶寬產(chǎn)生的有損壓縮協(xié)議,大腦原生認(rèn)知是連續(xù)高維活動(dòng),大量感官認(rèn)知從未被離散token編碼。當(dāng)前主流自回歸大模型僅在人類壓縮后的離散token序列上建模,只能模擬語(yǔ)言行為,無(wú)法觸及未編碼的認(rèn)知維度,這是其天生的結(jié)構(gòu)性天花板。2024年末OpenAI前首席科學(xué)家Ilya Sutskever稱「預(yù)訓(xùn)練即將終結(jié)」,2026年圖靈獎(jiǎng)得主Yann LeCun明確表示大語(yǔ)言模型路線錯(cuò)誤,二者均認(rèn)可當(dāng)前路徑存在天花板。 ## 2. 學(xué)術(shù)界已驗(yàn)證連續(xù)空間范式的可行性 2026年5月,MIT何愷明團(tuán)隊(duì)與字節(jié)跳動(dòng)Seed實(shí)驗(yàn)室?guī)缀跬瑫r(shí)發(fā)布論文,證明語(yǔ)言生成核心建??煞旁谶B續(xù)向量空間,僅最后一步映射回文本,打破「token是語(yǔ)言建模必要條件」的固有認(rèn)知。何愷明團(tuán)隊(duì)的ELF用Flow Matching完成生成,僅32個(gè)采樣步生成質(zhì)量就超過離散模型1024步結(jié)果,訓(xùn)練數(shù)據(jù)約450億token,僅為主流方法的十分之一。字節(jié)Seed團(tuán)隊(duì)的Cola DLM先將文本壓縮至語(yǔ)義潛空間再建模,20億參數(shù)對(duì)比同體量自回歸模型、千億參數(shù)LLaDA2.0,連續(xù)路線的scaling曲線健康有效。 ## 3. 全球科技界已開始下注新范式 Google從Gemini 1.0到3.1 Pro始終堅(jiān)持原生多模態(tài)統(tǒng)一,將所有模態(tài)映射到同一個(gè)連續(xù)向量空間,消弭模態(tài)邊界。OpenAI推進(jìn)多模態(tài)深度整合,暫時(shí)退出視頻生成賽道等待更高效架構(gòu)成熟;字節(jié)Seed團(tuán)隊(duì)的視頻生成模型Seedance已應(yīng)用連續(xù)潛空間架構(gòu),具備工業(yè)級(jí)驗(yàn)證的先天數(shù)據(jù)優(yōu)勢(shì)。Ilya Sutskever的SSI獲20億美元融資押注新范式,Yann LeCun離職Meta創(chuàng)辦AMI Labs,押注在連續(xù)空間建模世界因果規(guī)律的JEPA路線;Anthropicall聚焦文本推理與代碼,已實(shí)現(xiàn)Claude Code年化25億美元收入,但在范式演進(jìn)上積累了技術(shù)債。 ## 4. 范式轉(zhuǎn)移將重構(gòu)AI產(chǎn)業(yè)格局 如果核心計(jì)算全面遷移到連續(xù)空間,主打高質(zhì)量視頻離散編碼的相關(guān)公司將首當(dāng)其沖受到?jīng)_擊?!付嗄B(tài)能力」將成為基礎(chǔ)模型默認(rèn)配置,不再是差異化賣點(diǎn),模態(tài)橋接對(duì)齊的中間層生意也會(huì)失去存在基礎(chǔ)。當(dāng)前按token收費(fèi)的模式也會(huì)被重構(gòu),連續(xù)空間擴(kuò)散模型多為固定步數(shù)生成,輸出長(zhǎng)度與計(jì)算量脫鉤,token數(shù)不再是成本的真實(shí)度量。 ## 5. 連續(xù)空間范式只是通往AGI的第一步 token范式受限于人類語(yǔ)言的信息丟失,注定無(wú)法走到AGI,但推翻token范式也不直接等同于實(shí)現(xiàn)AGI。目前已驗(yàn)證的連續(xù)空間模型訓(xùn)練數(shù)據(jù)仍來自人類壓縮后的內(nèi)容,尚未解決新訓(xùn)練信號(hào)的來源問題。下一步模型若要突破邊界,大概率需要從主動(dòng)探索、環(huán)境交互反饋、遞歸自我改進(jìn)中獲取新訓(xùn)練信號(hào)。
“Token”必須死?
2026-05-25 13:19

“Token”必須死?

本文來自微信公眾號(hào):騰訊科技,作者:曉靜,編輯:徐青陽(yáng),題圖來自:AI 生成


“我語(yǔ)言的局限,即意味著我世界的局限?!?span id="fe2iclqy7" class="text-remarks" label="備注">( Die Grenzen meiner Sprache bedeuten die Grenzen meiner Welt. )


哲學(xué)家維特根斯坦在1921年寫下這句話時(shí),他談?wù)摰氖侨祟愓J(rèn)知的邊界。一百年后,這句話精確地描述了大語(yǔ)言模型面臨的結(jié)構(gòu)性困境,如果AI的“語(yǔ)言”就是離散token序列,那么它的“世界”永遠(yuǎn)被困在token能表達(dá)的范圍內(nèi)。


這也引出了一個(gè)老生常談的問題:大語(yǔ)言模型范式能走到AGI(通用人工智能)嗎?


2024年12月,OpenAI 前首席科學(xué)家Ilya Sutskever在NeurIPS發(fā)表主題演講,他說“預(yù)訓(xùn)練即將終結(jié)”。2026年3月,圖靈獎(jiǎng)得主Yann LeCun離開Meta創(chuàng)辦AMI Labs,直接宣判“大語(yǔ)言模型路線錯(cuò)了”。


兩位深度學(xué)習(xí)殿堂級(jí)的大師,一位選擇顛覆自己親手開啟的預(yù)訓(xùn)練時(shí)代,另一位選擇繼續(xù)踐行自己堅(jiān)守多年的世界模型路線,去賭“LLM的下一個(gè)時(shí)代”。


當(dāng)然絕對(duì)不是當(dāng)前的模型不好用或沒有商業(yè)價(jià)值,大模型的用戶數(shù)量及滲透率都在持續(xù)增長(zhǎng),產(chǎn)業(yè)價(jià)值會(huì)越來越大。但是從技術(shù)路徑來看,他們要表達(dá)的是:這條路有一個(gè)結(jié)構(gòu)性的天花板,這個(gè)天花板恰好卡在通往AGI(通用人工智能)的路上。


2026年5月,MIT何愷明團(tuán)隊(duì)和字節(jié)跳動(dòng)Seed實(shí)驗(yàn)室?guī)缀跬瑫r(shí)發(fā)布論文,給出了一個(gè)更明確的信號(hào):語(yǔ)言生成的核心建模過程不必始終發(fā)生在離散token空間中,也可以轉(zhuǎn)移到連續(xù)embedding或latent空間里完成,最后再映射回文本。


這是第一批來自工程實(shí)驗(yàn)的硬證據(jù),逐token預(yù)測(cè)可能是通向AGI路上的一個(gè)局部最優(yōu)解。但連續(xù)空間范式打開了另一條路,這條路的天花板也許更高。


圖:美國(guó)國(guó)家人工智能科學(xué)院院士,麻省理工學(xué)院電氣工程與計(jì)算機(jī)科學(xué)系副教授何愷明,圖片由AI生成


天花板在哪?


維特根斯坦的話可以這樣理解。


人類的離散語(yǔ)言不是思維的原生格式。大腦內(nèi)部的認(rèn)知活動(dòng)是連續(xù)的、并行的、高維的。比如人類想到一個(gè)蘋果時(shí),激活的不是“蘋果”兩個(gè)字的token,而是一大片感覺皮層的連續(xù)活動(dòng)模式,包括顏色、質(zhì)感、重量、咬下去的聲音。人之所以把這團(tuán)連續(xù)體驗(yàn)壓縮成“蘋果”這個(gè)離散符號(hào),純粹是因?yàn)槿祟惔竽X的帶寬逼你序列化。


人類語(yǔ)言是進(jìn)化設(shè)計(jì)的有損壓縮協(xié)議,它是跨腦傳輸?shù)墓こ掏讌f(xié)。


我們目前用到的主流的商業(yè)化大模型產(chǎn)品,底層都是自回歸架構(gòu)(預(yù)測(cè)下一個(gè)token)。


自回歸大模型做的事情是,在這個(gè)壓縮協(xié)議的輸出格式上建模。它無(wú)法理解“世界如何運(yùn)作”,它了解的是“人類選擇用什么符號(hào)序列來描述世界”。它們極其擅長(zhǎng)模擬人類的語(yǔ)言行為,但模擬語(yǔ)言行為和理解世界之間,差著一個(gè)認(rèn)識(shí)論的鴻溝。


比如身體感受,疼痛是怎樣的;空間直覺,知道怎么接住球但無(wú)法描述如何接住的;因果干預(yù)的具身反饋,比如如果“我把這個(gè)椅子推倒會(huì)怎樣”的直覺。這些隱藏在人類大腦中的“感覺”,從未被任何人類語(yǔ)言編碼過。所以它們從未進(jìn)入訓(xùn)練數(shù)據(jù),在token序列上做任何建模,無(wú)論參數(shù)多大、數(shù)據(jù)多多,都觸及不到這些維度。


這就是token范式的天花板。


“逃逸”實(shí)驗(yàn)


從token空間逃逸的第一批實(shí)驗(yàn)正在發(fā)生。


何愷明團(tuán)隊(duì)的ELF(Embedded Language Flows,嵌入式語(yǔ)言流)做了一件反直覺的事:把文字生成的全過程留在連續(xù)向量空間里完成,只在最后一步,真的只有最后一步,才把連續(xù)向量投影回人類可讀的文字。它用Flow Matching(一種2022年由Yaron Lipman等人提出的連續(xù)正則化流框架)從噪聲出發(fā),沿學(xué)習(xí)到的速度場(chǎng)平滑演化到目標(biāo)嵌入。32個(gè)采樣步,生成質(zhì)量超過離散模型用1024步的結(jié)果。訓(xùn)練數(shù)據(jù)約450億token,只有主流方法的十分之一。


圖:ELF僅用32步采樣即超越MDLM、Duo等離散模型1024步的生成質(zhì)量,且未使用蒸餾加速。模型參數(shù)105M,訓(xùn)練數(shù)據(jù)約為同類方法的十分之一。


四天后發(fā)布的Cola DLM(字節(jié)Seed團(tuán)隊(duì)):先用Text VAE把語(yǔ)言壓縮成更深層的語(yǔ)義潛空間,再在這個(gè)純語(yǔ)義空間里用Flow Matching建模全局先驗(yàn),最后才解碼回文字。論文明確說:擴(kuò)散過程做的是“潛在先驗(yàn)運(yùn)輸”,不是“token級(jí)別的觀測(cè)恢復(fù)”。20億參數(shù),8個(gè)基準(zhǔn),與同體量自回歸模型和已經(jīng)scale到1000億參數(shù)的LLaDA2.0嚴(yán)格對(duì)比,連續(xù)路線的scaling曲線是健康的。


圖:Cola DLM 整體架構(gòu)圖


兩篇論文的核心都在表達(dá),token不是語(yǔ)言建模的必要條件。連續(xù)空間可以做得更好、更快、更省。


圖:自回歸模型逐token生成,每一步不可逆選擇一個(gè)離散符號(hào),已選token鎖定后續(xù)所有可能性。


圖:連續(xù)流模型從噪聲出發(fā),沿速度場(chǎng)平滑演化到目標(biāo)嵌入,全程可逆可調(diào),僅在終點(diǎn)映射回文字,ELF論文。


AI巨頭也在質(zhì)疑“Tokenization”?


這兩篇論文只是學(xué)術(shù)信號(hào),科技巨頭也在用真金白銀下注。


Google是最早、也最堅(jiān)定地走向“原生多模態(tài)統(tǒng)一”的巨頭。Gemini的技術(shù)報(bào)告明確寫道:它是“from the ground up”訓(xùn)練的多模態(tài)模型,“not by bolting a frozen vision encoder onto a text decoder”(不是把凍結(jié)的視覺編碼器接到文本解碼器上)。


文本、圖像、音頻、視頻在同一個(gè)模型里交錯(cuò)訓(xùn)練,共享注意力層。這個(gè)設(shè)計(jì)哲學(xué)從2023年12月的Gemini 1.0延續(xù)到了2026年的3.1 Pro。2026年3月發(fā)布的Gemini Embedding 2把這件事推到了表征層面:一個(gè)embedding模型,原生接受文本、圖像、文檔、音頻、視頻輸入,全部映射到同一個(gè)3072維向量空間。


Google在做的事情,本質(zhì)上就是為所有模態(tài)建造一個(gè)統(tǒng)一的連續(xù)坐標(biāo)系,模態(tài)之間的邊界在這個(gè)坐標(biāo)系里不存在。


OpenAI走了一條更曲折的路。GPT-4V時(shí)代的架構(gòu)是拼接式的,由一個(gè)視覺編碼器外掛到語(yǔ)言模型上,跨模態(tài)信息需要經(jīng)過額外的投影層傳遞。GPT-5系列公開強(qiáng)化了多模態(tài)推理能力,但OpenAI并未披露足夠細(xì)的架構(gòu)信息。可以確定的是,OpenAI正在把文本、視覺、視頻等能力更深地整合進(jìn)核心模型體驗(yàn);不能確定的是,它是否已經(jīng)完成了統(tǒng)一Transformer層面的架構(gòu)切換。


根據(jù)外媒報(bào)道Sora運(yùn)營(yíng)期間“被員工視作拖累核心算力的吞金獸”。OpenAI選擇砍掉視頻應(yīng)用,把算力集中到GPT-5.5的Agent架構(gòu)和Codex代碼工具上。這也可以猜測(cè):OpenAI認(rèn)同多模態(tài)統(tǒng)一的方向,但在視頻生成這個(gè)具體維度上暫時(shí)退場(chǎng),等待更高效的架構(gòu)方案成熟后重新進(jìn)入。


字節(jié)跳動(dòng)Seed團(tuán)隊(duì)在Cola DLM論文的最后一句話是“為離散文本與連續(xù)模態(tài)的統(tǒng)一建模指出了一條具體路徑”。Seed團(tuán)隊(duì)透露視頻生成模型Seedance系列已經(jīng)在使用類似的連續(xù)潛空間架構(gòu),獨(dú)特優(yōu)勢(shì)在于:它同時(shí)擁有抖音/TikTok級(jí)別的海量視頻數(shù)據(jù)和前沿模型研究能力。如果連續(xù)統(tǒng)一空間確實(shí)是下一代架構(gòu)的答案,字節(jié)是最有條件最先在工業(yè)規(guī)模驗(yàn)證它的公司。


Anthropic的選擇是所有巨頭中最獨(dú)特的,它在刻意回避多模態(tài)生成。截至2026年5月,Claude沒有原生圖像生成能力,沒有視頻理解,沒有音頻處理。2026年4月發(fā)布的Claude Design生成的是結(jié)構(gòu)化設(shè)計(jì)產(chǎn)出物,原型圖、線框圖、幻燈片,而不是像素級(jí)圖像。


Anthropic把幾乎所有資源壓在文本推理和代碼執(zhí)行上。這個(gè)策略在商業(yè)上正在被驗(yàn)證:Claude Code年化收入25億美元,2026年5月Anthropic隱含估值沖到1.2萬(wàn)億美元(36氪報(bào)道),主要靠的是企業(yè)客戶為推理和代碼能力付費(fèi)。但從范式演進(jìn)的角度看,這是一個(gè)在積累技術(shù)債的選擇。如果兩到三年后競(jìng)爭(zhēng)的核心轉(zhuǎn)向“誰(shuí)能在統(tǒng)一連續(xù)空間里同時(shí)理解和生成所有模態(tài)”,Anthropic就很被動(dòng)。


在巨頭之外,兩個(gè)最值得關(guān)注的獨(dú)立押注來自Ilya Sutskever和Yann LeCun。Sutskever創(chuàng)辦的SSI(Safe Superintelligence)在2025年5月完成20億美元融資,估值320億美元——沒有產(chǎn)品、沒有論文、沒有任何公開技術(shù)細(xì)節(jié)。投資人買的純粹是他對(duì)“下一個(gè)范式”的判斷力。他在NeurIPS 2024所說的“預(yù)訓(xùn)練即將終結(jié)”,指的是靠堆數(shù)據(jù)預(yù)測(cè)next token的方式已到收益遞減階段,下一步需要的是質(zhì)變。


LeCun2026年3月離開工作超過十年的Meta,創(chuàng)辦AMI Labs,融資10.3億美元,估值35億。他的JEPA路線和ELF/Cola DLM哲學(xué)相通,都是離開token空間、在連續(xù)表征空間建模,但方向不同。JEPA不追求生成逼真的輸出,強(qiáng)調(diào)在抽象空間里預(yù)測(cè)事物演化的物理后果。


LeCun在5月的訪談中說:“自回歸機(jī)制逐個(gè)預(yù)測(cè)token,本質(zhì)是在字符級(jí)別做統(tǒng)計(jì)復(fù)現(xiàn),不是在建模世界的因果規(guī)律。參數(shù)量的增加解決不了這個(gè)結(jié)構(gòu)性缺陷。”他認(rèn)為,生成只是模擬,預(yù)測(cè)才是理解。


如果token范式衰退,誰(shuí)會(huì)沒有未來?


做視頻tokenizer的公司首當(dāng)其沖。VQ-VAE、MAGVIT、OmniTokenizer,這些工作的核心價(jià)值主張是“高質(zhì)量視頻離散編碼”。英偉達(dá)的Cosmos Tokenizer、微軟的VidTok,大廠也在競(jìng)爭(zhēng)。如果語(yǔ)言生成都開始把核心計(jì)算遷移到連續(xù)空間,那么視頻這類天然連續(xù)的數(shù)據(jù),更沒有理由被默認(rèn)壓成離散token序列。


真正的問題會(huì)變成:什么樣的視覺表征既能高效壓縮,又能保留足夠的物理、時(shí)序和語(yǔ)義結(jié)構(gòu)。


然后是“多模態(tài)”這個(gè)產(chǎn)品敘事本身。當(dāng)所有模態(tài)共享一個(gè)連續(xù)空間時(shí),“多模態(tài)能力”變成默認(rèn)配置,不再是差異化賣點(diǎn)。就像今天沒人把“支持中文和英文”當(dāng)成一個(gè)AI產(chǎn)品的核心競(jìng)爭(zhēng)力。做模態(tài)橋接和對(duì)齊的中間層產(chǎn)品也面臨同樣的問題——如果基礎(chǔ)模型原生在統(tǒng)一空間運(yùn)行,文本和視覺之間不存在需要被彌補(bǔ)的“鴻溝”,彌補(bǔ)鴻溝的生意就沒有理由存在。


再往下游推一步,今天整個(gè)行業(yè)按 token 收費(fèi),是因?yàn)樽曰貧w模型的成本結(jié)構(gòu)極其透明,輸入輸出的token數(shù)直接可以算出算力消耗。


但如果核心計(jì)算遷移到連續(xù)空間,擴(kuò)散模型可能用固定步數(shù)生成任意長(zhǎng)度文本,輸出長(zhǎng)度與計(jì)算量脫鉤,“消耗了多少token”就不再是成本的真實(shí)度量。


只是,AI的發(fā)展太快,衡量AI商業(yè)價(jià)值的真正定價(jià)體系還沒固定下來,下一個(gè)范式可能就會(huì)發(fā)生。而具體會(huì)是多快,沒有人能夠預(yù)測(cè)。


大語(yǔ)言模型能走到AGI嗎?


回到開頭的問題,大語(yǔ)言模型范式能走到AGI嗎?


從token范式本身的結(jié)構(gòu)來看,不能,它的訓(xùn)練信號(hào)有信息論上的硬上限。人類語(yǔ)言作為有損壓縮協(xié)議,在編碼時(shí)就不可逆地丟棄了世界的大量結(jié)構(gòu)。在壓縮產(chǎn)物上做任何建模,都還原不了被丟棄的維度。


但“殺死tokenization”也不等于到達(dá)AGI。ELF和Cola DLM證明了連續(xù)空間更高效、更優(yōu)雅,但它們的訓(xùn)練數(shù)據(jù)仍然來自人類產(chǎn)出的內(nèi)容,一個(gè)有損壓縮后的世界。LeCun看到了這一層,所以他押注“能預(yù)測(cè)物理后果的世界模型”。Sutskever大概也看到了。


但這也許只是第一步,如果模型不再受困于人類語(yǔ)言的壓縮格式時(shí),它需要的新訓(xùn)練信號(hào)從哪里來?


答案大概不在更多的數(shù)據(jù)里,而在某種主動(dòng)探索中——在世界中行動(dòng),承受后果,從反饋中學(xué)習(xí)。也是現(xiàn)在關(guān)注度十分高的RSI, AI 的遞歸自我改進(jìn)(Recursive Self-Improvement)。這也將是我們?cè)诤竺娴奈恼轮?,繼續(xù)討論的主題。


本文來自微信公眾號(hào):騰訊科技,作者:曉靜,編輯:徐青陽(yáng)

AI創(chuàng)投日?qǐng)?bào)頻道: 前沿科技
本內(nèi)容由作者授權(quán)發(fā)布,觀點(diǎn)僅代表作者本人,不代表虎嗅立場(chǎng)。
如對(duì)本稿件有異議或投訴,請(qǐng)聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
故城县| 泾源县| 三穗县| 冀州市| 陆河县| 龙岩市| 常山县| 酒泉市| 鹤峰县| 满洲里市| 河北省| 东莞市| 海盐县| 正镶白旗| 北流市| 肥乡县| 德兴市| 静宁县| 故城县| 禄丰县| 西吉县| 施秉县| 佛坪县| 化隆| 井陉县| 秦安县| 桃园市| 额济纳旗| 义乌市| 西乡县| 七台河市| 大冶市| 富锦市| 贵溪市| 霞浦县| 遵义县| 长沙市| 呼图壁县| 宝鸡市| 信阳市| 禹城市|