本文來自微信公眾號: 格隆 ,作者:萬連山
Gemini似乎漸漸變成了大號豆包。
昨夜,萬眾期待的Gemini 3.5 Pro沒來,谷歌卻端上來三道配菜。
Gemini 3.5 Flash-Lite。
定位高吞吐、低延遲,速度跑到每秒350個token,輸入0.3美元、輸出2.5美元/百萬token。
跟3月發(fā)布的3.1 Flash-Lite比,Terminal-Bench 2.1從31%上升到54%,長文本理解基準GDM-MRCR v2從60.1%拉到72.2%,真實任務執(zhí)行力GDPval-AA v2更是從642飆到1140。
跑分非常好看。
Gemini 3.5 Flash Cyber。
據DeepMind拿Chrome的V8 JavaScript引擎當靶子測試,用“一個問題連問5遍取交集”的多智能體套路,Cyber找出了55個獨立確認漏洞,比3.5 Flash(47個)和Claude Opus 4.6(36個)都要多,其中10個是別的模型完全沒揪出來的。
不過這款目前只對政府機構和“受信任合作伙伴”開放試點,普通用戶用不了。
Gemini 3.6 Flash。
相比3.5 Flash,在Artificial Analysis Index測量下少用17%的輸出token,在DeepSWE基準上,token消耗甚至能省到65%。
硬指標上也往上走了一截:SWE-Bench Pro從55.1%漲到58.7%,MLE-Bench從49.7%提升到63.9%,OSWorld-Verified從78.4%提到83.0%,GDPval-AA v2從1349漲到1421。
價格也降了一些:每百萬輸出token從9美元砍到7.5美元,輸入維持1.5美元不變,還帶上下文緩存讀?。?.15美元/百萬token)。

總之,聽上去感覺都還不錯。
但是,三者的風評卻完全不對稱。
Flash-Lite被公認是真升級,Cyber走專業(yè)路線沒什么爭議,本該挑大梁的3.6 Flash,卻被大量差評淹沒。
這個評價有些過分了。
但有一點不得不承認:谷歌正被架在火上烤。
01
這次雷聲大雨點小的發(fā)布會,是當下AI競賽的一個縮影。
行業(yè)確實形成了新的共識:重心從“卷參數、卷跑分”轉向“卷效率、卷單位成本”,用更少的算力干等量甚至更多的活。
3.6 Flash和Flash-Lite主打的token效率提升、推理步驟精簡,本質上是幾乎所有大廠都在做的事。
Flash Cyber針對具體高價值場景(比如網絡安全漏洞挖掘)單獨調優(yōu)、用多智能體協(xié)作把成本攤薄。
這種打法部署更快、成本更低,未來大概率也會被更多企業(yè)復制。
但也不能因為這樣,就完全忽視了模型能力的升級。
所以,3.6 Flash到底是什么鬼?
為了強行降低輸出Token的成本,谷歌極大概率在后訓練和RLHF階段,粗暴地剪枝了模型生成冗余結構標簽的傾向。
結果就是,模型直接省略了必要的包裹層和樣式重置代碼。
你以為它變快了,其實是變傻了。
據昨夜多位知名開發(fā)者的連夜測試數據,3.6 Flash在生成帶有超過3個層級嵌套的React/Vue組件時,標簽閉合錯誤率高達42%。
Artificial Analysis給出的智能指數上,3.6 Flash只拿了50分,跟3.5 Flash完全打平,排在Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra一大票對手后面;反倒是Flash-Lite漲了11分。
雖然價格降了一點,但有人算了賬,它每token的使用成本比GPT-5.6 Sol medium還貴,智能程度卻更低。
flash模型的特點就是性價比,你這又貴又笨是怎么回事?
這就很尷尬。

按理說,谷歌這種巨頭,內部測試流程極其嚴格,為什么會發(fā)布這樣一個有明顯缺陷的新模型?
最核心的原因,谷歌官方可能已經說出來了:
我們已經開始了迄今為止最雄心勃勃的預訓練任務,Gemini 4。
翻譯一下就是,算力全部調去跑Gemini 4的預訓練了。
彭博社援爆料的信息,3.5 Pro內部測試沒能達到既定目標,短板主要集中在編碼能力上,遲遲達不到發(fā)布標準。
谷歌6月底曾專門針對性更新訓練數據想補齊編碼短板,結果效果不盡如人意。
而與此同時,對手一點沒閑著:OpenAI已經發(fā)布GPT-5.5并開始推送GPT-5.6,還官宣給付費用戶重置使用額度;Anthropic則接連推出Claude Opus 4.8、Claude Sonnet 5,并擴大了Fable 5的開放范圍。
自家旗艦遲遲不來,對手卻接連上新?lián)屨际袌?,谷歌總得拿出點動靜證明自己沒有躺平。
只能把原本只是測試分支的3.6 Flash和Lite版本拿出來湊數。

其次,財報的壓力。
谷歌今晚就要交出Q2財報,市場預期營收1169億美元、每股收益2.90美元,Cloud業(yè)務增速預計在64%左右。
真正左右市場方向的,是云業(yè)務增長曲線和管理層有沒有給3.5 Pro一個更靠譜的時間表,而不是用戶對3.6 Flash的吐槽熱度。
之前的Grok 4.5發(fā)布時,我們已經討論過。
目前,AI行業(yè)的敘事邏輯已經發(fā)生了巨大變化。
模型有多強不再是唯一的指標,更重要的是能不能賺錢。
谷歌云的銷售團隊,需要更便宜、速度更快、Token消耗更少的模型,去跟微軟Azure和AWS打價格戰(zhàn)。
為了實現降本目標,研發(fā)團隊被迫使用了極端的多專家混合網絡路由剪枝策略和高損的KV Cache壓縮。
結果就是,前端生成和空間推理這種需要高度注意力機制的全量在線復雜任務,成為了成本優(yōu)化的犧牲品。
所以,盡管在用戶社區(qū)上罵聲一片,但摩根士丹利、摩根大通、高盛等機構依然維持看多評級,理由是谷歌在算力基建、Cloud和Workspace分發(fā)渠道上的護城河依然堅固。
昨夜,谷歌股價僅僅微跌1.38%,也遠不及前幾周因人才和跳票消息造成的暴跌。
目前的真實情況是:谷歌不是沒有牌可打了,而是打法太亂。
一手基建和分發(fā)的好牌,但旗艦遲遲不到位、核心人才不斷被挖角、發(fā)布節(jié)奏被對手牽著鼻子走的窘境,湊在一起顯得格外擰巴。
02
Gemini 3.6flash這次發(fā)布即被群嘲,只是谷歌今年AI故事里的一個小插曲。
它的大企業(yè)病癥狀,已經明顯成為競爭中的障礙。
至少表現在兩個方面。
第一,內斗不斷。
雖然早在幾年前谷歌就將Google Brain和DeepMind合并為了Google DeepMind,但強扭的瓜根本不甜。
3.6flash就是個典型的例子。
模型底層優(yōu)秀的Token吞吐能力,顯然是底層工程團隊(原Brain系)優(yōu)化的功勞;而極度糟糕的視覺-空間融合,暴露了多模態(tài)訓練團隊在資源爭奪上的失敗。
負責模型基座的團隊和負責多模態(tài)視覺微調的團隊,似乎根本沒有好好溝通。
導致視覺Encoder傳過來的特征向量,跟語言大模型的輸入空間之間,存在著巨大的語義鴻溝。
更糟糕的是,沒人愿意為之負責,所有人都只想完成任務趕緊交差。

谷歌AI團隊結構
第二,創(chuàng)新者窘境。
即我們常說的船大難掉頭。
歸根結底,谷歌所有的AI動作,都籠罩在保護其萬億市值基石——搜索廣告業(yè)務的陰影下。
比如,為什么Gemini始終在Agent操作UI這件事上顯得畏手畏腳?
因為如果一個AI能夠完美地理解網頁結構,幫你買東西、幫你查資料,誰還會去看谷歌搜索結果頁面上的廣告?
這根本就不是技術上的問題,而是戰(zhàn)略上無法讓AI接管UI。
Google Search一年創(chuàng)造數千億美元廣告收入。
任何AI戰(zhàn)略都必須考慮,“如果AI替代搜索,會不會砍掉自己的利潤?”
這是非?,F實的問題。
谷歌確實需要AI成為一個強大的輔助工具(所以它推GitHub Copilot接入、推文檔處理工具),但它更恐懼能夠完全替代用戶瀏覽網頁的Agent。
過去,谷歌擁有搜索入口、Android入口、瀏覽器入口、YouTube入口、云入口,是全球互聯(lián)網最豪華的生態(tài)。
如果AI真的成為下一代入口,谷歌最大的恐懼不是輸掉一個模型,而是輸掉下一代計算入口。
所以我們最終看到的結果:
谷歌明明擁有最頂級的研究能力,商業(yè)執(zhí)行速度卻總是慢一拍。
可惜,時間不等人。
此時此刻,OpenAI在下注,Anthropic在下注,開源社區(qū)在下注,中國AI公司也在下注……
幾年之內,互聯(lián)網行業(yè)很可能迎來前所未有的重新洗牌。
而谷歌能不能完成從“搜索巨頭”到“AI基礎設施巨頭”的轉型,將決定它未來十年的生態(tài)位。
