久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

本文解析騰訊混元Hy3正式版,肯定其補(bǔ)了騰訊大模型短板,同時指出其仍未整合騰訊生態(tài)優(yōu)勢,AI下半場挑戰(zhàn)仍存。 ## 1. 騰訊混元Hy3:上桌補(bǔ)短板,無代際突破 7月6日,姚順雨空降騰訊主導(dǎo)混元架構(gòu)重建201天后,推出了其治下首款正式大模型騰訊混元Hy3。這款總參數(shù)295B、僅激活21B參數(shù)的MoE模型,走工程調(diào)優(yōu)路線,官方稱性能比肩2~5倍參數(shù)的旗艦?zāi)P?,搭配開源權(quán)重、極低API定價與全產(chǎn)品線接入,主打高性價比。 該模型未做底層架構(gòu)改動,僅靠后訓(xùn)練數(shù)據(jù)提質(zhì)、RL算力擴(kuò)容實(shí)現(xiàn)提升,參數(shù)規(guī)模僅和DeepSeek V4 Flash、MiniMax M3同梯隊(duì),遠(yuǎn)低于行業(yè)第一梯隊(duì)普遍的萬億級門檻;256K上下文窗口夠用,但無法適配企業(yè)剛需的超長源碼、全量知識庫等硬核場景。 ## 2. 實(shí)用主義路線導(dǎo)致偏科:細(xì)分優(yōu)勢突出,核心能力不足 Hy3走實(shí)用主義路線,能力呈現(xiàn)鮮明偏科特征:長板集中在信息檢索與單工具執(zhí)行,BrowseComp基準(zhǔn)拿84.2分,幾乎追平GPT-5.5的84.4分;ClawEval基準(zhǔn)得68.5分,僅次于Claude Opus 4.8,能力高度貼合日常辦公高頻需求。 在決定大模型能力上限的復(fù)雜推理、硬核代碼、多工具協(xié)同領(lǐng)域,Hy3差距明顯:核心代碼基準(zhǔn)SWE-bench Pro得57.9分,大幅落后于Claude Opus 4.8的69.2分與GLM 5.2的62.1分;MathArena Apex數(shù)學(xué)競賽基準(zhǔn)得38.7分,不到GPT-5.5的一半;MCP Atlas多工具調(diào)用基準(zhǔn)僅排倒數(shù)第一,復(fù)雜多工具任務(wù)容錯能力不足。 ## 3. 場景接入多點(diǎn)開花,尚未串聯(lián)騰訊核心生態(tài) Hy3上線后已有WorkBuddy、QQ瀏覽器、微信讀書等數(shù)十款騰訊產(chǎn)品接入,辦公任務(wù)成功率從72%升至90%,幻覺率從12.5%降至5.4%,高頻場景Token消耗比GLM 5.2節(jié)省近50%,環(huán)比進(jìn)步明顯,但環(huán)比增速不代表行業(yè)站位,劣勢場景的高 Token 消耗會對沖其價格優(yōu)勢。 騰訊做AI的核心優(yōu)勢是微信14.32億月活帶來的獨(dú)一無二的場景與context優(yōu)勢,但因隱私紅線,微信數(shù)據(jù)無法用于模型訓(xùn)練;且微信原生AI助手目前仍以自研WeLM為主,混元尚未成為騰訊內(nèi)部統(tǒng)一AI底座,在金融、游戲等垂直賽道也僅做了點(diǎn)狀功能升級,未形成場景壁壘。 ## 4. 性價比路線空間有限,騰訊仍未亮出真正底牌 Hy3是姚順雨“用真實(shí)產(chǎn)品反饋迭代模型”理念的具象成果,依托中等參數(shù)量+極致推理優(yōu)化的差異化路線,搭配1元/百萬Tokens輸入、4元/百萬Tokens輸出的低價與Apache 2.0開源協(xié)議,對中小企業(yè)吸引力很強(qiáng),preview版上線后日均Token消耗量已增長20倍。 但性價比賽道目前已十分擁擠,DeepSeek、智譜等廠商均推出同類產(chǎn)品,同時頂級大模型持續(xù)降價擠壓中高端模型生存空間,性價比路線很難支撐騰訊的AI戰(zhàn)略野心。 整體來看,Hy3上線讓騰訊擁有了合格的主流大模型,終于摸到了AI下半場的門檻,但騰訊AI的核心挑戰(zhàn)是把場景生態(tài)優(yōu)勢轉(zhuǎn)化為AI競爭優(yōu)勢,目前仍未到亮底牌的時刻。
騰訊終于上桌了?
原創(chuàng)2026-07-09 06:50

騰訊終于上桌了?

出品|虎嗅黃青春頻道

作者|商業(yè)消費(fèi)主筆 黃青春

題圖|視覺中國


7 月 6 日,騰訊混元 Hy3 正式版發(fā)布,距離 4 月 23 日 Hy3 preview 亮相僅兩個多月,距離姚順雨以首席 AI 科學(xué)家身份空降騰訊、主導(dǎo)混元架構(gòu)重建不過 201 天。


作為姚順雨治下首款正式版大模型,Hy3 被賦予了雙重象征意義:它既是騰訊 AI 底層基礎(chǔ)設(shè)施推倒重建后的首份完整答卷,也被外界視作騰訊補(bǔ)齊短板、入局 AI 下半場的標(biāo)志性產(chǎn)品。


官方口徑中,這款總參數(shù) 295B、僅激活 21B 參數(shù)的 MoE 模型,實(shí)現(xiàn)了比肩 2~5 倍參數(shù)規(guī)模旗艦?zāi)P偷男Ч?,搭配開源權(quán)重、極低 API 定價與全產(chǎn)品線接入,儼然一副領(lǐng)跑高性價比生產(chǎn)力模型的姿態(tài)。


然而,將 Hy3 的公開數(shù)據(jù)放回行業(yè)坐標(biāo)系、嵌入騰訊生態(tài)語境審視便會發(fā)現(xiàn):姚順雨要托起騰訊 AI 下半場,絕非易事。


實(shí)用主義走向“偏科”


Hy3 最核心的標(biāo)簽是“小身板對標(biāo)大模型”。官方強(qiáng)調(diào)其以 21B 激活參數(shù),實(shí)現(xiàn)了參數(shù)規(guī)模 2~5 倍于自身的旗艦?zāi)P托Ч?;然而,拆解其技術(shù)規(guī)格不難發(fā)現(xiàn):這并非底層架構(gòu)層面的創(chuàng)新突破,只是稀疏模型路線下的工程化調(diào)優(yōu),能力邊界從一開始就被參數(shù)規(guī)模鎖死。


從架構(gòu)上看,Hy3 沿用了 preview 版本的底層設(shè)計(jì):MoE 混合專家架構(gòu),總參數(shù) 295B,每次推理激活 Top-8 共 21B 參數(shù),搭配 3.8B 的 MTP 層參數(shù)、80 層主網(wǎng)絡(luò)結(jié)構(gòu),支持 256K 上下文長度。


換言之,正式版未做架構(gòu)層面的改動,提升全部來自后訓(xùn)練數(shù)據(jù)提質(zhì)、RL 算力擴(kuò)容與工程調(diào)優(yōu),典型的架構(gòu)不動、數(shù)據(jù)補(bǔ)位,注定它是補(bǔ)短板式的升級,而非代際跨越。


放在行業(yè)坐標(biāo)系中,295B 參數(shù)規(guī)模僅與 DeepSeek V4 Flash、MiniMax M3 處于同一梯隊(duì),而國內(nèi)外第一梯隊(duì)模型總參數(shù)量已普遍跨過萬億級門檻。


上下文窗口的選擇,同樣值得玩味。


當(dāng)下行業(yè)普遍以 1M 甚至 2M 超長窗口作為性能噱頭秀技術(shù)實(shí)力,Hy3 正式版不盲目追超大長度,轉(zhuǎn)而在 256K 區(qū)間內(nèi)打磨性能上限,減少真實(shí)業(yè)務(wù)場景中的出錯率,充分體現(xiàn)出姚順雨的實(shí)用主義思路:絕大多數(shù)日常辦公、代碼開發(fā)場景,256K 足以覆蓋。


可務(wù)實(shí)的代價是戰(zhàn)略收縮——Hy3 難以適配超長源碼庫、全量知識庫等硬核場景,而對企業(yè)級客戶而言,長上下文能力屬于剛需,是大模型弱化傳統(tǒng)檢索依賴的核心價值。Hy3 將自身定位為中高端生產(chǎn)力工具而非全場景旗艦,雖換取了成本與穩(wěn)定性優(yōu)勢,卻從戰(zhàn)略上放棄了大模型競賽中單點(diǎn)性能極限的突破。


不止參數(shù)規(guī)模與上下文窗口,被視作 Hy3 賣點(diǎn)的快慢思考融合機(jī)制,本質(zhì)是推理階段的分級檔位調(diào)度:常規(guī)請求采用輕量化推理深度實(shí)現(xiàn)快速響應(yīng),高復(fù)雜度任務(wù)則提升算力、加長思考鏈路以提升準(zhǔn)確率。


這套機(jī)制的核心價值在于平衡速度與成本,凸顯的是工程團(tuán)隊(duì)的精細(xì)化調(diào)度能力,而非底層模型技術(shù)路線的代際領(lǐng)先。


當(dāng)然,評判一款大模型的真實(shí)水平,既要橫向看 benchmark,也要縱向看真實(shí)場景的落地表現(xiàn)。Hy3 呈現(xiàn)出鮮明的“偏科”特征:長板足夠突出,但集中在細(xì)分賽道;短板同樣明顯,恰恰落在 AI 下半場的核心競爭領(lǐng)域。


Hy3 表現(xiàn)最強(qiáng)的維度,集中在信息檢索與單工具執(zhí)行。


  • 搜索智能體方向,BrowseComp 基準(zhǔn) 84.2 分,與 GPT-5.5 的 84.4 分幾乎持平,躋身第一梯隊(duì);

  • WideSearch 與 DeepSearchQA 同樣躋身前列。這意味著在網(wǎng)頁導(dǎo)航、多源信息交叉驗(yàn)證、長文檔抽取等任務(wù)中,Hy3 已接近國際頂流模型的穩(wěn)定性與準(zhǔn)確率。


Agent 執(zhí)行層面同樣可圈可點(diǎn)。


  • ClawEval 基準(zhǔn) 68.5 分,僅次于 Claude Opus 4.8,超過 DeepSeek V4 Pro 與 Qwen 3.7 Max;

  • SkillsBench 從 preview 的 29.1 分躍升至 55.3 分,漲幅近 90%,位列第二。說明 Hy3 在單 Agent、可控環(huán)境下的工具調(diào)用準(zhǔn)確率與步驟規(guī)劃能力已躋身行業(yè)頭部。


這些長板精準(zhǔn)命中辦公場景痛點(diǎn):信息整理、文檔生成、簡單工具調(diào)用均是白領(lǐng)最高頻的需求。難怪內(nèi)部 270 位專家盲測中,Hy3 在辦公、前端等場景評分高于 GLM 5.1,敢情其能力分布高度貼合內(nèi)部日常需求。


當(dāng)然,細(xì)分賽道領(lǐng)先,不等于綜合能力領(lǐng)跑。


信息檢索與單工具執(zhí)行,本質(zhì)是對已有信息的整合落地,考驗(yàn)的是指令遵循與穩(wěn)定性;而真正決定大模型能力上限的,是復(fù)雜推理、硬核代碼、多工具生態(tài)協(xié)同等底層能力——在這些核心賽道上,Hy3 差距肉眼可見。


比如,最考驗(yàn)硬核工程能力的代碼賽道,Hy3 的表現(xiàn)只能用“平庸”形容。


  • SWE-bench Pro 基準(zhǔn)上,Hy3 拿到 57.9 分,雖較 preview 版提升超 25%,但大幅落后 Claude Opus 4.8 的 69.2 分,也低于 GLM 5.2 的 62.1 分。

  • SWE-bench Multilingual 75.8 分,同樣落后于 Claude 與 GLM 5.2。

  • Terminal Bench 2.1 終端命令基準(zhǔn) 71.7 分,與前三存在明顯差距。

  • NL2repo 自然語言轉(zhuǎn)代碼倉庫任務(wù) 45.6 分,僅處行業(yè)中游。


換言之,Hy3 的代碼升級更多體現(xiàn)在前端生成、簡單腳本編寫等輕量場景,這與內(nèi)部盲測前端類別優(yōu)勢顯著的結(jié)論吻合;但面對倉庫級重構(gòu)、復(fù)雜系統(tǒng) Debug、多語言工程遷移等硬核軟件工程任務(wù),它與第一梯隊(duì)之間仍有清晰的代差。


數(shù)學(xué)與推理維度差距更甚。MathArena Apex 數(shù)學(xué)競賽基準(zhǔn)上,Hy3 拿到 38.7 分,盡管較 preview 版的 12.8 分實(shí)現(xiàn) 207% 的爆發(fā)式增長,但橫向?qū)Ρ炔坏?GPT-5.5 的一半,也低于 Qwen 3.7 Max 的 44.5 分。即便是表現(xiàn)較好的 GPQA Diamond 博士級科學(xué)問題基準(zhǔn),90.4 分仍與 GPT-5.5 的 93.6 分有明顯距離。


甚至,在 MCP Atlas 工具調(diào)用基準(zhǔn)上,Hy3 僅 79.1 分,在參與對比的 6 個主流模型中排名末位,不僅低于 Claude Opus 4.8、GLM 5.2,也略遜于 Seed 2.1 Pro。


要知道,MCP 是當(dāng)前 Agent 生態(tài)的事實(shí)標(biāo)準(zhǔn),多工具協(xié)作、跨系統(tǒng)調(diào)度的能力直接決定 Agent 能否落地復(fù)雜工作流。這從側(cè)面印證:單工具、可控環(huán)境中 Hy3 表現(xiàn)亮眼;但跨多工具、需異常處理的復(fù)雜任務(wù)中,其容錯能力與穩(wěn)定性仍是硬傷。


串聯(lián)生態(tài)的鑰匙?


Hy3 剛上線就享受了眾星捧月的待遇,WorkBuddy、元寶、ima、Marvis、QQ 瀏覽器、微信讀書、WeGame 等數(shù)十款產(chǎn)品接入,但它真能成為串聯(lián)騰訊內(nèi)部 AI 生態(tài)的鑰匙嗎?


官方披露的數(shù)據(jù)都在強(qiáng)調(diào)相較于 preview 版的提升幅度:


  • WorkBuddy 辦公任務(wù)成功率從 72% 升至 90%,平均耗時縮短 34%,Token 消耗較 GLM 5.2 節(jié)省近 50%;

  • 通用體驗(yàn)層面,幻覺率從 12.5% 降至 5.4%,常識錯誤率從 25.4% 降至 12.7%,多輪問題率從 17.4% 降至 7.9%,長對話理解基準(zhǔn) MRCR 從 42.9% 升至 75.1%;

  • Agent 賽道,Marvis 任務(wù)完成率提升 12.7%,多 Agent 派發(fā)正確率提升 13.5%。


這些環(huán)比數(shù)據(jù)印證了場景反哺模型的有效性,但環(huán)比增速只代表進(jìn)步幅度,不代表行業(yè)站位。


況且,部分?jǐn)?shù)據(jù)的宣傳口徑偏向有利場景:官方只提高頻辦公任務(wù)中 Token 消耗顯著低于 GLM 5.2,卻回避短板場景的消耗表現(xiàn)。在代碼重構(gòu)、復(fù)雜推理等劣勢場景,Token 消耗會因反復(fù)重試、無效調(diào)用而大幅上升,單價優(yōu)勢自然會被對沖——只算優(yōu)勢賬、不算短板賬,顯然不是完整的真相。


行業(yè)普遍認(rèn)為,騰訊做 AI 的底牌從來不是模型技術(shù)本身,而是獨(dú)一無二的場景生態(tài)——微信 14.32 億月活、社交關(guān)系鏈、小程序生態(tài)、內(nèi)容生態(tài),是所有競爭對手都不具備的 context 優(yōu)勢。姚順雨選擇加入騰訊,最核心的考量也是其“擁有大量真實(shí)場景”。


然而,這張底牌至今未與混元形成真正合力。最標(biāo)志性的信號:微信原生 AI 助手“小微”以自研 WeLM 為主、部分場景調(diào)用 DeepSeek-v4。


作為騰訊流量與場景的核心陣地,微信事業(yè)群擁有獨(dú)立 AI 團(tuán)隊(duì)、專屬模型路線,甚至有獨(dú)立的技術(shù)選型優(yōu)先級。這很大程度上源于,WeLM 更適配微信的隱私、安全合規(guī)要求,也意味著混元尚未成為騰訊內(nèi)部統(tǒng)一的 AI 底座——至少在微信體系內(nèi),它只是選項(xiàng)之一,而非默認(rèn)選擇。


據(jù)虎嗅了解,騰訊不會在未經(jīng)用戶允許的情況下使用微信數(shù)據(jù)訓(xùn)練模型,微信數(shù)據(jù)涉及用戶隱私與產(chǎn)品體驗(yàn),是內(nèi)部絕對紅線。


有鑒于此,騰訊手握全行業(yè)最豐富的 context,卻無法真正匯聚到模型訓(xùn)練的閉環(huán)里。除內(nèi)部辦公場景外,Hy3 在金融、游戲等垂直賽道的落地也多為點(diǎn)狀功能升級,尚未形成場景壁壘:


  • 金融賽道:騰訊自選股 7 月 7 日宣布全場景接入 Hy3,主打行情解讀與異動分析,內(nèi)部金融建模評測表現(xiàn)與 GLM 5.2 基本持平。

  • 游戲賽道:WeGame 的《流放之路:降臨》AI 助手接入后幻覺率下降、成功率提升,但本質(zhì)仍是游戲內(nèi)問答工具,未觸及玩法設(shè)計(jì)、內(nèi)容生成、數(shù)值平衡等研發(fā)核心環(huán)節(jié)。


姚順雨的局限性


Hy3 的產(chǎn)品邏輯,是姚順雨“AI 下半場”理念的具象化。他認(rèn)為,AI 上半場是找到方法論,下半場是解決真實(shí)世界問題;如今看來,實(shí)用主義可以快速補(bǔ)短板、打磨體驗(yàn),但要支撐騰訊在 AI 下半場實(shí)現(xiàn)彎道超車,難度不小。


姚順雨經(jīng)常強(qiáng)調(diào)模型與產(chǎn)品的 Co-Design(聯(lián)合設(shè)計(jì)),主張用真實(shí)產(chǎn)品反饋定義評測標(biāo)準(zhǔn)、迭代模型能力。從 preview 到正式版的迭代也證明了這一路線的有效性:50 多個業(yè)務(wù)團(tuán)隊(duì)的反饋,幫助模型修復(fù)了大量榜單發(fā)現(xiàn)不了的底線問題,幻覺、多輪跑偏、工具調(diào)用錯誤等體驗(yàn)痛點(diǎn)也得到明顯改善。


但 Co-Design 的前提是跨部門深度協(xié)同、數(shù)據(jù)順暢流通、目標(biāo)高度一致。據(jù)虎嗅了解,為推進(jìn)與元寶的合作,姚順雨曾派后訓(xùn)練最強(qiáng)的骨干力量支援元寶團(tuán)隊(duì),哪怕當(dāng)時預(yù)訓(xùn)練還沒準(zhǔn)備好——這恰恰說明,跨部門協(xié)作阻力之大,需要負(fù)責(zé)人強(qiáng)力推動。


這也解釋了為何湯道生與姚順雨的對談中,建立信任、換位思考、對齊目標(biāo)被反復(fù)提及,因?yàn)閰f(xié)同成本堪稱互聯(lián)網(wǎng)大廠最大的隱形成本。


技術(shù)路線層面,Hy3 走出了一條差異化路徑:不追萬億參數(shù),不卷百萬超長上下文,依托中等參數(shù)量底座搭配極致推理工程優(yōu)化,主打高性價比生產(chǎn)力落地場景;疊加 1 元 / 百萬 Tokens 輸入、4 元 / 百萬 Tokens 輸出的低價策略,再輔以商用友好的 Apache 2.0 開源協(xié)議,試圖在中高端模型市場撕開一道口子。


這條路線的優(yōu)勢很明顯:推理成本低、落地周期短、運(yùn)行體驗(yàn)穩(wěn),對預(yù)算敏感的中小企業(yè)與開發(fā)者吸引力極強(qiáng)。preview 版上線至正式版發(fā)布,日均 Token 消耗量增長 20 倍,也印證了性價比路線的市場需求。


可硬幣的另一面,風(fēng)險同樣清晰。


首先,性價比賽道正變得越發(fā)擁擠:DeepSeek 有 V4 Flash,智譜有輕量旗艦版,各家都在推出高性價比中量級模型。隨著技術(shù)整體進(jìn)步,輕量模型的能力持續(xù)上探、價格持續(xù)下探,Hy3 當(dāng)前的價格優(yōu)勢能維持多久,要打一個大大的問號。


其次,頂級模型的溢出效應(yīng)正在加速顯現(xiàn)。GPT、Claude 持續(xù)降價,國內(nèi)頭部旗艦?zāi)P统杀究焖傧绿?,中高端模型的生存空間勢必會受到持續(xù)擠壓。企業(yè)用戶的選擇邏輯很簡單:如果頂級模型成本只高一點(diǎn)點(diǎn)、能力卻強(qiáng)一大截,多數(shù)人會選擇一步到位。性價比路線永遠(yuǎn)有細(xì)分市場,但很難成為主流,更難支撐騰訊 AI 的戰(zhàn)略野心。


所以,姚順雨操刀的 Hy3 正式版上線,騰訊終于算是上桌了——它讓騰訊擁有了一款拿得出手、用得上的主流大模型,補(bǔ)上了過去幾年落下的功課,摸到了 AI 下半場的門檻;但騰訊 AI 的核心挑戰(zhàn),從來都不是能否做出一款合格的大模型,而是能不能把自身的場景優(yōu)勢、生態(tài)優(yōu)勢,真正轉(zhuǎn)化為 AI 時代的競爭優(yōu)勢。


姚順雨說,AI 是一場長跑,下半場才剛剛開始;如今,Hy3 上桌后,騰訊 AI 還未到亮底牌的時刻。


# 虎嗅商業(yè)消費(fèi)主筆黃青春、黃青春頻道出品人,關(guān)注文娛社交、游戲影音等多個領(lǐng)域,行業(yè)人士交流加微信:724051399,新聞線索亦可郵件至 huangqingchun@huxiu.com

文章標(biāo)題:騰訊終于上桌了?

文章鏈接:http://www.woaidiy.net/article/4873333.html

閱讀原文:騰訊終于上桌了?_虎嗅網(wǎng)
頻道: 商業(yè)消費(fèi)
本內(nèi)容未經(jīng)允許不得轉(zhuǎn)載。授權(quán)事宜請聯(lián)系 hezuo@huxiu.com。
正在改變與想要改變世界的人,都在虎嗅APP
花莲县| 垦利县| 元朗区| 桂东县| 原平市| 涡阳县| 沂南县| 安乡县| 田林县| 格尔木市| 柘城县| 桐柏县| 新民市| 株洲县| 年辖:市辖区| 达日县| 蓬溪县| 凌云县| 柘城县| 石景山区| 永康市| 汾西县| 炎陵县| 大厂| 泾阳县| 肥城市| 永春县| 南和县| 广元市| 津市市| 宝鸡市| 井陉县| 丰都县| 肇源县| 兴义市| 遂宁市| 广南县| 华池县| 姜堰市| 班戈县| 台南市|