久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

本文實測Kimi K3大模型,點明其能力上限突出但體驗仍有短板,展現(xiàn)了國產(chǎn)大模型的最新進展。 ## 1. Kimi K3基礎信息與官方成績 月之暗面發(fā)布的Kimi K3擁有2.8萬億參數(shù)、原生視覺理解能力、100萬Token上下文窗口,完整上下文僅對199元/月及以上等級會員開放,是全球首個開源3萬億級別大模型。 官方數(shù)據(jù)顯示Kimi K3整體排名全球第三,在用戶盲測的Code Arena榜單中,以1679分排在前端編程能力全球第一,超過Claude Fable 5的1631分和GPT-5.6 Sol的1618分。 API價格輸入每百萬Token20元、輸出100元,對比海外旗艦模型價格更低,但對比自家上一代K2.6,輸入價格漲3倍多,輸出價格漲近4倍。 ## 2. 實測表現(xiàn):能力突出,速度是最大短板 Kimi K3在3D生成、視覺設計、前端編程領域能力突出:3D場景和SVG視覺細節(jié)貼合需求,端側報告脈絡清晰、視覺完成度高,視頻剪輯可自主完成選片質檢。 生成速度是核心短板:同場景生成時間約為GPT-5.6 Sol的2-3倍,復雜場景生成耗時近半小時到兩小時,可能源于大參數(shù)計算量大、默認開啟深度思考、基礎設施未充分擴容,后續(xù)推出不同強度檔位后或有改善。 整體來看,Kimi K3在視覺審美上有明顯優(yōu)勢,但工程可靠性和速度仍有明顯短板,是能力上限高、體驗未完全跟上的產(chǎn)品。 ## 3. 對標GPT-5.6 Sol:各有優(yōu)劣 在第一人稱3D迷宮生成場景中,GPT-5.6 Sol生成速度快、結果穩(wěn)定合格,是快速出成品的首選;Kimi K3生成慢,但視覺設計更有辨識度、可玩性更高。 在杯子倒水物理仿真場景中,GPT-5.6 Sol一次生成就符合物理規(guī)律,結果合格;Kimi K3首次生成出現(xiàn)穿模、出水位置錯誤等硬傷,經(jīng)提醒修正后才達標,GPT-5.6 Sol勝出。 在尼亞加拉大瀑布全景生成場景中,GPT-5.6 Sol功能完整但視覺敷衍,遺漏彩虹元素、水的渲染缺乏美感;Kimi K3元素完整、水的渲染更自然美觀,但生成耗時近半小時。 整體結論:需要又快又穩(wěn)的成品選GPT-5.6 Sol,需要更有辨識度的視覺效果、能接受更長時間等待可選Kimi K3。 ## 4. 行業(yè)視角:國產(chǎn)大模型已能對標海外旗艦 月之暗面近期融資估值增長迅猛,2025年5月投后估值突破200億美元,6月投前估值升至315億美元;Kimi ARR從今年3月的1億美元,到6月中旬增至3億美元,三個月漲3倍,API貢獻超七成收入,海外API收入已超過國內,個人訂閱也進入Stripe全球榜單前十。 月之暗面以開源吸引開發(fā)者、轉化為API客戶的飛輪路徑仍需數(shù)據(jù)驗證,當前AI行業(yè)價值已轉向API調用和訂閱,傳統(tǒng)市場份額統(tǒng)計已無法反映真實競爭格局。 Kimi K3是月之暗面籌備港股IPO前的能力宣示,IPO最終需要檢驗ARR增長可持續(xù)性、客戶留存、推理成本控制等核心指標。 Kimi K3證明國產(chǎn)大模型已經(jīng)大幅壓縮了與海外旗艦的差距,已經(jīng)具備和海外頂尖模型競爭的能力。
實測Kimi K3:強得意外,慢得著急
2026-07-17 21:30

實測Kimi K3:強得意外,慢得著急

本文來自微信公眾號: AIX財經(jīng) ,作者:AIX財經(jīng)團隊,編輯:金玙璠


能力上限高,但體驗還沒完全跟上。


AIX財經(jīng)(AIXcaijing)原創(chuàng)


月之暗面最近動作不斷。7月16日晚上,先悄悄上線了新模型Kimi K3,幾小時后才在公眾號正式發(fā)布公告。


但是吧,它藏得也不夠嚴實。最近,代號為“Kivine”的匿名模型出現(xiàn)在了大模型競技場榜單Arena上,被開發(fā)者們猜測為Kimi K3。它在前端生成和3D任務上的表現(xiàn)引發(fā)了密集討論,甚至頻頻被用來與Anthropic的Fable 5、OpenAI的GPT-5.6 Sol對比。此外,Kimi開放平臺上一個關于Kimi K3上線限時充值活動的頁面被短暫泄露,雖然幾小時后被撤下,但截圖已被廣泛傳播,Kimi K3的熱度在發(fā)布前就已經(jīng)拉滿。


我們照例先來看一下參數(shù)。Kimi K3擁有2.8萬億參數(shù)、原生視覺理解能力、100萬Token上下文窗口。不過,實際可用的上下文長度受會員等級限制,最低檔位會員Andante(49元/月)不支持調用,第二檔位的會員Moderato(99元/月)僅支持256K,第三檔位的會員Allegretto(199元/月)及以上等級才支持完整的1M上下文。


官方稱其是全球首個開源的3萬億級別模型,面向長程編程、知識工作和推理等前沿智能場景而設計。這次的官方發(fā)布中甚至連官方品牌宣傳視頻都是Kimi K3自己剪輯的,它在56段原始素材里完成選片、卡點、動作匹配和音頻處理。月之暗面用這種方式傳遞了一個信號,它能做出完整的、讓人滿意的復雜作品。




圖源/Kimi官方推文


官方給出的成績單涵蓋編碼、通用Agent和視覺Agent三大板塊,整體看下來,Kimi K3排名穩(wěn)定在第三,個別維度甚至登頂。


除了官方給出的數(shù)據(jù),在Arena凌晨更新的Code Arena榜單上,Kimi K3以1679的分數(shù)排在全球第一,超過了Claude Fable 5的1631分和GPT-5.6 Sol的1618分。Arena的榜單結果是來自用戶的公開盲測,投票結束才會看到模型身份。Code Arena考察的主要是前端編程能力,這樣來看,在這一場景里,Kimi K3的能力得到了驗證。


目前Kimi K3已上線Kimi網(wǎng)頁端、App、Kimi Work桌面端、Kimi Code和API,默認思考強度拉到了max,low和high兩種模式在后續(xù)更新中增加。API價格也值得關注,輸入每百萬Token20元,輸出100元。換算下來,GPT-5.6 Sol的價格是輸入5美元、輸出30美元,F(xiàn)able 5更貴,輸入10美元、輸出50美元,而Kimi K3的輸出單價折合不到14美元,價格還便宜。不過,“便宜”是相對海外旗艦而言,對比自家上一代K2.6,K3的API輸入價格實際漲了3倍多,輸出價格漲了近4倍。


月之暗面在官方博文里坦誠地寫了三個局限:Kimi K3對歷史思考內容敏感,中途切換模型可能導致輸出質量明顯下降;訓練偏向長程高難任務,面對簡單的日常問題時容易替代用戶做決定;與Fable 5和GPT-5.6 Sol相比,在用戶體驗上仍有差距。


那么,被用來和海外最強旗艦模型對比的Kimi K3,實際表現(xiàn)到底怎么樣?


01.Kimi K3實測:3D驚艷,速度拖后腿


Kimi K3正式上線不到24小時,X上的實測已經(jīng)密集到可以按場景分類了。翻一圈下來,出現(xiàn)頻率最高的測試方向有三個:3D交互生成、前端編程能力和視覺設計。綜合各方測試來看,開發(fā)者們對Kimi K3的評價大多集中在這幾個方面:3D和視覺生成能力最突出、前端UI的設計水準接近Fable 5、編碼能力強但還沒有超過最強閉源模型、速度是最大的短板。


還有網(wǎng)友指出Kimi K3在基準測試上全面超過了Opus 4.8,而Opus 4.8發(fā)布于5月28日,距今不到兩個月。即便還不能說追平了最頭部的閉源模型,國產(chǎn)開源與海外旗艦的差距,至少已經(jīng)大幅壓縮了。


具體看幾個熱度較高的測試。


科技博主Chris在模型正式發(fā)布前就拿到了Kimi K3的匿名測試版本,讓Kimi K3和GPT?5.6 Sol(extra high)分別做一個體素死星壕溝飛行進行對比,他表示GPT-5.6在光照和特效方面更好,但Kimi K3的畫面更流暢。模型正式發(fā)布后,他又用Kimi K3構建了一個CS:GO×Portal克隆游戲,三輪對話、花費約60萬Token,按API定價算下來只花了3.24美元,并配文“免費獨立游戲開發(fā)的時代比你想象的還要近”。



有網(wǎng)友用櫻花盆景測試Kimi K3的SVG視覺生成能力,發(fā)現(xiàn)Kimi K3在樹干扭曲、分層樹冠等細節(jié)上甚至比Fable 5更貼合要求。也有人測試了水流效果的生成,稱Kimi K3能模擬出逼真的水波紋,保持物理上的連貫性。



當然,推特上的測試終歸是千人千面。模型好不好用,還是得自己上手。


我們先從最常規(guī)的場景開始。讓Kimi K3制作一份咨詢報告風格的端側AI行業(yè)研究,要求包含時間線、樹狀圖、瀑布圖等呈現(xiàn)形式。對AI來說,算是比較基礎的測試。


←左右滑動查看更多→


Slide for more photos


整體色彩搭配協(xié)調,視覺完成度較高。從實際結果來看,這份報告的完成度較高,脈絡、產(chǎn)業(yè)鏈、市場規(guī)模等章節(jié)層層推進,沒有出現(xiàn)前后章節(jié)自說自話的割裂感,信息密度也比較到位。不過,數(shù)據(jù)引用比較單一,基本只用了智次方研究院和集微半導體大會報告,缺乏多來源數(shù)據(jù)的交叉驗證。


這只是前菜,接下來看看幾個最受關注的功能。


先看3D交互生成。我們先讓它用Three.js生成一個可探索的微型城市,要有高低錯落的建筑、街道、樹木、一條穿城而過的小河,同時需要一個晝夜循環(huán)系統(tǒng)。


Kimi K3生成的微型世界


提示詞里要求的元素都沒有落下,畫面、配色和諧,能看出在設計上花了心思。但細節(jié)不夠到位,會出現(xiàn)樹和路燈擋在路中間的情況。


再來看看前端編程能力。我們給了它一個GitHub上開源的考察前端編程能力的復雜題目。這道題目要實現(xiàn)化學實驗的交互演示,主要考察數(shù)學計算、計算幾何能力和物理空間建模等能力。


Kimi K3生成的化學實驗交互演示


Kimi K3交出來的成品有亮點也有瑕疵。先說做得好的部分,泡沫從瓶口涌出的過程很自然,噴射、擴散的節(jié)奏符合化學反應的表現(xiàn),且噴射出來的粒子能看出泡沫的質感。但有一個遺漏,瓶身不透明,看不到瓶內的液體,說明它在處理容器液面渲染時做了簡化處理。


接著,看視覺設計。我們讓它構建一個莫奈《睡蓮》風格的沉浸式全景世界。


Kimi K3生成的《睡蓮》風格全景世界


Kimi K3的成品在視覺表現(xiàn)上確實有亮點。整體的設計符合莫奈《睡蓮》的風格,可以選擇場景、船速、天色等,不過在船經(jīng)過睡蓮時會出現(xiàn)蓮花穿過船的錯位現(xiàn)象,物理渲染有瑕疵。


最后,看看官方提到的視頻剪輯功能。


我們給了它2026世界人工智能大會的官方宣傳視頻、官方海報和大會的議程推文,讓它基于此做一個30秒的宣傳視頻。它處理得比較仔細,合成視頻后并沒有直接交付,還會自己進行質檢,發(fā)現(xiàn)問題后再修正,最終花了近兩個小時才完成。


Kimi K3制作的世界人工智能大會宣傳視頻


成片整體達到了宣傳片應有的樣子,它還配了背景音樂和口播旁白,不過口播聲音較小,不太能聽清??紤]到它生成視頻的速度確實很慢,如果是比較簡單的視頻,自己動手可能速度更快,如果手頭有大量素材、需要一個能自主完成選片和粗剪的助手,可以讓它來試試。


幾輪測下來,Kimi K3在視覺審美和3D生成方面確實有優(yōu)勢,但速度始終是繞不過去的問題。同一場景生成時間約為GPT-5.6 Sol的兩到三倍,瀑布場景近半小時,視頻剪輯近兩小時。綜合來看,Kimi K3在“審美直覺”上有明顯優(yōu)勢,但在“工程可靠性”和“速度”上仍有明顯短板。


關于Kimi K3生成速度慢的原因,官方未作說明。可能的因素包括:2.8萬億參數(shù)的推理計算量大、max檔位默認開啟深度思考、推理基礎設施尚未充分擴容等。隨著后續(xù)開放low和high檔位,速度問題可能會有所改善。整體而言,K3給人的感覺是一個能力上限高,但體驗還沒完全跟上的選手。


02.Kimi K3 vs GPT-5.6 Sol:Sol贏在可靠,K3贏在審美


單獨體驗完Kimi K3之后,自然會想,它到底能不能打得過對標的海外頭部選手呢?我們就拿上周剛全量發(fā)布的GPT-5.6 Sol來對比,選了三個場景,用同一套提示詞分別喂給兩個模型,看看誰更經(jīng)得起實戰(zhàn)。


場景一:3D迷宮游戲


我們讓它們生成一個第一人稱的3D迷宮游戲,讓玩家用WASD和鼠標控制,角落需要配置小地圖顯示已探索區(qū)域,用閃爍火炬照明,60秒倒計時,到達出口顯示勝利畫面。


這套提示詞里包含了好幾個獨立的功能需求,考驗的是模型把算法、3D渲染、交互邏輯和視覺效果一次性協(xié)調到位的綜合能力。


GPT-5.6 Sol干活非常快。Kimi還在加載的時候,Sol這邊已經(jīng)能開始玩了;我們在Sol上跑了好幾輪,Kimi K3才把游戲交出來。


回到游戲本身,Sol生成的畫面風格偏寫實常規(guī),火炬和墻面中規(guī)中矩,更像一個不會出錯的合格成品。


GPT-5.6 Sol生成的迷宮游戲


再看Kimi K3,速度是最明顯的短板,生成時間接近Sol的兩到三倍。不過Kimi K3交付的成果整體視覺帶有像素風,火炬、墻面紋理都更有設計感,光線更暗,可玩性更高。


Kimi K3生成的迷宮游戲


這個場景的差異主要在于速度和審美。GPT-5.6 Sol快、穩(wěn),是需要快速得到一個可用成品時的首選;Kimi K3雖慢,但出來的東西更有辨識度。愿意多等一會、對視覺有要求,Kimi K3值得一試。


場景二:杯子倒水物理仿真模型


接下來這道題來自GitHub上開源的復合型工程化編程測試,要求實現(xiàn)杯子裝水和倒水的物理仿真,綜合考察數(shù)學建模、物理直覺、圖形學處理和邊緣情況處理。


GPT-5.6 Sol交了一份合格的答案。裝水時水粒子老老實實待在杯子里,沒有穿模泄漏;倒水時水從杯口流出,符合物理規(guī)律。


GPT-5.6 Sol生成的杯子倒水仿真模型


Kimi K3在這道題上“翻車”了。第一次生成存在兩個硬傷:一是裝水時,水粒子穿透杯壁漏出去了;二是倒水時,水從杯底流出。經(jīng)提醒之后Kimi K3做出了改正,但改得也很慢,最終結果符合要求。


Kimi K3生成的杯子倒水仿真模型


這個場景GPT-5.6 Sol獲勝。值得注意的是,官方在K3的介紹中特別強調了視覺理解與空間推理的結合提升,但至少在這道題上,它的物理仿真還沒做到一次到位。


場景三:3D交互視覺設計


最后看視覺設計,這道題同樣來自GitHub上的開源題目。我們讓它用Three.js創(chuàng)建一個尼亞加拉大瀑布全景。這道題主要檢驗視覺審美能力和工程能力。


GPT-5.6 Sol在功能完整性上一如既往地穩(wěn),連按鈕命名都忠實還原了提示詞的措辭。但問題在于,它有點“敷衍”。在這個考題中,水應該是最出彩的主角,提示詞要的是玻璃質感的綠水、帶透光的白色水幕,拿到手的是一大片白色粒子糊在懸崖面上,不夠有美感。此外,彩虹這一提示詞里提到的元素,也沒有出現(xiàn)。


GPT-5.6 Sol生成的瀑布全景


Kimi K3這邊更用心。畫面整體更精美,GPT-5.6 Sol缺失的彩虹它沒有落下。在水的渲染上,Kimi K3處理得更自然,更接近真實瀑布水汽氤氳的視覺體驗。當然,Kimi K3生成的速度依舊很慢,花了近半小時才做好。


Kimi K3生成的瀑布全景


三輪測試的結論可以總結為:要又快又穩(wěn)的成品選Sol,但弱項在于審美,更傾向于“完成需求”;要視覺上有辨識度的成品選K3,但速度和一次性準確率是硬傷,K3需要你付出兩到三倍的時間成本。


03.結語


看完實測,我們把視角轉向Kimi K3背后的公司月之暗面。


2025年12月,月之暗面完成C輪融資5億美元,由IDG領投,阿里、騰訊等老股東超額認購,投后估值43億美元。今年5月,完成約20億美元融資,投后估值突破200億美元;6月底,又啟動新一輪融資,投前估值已升至315億美元。


支撐估值增長的除了模型能力,還有收入增速。3月,Kimi的ARR(年度經(jīng)常性收入)突破1億美元,6月中旬達到3億美元,三個月增至3倍。這輪增長還是在API持續(xù)調價的情況下實現(xiàn)的。此前K2到K2.7 Code漲價約60%,ARR仍保持增長;但K3相比K2.6漲幅更為激進,這一價格水平下的市場接受度尚待觀察。



目前,API貢獻了Kimi總收入的七成以上,海外API收入也已超過國內。API是Kimi收入的基本盤,訂閱數(shù)據(jù)則補充證明了其海外個人用戶的付費意愿。根據(jù)Stripe的數(shù)據(jù),Kimi個人訂閱用戶1月支付訂單數(shù)環(huán)比增長8280%,2月環(huán)比再漲123.8%,進入Stripe全球榜單前十,成為首個闖入前十的中國AGI產(chǎn)品。


月之暗面試圖構建這樣一套路徑:用開源模型吸引全球開發(fā)者,通過開發(fā)者工具進入真實工作流,再將對穩(wěn)定性、速度和服務要求更高的用戶轉化為API客戶。理論上,這條路徑可以形成飛輪效應:模型能力帶來開源影響力,開源帶來開發(fā)者,開發(fā)者轉化為API收入,收入再支持訓練和推理投入。但能否真正跑通,還需要開發(fā)者留存率、API客戶轉化率等數(shù)據(jù)來驗證。


當越來越多的收入來自API調用和訂閱,傳統(tǒng)軟件工具的統(tǒng)計口徑也開始失真。這也解釋了IDC市場份額與大模型公司ARR之間出現(xiàn)錯位。7月16日,IDC發(fā)布了2025年中國AI編程市場份額報告,總規(guī)模3.99億元人民幣,阿里Qoder以47.6%的份額位居第一,超過第二到第五名總和;智譜CodeGeeX排名第二,份額11.5%。7月17日,多家媒體披露智譜的ARR已達10億美元,半年增長15倍。


這種反差說明AI編程行業(yè)的價值正在從傳統(tǒng)軟件銷售,逐漸轉向API調用和訂閱等新模式。隨著市場衡量標準發(fā)生變化,行業(yè)競爭也開始進入新的階段。


在這一背景下,月之暗面與智譜的競爭,不再只是比市場份額,還要看誰能更快把高速增長轉化為可持續(xù)收入。


月之暗面目前仍處于講增長故事、兌現(xiàn)長期空間的階段,主要展示增長速度和遠期空間,而已經(jīng)上市的智譜則必須持續(xù)接受收入兌現(xiàn)、成本控制和盈利路徑的檢驗。兩家公司都證明了AI編程付費需求遠超預期,只是所處的發(fā)展階段不同,因此市場關注點也已經(jīng)發(fā)生變化。


從時間節(jié)點看,Kimi K3發(fā)布的節(jié)點很微妙。月之暗面正在籌備港股IPO,Kimi K3不只是一輪產(chǎn)品更新,也像一次上市前的能力宣示。但IPO最終檢驗的不會是榜單成績,還有3億美元ARR能否持續(xù)、客戶是否留存、推理成本能否控制,以及技術優(yōu)勢能保持多久。


把時間軸拉到18個月前,當時國產(chǎn)大模型的話題還是能不能追上GPT-4,而現(xiàn)在的對標對象已經(jīng)變成了Claude Fable 5和GPT-5.6 Sol。Kimi K3不一定是最終追上的那個模型,但它證明了國產(chǎn)大模型已經(jīng)具備和海外巨頭掰手腕的能力。


*題圖來源于月之暗面Kimi微信服務號。

AI原生產(chǎn)品日報頻道: 前沿科技
本內容由作者授權發(fā)布,觀點僅代表作者本人,不代表虎嗅立場。
如對本稿件有異議或投訴,請聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
新化县| 界首市| 河南省| 综艺| 沙坪坝区| 商河县| 沂南县| 丹江口市| 曲周县| 绩溪县| 丰镇市| 和龙市| 南华县| 米林县| 贵德县| 北京市| 新源县| 高平市| 伊金霍洛旗| 突泉县| 石渠县| 酉阳| 壶关县| 昆明市| 稷山县| 南溪县| 南平市| 闻喜县| 南康市| 融水| 青铜峡市| 中阳县| 白沙| 白城市| 嘉定区| 基隆市| 淅川县| 溆浦县| 永州市| 台中市| 庆阳市|