實測Kimi K3:強得意外,慢得著急_模型_Fable_的測試
能力上限高,但體驗還沒完全跟上。
AIX財經(AIXcaijing)原創
作者 | 雷晶
編輯 | 金玙璠
月之暗面最近動作不斷。7月16日晚上,先悄悄上線了新模型Kimi K3,幾小時后才在公眾號正式發布公告。
但是吧,它藏得也不夠嚴實。最近,代號為“Kivine”的匿名模型出現在了大模型競技場榜單Arena上,被開發者們猜測為Kimi K3。它在前端生成和3D任務上的表現引發了密集討論,甚至頻頻被用來與Anthropic的Fable 5、OpenAI的GPT-5.6 Sol對比。此外,Kimi開放平臺上一個關于Kimi K3上線限時充值活動的頁面被短暫泄露,雖然幾小時后被撤下,但截圖已被廣泛傳播,Kimi K3的熱度在發布前就已經拉滿。
我們照例先來看一下參數。Kimi K3擁有2.8萬億參數、原生視覺理解能力、100萬Token上下文窗口。不過,實際可用的上下文長度受會員等級限制,最低檔位會員Andante (49元/月)不支持調用,第二檔位的會員Moderato(99元/月)僅支持256K,第三檔位的會員Allegretto(199元/月)及以上等級才支持完整的1M上下文。
官方稱其是全球首個開源的3萬億級別模型,面向長程編程、知識工作和推理等前沿智能場景而設計。這次的官方發布中甚至連官方品牌宣傳***都是Kimi K3自己剪輯的,它在56段原始素材里完成選片、卡點、動作匹配和音頻處理。月之暗面用這種方式傳遞了一個信號,它能做出完整的、讓人滿意的復雜作品。
圖源 / Kimi官方推文
官方給出的成績單涵蓋編碼、通用Agent和視覺Agent三大板塊,整體看下來,Kimi K3排名穩定在第三,個別維度甚至登頂。
除了官方給出的數據,在Arena凌晨更新的Code Arena榜單上,Kimi K3以1679的分數排在全球第一,超過了Claude Fable 5的1631分和GPT-5.6 Sol的1618分。Arena的榜單結果是來自用戶的公開盲測,投票結束才會看到模型身份。Code Arena考察的主要是前端編程能力,這樣來看,在這一場景里,Kimi K3的能力得到了驗證。
目前Kimi K3已上線Kimi網頁端、App、Kimi Work桌面端、Kimi Code和 API,默認思考強度拉到了max,low和high兩種模式在后續更新中增加。API價格也值得關注,輸入每百萬Token20元,輸出100元。換算下來,GPT-5.6 Sol的價格是輸入5美元、輸出30美元,Fable 5更貴,輸入10美元、輸出50美元,而Kimi K3的輸出單價折合不到14美元,價格還便宜。不過,“便宜”是相對海外旗艦而言,對比自家上一代K2.6,K3的API輸入價格實際漲了3倍多,輸出價格漲了近4倍。
月之暗面在官方博文里坦誠地寫了三個局限:Kimi K3對歷史思考內容敏感,中途切換模型可能導致輸出質量明顯下降;訓練偏向長程高難任務,面對簡單的日常問題時容易替代用戶做決定;與Fable 5和GPT-5.6 Sol相比,在用戶體驗上仍有差距。
那么,被用來和海外最強旗艦模型對比的Kimi K3,實際表現到底怎么樣?
01.Kimi K3實測:3D驚艷,速度拖后腿
Kimi K3正式上線不到24小時,X上的實測已經密集到可以按場景分類了。翻一圈下來,出現頻率最高的測試方向有三個:3D交互生成、前端編程能力和視覺設計。綜合各方測試來看,開發者們對Kimi K3的評價大多集中在這幾個方面:3D和視覺生成能力最突出、前端UI的設計水準接近Fable 5、編碼能力強但還沒有超過最強閉源模型、速度是最大的短板。
還有網友指出Kimi K3在基準測試上全面超過了Opus 4.8,而Opus 4.8發布于5月28日,距今不到兩個月。即便還不能說追平了最頭部的閉源模型,國產開源與海外旗艦的差距,至少已經大幅壓縮了。
具體看幾個熱度較高的測試。
科技博主Chris在模型正式發布前就拿到了Kimi K3的匿名測試版本,讓Kimi K3和GPT?5.6 Sol(extra high)分別做一個體素死星壕溝飛行進行對比,他表示GPT-5.6在光照和特效方面更好,但Kimi K3的畫面更流暢。模型正式發布后,他又用Kimi K3構建了一個CS:GO×Portal克隆游戲,三輪對話、花費約60萬Token,按API定價算下來只花了3.24美元,并配文“免費獨立游戲開發的時代比你想象的還要近”。
有網友用櫻花盆景測試Kimi K3的SVG視覺生成能力,發現Kimi K3在樹干扭曲、分層樹冠等細節上甚至比Fable 5更貼合要求。也有人測試了水流效果的生成,稱Kimi K3能模擬出逼真的水波紋,保持物理上的連貫性。
當然,推特上的測試終歸是千人千面。模型好不好用,還是得自己上手。
我們先從最常規的場景開始。讓Kimi K3制作一份咨詢報告風格的端側AI行業研究,要求包含時間線、樹狀圖、瀑布圖等呈現形式。對AI來說,算是比較基礎的測試。
整體色彩搭配協調,視覺完成度較高。從實際結果來看,這份報告的完成度較高,脈絡、產業鏈、市場規模等章節層層推進,沒有出現前后章節自說自話的割裂感,信息密度也比較到位。不過,數據引用比較單一,基本只用了智次方研究院和集微半導體大會報告,缺乏多來源數據的交叉驗證。
這只是前菜,接下來看看幾個最受關注的功能。
先看3D交互生成。我們先讓它用Three.js生成一個可探索的微型城市,要有高低錯落的建筑、街道、樹木、一條穿城而過的小河,同時需要一個晝夜循環系統。
Kimi K3生成的微型世界
提示詞里要求的元素都沒有落下,畫面、配色和諧,能看出在設計上花了心思。但細節不夠到位,會出現樹和路燈擋在路中間的情況。
再來看看前端編程能力。我們給了它一個GitHub上開源的考察前端編程能力的復雜題目。這道題目要實現化學實驗的交互演示,主要考察數學計算、計算幾何能力和物理空間建模等能力。
Kimi K3生成的化學實驗交互演示
Kimi K3交出來的成品有亮點也有瑕疵。先說做得好的部分,泡沫從瓶口涌出的過程很自然,噴射、擴散的節奏符合化學反應的表現,且噴射出來的粒子能看出泡沫的質感。但有一個遺漏,瓶身不透明,看不到瓶內的液體,說明它在處理容器液面渲染時做了簡化處理。
接著,看視覺設計。我們讓它構建一個莫奈《睡蓮》風格的沉浸式全景世界。
Kimi K3生成的《睡蓮》風格全景世界
Kimi K3的成品在視覺表現上確實有亮點。整體的設計符合莫奈《睡蓮》的風格,可以選擇場景、船速、天色等,不過在船經過睡蓮時會出現蓮花穿過船的錯位現象,物理渲染有瑕疵。
最后,看看官方提到的***剪輯功能。
我們給了它2026世界人工智能大會的官方宣傳***、官方海報和大會的議程推文,讓它基于此做一個30秒的宣傳***。它處理得比較仔細,合成***后并沒有直接交付,還會自己進行質檢,發現問題后再修正,最終花了近兩個小時才完成。
成片整體達到了宣傳片應有的樣子,它還配了背景音樂和口播旁白,不過口播聲音較小,不太能聽清。考慮到它生成***的速度確實很慢,如果是比較簡單的***,自己動手可能速度更快,如果手頭有大量素材、需要一個能自主完成選片和粗剪的助手,可以讓它來試試。
幾輪測下來,Kimi K3在視覺審美和3D生成方面確實有優勢,但速度始終是繞不過去的問題。同一場景生成時間約為GPT-5.6 Sol的兩到三倍,瀑布場景近半小時,***剪輯近兩小時。綜合來看,Kimi K3在“審美直覺”上有明顯優勢,但在“工程可靠性”和“速度”上仍有明顯短板。
關于Kimi K3生成速度慢的原因,官方未作說明。可能的因素包括:2.8萬億參數的推理計算量大、max檔位默認開啟深度思考、推理基礎設施尚未充分擴容等。隨著后續開放low和high檔位,速度問題可能會有所改善。整體而言,K3給人的感覺是一個能力上限高,但體驗還沒完全跟上的選手。
02.Kimi K3 vs GPT-5.6 Sol:Sol贏在可靠,K3贏在審美
單獨體驗完Kimi K3之后,自然會想,它到底能不能打得過對標的海外頭部選手呢?我們就拿上周剛全量發布的GPT-5.6 Sol來對比,選了三個場景,用同一套提示詞分別喂給兩個模型,看看誰更經得起實戰。
場景一:3D迷宮游戲
我們讓它們生成一個第一人稱的3D迷宮游戲,讓玩家用WASD和鼠標控制,角落需要配置小地圖顯示已探索區域,用閃爍火炬照明,60秒倒計時,到達出口顯示勝利畫面。
這套提示詞里包含了好幾個獨立的功能需求,考驗的是模型把算法、3D渲染、交互邏輯和視覺效果一次性協調到位的綜合能力。
GPT-5.6 Sol干活非常快。Kimi還在加載的時候,Sol這邊已經能開始玩了;我們在Sol上跑了好幾輪,Kimi K3才把游戲交出來。
回到游戲本身,Sol生成的畫面風格偏寫實常規,火炬和墻面中規中矩,更像一個不會出錯的合格成品。
GPT-5.6 Sol生成的迷宮游戲
再看Kimi K3,速度是最明顯的短板,生成時間接近Sol的兩到三倍。不過Kimi K3交付的成果整體視覺帶有像素風,火炬、墻面紋理都更有設計感,光線更暗,可玩性更高。
Kimi K3生成的迷宮游戲
這個場景的差異主要在于速度和審美。GPT-5.6 Sol快、穩,是需要快速得到一個可用成品時的首選;Kimi K3雖慢,但出來的東西更有辨識度。愿意多等一會、對視覺有要求,Kimi K3值得一試。
場景二:杯子倒水物理仿真模型
接下來這道題來自GitHub上開源的復合型工程化編程測試,要求實現杯子裝水和倒水的物理仿真,綜合考察數學建模、物理直覺、圖形學處理和邊緣情況處理。
GPT-5.6 Sol交了一份合格的答案。裝水時水粒子老老實實待在杯子里,沒有穿模泄漏;倒水時水從杯口流出,符合物理規律。
GPT-5.6 Sol生成的杯子倒水仿真模型
Kimi K3在這道題上“翻車”了。第一次生成存在兩個硬傷:一是裝水時,水粒子穿透杯壁漏出去了;二是倒水時,水從杯底流出。經提醒之后Kimi K3做出了改正,但改得也很慢,最終結果符合要求。
Kimi K3生成的杯子倒水仿真模型
這個場景GPT-5.6 Sol獲勝。值得注意的是,官方在K3的介紹***別強調了視覺理解與空間推理的結合提升,但至少在這道題上,它的物理仿真還沒做到一次到位。
場景三:3D交互視覺設計
最后看視覺設計,這道題同樣來自GitHub上的開源題目。我們讓它用Three.js創建一個尼亞加拉大瀑布全景。這道題主要檢驗視覺審美能力和工程能力。
GPT-5.6 Sol在功能完整性上一如既往地穩,連按鈕命名都忠實還原了提示詞的措辭。但問題在于,它有點“敷衍”。在這個考題中,水應該是最出彩的主角,提示詞要的是玻璃質感的綠水、帶透光的白色水幕,拿到手的是一大片白色粒子糊在懸崖面上,不夠有美感。此外,彩虹這一提示詞里提到的元素,也沒有出現。
GPT-5.6 Sol生成的瀑布全景
Kimi K3這邊更用心。畫面整體更精美,GPT-5.6 Sol缺失的彩虹它沒有落下。在水的渲染上,Kimi K3處理得更自然,更接近真實瀑布水汽氤氳的視覺體驗。當然,Kimi K3生成的速度依舊很慢,花了近半小時才做好。
Kimi K3生成的瀑布全景
三輪測試的結論可以總結為:要又快又穩的成品選Sol,但弱項在于審美,更傾向于“完成需求”;要視覺上有辨識度的成品選K3,但速度和一次性準確率是硬傷,K3需要你付出兩到三倍的時間成本。
03.結語
看完實測,我們把視角轉向Kimi K3背后的公司月之暗面。
2025年12月,月之暗面完成C輪融資5億美元,由IDG領投,阿里、騰訊等老股東超額認購,投后估值43億美元。今年5月,完成約20億美元融資,投后估值突破200億美元;6月底,又啟動新一輪融資,投前估值已升至315億美元。
支撐估值增長的除了模型能力,還有收入增速。3月,Kimi的ARR(年度經常性收入)突破1億美元,6月中旬達到3億美元,三個月增至3倍。這輪增長還是在API持續調價的情況下實現的。此前K2到K2.7 Code漲價約60%,ARR仍保持增長;但K3相比K2.6漲幅更為激進,這一價格水平下的市場接受度尚待觀察。
圖源 / Kimi官方推文
目前,API貢獻了Kimi總收入的七成以上,海外API收入也已超過國內。API是Kimi收入的基本盤,訂閱數據則補充證明了其海外個人用戶的付費意愿。根據Stripe的數據,Kimi個人訂閱用戶1月支付訂單數環比增長8280%,2月環比再漲123.8%,進入Stripe全球榜單前十,成為首個闖入前十的中國AGI產品。
月之暗面試圖構建這樣一套路徑:用開源模型吸引全球開發者,通過開發者工具進入真實工作流,再將對穩定性、速度和服務要求更高的用戶轉化為API客戶。理論上,這條路徑可以形成飛輪效應:模型能力帶來開源影響力,開源帶來開發者,開發者轉化為API收入,收入再支持訓練和推理投入。但能否真正跑通,還需要開發者留存率、API客戶轉化率等數據來驗證。
當越來越多的收入來自API調用和訂閱,傳統軟件工具的統計口徑也開始失真。這也解釋了IDC市場份額與大模型公司ARR之間出現錯位。7月16日,IDC發布了2025年中國AI編程市場份額報告,總規模3.99億元人民幣,阿里Qoder以47.6%的份額位居第一,超過第二到第五名總和;智譜CodeGeeX排名第二,份額11.5%。7月17日,多家媒體披露智譜的ARR已達10億美元,半年增長15倍。
這種反差說明AI編程行業的價值正在從傳統軟件銷售,逐漸轉向API調用和訂閱等新模式。隨著市場衡量標準發生變化,行業競爭也開始進入新的階段。
在這一背景下,月之暗面與智譜的競爭,不再只是比市場份額,還要看誰能更快把高速增長轉化為可持續收入。
月之暗面目前仍處于講增長故事、兌現長期空間的階段,主要展示增長速度和遠期空間,而已經上市的智譜則必須持續接受收入兌現、成本控制和盈利路徑的檢驗。兩家公司都證明了AI編程付費需求遠超預期,只是所處的發展階段不同,因此市場關注點也已經發生變化。
從時間節點看,Kimi K3發布的節點很微妙。月之暗面正在籌備港股IPO,Kimi K3不只是一輪產品更新,也像一次上市前的能力宣示。但IPO最終檢驗的不會是榜單成績,還有3億美元ARR能否持續、客戶是否留存、推理成本能否控制,以及技術優勢能保持多久。
把時間軸拉到18個月前,當時國產大模型的話題還是能不能追上GPT-4,而現在的對標對象已經變成了Claude Fable 5和GPT-5.6 Sol。Kimi K3不一定是最終追上的那個模型,但它證明了國產大模型已經具備和海外巨頭掰手腕的能力。
*題圖來源于月之暗面Kimi微信服務號。返回搜狐,查看更多








