取次硅谷懶回顧,半緣DeepSeek半緣Kimi_OpenAI_模型_楊植麟
文 | 數字力場,作者 | 佘宗明
25年前,《少林足球》上映。片中有個名場面:半決賽時,少林隊遇到了莫文蔚與張柏芝客串的“玉面雙飛龍”,二人頂著夸張臟辮、貼著滑稽***胡,說“想入決賽,先問問我們!”
時間來到2026年,星爺新片《功夫女足》讓這對傳奇組合重生——張小斐飾演的“雙雙”與迪麗熱巴飾演的“鈺瓏”,名字合璧正好對應“玉面雙飛龍”。
作為峨眉隊隊長的雙雙是全隊攻防大腦,根基扎實,球路沉穩,招牌絕技是太極卸力盤帶、太極沉勁遠射等,招式守正出奇,強于以柔克剛;身為峨眉隊前鋒的鈺瓏是球隊尖刀,身法靈動,攻勢凌厲,獨門絕技是十二路彈腿、旋風削球等,能精準破局,極具爆發力。
現在看,AI賽道的“粵籍雙雄”——梁文鋒和楊植麟,也挺像這對組合。
DeepSeek擅長以柔克剛,如果說“大力出奇跡”的scaling law路線是剛,那MoE稀疏激活+原生FP8訓練框架+純RL驅動的卸力打法就是柔。
Kimi爆發力十足,猶記得1年前,Kimi還時常是作為DeepSeek的反面鏡像被討論,“Kimi掉隊了”的說法蔚為風行,可如今,它直接整出了王者歸來的氣勢。
而Anthropic和OpenAI領銜的硅谷御三家,則成了擺在它們面前的“大河隊”。
01
“美國為什么沒留下楊植麟”,7月17日,有老外在X上發出了這番靈魂拷問。
這掀起了激烈討論,連楊植麟在卡內基梅隆大學的博士生導師、AI領域知名學者Russ Salakhutdinov都下了場,說“我本將心向明月,奈何明月照溝渠”……說錯了,是楊植麟曾收到來自蘋果高管的橄欖枝,但他態度已決——要創立自己的公司。
在遭到MAGA信徒攻擊“為對手輸送人才”后,Russ還回懟:這不就是你們想要的嗎?(Ps:這里針對的是特朗普***制定的H-1B簽證政策。)
咱就是說,要是大洋彼岸的網民還學會了扣“反思怪”跟“帶路黨”帽子,那就更有內味了。
而引發這場爭論的直接由頭,就是Kimi K3攜2.8萬億超大參數架構強勢登場,給了硅谷和華爾街億點點震撼。
如果Kimi K3只在AI圈博主的嘴里遙遙領先,那被“三天一震撼,五天一炸裂”歷練出反詐技能的我們大可呵呵一笑。可硅谷技術圈跟華爾街資本市場的表現,還是有參考價值的。
馬斯克在評測帖下留言“Impressive(令人印象深刻)”;OpenAI戰略負責人Dean Ball說,大規模開放權重前沿模型是“減速主義力量”,還預判美國監管層面會出手搞保護主義;特朗普***AI顧問D***id Sacks說,K3的突破令人擔憂,加劇AI地緣競爭壓力……秉持“對手肯定>國內同行認可>自嗨式PR”的原則,咱們高低得對K3多看幾眼。
《華爾街日報》頭版打出大標題——“The Kimi Shock”;高盛研報認為K3標志著中國模型走向定價權的全新節點……也給Kimi走了面兒。
風乍起,吹皺一池夏水并吹掉一堆泡沫:美股AI板塊直接來了個“72小時驚魂”,整體市值蒸發約4700億美元,費城半導體指數單周大跌12.5%,墜入技術性熊市。“DeepSeek時刻”都意思意思了,“DeepSeek2.0時刻”自然也不好意思不意思一番。
順著“它跌得,我跌不得”的選擇性接軌邏輯,A股也成功將這股“跌跌不休,時不我予的哀愁”意緒傳遞給了本土股民。
而上個讓硅谷跟華爾街爬進“驚弓之鳥”成語注釋里的,還是DeepSeek。
去年1月,R1出來后,也是驚得硅谷跟華爾街哇聲一片。著名投資人、A16Z創始人馬克·安德森的那句“斯普特尼克時刻”,成了對其影響的最佳定性。
Meta開啟危情模式、成立四個“戰情局”,Scale AI創始人亞歷山大·王說“DeepSeek的發布可能會改變一切”……都是變相為DeepSeek上分。
英偉達股價單日暴跌16.86%,市值一夜蒸發5888.62億美元,彼時彼刻,恰如K3出來后的此時此刻。
02
1年半前,DeepSeek攜性能比肩OpenAI o1、API調用成本卻僅為o1約2%的R1,拍了拍眾人,來了一句“驚不驚喜?”
1年半后,在眾人以為驚喜是意外后,Kimi又攜躋身全球頂尖大模型第一梯隊的K3登場,笑著說“意不意外?”
突破一次,也許是運氣眷顧;突破一次又一次,那就……因吹斯聽了。
在DeepSeek-R1問世后,《自然》雜志將梁文鋒評為了“2025十大科學人物”,說DeepSeek“首次讓世界意識到美國并非遙遙領先。”
在Kimi K3官宣后,摩根士丹利評價稱,K3證明中國大模型在規模、性能、定價層面對美國頭部模型實現“全方位追趕”。
個中意味,頗堪尋思。
都知道,自ChatGPT掀起這波AI浪潮以來,全球AI大模型賽道的劇本就是男一OpenAI跟男二男三Anthropic、谷歌的角力游戲,其他的多為群演……
當時的格局就擺在那:國內“六小虎”雖然也在蹦跶,可OpenAI說“我話說完,誰支持誰反對”,它們只有不吭聲的份兒,能爭的也就是個“中國版OpenAI”的名頭。
亦步亦趨、微調借鑒,成了那時國產大模型的路徑依賴。
如此效仿三兩年,直到DeepSeek說“頭部AI,寧有種乎?”
MLA(多頭潛在注意力)把顯存占用砍到傳統架構的5%-13%,DeepSeekMoE稀疏架構通過稀疏激活讓計算量大幅下降,Zero無樣本自進化開辟了低成本訓練強推理模型的新路線……憑著這些,DeepSeek成功將“中國AI落后美國兩到三年”的技術代差縮小了些。
DeepSeek給了“力大磚飛”的硅谷信仰重重一擊,給國內外科技企業上了一課:AI核心競爭力不只在參數堆積、算力堆疊,還在于算法架構優化、工程落地能力與***利用效率等。
整體上,DeepSeek為中國大模型樹立的心智錨點是:雖然性能稍有差距,但性價比是真香。
而到了Kimi K3這,中國大模型的角色又從“攪局者”變成了“破局者”,因為K3在復雜邏輯推理、長文本處理、代碼生成、多場景落地等核心維度的表現讓人意識到,原來中國大模型在性能上也可以多方位、深層次地趕上美國頂尖模型。
在此之前,硅谷AI公司能享受高溢價的核心支撐點,其實就在于依靠“閉源付費+高端性能”模式收割全球市場、依靠技術壁壘維持超額利潤的想象空間。
這在此前確實成立:雖然有國產大模型先前就在有些方面趕超了GPT、Claude和Gemini等,但在核心維度很難占優,所以對外口徑只能是“位列開源大模型第一梯隊”……這里為什么要加上“開源”二字,你懂的。
但Kimi K3綜合能力在Artificial Analysis綜合智能指數評測中排名第三,在代碼評測榜單Arena的前端代碼榜上則登頂全球編程模型第一(這點含金量很高),在智能體&自動化任務、長文檔檢索等維度也是Top1……讓頂尖開源模型終于能跟頂尖閉源模型坐同一桌了。
猶記得,上個月,有網友在X上問馬斯克:“中國大模型何時能追上 Anthropic的Fable水平?”馬斯克預測要等到2027年一季度。隨后智譜創始人唐杰回應:“用不了那么久”。
現在楊植麟用K3為他的清華老師這番話撐了腰。加州大學伯克利分校教授伊恩·斯托伊卡就感慨:“我們過去常說開源模型落后最前沿6至9個月,現在差距可能只剩2到3個月。”從“性能不及頂尖但價格屬實美麗”,到“性能也能到頂尖水平”,這樣的邁步會讓不少人想起中國制造——早些年,中國制造給人的印象是“能造出質量還行價格實惠的商品”,而如今,中國制造也可以是“高端制造”的代名詞。
03
說這些,不是要導向“東升西落”式的贏學敘事,也不是要回避“整體差距依舊不小”的基本事實。
DeepSeek-R1和Kimi K3,都讓硅谷跟華爾街的中國AI“巨物恐懼癥”發作了。但這不等于,差距已經被抹平了。
拋開模型能力代差不談,從底層算力看,國內高端算力自主可控率仍大有提升空間,不能因為“寒武紀不是小英偉達,英偉達是小寒武紀”的段子,就真把橫亙其間的天塹給無視了。
從生態成熟度看,硅谷AI經過多年積淀,形成了“算力+模型+工具+場景+資本”的完整閉環,上下游產業鏈高度成熟,中國AI生態則處于快速發展期,商業化體系等仍待完善。看看國內AI創企跟Anthropic、OpenAI的ARR量級差距,就知道了。
從人才儲備看,國內工程師紅利雖然讓黃仁勛們眼紅,但頂尖AI算法人才、底層架構人才的總量跟硅谷還有差距。在“Our Chinese”跟“Their Chinese”的PK中,我們還需要想方設法吸引更多的楊植麟、姚順雨回來。
看到中國AI從單點技術突破到體系化能力成型的提升,跟看到中美AI的差距,不矛盾。
事實上,越是能看到差距,就越能在正視的基礎上加速追趕。梁文鋒就說過:“我們經常說中國AI和美國有一兩年差距,但真實的差距是原創和模仿之差。如果這個不改變,中國永遠只能是追隨者,所以有些探索也是逃不掉的。”
也正因看到了差距,DeepSeek跟Kimi都實現了許多架構級的原創式創新。
如DeepSeek的原生鏈式思考(CoT)自主推演+R1-Zero無樣本自進化機制+MoE稀疏架構+MLA優化長上下文承載力等;
又如Kimi的超大容量稀疏MoE基座+KDA混合線性注意力體系+原生百萬Token上下文建模技術+Agent Swarm+RL Scaling全鏈路強化學習范式+MuonClip大規模訓練優化器等。
得益于此,DeepSeek V4解決了大模型長文本推理卡頓、邏輯斷層、算力浪費的行業痛點,在萬億級參數模型的輕量化部署上創下全球最優水平。Kimi K3則突破了超大參數模型的訓練瓶頸,在長文本理解、復雜代碼生成、多模態融合能力上實現了對海外旗艦模型的反超。
從DeepSeek R1到Kimi K3,都讓人看到了將代差持續縮小的可能——盡管差距依舊存在。
而這類接連涌現的突破,使得中國AI正實現從仰視到平視海外標桿的改變,也注定會讓硅谷迎來心態的轉變。
過去數十年,美國科技產業的核心優勢在于技術迭代的持續性與領先性,頂尖技術誕生后,經常能長期保持代際優勢。其他國家則照搬其技術框架、遵循其硬件標準、接受其定價體系。
但DeepSeek-R1和Kimi K3們,正撼動著這樣的敘事。
一次可以叫偶然,兩次——不同企業在不同時間節點、不同技術路徑上,都實現了深層突破,這難免讓硅谷部分企業失去“反正有追趕窗口期”的心理優勢。
對硅谷而言,它未必忌憚成為第二名的追隨者——哪怕其緊追不舍,卻必定會忌憚跳出既定軌道的創新者——即便其隔得很遠。
04
取次硅谷懶回顧,半緣DeepSeek半緣Kimi,這是時下很多人的感受——DeepSeek跟Kimi,都成了AI界“爭氣機”式的存在。
現在說對硅谷“懶回顧”,終究顯得有些膨脹,但DeepSeek與Kimi確實呈現了中國AI最有活力的樣子。
說起來,無論是DeepSeek,還是Kimi,都不是一開始就被看好能撼動硅谷的“人”。
DeepSeek起初在“6(六小虎)+2(兩家有特色創企)”的行業頭部格局中并不靠前,在V4跟R1之前,它充當的不過是大模型界“拼多多”的生態位。
Kimi雖然憑借長文本風光過一陣子,但到了2024年以后就拿到了過山車劇本,特別是在DeepSeek火了后,它更是被置于“既生D何生K”的同框對比中成為被群嘲對象。
但它們卻在不怎么被看好的情況下跑了出來。
這跟梁楊二人的朝氣銳氣有關。
梁文鋒說中美AI真實差距是“原創和模仿之差”,決意要做原創式創新。
楊植麟說“很多時候你愿意去做一個你不知道的東西,其實你不知道有很多東西不知道,所以你才有這樣的勇氣去做。當你做了,你會發現有很多新的問題,也許這個東西就是創新的意義。”“Problems are inevitable, but problems are soluble。”
言語之間,都挺顯廣東人的務實與鋒芒。
他們代表了那股瘋狂生長、銳意創新的力量。
這也跟當下相對純粹的競爭環境有關。
回頭看,DeepSeek跟Kimi的“***”其實從未停止:
2025年1月,DeepSeek-R1和Kimi K1.5同日上線,相隔僅兩小時;2025年2月,兩家前后腳發論文改造Transformer注意力機制;2025年4月,Kimi推出數學推理模型沒多久,DeepSeek-Prover-V2也發布;今年4月,Kimi發布Kimi K2.6,支持300個子Agent協同,OpenRouter調用量直接沖到全球第一,3天后,DeepSeek發布V4系列……
二者也相互“致敬”:Kimi***用的MLA注意力機制,核心思想源于DeepSeek早期工作;DeepSeek V4中關鍵的Muon優化器,其有效性由Kimi團隊率先驗證。
良好的競爭生態之上,才能長出更多的DeepSeek跟Kimi。
因而,要珍惜梁文鋒楊植麟們身上的創新動能,要呵護讓AI企業可以激烈良性競爭的市場氛圍。
在適配創新生長的土壤氣候里,DeepSeek和Kimi這樣的新銳力量才會有更大的向上拓展空間,才會有更多的機會接著在全球AI角力場中證明——
“我們玉面雙飛龍,可不是浪得虛名”。返回搜狐,查看更多









