DeepSeek-V4和國產(chǎn)芯片雙向奔赴,意味著什么?_模型_FlagOS_推理
圖片由AI生成
出品 | 搜狐科技
作者 | 梁昌均
編輯 | 楊錦
最近,業(yè)內(nèi)期待了很久的DeepSeek-V4發(fā)布,國產(chǎn)AI芯片迅速掀起適配潮。
華為在發(fā)布當(dāng)天迅速發(fā)文稱,通過雙方芯模技術(shù)緊密協(xié)同,實(shí)現(xiàn)昇騰超節(jié)點(diǎn)全系列產(chǎn)品支持V4模型。
搜狐科技注意到,除了華為昇騰,還有寒武紀(jì)、海光信息、摩爾線程、沐曦股份、昆侖芯、平頭哥、天數(shù)智芯、清微智能、曦望等共計(jì)10款主流國產(chǎn)AI芯片均已完成對(duì)V4的適配。
智源眾智FlagOS技術(shù)團(tuán)隊(duì)最近因此變得異常忙碌,作為打造支持多種AI芯片的開源統(tǒng)一生態(tài)的技術(shù)團(tuán)隊(duì),其在V4發(fā)布后就迅速完成了和9家國產(chǎn)AI芯片的適配。
4月29日,搜狐科技獨(dú)家對(duì)話了北京智源人工智能研究院副院長兼總工程師林詠華。
她認(rèn)為,V4核心突破在于系統(tǒng)優(yōu)化,從硬件優(yōu)化和架構(gòu)創(chuàng)新層面,繼續(xù)大幅降低模型所需要的計(jì)算和顯存,DeepSeek在持續(xù)探索最極致的降本方法。
此次國產(chǎn)芯片和V4的適配,多數(shù)企業(yè)包括FlagOS都宣布Day0適配,可謂快速。她告訴搜狐科技,要做到Day0適配,需要提前做大量技術(shù)準(zhǔn)備工作。
在適配過程中,技術(shù)團(tuán)隊(duì)需要解決在多款芯片上的統(tǒng)一算子替換、精度轉(zhuǎn)換、顯存限制等基礎(chǔ)技術(shù)問題,更重要的是要進(jìn)行精度對(duì)齊。
從適配效果看,林詠華表示,內(nèi)部測試顯示,F(xiàn)lagOS團(tuán)隊(duì)在國產(chǎn)AI芯片上適配的V4 Flash模型,推理效果已基本對(duì)齊DeepSeek發(fā)布的原版模型。
更關(guān)鍵的是,模型廠商的態(tài)度也發(fā)生了變化。今年之前,模型廠商主動(dòng)適配國產(chǎn)芯片的意愿并不高,重心依然圍繞英偉達(dá)。今年以來,國內(nèi)大模型和國產(chǎn)AI芯片則更像是一場雙方奔赴。
林詠華認(rèn)為,現(xiàn)在國內(nèi)模型廠商適配意愿提升,主要得益于推理市場算力需求提升的帶動(dòng)。
“即便模型性能卓越,若算力支撐不足、難以滿足用戶需求,用戶仍將轉(zhuǎn)向替代方案。正因如此,今年模型廠商普遍呈現(xiàn)出更積極的姿態(tài),主動(dòng)推進(jìn)甚至提前布局與芯片廠商的適配工作。”
國產(chǎn)芯片的進(jìn)步不止于推理層面,在訓(xùn)練領(lǐng)域同樣取得了關(guān)鍵突破。
林詠華透露,當(dāng)前基于千卡規(guī)模的國產(chǎn)芯片集群,已基本能夠復(fù)刻出與英偉達(dá)芯片相當(dāng)?shù)挠?xùn)練效果。
她所在的技術(shù)團(tuán)隊(duì)已完成對(duì)多種AI芯片、異構(gòu)混合訓(xùn)練方案在多種模型上的驗(yàn)證,覆蓋了端到端從頭預(yù)訓(xùn)練這一嚴(yán)苛場景,但萬卡級(jí)國產(chǎn)集群的穩(wěn)定性和表現(xiàn)仍有待進(jìn)一步驗(yàn)證。
林詠華認(rèn)為,這背后的挑戰(zhàn)在于行業(yè)對(duì)國產(chǎn)芯片的信心,同時(shí)面臨跨芯遷移難題。
不過,通過國內(nèi)外多個(gè)技術(shù)團(tuán)隊(duì)在軟硬件開源生態(tài)的合作和共建,當(dāng)下以FlagOS為代表的國內(nèi)AI計(jì)算生態(tài)發(fā)展已經(jīng)有了很大的進(jìn)步。林詠華提到,這主要體現(xiàn)在三個(gè)層面。
一是實(shí)現(xiàn)從手寫算子到AI自動(dòng)生成算子的跨越,二是實(shí)現(xiàn)從單芯片專用語言到跨芯片統(tǒng)一編程語言的突破,三是從單芯片適配到Day-0多芯片同步發(fā)布的能力躍升。
未來國產(chǎn)芯片如果想要繼續(xù)在大模型領(lǐng)域?qū)崿F(xiàn)更好的適配,林詠華認(rèn)為,還需在開發(fā)者習(xí)慣與社區(qū)生態(tài)的遷移,以及在編譯優(yōu)化、算子庫覆蓋率、硬件特性利用等繼續(xù)投入,打通性能的“最后一公里”。
同時(shí),還要發(fā)揮生態(tài)的網(wǎng)絡(luò)效應(yīng)。“CUDA的優(yōu)勢不僅是技術(shù),更是大家都在用。當(dāng)開發(fā)者發(fā)現(xiàn)用各種AI芯片跑模型都很簡單時(shí),生態(tài)才會(huì)真正發(fā)展起來。”
以下是對(duì)話精編:
搜狐科技:此次DeepSeek-V4發(fā)布,最核心的創(chuàng)新和進(jìn)步是什么?
林詠華:DeepSeek-V4目前是開源模型第一梯隊(duì),甚至是最頂尖的,對(duì)整個(gè)開源社區(qū)和產(chǎn)業(yè)是一份很重要的禮物。隨著VLLM 和 SGLang兩個(gè)推理引擎推出正式版本支持之后,將推動(dòng)更多落地使用。
它核心突破是在系統(tǒng)優(yōu)化上,不只是硬件優(yōu)化,而是從模型架構(gòu)創(chuàng)新層面,繼續(xù)大幅降低模型所需要的計(jì)算和顯存,在降低推理成本上是極致的探索和優(yōu)化。
DeepSeek尋求的是如何用更少算力、更低成本,去追求更高的智能,希望在這條路上探索最極致的方法,未來應(yīng)該還有更多可能和空間把成本做得更低。
搜狐科技:V4發(fā)布后似乎沒有V3和R1那般驚艷,DeepSeek這次沒有復(fù)現(xiàn)自己的“DeepSeek時(shí)刻”,您怎么看?
林詠華:R1去年初發(fā)布,是首次有比較領(lǐng)先的頂級(jí)大模型做到了GPT-o1具備的推理思考的能力,并直接開源出來。這是從無到有,把國內(nèi)開源帶上了新臺(tái)階,所以市場反應(yīng)很大。
但過去一年,國內(nèi)其他大模型企業(yè)激烈競爭,把大眾也拉到了比較高度使用的狀態(tài)。這次V4雖然在繼續(xù)往上走,但以如今大模型的強(qiáng)大能力,外界已經(jīng)很難對(duì)它的進(jìn)步進(jìn)行準(zhǔn)確“度量”了。
此外,這次還沒有出現(xiàn)當(dāng)初千問模型蒸餾R1的工作,如果都以當(dāng)下的284B或1.6T的巨大模型尺寸進(jìn)行部署,對(duì)硬件的需求不低。所以目前看到的更多是互聯(lián)網(wǎng)大廠,如騰訊云等部署了V4作為API服務(wù),但廣大的企業(yè)用戶私有化部署,還未能大量出現(xiàn)。
搜狐科技:最近斯坦福報(bào)告說國內(nèi)距國外最前沿模型只有2.7%的差距,這是在V4發(fā)布前,V4發(fā)布后差距有進(jìn)一步縮小嗎?
林詠華:DeepSeek評(píng)估V4和國外最新的頂尖閉源模型還有3到6個(gè)月的差距,比較客觀。目前評(píng)測追求的還是模型的絕對(duì)智力,但在產(chǎn)業(yè)落地的時(shí)候,現(xiàn)在開始看重的是能否高效完成任務(wù)。既衡量智力,又要衡量Token效率,這種綜合衡量還缺乏權(quán)威的評(píng)測。
搜狐科技:V4發(fā)布后,華為、寒武紀(jì),包括智源FlagOS等都宣布Day0適配,為什么能做到這么快?解決了哪些關(guān)鍵挑戰(zhàn)?
林詠華:對(duì)于V4這種量級(jí)的模型,整個(gè)架構(gòu)有很多變化,所以提前需要做大量的技術(shù)準(zhǔn)備工作,目標(biāo)是要讓這個(gè)模型能夠在很多AI芯片上跑起來,里面有很多基礎(chǔ)的技術(shù)問題要解決。
第一,要將DeepSeek的原版算子用FlagOS的技術(shù)棧全部替換,從而保證之前已經(jīng)適配過我們技術(shù)棧的芯片都能跑這些算子。
第二,要解決模型對(duì)硬件的精度依賴問題。DeepSeek這次***用的是FP4和FP8混合精度,而國內(nèi)上市的芯片多數(shù)都是以BF16為主,必須轉(zhuǎn)換成這些芯片所能支持的精度。
第三,要解決顯存并行限制的問題。國內(nèi)主流顯卡基本是32G或64G顯存,需要張量并行大于8份才能放得下,但V4最多切8份,所以就需要重新做并行策略的切割。
這些都是在工程上、技術(shù)上怎么讓它跑起來,后面更重要的要對(duì)齊精度。我們端到端測試了所有芯片,把精度誤差控制在5%以內(nèi),然后才發(fā)布開源出來,讓大家能下載代碼,開箱即用。
搜狐科技:國產(chǎn)芯片適配V4后,您這邊內(nèi)部測試或業(yè)內(nèi)反饋的效果如何?
林詠華:我們?cè)贔lash版完整做過測試,推理效果基本跟原版對(duì)齊。馬上VLLM和SGlang就會(huì)推出正式版本支持,我們將重新去適配國產(chǎn)芯片,這樣吞吐量會(huì)明顯上升,就可以跑得更快。
搜狐科技:最近除了V4,Hy3.0、MiMo-V2.5-Pro等都在和國產(chǎn)芯片適配,原來這種情況并不多見,您怎么看這種變化?
林詠華:原來都關(guān)注英偉達(dá),模型廠商沒有很大動(dòng)力跟國產(chǎn)芯片適配。但今年很大的變化是,智能體拉動(dòng)國內(nèi)大模型的部署使用需求大幅上升,普遍需要更多的算力進(jìn)入推理市場。
如果模型廠商手上沒有更多的算力***,就很難支撐它去做更多的推理任務(wù),吸引更多的用戶。即便模型性能卓越,若算力支撐不足、難以滿足用戶需求,用戶仍將轉(zhuǎn)向替代方案。正因如此,今年模型廠商普遍呈現(xiàn)出更積極的姿態(tài),主動(dòng)推進(jìn)甚至提前布局與芯片廠商的適配工作。
搜狐科技:現(xiàn)在適配更多聚焦在推理部署層面,那訓(xùn)練側(cè)國產(chǎn)芯片進(jìn)展如何?卡點(diǎn)是什么?
林詠華:在千卡量級(jí),基于FlagOS在國產(chǎn)芯片上去做訓(xùn)練,無論是語言模型還是多模態(tài)模型,都沒問題,跟英偉達(dá)比完全能夠?qū)R。
我們做了很多的實(shí)驗(yàn)完成了多輪的驗(yàn)證。這些過程的驗(yàn)證是很昂貴的,如果萬卡級(jí)別的端到端驗(yàn)證,那就更昂貴了。
這也是為什么當(dāng)下還看不到很多企業(yè)用國產(chǎn)萬卡集群去訓(xùn)模型。如果沒有對(duì)照過英偉達(dá)的萬卡,是否放心在國產(chǎn)萬卡上去做?
所以挑戰(zhàn)在于,第一還是信心的問題,驗(yàn)證需要大量資金進(jìn)行陪跑驗(yàn)證;第二在于跨芯遷移。
過去這么多年,產(chǎn)業(yè)都是用英偉達(dá)CUDA作為數(shù)值對(duì)齊的標(biāo)準(zhǔn)。那么使用某款非英偉達(dá)芯片訓(xùn)練出來的模型,是否可以順利遷移到其它芯片上?這里面既有精度對(duì)齊的難題,也有跨芯技術(shù)棧的難題。
不過由于FlagOS本身已經(jīng)在訓(xùn)練、推理上做到了多種AI芯片統(tǒng)一了編譯器、算子庫、框架接入等。所以跨芯的軟件問題已經(jīng)被解決了,剩下主要還是精度對(duì)齊的挑戰(zhàn)。
搜狐科技:兩年前您說國內(nèi)算力生態(tài)要在架構(gòu)創(chuàng)新、底層軟件、編譯器等層面補(bǔ)課,過去兩年有哪些進(jìn)步?
林詠華:我認(rèn)為有三個(gè)關(guān)鍵進(jìn)步。第一,從手寫算子到AI自動(dòng)生成算子的跨越。兩年前,移植模型到新芯片,需要花數(shù)周手寫適配算子,現(xiàn)在只需用自然語言描述需求就能自動(dòng)生成、驗(yàn)證、優(yōu)化算子,大大縮短開發(fā)周期。
第二,從單芯片專用語言到跨芯片統(tǒng)一編程語言的突破。原來每換一顆芯片就要學(xué)一套新語言、新工具鏈,但現(xiàn)在通過兼容標(biāo)準(zhǔn),讓開發(fā)者寫一套代碼,就能在所有芯片上跑出好性能。
第三,從單芯片適配到Day-0多芯片同步發(fā)布的能力躍升。像這次V4發(fā)布當(dāng)天,我們就完成了10款芯片的同步適配,行業(yè)內(nèi)跨芯片適配時(shí)間已從原來的數(shù)周縮短至數(shù)天。
搜狐科技:國內(nèi)算力生態(tài)如果想打造類似CUDA的生態(tài),還要在哪些領(lǐng)域繼續(xù)努力?
林詠華:一是開發(fā)者習(xí)慣與社區(qū)生態(tài)的遷移。CUDA擁有十幾年積累的海量代碼、文檔、教程和開發(fā)者習(xí)慣,同時(shí)不同模型在算子生成任務(wù)上的能力差異明顯,需要更多開源模型和工具來降低多元芯片的使用門檻。
二是還需要在編譯優(yōu)化、算子庫覆蓋率、硬件特性利用等方面持續(xù)投入,打通性能的“最后一公里”。
三是要發(fā)揮生態(tài)的網(wǎng)絡(luò)效應(yīng)。CUDA的優(yōu)勢不僅是技術(shù),更是大家都在用。當(dāng)開發(fā)者發(fā)現(xiàn)用各種AI芯片跑模型都很簡單時(shí),生態(tài)才會(huì)真正發(fā)展起來。返回搜狐,查看更多








