前言:從1986年“863***”提出算起,到2026年正好四十年。這是中國基礎(chǔ)軟件從無到有、從追趕到追趕的整整四十年。彼時,中國在高端芯片、操作系統(tǒng)、數(shù)據(jù)庫等核心領(lǐng)域幾乎一片空白,跨國巨頭壟斷著從標準到市場的全鏈條。四十年來,國產(chǎn)數(shù)據(jù)庫在夾縫中求生存,從高校實驗室的原型起步,在金融、電信等關(guān)鍵行業(yè)逐步撕開口子,完成了從“有沒有”到“好不好”的跨越——但始終是在別人劃定的賽道里奔跑。如今,AI正在重寫數(shù)據(jù)世界的底層邏輯。當數(shù)據(jù)庫的使用者從人變成Agent、數(shù)據(jù)形態(tài)從結(jié)構(gòu)化走向多模態(tài),舊范式正在失效,新范式尚未固化。一個根本性的轉(zhuǎn)變正在發(fā)生:中國基礎(chǔ)軟件第一次有機會從“規(guī)則追隨者”變?yōu)椤耙?guī)則定義者”。
【環(huán)球網(wǎng)科技報道 記者 李文瑤】過去三年,AI領(lǐng)域的焦點被算力和模型的競賽所壟斷。從GPT系列模型的能力躍遷,到英偉達GPU的一卡難求,技術(shù)的聚光燈始終打在算力集群與算法迭代之上。然而,一個現(xiàn)象也正在全球企業(yè)界蔓延:根據(jù)Gartner預(yù)測,到2026年,超過60%的AI項目將被放棄,投入產(chǎn)出比遠不及預(yù)期。
模型買了,算力部署了,價值為何無法兌現(xiàn)?
“AI落地的‘最后一公里’,本質(zhì)上是一道數(shù)據(jù)的難題。”O(jiān)ceanBase CEO楊冰在接受記者***訪時給出了判斷。在他看來,大模型之間的差距正在快速收斂,而應(yīng)用與應(yīng)用的差距,將越來越體現(xiàn)為“上下文質(zhì)量”的差距。這一轉(zhuǎn)移,將數(shù)據(jù)庫從支撐業(yè)務(wù)的后臺系統(tǒng),推向了AI價值兌現(xiàn)的關(guān)鍵核心點。
6月29日,OceanBase發(fā)布面向AI時代的湖庫一體AI數(shù)據(jù)庫。這不僅僅是一次產(chǎn)品更新,更是一次對數(shù)據(jù)庫根本角色的重新定義。在OceanBase 方面看來:“AI數(shù)據(jù)庫不是傳統(tǒng)數(shù)據(jù)庫的‘分支’,而是AI時代的基礎(chǔ)設(shè)施重建。中國第一次有機會參與定義下一代數(shù)據(jù)庫范式。”
AI落地的“最后一公里”:從模型設(shè)置到數(shù)據(jù)難題
近年來,大模型的進化速度令人目眩。Gartner預(yù)測,從2024年到2028年,全球企業(yè)在模型上的支出將從50億美金飆升至390億美金,算力投入更是高達數(shù)千億美金。然而,巨額投入并未帶來預(yù)期的價值兌現(xiàn)。Gartner的另一組數(shù)據(jù)顯示,2026年超過60%的AI項目可能會被放棄。
“在通用的模型和企業(yè)所需的智能之間,有一個宏大的業(yè)務(wù)上下文的鴻溝。”楊冰一針見血地指出了癥結(jié)所在,“模型再聰明、聊天聊得好,如果說無法理解業(yè)務(wù)、參與決策、跑通流程,它就沒法為企業(yè)創(chuàng)造價值。”
這一判斷正在成為行業(yè)共識。大模型之間的技術(shù)差距在快速收斂,AI競爭的天平正從“誰的模型參數(shù)更多”滑向“誰能讓AI真正讀懂一家企業(yè)的業(yè)務(wù)邏輯”。而這恰恰是純模型廠商難以觸及的深水區(qū)。
“AI落地企業(yè)最后一公里應(yīng)該是一道數(shù)據(jù)的難題。”楊冰總結(jié)道,“如何管理和使用好所有數(shù)據(jù),給模型提供精準完整的上下文是最為核心的挑戰(zhàn)。”
兩道根本性的力量,正將這一難題推向必須解決的臨界點。
第一道力量是數(shù)據(jù)的使用者正在發(fā)生變化。 過去,數(shù)據(jù)庫的設(shè)計圍繞人類工程師展開,逐條編寫查詢、按需調(diào)用、8小時工作制。而如今,AI Agent正在成為數(shù)據(jù)的主要消費者。Gartner預(yù)測,到2028年,超過三分之一的企業(yè)軟件交付將由智能體完成。
這些“硅基工程師”的行為模式與人類截然不同:高頻數(shù)據(jù)調(diào)用、大規(guī)模并行執(zhí)行、7×24小時不間斷運行。這對數(shù)據(jù)底座的彈性、隔離性和成本模型提出了前所未有的要求。
第二道力量是數(shù)據(jù)的形態(tài)正在發(fā)生結(jié)構(gòu)性崩塌與重構(gòu)。 全球超過80%的數(shù)據(jù)是非結(jié)構(gòu)化的——文本、圖像、音頻、***。過去,這些數(shù)據(jù)因機器無法深度理解而長期沉睡,僅用于存檔和事后審計,是純粹的成本中心。AI大模型的到來改變了這一切,它第一次讓非結(jié)構(gòu)化數(shù)據(jù)變得“可計算”。
“這些非結(jié)構(gòu)化數(shù)據(jù)從企業(yè)的邊角料變成真正的核心資產(chǎn)。”楊冰指出。要釋放這筆資產(chǎn)的真正價值,它必須與企業(yè)的結(jié)構(gòu)化經(jīng)營數(shù)據(jù)在同一底座上被統(tǒng)一管理、治理和調(diào)用,否則Agent仍將“盲人摸象”。
兩股力量疊加,傳統(tǒng)數(shù)據(jù)庫架構(gòu)開始劇烈承壓。楊冰打了個形象的比方:“過去,就像‘雙十一’推動原生分布式架構(gòu)的升級。這兩個變化的疊加,也會帶來數(shù)據(jù)底座更大的變革。”
而這一變革,把數(shù)據(jù)庫從支撐業(yè)務(wù)的“后臺系統(tǒng)”推向了AI價值兌現(xiàn)的前臺。
規(guī)則重寫:AI數(shù)據(jù)庫的“兩個需求”與“兩條底線”
面對上述劇變,需要關(guān)注的是AI數(shù)據(jù)庫絕非“傳統(tǒng)數(shù)據(jù)庫加一個向量檢索插件”的拼合。它需要從底層邏輯上重新回答一個根本問題——在一個由AI驅(qū)動的世界里,數(shù)據(jù)究竟應(yīng)該如何被組織、被理解、被調(diào)用?
通過對阿里、螞蟻以及大量數(shù)據(jù)密集型客戶的AI落地實踐進行深度復(fù)盤,OceanBase將AI對數(shù)據(jù)庫提出的新需求歸納為“兩個需求”與“兩條設(shè)計原則”。
兩個需求由AI時代的業(yè)務(wù)負載決定,是必答題:第一個需求是一體化。多模態(tài)數(shù)據(jù)、離線與在線的計算,必須統(tǒng)一在同一個強一致的底座上。“數(shù)據(jù)不再被切割、不必在多套系統(tǒng)之間反復(fù)搬運。”楊冰強調(diào),只有這樣,那個“越用越準”的數(shù)據(jù)飛輪才能真正轉(zhuǎn)起來。如果在線數(shù)據(jù)庫、離線數(shù)倉、模型訓(xùn)練彼此割裂,依賴ETL(數(shù)據(jù)抽取轉(zhuǎn)換加載)進行漫長的數(shù)據(jù)搬運,今天的問題可能要幾天以后才能被恢復(fù),AI的實時性價值將被徹底消解。
第二個需求是多模態(tài)。 結(jié)構(gòu)化、半結(jié)構(gòu)化和非結(jié)構(gòu)化數(shù)據(jù),必須在同一套體系中被統(tǒng)一管理和治理,通過標量、全文、向量等方式進行混合搜索。楊傳輝說道:“今天的AI數(shù)據(jù)庫跟原有關(guān)系數(shù)據(jù)庫最大的區(qū)別在于混合搜索。原先的關(guān)系數(shù)據(jù)庫只支持關(guān)系的查找,我們的AI數(shù)據(jù)庫在同一張表里面能夠完成關(guān)系、向量、全文、圖計算與AI的計算。”
兩條設(shè)計原則是數(shù)據(jù)庫面向AI時代應(yīng)有的立場:首先是Agent友好。 Agent所需的記憶、上下文、隔離、分支、回滾與規(guī)模化運行能力,不應(yīng)依賴外部系統(tǒng)拼裝,而應(yīng)成為數(shù)據(jù)底座的原生能力。例如,為解決Agent海量并行開發(fā)與評測的環(huán)境痛點,OceanBase構(gòu)建了Fork Database 能力,可以通過像Git分支一樣,為AI提供即用、即建、即拋的數(shù)據(jù)庫沙箱,毫秒級創(chuàng)建、低成本開銷,讓AI的試錯成本極大降低。
其次是開放。企業(yè)的數(shù)據(jù)主權(quán)應(yīng)牢牢握在自己手中。OceanBase堅持存儲與計算中立和開放,***用存算分離架構(gòu),兼容S3對象存儲與Iceberg開放表格式,除了原有的 SQL 計算,還可對接Spark、Ray等開放計算引擎,讓客戶做到“Infra自由、模型自由以及數(shù)據(jù)主權(quán)”。
盡管AI改寫了數(shù)據(jù)庫的“用法”,楊冰卻特別強調(diào),數(shù)據(jù)庫的“底線”在AI時代變得前所未有地重要。“一致性、擴展性、可靠性、實時性,這四條底線不可退讓。”他解釋道,當智能體從輔助工具走向“替人決策”——在風控審核、內(nèi)容安全等環(huán)節(jié),已經(jīng)是智能體直接面對用戶在拍板——背后數(shù)據(jù)的錯一條、慢一拍,就不再是技術(shù)指標的小問題,而是真實的業(yè)務(wù)事故。金融級數(shù)據(jù)底座的核心能力,因此成為了AI生產(chǎn)級應(yīng)用的“生命線”。
“真正需要被重寫的是架構(gòu),必須被堅守的是底線。”楊冰說。
中國基礎(chǔ)軟件的歷史性機遇:從“跟隨者”到“共同定義者”
如果從全球產(chǎn)業(yè)來看“兩個需求”和“兩條原則”,AI數(shù)據(jù)庫正在成為基礎(chǔ)軟件賽道數(shù)十年未有的關(guān)鍵賽點。
過去四十年,數(shù)據(jù)庫的范式迭代路徑清晰而固化。關(guān)系型數(shù)據(jù)庫時代,甲骨文、IBM、微軟等定義了企業(yè)數(shù)據(jù)管理的標準;互聯(lián)網(wǎng)與海量數(shù)據(jù)時代,Hadoop生態(tài)、Snowflake、Databricks等新興力量雖然實現(xiàn)了突破,但并未從根本上動搖OLTP(在線事務(wù)處理)領(lǐng)域的堅固壁壘;云數(shù)據(jù)庫時代,AWS Aurora等產(chǎn)品雖革新了部署模式,但底層架構(gòu)仍是“分布式SQL”的延續(xù)。
然而,AI Agent的崛起正在從需求端顛覆這一邏輯。它在生產(chǎn)環(huán)境中的實時決策、多模態(tài)交互、高頻試錯和海量并發(fā),使得基于ACID(原子性、一致性、隔離性、持久性)的傳統(tǒng)數(shù)據(jù)庫內(nèi)核與基于MPP(大規(guī)模并行處理)的離線數(shù)倉系統(tǒng),都顯得力不從心。
楊傳輝在***訪中對這種代際更替做了清晰的劃分:“第一代數(shù)據(jù)基建就是Oracle這種,關(guān)系數(shù)據(jù)庫做TP(事務(wù)處理)的。第二代數(shù)倉就出來了,第三代是大數(shù)據(jù),第四代就是做AI的。每一代之間,它的數(shù)據(jù)需求都是靠場景驅(qū)動的。”
關(guān)鍵的區(qū)別在于,在前三代范式的定義過程中,中國廠商幾乎是缺席的。而到了AI數(shù)據(jù)庫這一代,全球幾乎站在同一條起跑線上,既有技術(shù)存量不再是不可逾越的壁壘。
“過去,中國的數(shù)據(jù)庫廠商更多是在證明‘我們也能做’,而不是‘我們認為應(yīng)該怎么做’。”楊冰坦言:“核心原因在于,前幾代數(shù)據(jù)庫的標準形態(tài)已經(jīng)在西方市場被定義成熟了,我們只能追趕。”
AI數(shù)據(jù)庫的不同在于,它不是一個“優(yōu)化版”的數(shù)據(jù)庫,而是一個“新物種”。它要處理的不再是純結(jié)構(gòu)化數(shù)據(jù),而是結(jié)構(gòu)化、半結(jié)構(gòu)化、非結(jié)構(gòu)化數(shù)據(jù)的混合體;它的使用者不再主要是人類工程師,而是Agent;它的負載不再主要是OLTP或OLAP的線性組合,而是包含向量檢索、全文搜索、實時推理的混合工作負載。
“當?shù)讓拥氖褂谜吆蛿?shù)據(jù)形態(tài)都變了,架構(gòu)必須被重寫,標準也就有了重新定義的空間。”楊冰說。“這就像手機操作系統(tǒng)——PC時代Windows定義了標準,但移動時代iOS和Android重新定義了它。不是因為微軟技術(shù)不行,而是交互方式和硬件形態(tài)變了。”
這一判斷在宏觀產(chǎn)業(yè)層面也有具體的支撐。AI的競爭正在從“模型層”下沉到“數(shù)據(jù)層與算力層”。在模型能力快速收斂的當下,應(yīng)用與應(yīng)用的差距,越來越體現(xiàn)為“上下文質(zhì)量”的差距。而誰能高效、實時、安全地為企業(yè)構(gòu)建這一“上下文”,誰就掌握了下一代企業(yè)級軟件的命脈。
OceanBase的判斷是,在這場定義權(quán)的競爭中,中國廠商具備獨特的優(yōu)勢。楊傳輝介紹:“數(shù)據(jù)類的基建核心是應(yīng)用打磨出來的,不是想象的一個方向性。你能不能做成一個事實的標準,取決于你是不是在很多應(yīng)用里面滿足了這個需求。中國的AI落地快,所以甚至有可能中國的企業(yè)在里面起主要作用。”
OceanBase的底氣
然而,參與定義下一代數(shù)據(jù)庫標準的“門票”是極其昂貴的。它要求參與者不僅要有敏銳的洞察,更要有厚重的工程積累。
OceanBase并非平地起高樓。這款中國自主研發(fā)的分布式數(shù)據(jù)庫,內(nèi)核完全自研,已經(jīng)過了長達十五年的“煉獄級”場景打磨。它源于2010年“雙十一”場景對集中式數(shù)據(jù)庫的極限挑戰(zhàn),隨后在金融這一對可靠性要求最為嚴苛的領(lǐng)域扎根——目前已服務(wù)超過400家金融機構(gòu),近七成萬億級資產(chǎn)規(guī)模的銀行將核心系統(tǒng)運行在OceanBase之上;它連續(xù)兩年在中國分布式數(shù)據(jù)庫本地部署市場位居第一,也是迄今唯一同時在TPC-C(事務(wù)處理)和TPC-H(分析處理)兩項國際權(quán)威基準測試中登頂?shù)臄?shù)據(jù)庫。
“數(shù)據(jù)不出錯、系統(tǒng)不中斷、故障毫秒恢復(fù)——AI時代所說的這些剛需,在金融級場景中早已錘煉成熟。”楊冰說。
但更為關(guān)鍵的是,OceanBase擁有一個全世界任何數(shù)據(jù)庫廠商都難以復(fù)制的“AI練兵場”——阿里與螞蟻集團本身。從支付寶的AI支付、螞蟻阿福(AI健康管家)、靈光(全模態(tài)AI助手),到淘寶AI購物助理、通義千問、高德地圖,這些不僅是OceanBase的客戶,更是其AI數(shù)據(jù)庫能力的真實練兵場。
“我們在過去這一年當中,非常***在阿里和螞蟻在AI的方向上大力的投入,為我們創(chuàng)造了大量生產(chǎn)級AI的一些場景。”楊冰坦言,“我們在過程當中進行了大量的實踐和落地,逐步找到了答案。”
楊冰在***訪中進一步闡述了這種“內(nèi)測”的價值:“阿里巴巴也好、螞蟻也好,在這個方向上屬于投入最大的企業(yè)之一。它給我們一下子比我們的客戶更快地帶來了巨多的生產(chǎn)級場景。這個是我覺得比較***的。”
據(jù)了解,螞蟻訓(xùn)練了百靈基礎(chǔ)大模型,并在醫(yī)療和金融場景做了垂直領(lǐng)域的數(shù)據(jù)增強,搭建了訓(xùn)推平臺,并在阿福、螞小財?shù)葮I(yè)務(wù)中迭代出了新一代AI平臺。在這些實際應(yīng)用場景中獲得的前沿認知和痛點,直接反哺了OceanBase AI數(shù)據(jù)庫的設(shè)計。
這使得OceanBase能夠比競爭對手更早地觸及AI落地中的真實痛點——無論是Agent上下文構(gòu)建的準確性,還是海量小庫的隔離與調(diào)度,亦或是多模態(tài)數(shù)據(jù)的一致性難題。
再造一個“AI時代的OceanBase”
在AI時代,中國市場的特殊性在于:企業(yè)數(shù)字化程度參差不齊,但AI接受度極高,且場景豐富度在全球領(lǐng)先。政務(wù)、金融、互聯(lián)網(wǎng)、制造、能源、交通等行業(yè)對AI的需求幾乎同步爆發(fā),這為AI數(shù)據(jù)庫提供了多行業(yè)、大規(guī)模的驗證環(huán)境。
OceanBase選擇了一條獨特的技術(shù)路線。楊傳輝透露,業(yè)界對“湖庫一體”有不同定義。“Databricks的優(yōu)勢在處理大規(guī)模數(shù)據(jù),OceanBase做的更好的是偏在線一點。Agent最大的變化在于,原來跑批的報表系統(tǒng)到了Agent時代會變成實時決策。越來越多的場景會是毫秒級、幾十毫秒、一秒級以內(nèi)的實時處理,在這方面我們有優(yōu)勢。”
“在美國,一個新技術(shù)出現(xiàn)后,通常先由科技公司驗證,再向傳統(tǒng)行業(yè)滲透。但在中國,金融、制造、政務(wù)幾乎同步進入AI落地周期,這意味著我們可以在更短時間內(nèi)獲得更多樣化的場景反饋。”楊冰說。 “這對于定義標準至關(guān)重要——標準不是憑空想出來的,是從實踐中抽象出來的。”
而OceanBase的發(fā)展考量不止于國產(chǎn)升級,還有全球增量市場。目前,OceanBase的業(yè)務(wù)已覆蓋東南亞、日本、印度、拉美、中東等市場,但在北美和歐洲的市場份額有限。楊冰坦言:“北美市場的生態(tài)壁壘很高,企業(yè)選數(shù)據(jù)庫不只看技術(shù),還看生態(tài)、品牌、合規(guī)。這些需要長期投入,不是一年兩年能解決的。”
當然,挑戰(zhàn)同樣不容回避。盡管AI數(shù)據(jù)庫發(fā)展前景廣闊,OceanBase清醒地認識到,這是一場長時間的遠征。數(shù)據(jù)庫領(lǐng)域的生態(tài)構(gòu)建,比技術(shù)突破更為漫長。同行業(yè)廠商用數(shù)十年建立的企業(yè)信任和開發(fā)者生態(tài),不可能被任何一場產(chǎn)品發(fā)布會在一夜間顛覆。
楊冰坦言,最大的挑戰(zhàn)在于品牌、影響力和生態(tài)的構(gòu)建。“一家企業(yè)真正愿意長期選一個數(shù)據(jù)庫,真的不是一下子的事情。”此外,宏觀的全球技術(shù)生態(tài)割裂風險,也是中國企業(yè)走向世界時必須面對的現(xiàn)實障礙。
從產(chǎn)業(yè)經(jīng)濟學(xué)的角度看,數(shù)據(jù)庫作為基礎(chǔ)軟件,天然具有“鎖定效應(yīng)”:一旦企業(yè)將核心系統(tǒng)運行在某款數(shù)據(jù)庫上,遷移成本極高,因此市場格局一旦形成就非常穩(wěn)定。甲骨文在關(guān)系數(shù)據(jù)庫時代的不可撼動也正是源于此。在AI數(shù)據(jù)庫這個新賽道上,誰先建立起足夠的案例、生態(tài)和信任,誰就可能獲得類似的鎖定優(yōu)勢。
OceanBase選擇了一條獨特的技術(shù)路線。楊傳輝透露,業(yè)界對“湖庫一體”有不同定義。“Databricks的優(yōu)勢在處理大規(guī)模數(shù)據(jù),OceanBase做的更好的是偏在線一點。Agent最大的變化在于,原來跑批的報表系統(tǒng)到了Agent時代會變成實時決策。越來越多的場景會是毫秒級、幾十毫秒、一秒級以內(nèi)的實時處理,在這方面我們有優(yōu)勢。”
從十五年前一行行代碼應(yīng)對“雙十一”洪峰,到今天在AI最前沿的場景中持續(xù)打磨——OceanBase的進化路徑始終是由真實的、極具挑戰(zhàn)的業(yè)務(wù)場景倒逼驅(qū)動的。楊冰總結(jié)道:“過去十五年,商業(yè)的范式轉(zhuǎn)變誕生了‘雙十一’,從而倒逼了OceanBase原生分布式數(shù)據(jù)庫的誕生。今天同樣在這些場景下,正在倒逼下一代的AI數(shù)據(jù)庫。這也是OceanBase獨特的演進方式。下一個十年,OceanBase的目標就是再造一個AI時代的數(shù)據(jù)庫。”