【環球網科技報道 記者 林迪】當人工智能的熱潮從語言大模型(LLM)蔓延至物理世界,機器人究竟需要一顆怎樣的“大腦”?在近日舉辦的第八屆北京智源大會(BAAI Conference)上,星源智聯合創始人、智源研究院具身交互世界模型研究中心負責人孫振國正式發布首個具身交互世界模型——ω-EVA(Omega-EVA),旨在對當前世界模型技術路線進行糾偏:讓AI從單純的“***生成”走向真實的“行動決策閉環”。
當世界模型不再“紙上談兵”
孫振國認為:“世界模型不應該只在訓練時預測未來,而應該真正參與動作生成?!?/p>
據介紹,目前的行業現狀是,大多數世界模型仍停留在“離線預測”或“環境模擬”階段,作為輔助功能存在。機器人在執行任務時,往往只能被動執行指令,無法預判動作帶來的連鎖反應,導致在復雜物理環境中作業穩定性不足。
針對這一痛點,星源智發布的ω-EVA模型首創了“預演、驗證、行動”的決策閉環邏輯。與傳統的“看見即行動”不同,ω-EVA讓機器人在執行指令前,先在模型內部“想象”動作帶來的環境變化,并根據推演結果優化動作方案。
“多模態也不是簡單增加輸入,而是讓每種感知以合適的結構參與決策。”孫振國強調,具身模型的終極目標應是從一次性的預測,走向持續感知、想象、修正,并從真實交互中更新自己。
面對“是否忽略了語言理解”的質疑,星源智CEO劉東明確表示,星源智的具身大腦基座依然是基于VLM(視覺語言模型),具備極強的語義理解能力。但ω-EVA的突破在于補全了“預測”與“動作”之間的短板。
“現在的世界模型更多是以語言作為條件,這在具身領域天然存在不一致性。”孫振國解釋道,語言描述具有主觀性和多樣性,容易導致模型決策的不確定性;而以“Action(動作)”作為條件輸入,是唯一的、可控的。ω-EVA將動作(如手腕位姿、末端執行器狀態)作為核心約束,讓模型對未來狀態的預測具備了唯一的“標準解”。
這一技術路線的選擇,直接決定了模型的效率與部署成本。相較于“***生成”路線(如生成未來10秒的像素級畫面),星源智選擇了隱空間(Latent Space)建模。
“我們不會做***生成的技術底座,我們更關注的是關鍵的時效或者關鍵狀態的轉變?!睂O振國透露,ω-EVA參數量僅1.2B,全程在特征空間推理,無需生成像素級***,這使其算力消耗遠低于競品,得以實現端側部署。
端側部署與“賣鏟子”的生意經
在智駕領域,高延遲是致命的;在具身智能領域亦是如此。劉東描述了端側部署的必要性:“如果機器人上面帶著十幾個攝像頭和激光雷達,每秒幾個G的數據量傳到云端,再等指令回來,時延幾秒后,機器人可能已經撞上了障礙物?!?/p>
ω-EVA的輕量化設計(1.2B參數)使其能夠在星源智自研的T5、N5算力模組上高效運行,真正實現了脫離云端的獨立思考。這也構成了星源智獨特的商業壁壘——做具身智能時代的 “英偉達”,而非自己下場造機器人。
“我們不會做本體。”劉東多次重申這一立場。他將當前的行業比作十年前的自動駕駛:“2015、2016年大家瞄著L4、L5,但L2還沒落地?,F在具身智能也是一樣?!彼J為,未來將是“分工”的時代:家電企業和車廠擁有強大的硬件制造能力,但缺乏“大腦”。
星源智提供的正是這套軟硬一體的解決方案。
這一策略得到了資本的青睞。劉東透露,公司成立僅十個月便融資十億,核心在于“價格優勢”與“落地能力”。“對于投資者來說,既然有很好的標的,價格又遠遠低于市場平均價格,他們是很愿意投資的?!?/p>
在現場的Demo展示區,ω-EVA的能力得到了直觀驗證: 機器人不再盲目移動,而是在行動前預演每一步對后續路徑的影響;在現場展示的華容道互動場景中,機器人在有限棋盤內理解滑塊、空格與移動約束之間的關系,并持續評估每一步動作對后續路徑的影響。觀眾可現場打亂棋局,機器人通過觀察當前格局、理解約束關系,最終自主完成還原任務。這一過程直觀呈現世界模型的核心能力:機器人能夠在動作執行前預演后果,并基于狀態變化完成路徑規劃與動作修正。
尤為引人注目的是具身叉車項目。劉東介紹,傳統叉車自動化方案(如AGV)無法應對卡車形態各異、貨物雜亂的“非結構化”場景。
交互是核心,數據是護城河
對于未來的技術演進,星源智展現出了清晰的圖景。孫振國將當前的世界模型路線分為四類:***生成、表征學習、數據生成器,以及星源智主推的“交互世界模型”。
“交互是世界模型非常核心的東西。”他認為,如果世界模型只是作為訓練信號的約束,那它只發揮了10%的性能;只有讓它參與到改變動作的環節,形成閉環,才能釋放其最大價值。
在數據層面,不同于大模型依賴互聯網公開語料,具身智能面臨巨大的數據瓶頸。星源智通過與物流、叉車等行業的合作伙伴建立深度數據共享,積累了寶貴的場景數據。
“數據利用的效率是關鍵。”孫振國表示,VLA(視覺語言動作)模型依賴高質量的成功數據,而世界模型可以利用失敗的軌跡數據。工作8小時,VLA可能產出3小時高質量數據,而世界模型能提升至6-7小時,大幅降低了數據獲取成本。
從“看見世界”到“預判后果”,星源智的ω-EVA正在試圖解決機器人走進現實世界的最后一道難關。在這個喧囂的AI時代,這家年輕的公司選擇用“行動閉環”在每一個具體的場景中(物流、巡檢、服務)扎下根來。正如劉東所說,具身智能的競爭焦點已從“能不能動”轉向“動得穩不穩、準不準”。而星源智,正試圖成為那個讓機器人“動得更準”的幕后推手。