林俊旸從阿里離職后首發長文:復盤千問路線受阻,斷言AI演進全面轉向智能體_思考_模型_推理
3月27日,前阿里千問技術負責人林俊旸離職后發表長文,明確指出 AI 大模型的發展路線正在經歷重大跨越,核心競爭焦點正從“推理型思考(Reasoning Thinking)”全面轉向“智能體思考(Agentic Thinking)”。
文章復盤了以 OpenAI o1 和 DeepSeek-R1 為代表的第一***理模型浪潮,指出這標志著行業從擴大預訓練規模,正式步入擴大強化學習(RL)后訓練規模的新階段,數學與代碼等可驗證領域成為優化模型正確性的核心試金石。
林俊旸在文中深度剖析了行業內嘗試“融合思考與指令模式”所面臨的落地困境。他透露,千問團隊曾試圖通過 Qwen3 打造支持混合思考模式的系統,但在實際推進中發現,指令模型追求極簡與低延遲,而思考模型需要消耗大量 Token 進行復雜推演,兩者在數據分布和行為目標上存在根本沖突。若數據篩選不當,強行融合往往會導致模型在兩端表現平庸?;谏虡I客戶對高吞吐量和低成本的真實需求,Qwen 在后續的 2507 版本中選擇推出了分離的 30B 和 235B 指令與思考變體。與之形成對比的是,Anthropic 和 DeepSeek 等廠商則繼續在統合推理與工具調用的混合架構上進行探索。
針對下一階段的技術演進,林俊旸斷言,單純延長模型內部推理軌跡的時代即將過去,未來的主導將是在與環境交互中持續迭代***的智能體思考。他指出,智能體強化學習(Agentic RL)徹底改變了原有的技術棧要求,訓練與推理必須實現更純粹的解耦。隨著大模型獲得搜索、代碼執行等工具權限,防范獎勵***(Reward Hacking)將成為極其危險的挑戰。未來的行業護城河將不再局限于算法本身,而是轉移至高質量環境設計、防***協議以及多智能體協同編排等系統工程能力上。
來源:鳳凰網科技返回搜狐,查看更多









