萬億數據產業背后,被AI「困住」的打工人_文琪_工作_崗位
「核心提示」
AI發展帶來數據標注、數據***集等新崗位,但職業瓶頸和薪資限制了這些崗位的人才流入,反過來影響了AI能力的天花板。
作者 | 張經緯
編輯 | 邢昀
AI的發展正催生出這樣的圖景:在分工層次上,人來負責上層的“判斷和決策”、下層的“打標和整理”。而中間層的“分析和總結”,那些傳統由分析師、咨詢顧問和秘書完成的腦力勞動,正被各類AI工具填滿。
好消息是,上下兩層出現了一些新崗位。比如數據標注、數據構建和數據***集。這些崗位正以前所未有的速度涌入就業市場。脈脈報告顯示,2026年春招AI崗位量同比增長8.7倍。
數據***集與具身智能密切相關:***集員需要穿戴動捕設備,記錄觸覺、視覺、力學等多模態數據,幫助機器人學習抓取、行走、避障等動作。
數據構建則是對數據“去雜”的過程:公開數據或企業數據庫往往格式混亂、存在錯誤,需要人工進行篩選和整理。
數據標注則是AI產出內容的“裁判”,告訴大模型什么樣的輸出是“好的”,幫助AI形成學習正反饋,提升大模型輸出內容的質量。
這些新工作到底是長久趨勢,還是曇花一現;能成為“文科生的康莊大道”嗎,還只是“新一代天坑”?為此,《豹變》找到了一些從事相關工作的人,試圖還原AI催生的新崗位背后真實情況。
1、“數據做題家”的真實面貌
景璃在北京某互聯網大廠擔任數據標注的外包,工作是提升AI文創工具的輸出質量,她大學專業是戲劇影視文學。
景璃對《豹變》說:“我標注過的品類包括演講稿、***、論文,現在做最多的是漫劇或者AI短劇的劇本。”
數據標注行業也有大量的非全職招聘。成都大學生文琪就找了一份數據標注的遠程兼職,內容是給英文的語音轉文字做標注。
她們的工作流程一般是這樣的:電腦上會顯示AI的幾個輸出結果,數據標注負責選一個最優結果,由負責質檢的同事再判斷一次,負責人抽查一次,最后再由甲方檢查。根據這個最優結果,AI能夠逐漸“理解”人類的評價標準,從而提升輸出質量。
景璃一些外包同事是數學或計算機背景,他們會承擔部分數據構建的工作,即爬取公開數據,依據特定的方式進行數據清洗、整理,最后用于大模型的標注和訓練。分工上,數據構建位于標注的上游。
行業內把構建和標注工作戲稱為“做題”,沒有這些“數據做題家”就沒有各類AI工具。
據國家數據發展研究院測算,2025年專業數據產品(含人工智能訓練的高質量數據集)產值規模超過2.3萬億元。
2025年3月,國家數據局數據顯示,成都、沈陽、合肥等七大數據標注基地帶動從業人員5.8萬人,相關產值超83億元。
市場很大,崗位薪水也各有不同。景璃與她的同事們每月能拿到12k到18k左右的固定薪水,少數人可以拿到額外獎金;文琪的兼職也能拿到每月接近10k的固定薪水。
但是,一線城市以外的地方,數據標注的薪水就沒這么可觀了。景璃談到,在一些北方省會城市,同等崗位工資大約是北京的一半。
一些小城市則更低,且人員流動性很大。“新員工下班等電梯都在刷BOSS直聘找工作。”某位身在小城市、剛剛入職的數據標注員這樣對《豹變》透露,他的首月薪水是1500元。
差異不光來自城市,也來自公司在行業的地位。在數據標注出現以前,景璃所在的公司就是業內知名的外包公司,客戶包括國內多家互聯網大廠。
這也決定了他們的招聘要求。景璃所在崗位要求有編劇、文學創作類經驗,校招生前幾年要求是本科,現在則要求985/211大學的文學類專業。文琪的兼職是英語類,要求英語專業八級,且成績至少要達到“良好”。
2、AI需要“裁判”“翻譯”和“保姆”
為什么AI需要這些工作?
因為AI缺乏實踐積累出來的判斷能力。目前,主流AI已經把互聯網上的公開信息學習完畢。但在各類細分行業,還存在著大量的“水下信息”:行業內部的隱性知識、經驗判斷,甚至市面上的二手消息也需要進行甄別,數據標注就是這樣一個幫助AI理解人類評價標準的“信息裁判”。
以法律領域為例,AI可以背誦所有法條,但面對一個具體案件的證據鏈分析,需要理解法官在特定地區的裁判傾向、了解某些證據在實踐中的***信概率,這些不會出現在裁判文書網上。
景璃所在的劇本賽道,AI在標注前的輸出質量很難讓人類滿意。“從戲劇創作的角度,AI生成的內容很多有明顯的問題,處理這些問題的標準是相對簡單、客觀的。有時候,AI給的幾個備選都不太好,甚至很難找到最優的。”
如果說數據標注是信息裁判,那么具身智能的數據***集就是AI與物理世界之間的翻譯。現實世界存在海量物理信息,人和動物的神經系統可以自主適應,但機器人就必須靠人把真實情況如何“告訴”它。
此前有業內人士表示,大語言模型GPT-5訓練語料折合約100億小時,而全行業匯聚的高質量具身數據僅約50萬小時,差距以萬倍計。
數據***集的缺口大,也催生出資本熱度,目前行業里頭部的創業玩家,光輪智能和帕西尼感知估值均達到了百億級別。
帕西尼感知2025年在天津投產了全球最大具身智能數據***集工廠——Super EID Factory,部署超150個標準化***集單元,年產2億條高質量訓練數據;2026年又在江蘇宿遷、湖北武漢、四川自貢、江西贛州建4座超級工廠。
復雜的不光是物理世界,還有企業的數據庫。一位從事制造業的人士告訴《豹變》,個人和企業級AI Agent存在開發上的鴻溝,因為AI本質上是一個概率模型,難以完成企業里一些“精準且復雜”的工作,比如數據管理。
一位AI產品經理表示,“我們現在的數據管理智能體,正式運行前的數據清洗還是需要人工來完成。AI如果想要應用于傳統制造業,對數據質量的要求很高。”
原因在于,大部分制造業沒有使用統一格式的數據庫,不同部門使用不同的數據標準,同一組數據在不同的表格里有不同的字段名稱,數據中還存在大量冗余信息和錯誤。由于AI有一定概率出現幻覺,無法精準消化這些“臟數據”,必須經過清洗、對齊、補全。
這導致了AI工具要在企業跑通,需要有人做它的“保姆”。現在的企業級AI Agent,大多以整合服務方案應用于制造業,方案內容包括:數據線上化、數據清洗,最后才是AI Agent的具體應用。
3、人和AI各自的“煩惱”
不光是傳統制造業,AI大廠的管理者們也希望通過AI提高企業日常運行的效率。但現實是,企業管理層往往寄望于AI降本增效,卻低估了基層員工在決策中的作用。
一些大廠員工對《豹變》表示,企業強推AI,實際上增加了工作壓力,因為員工不得不為AI的工作產出“擦屁股”。員工被要求在AI輔助下完成更多任務,但AI輸出的結果又需要人工反復核對修正。
這也和一些公開的研究成果相吻合。
員工行為分析平臺ActivTrak跟蹤了2023-2025年超千家企業和4.43億小時的數字化工作行為數據,并得出結論:隨著AI落地職場,從業者的工作量并未減少,反而出現周末加班增多、工作碎片化加劇的情況。其中,員工的協作溝通時長增加34%,多任務處理時間增加了12%。
當然,這種壓力一般不會壓在數據外包的頭上。“每天10點上班7點下班,一天工作8到9小時,白天時不時也能休息。”景璃這樣對《豹變》說。
雖然覺得工作的性價比還可以,但景璃還是在考慮別的方向。“我的目標是去做短劇編劇,現在這份工作很機械,做久了對職業發展沒什么幫助。”她的大多數同事卻覺得,現在找個事少離家近的工作已經不容易了,抱著先做著的心態。
想法的不同可能和群體有關。景璃剛參加工作不久,她的同事們則大多超過30歲。在互聯網大廠,這已經是一個平均年齡相對較大的群體。
文琪也明確表示,做數據標注的兼職只是賺個外快,校招找工作是不會找數據標注的。文琪的兼職群里也大多是學生或其他需要賺快錢的各類人群。
這可能意味著,從事數據標注的人要面對長期的職業生涯瓶頸。
這種沒有行業資深人士參與、提升空間有限的狀況,也限制了AI的能力。一些頭部數據標注公司也試圖尋找專業人士,但整體上并不成功。一位資深律師向《豹變》透露,有數據標注公司找上過自己,但被他拒絕,因為開出的價碼太低。“就算你給我8000元一小時,我還要掂量下要不要冒失去飯碗的風險,何況只給200元一小時呢?”
越是需要做復雜判斷的領域,數據標注的成本越高,但很多標注企業又不愿意付出足夠高的溢價。結果是,這些領域的數據缺口長期存在,模型在垂直場景的表現也難以突破。
具身智能也面對類似的數據價格瓶頸,后果則是企業間的差距被拉大。真機遙控操作是行業公認質量最高的數據***集方案,單小時有效數據的成本可高達數千元,頭部機器人公司憑借資金優勢擁有最豐富的真機數據積累。
但很多公司受限于資金規模,只能用頭部機器人公司的公開數據或仿真數據訓練自己的模型,但仿真數據與真實物理環境存在偏差,遷移到真機時往往出現“Sim2Real Gap”(仿真到現實的差距)。
長遠來看,數據成本總有隨著規模化而被攤薄的一天。但AI始終要面對“做錯了誰來負責”的問題。
責任背后,是法律與社會對“人格化主體”的認定。但AI不是法律主體,不能承擔民事責任。企業如果用AI替代專業人士完成這些工作,一旦出錯,責任鏈條會變得模糊不清。
這也是很多工作無法被AI取代的另一重原因。這些工作,既是AI發展的基石,也是AI局限性的證明。只要AI還在學習人類知識,只要物理世界還需要被“翻譯”成數字語言,只要社會還需要明確的責任主體,這些工作崗位就會繼續存在。
(應受訪者要求,文中均為化名)返回搜狐,查看更多









