tradingkey.logo
搜尋

AI數據是一門好生意嗎?

證券之星2026年7月27日 07:28
facebooktwitterlinkedin

2026年的AI賽道,大模型廠商還在激烈拼參數、卷迭代,但有一批公司已經悄悄開始“印鈔”了。Menlo Ventures合夥人Deedy不久前在社交平臺X上發佈了一張AI訓練數據公司全景圖,圖中收錄的28家創業公司合計年收入約85億美元,總估值接近1000億美元。僅從收入規模看,訓練數據已經成爲繼AI算力和大模型之後,AI產業第三大的細分賽道。

數字本身比任何分析都更有說服力。根據Stratistics MRC的數據,2026年全球人工智能訓練數據市場規模預計達到55億美元,到2034年將增長至227億美元,複合年增長率達19.3%。數據標註服務市場同樣可觀,研究機構估算2025年全球AI數據標註服務市場估值在42億至72億美元之間。而更具前瞻性的“數據合同”市場——也就是爲AI模型建立數據質量、合規和交付標準的契約化服務——據The Business Research Company報告預計將從2025年的12.8億美元增長到2030年的36.4億美元,年複合增長率達23.3%。

爆發式增長從何而來

這個市場的爆發並非偶然。數據在大模型訓練中的角色發生了根本性轉變——從一次性投入的原材料,變成了持續消耗的燃料。早期大模型實驗室在訓練開始前備好數據集,跑完一輪訓練就等下一代模型再採購,中間往往隔着一年半載。但到了2026年,模型迭代節奏已經快得令人目不暇接——OpenAI的GPT-5.4在3月推出,GPT-5.5在4月跟進,間隔僅約七週;Anthropic在5月底發佈Opus 4.8後,僅過12天又推出旗艦模型Claude Fable 5。迭代越快,實驗室發現的能力缺口就越多,對新增的高價值數據需求也就越頻繁。

需求頻次在上升,單位需求的數據體量也在同步膨脹。以代碼智能體爲例,早期模型僅覆蓋12個Python倉庫的SWE-bench基準測試;到2025年9月,Scale AI發佈的SWE-bench Pro基準測試範圍已擴張到41個倉庫、4種編程語言。一條訓練樣本也從“改幾行代碼”變成了一整套包含需求理解、多文件定位、跨文件修改的完整數據包,單條樣本的容量從幾百個詞元(token)漲到了幾萬個詞元。採購頻次更高、場景更多、每條數據更重——三個因素疊加,訓練數據的總需求量被大幅推高。

誰在悶聲發大財

頭部公司的增長數據堪稱驚人。Mercor在2025年9月的年化收入約5億美元,到2026年6月已突破20億美元(注:此數據爲年化毛收入,扣除專家付款後淨收入約6億至8億美元)。Handshake的增長更誇張——這家原本做了12年大學生招聘的平臺,2025年初才切入AI訓練數據業務,起步時年化毛收入僅500萬至1000萬美元,到2026年4月已接近11億美元(注:扣除專家付款後淨收入約4.5億美元,數據來源:Sacra),一年翻了整整100倍。據東吳證券研報,Scale AI預計2025年收入達到20億美元,2026年銷售額接近40億美元。這還是一個高度集中的賽道——Scale AI、Surge AI、Mercor和Handshake四家公司拿走了全行業超過四分之三的收入。

資本也在加速湧入。具身智能數據平臺覓蜂科技2026年2月才成立,幾個月內就完成了數億元天使+輪戰略融資,投資方包括國方創投、孚騰資本等機構。景聯文科技近期完成近億元A輪融資,投資方覆蓋地方國資、產業資本和數據安全企業。AI數據基礎設施正在成爲一級市場爭相佈局的新方向。

商業模式的進化

這已經不再是傳統意義上“賣勞動力”的生意。深度科技研究院院長張孝榮在接受《中國經營報》採訪時指出,數據標註行業的商業模式正在從“賣勞力”轉向“賣資產”——不再按數據量“一口價”賣數據,而是轉向賣API調用、賣全棧解決方案,甚至探索“詞元(Token)交易”和數據訂閱制。

交付模式也在同步升級。Scale AI已經從按月打包升級爲API按需交付——客戶發起標註任務,最快一小時就能拿到生產級的標籤數據。數據服務商與客戶之間的關係從外包服務逐步轉向長期協作。利潤率的變化反映了這一轉變——據QYResearch統計,2025年全球人工智能訓練數據服務毛利率約49%。數據公司賺的已經不再是標註的人工費,而是深度參與模型研發所產生的服務溢價。

硬幣的另一面:成本與合規

然而,高增長的另一面是同樣高昂的門檻和風險。

首先是數據獲取成本。崑崙萬維董事長方漢在WAIC 2026上指出,具身智能要實現可用水平,需要至少1000萬小時的多模態數據。高質量數據的清洗和標註成本同樣不菲,尤其是在醫療、法律等高精度需求領域。我國訓練數據面臨“質量低、數量少、分佈散”的突出問題,優質中文語料積累不足、公共數據流通不暢、垂直行業數據標註成本高企。

其次是法律風險。2023年12月,《紐約時報》對OpenAI提起版權侵權訴訟,指控其非法使用數百萬篇文章訓練AI模型。2025年5月,美國聯邦法院簽發保護令,要求OpenAI保存所有ChatGPT對話日誌,波及全球超4億用戶。OpenAI抗辯稱,僅合規技術成本就需耗費數月工程週期及數百萬美元的基礎設施支出。Anthropic也曾就類似版權集體訴訟達成15億美元和解協議——該協議於2026年7月20日獲美國聯邦法院最終批准,創下美國版權案件和解金額歷史紀錄。這些標誌性案件正在重塑全球AI企業的合規路徑。

再者是行業標準化的缺失。目前頭部數據企業普遍面臨60%至70%的數據利用率,大量採集數據淪爲“一次性資源”。真實世界數據的採集與標註至今仍高度依賴人工經驗,距離標準化的工業品生產仍有相當距離。大部分高質量數據集的生產仍處於“作坊式”階段,大模型公司大多“自採自用”。

好生意,但不是所有人都能做的生意

回到最初的問題:AI數據是一門好生意嗎?

從市場規模和增長速度來看,答案是肯定的。全球AI訓練數據市場以近20%的年複合增長率擴張,頭部公司年收入從幾億美元到幾十億美元只用了不到兩年時間。國家數據局數據顯示,2025年全國高質量數據集數量超11萬個,同比增長61.13%。市場呈現出“有多少買多少”的賣方市場狀態。

但“好生意”並不等於“容易的生意”。高增長背後是高門檻——數據採集的百億級成本、專業標註的人才稀缺、版權訴訟的鉅額罰單、跨境數據傳輸的合規迷宮。這條賽道真正的分水嶺,不在於誰擁有更多標註員或採集基地,而在於誰率先將“專家經驗”轉化爲“數據流水線”。資本可以燒出採集網絡和標註團隊,但燒不出行業知識的工業化生產體系。

AI數據這門生意,註定屬於那些能同時駕馭技術、成本和合規三重挑戰的玩家。對多數人而言,它是一道高牆內的風景;但對少數已經翻牆而入的公司來說,風景確實不錯。

免責聲明:本網站提供的資訊僅供教育和參考之用,不應視為財務或投資建議。

推薦文章

tradingkey.logo
風險提示:我們的網站和行動應用程式僅提供關於某些投資產品的一般資訊。Finsights 不提供財務建議或對任何投資產品的推薦,且提供此類資訊不應被解釋為 Finsights 提供財務建議或推薦。
投資產品存在重大投資風險,包括可能損失投資的本金,且可能並不適合所有人。投資產品的過去表現並不代表其未來表現。
Finsights 可能允許第三方廣告商或關聯公司在我們的網站或行動應用程式的任何部分放置或投放廣告,並可能根據您與廣告的互動情況獲得報酬。
© 版權所有: FINSIGHTS MEDIA PTE. LTD. 版權所有