State of Data — Sean Cai, Independent / State of Data
三句話摘要
資料市場如何決定AI應用層的成熟順序,以及為什麼企業級資料業務是資料公司的未來。 資料的最終價值不在規模,而在於能否持續連結真實工作流並自動最佳化企業模型——這要求資料業務演進為企業級RL平臺,而非永久的資料販賣者。 資料市場的商業結構轉變——從2023年的Scale/CoreWeave垂直整合模式,演進為20-30家專業化供應商競爭。質量瓶頸讓實驗室被迫分散採購,這是結構性變化而非過渡階段,反映出資料質量難以規模化的根本問題。
重點整理
重點- 1
資料市場的商業結構轉變——從2023年的Scale/CoreWeave垂直整合模式,演進為20-30家專業化供應商競爭。質量瓶頸讓實驗室被迫分散採購,這是結構性變化而非過渡階段,反映出資料質量難以規模化的根本問題。
- 2
Type 1 vs Type 2 的本質差異——Type 1是GitHub commits、會話回放這類真實工作流的最小加工版本;Type 2是僱傭專家在人工設定中創造的任務。將模型從20%推到80%的是Type 1資料,因為真實性內建於工作本身,而非外部獎勵塑形。
- 3
可驗證性法則決定應用層順序——程式碼之所以成為第一個成熟市場,因為GitHub同時解決三個驗證軸線:任務可分解(單元測試)、標準共識明確(程式碼要工作)、驗證例子無限(開源commit)。金融、醫療、法律、安全、生物的低可驗證性導致基準虛假,解釋了為何Anthropic先後投資網路安全→生物資料的商業訊號。
- 4
基準測試的危機——單個基準數字只是未測量分佈中的一個樣本。大多數廠商採用"專家生成→模型失敗例子→包裝基準→資料販賣來hill-climb"的迴圈,Goodhart定律讓測量失效。跨基準和跨框架差異導致高假陽性率(Opus 4.8 vs 4.7的不同最佳化方向表明模型差異),需要細緻的rubric分析才能看穿。
實用技巧與重點
乾貨- 資料標註產業規模:10-15億美元/年
- 資料分類法:Type 1(真實工作流+最小加工)vs Type 2(專家+人工設定)
- 可驗證性三軸線:(1)任務分解難度、(2)正確性共識、(3)驗證例子頻率
- 應用層成熟順序(按可驗證性升序):程式碼→搜尋→金融→醫療法律→網路安全/生物/科學發現→品味
- 財務任務例項:ARR waterfall reconciliation、LBO valuation memo、long-short pair trade
- 模型對比:Opus 4.8自我反思過度工程化;GPT-4.5與Opus 4.8在同任務中精算vs方法論各自最佳化方向相反
- 資料採購訊號示例:Anthropic 2024年1月專注網路安全資料→3-4月轉向生物資料→Claude Cyber/Claude Bio釋出
- 基礎設施歷史規律:沒有基礎設施技術先驅長期佔有超過10%市場(鐵路→汽車、AWS/Google未壟斷應用層)
- 新興企業基礎設施需求:小模型路由、RL資料集管理、跨模型自動再訓練
結論
結論“資料的最終價值不在規模,而在於能否持續連結真實工作流並自動最佳化企業模型——這要求資料業務演進為企業級RL平臺,而非永久的資料販賣者。”
完整解析
詳細資料市場正經歷從2023年垂直整合向專業化分工的根本轉變。曾經,Scale和CoreWeave這樣的巨頭壟斷了從人工採集到資料驗證的全鏈條,因為那是唯一讓經濟學成立的模式。但如今專業化廠商在採集、環境設計、獎勵機制、評估等各環節分別壓倒大廠,這種碎片化是永久的,而非過渡。
這個變化的根本原因是一個反直覺的發現:資料質量不隨數量線性增長。實驗室開始強制要求20-30家供應商多元化採購,本質上是對"規模化質量"這一承諾的集體不信任。這催生出"資料工業革命"的第二層結構——Type 1 vs Type 2資料的質量分層。Type 1是GitHub commits或會話回放這樣的真實工作流,最小化外部干預;Type 2是僱傭領域專家在人工設定中生成任務和解答。諷刺的是,大多數資料廠商都銷售Type 2並假裝是Type 1。
將模型效能從20%拉到80%的正是Type 1,因為現實性內嵌於工作本身,而非外部的獎勵標籤。這也解釋了為什麼可驗證性成為預測應用層成熟順序的關鍵指標。講者提出了驗證的三個軸線:(1)能否將任務分解為可檢查的步驟、(2)正確性定義的共識程度、(3)現實世界驗證例子的頻率。程式碼之所以成為第一個成熟的AI應用層市場,絕非偶然——GitHub同時在三個軸線上得分最高。單元測試提供了客觀的可分解正確性,社群對"程式碼可用"有明確共識,開源的無限commit提供了理由鏈。反觀金融、醫療、法律、安全,這些領域的驗證例子被鎖在企業工作流中,驗證共識模糊,任務分解困難。Anthropic的資料採購路線圖(2024年1月網路安全→3月生物)恰恰預示了後續產品釋出(Cyber、Bio),證明資料採購是應用層成熟的前置訊號。
現行基準測試體系本質上是虛假的。主流做法是:招聘專家→用聊天生成任務→讓模型解答→挑出模型失敗的案例→包裝成"硬核基準"→轉賣資料給實驗室最佳化這同一個基準。Goodhart定律在這裡呈現最壞形態:測量一旦成為目標,就停止衡量真實。單個基準數字只是從未被真正測量的分佈中抽取的一個樣本,而且充滿噪聲。講者用真實財務任務驗證發現,Opus 4.8在某些rubric上反而不如4.7,GPT-4.5與Opus 4.8在同一任務中精算vs方法論各自最佳化,說明跨框架差異掩蓋了模型設計方向。這種虛假基準的流行導致"基準精神分裂症":實驗室用同一個指標卻做出相反最佳化決策。
未來的資料業務不再是賣資料集本身。講者指出,成功的資料公司都在轉向企業級應用,成為"neo-labs"而非"資料工廠"。價值最終積累在服務層和應用層的真實工作。這要求建立一個新的抽象層:當企業停止租賃實驗室智慧、改為擁有自己的模型時,需要小模型路由、RL資料集管理、跨開源基座的自動再訓練等基礎設施。基礎設施技術歷史表明,沒有先驅能長期佔有超過10%市場份額——鐵路被汽車取代,AWS/Google壟斷了基礎層但未拿下應用層。Anthropic正在構建"fiefdoms",但這些壓力(蒸餾、出口限制、企業獨佔)本質上是"鐵路租賃",而開源模型(GLM-5.2)已證明應用層可以解耦模型層。資料公司的護城河不是資料本身,而是進入真實工作流的管道加保持再訓練的基礎設施。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


