KeyFrame內部研究專用

State of Data — Sean Cai, Independent / State of Data

AI Engineer·7月26日週日·18 min英文

三句話摘要

資料市場如何決定AI應用層的成熟順序,以及為什麼企業級資料業務是資料公司的未來。 資料的最終價值不在規模,而在於能否持續連結真實工作流並自動最佳化企業模型——這要求資料業務演進為企業級RL平臺,而非永久的資料販賣者。 資料市場的商業結構轉變——從2023年的Scale/CoreWeave垂直整合模式,演進為20-30家專業化供應商競爭。質量瓶頸讓實驗室被迫分散採購,這是結構性變化而非過渡階段,反映出資料質量難以規模化的根本問題。

重點整理

重點
  • 1

    資料市場的商業結構轉變——從2023年的Scale/CoreWeave垂直整合模式,演進為20-30家專業化供應商競爭。質量瓶頸讓實驗室被迫分散採購,這是結構性變化而非過渡階段,反映出資料質量難以規模化的根本問題。

  • 2

    Type 1 vs Type 2 的本質差異——Type 1是GitHub commits、會話回放這類真實工作流的最小加工版本;Type 2是僱傭專家在人工設定中創造的任務。將模型從20%推到80%的是Type 1資料,因為真實性內建於工作本身,而非外部獎勵塑形。

  • 3

    可驗證性法則決定應用層順序——程式碼之所以成為第一個成熟市場,因為GitHub同時解決三個驗證軸線:任務可分解(單元測試)、標準共識明確(程式碼要工作)、驗證例子無限(開源commit)。金融、醫療、法律、安全、生物的低可驗證性導致基準虛假,解釋了為何Anthropic先後投資網路安全→生物資料的商業訊號。

  • 4

    基準測試的危機——單個基準數字只是未測量分佈中的一個樣本。大多數廠商採用"專家生成→模型失敗例子→包裝基準→資料販賣來hill-climb"的迴圈,Goodhart定律讓測量失效。跨基準和跨框架差異導致高假陽性率(Opus 4.8 vs 4.7的不同最佳化方向表明模型差異),需要細緻的rubric分析才能看穿。

實用技巧與重點

乾貨
  • 資料標註產業規模:10-15億美元/年
  • 資料分類法:Type 1(真實工作流+最小加工)vs Type 2(專家+人工設定)
  • 可驗證性三軸線:(1)任務分解難度、(2)正確性共識、(3)驗證例子頻率
  • 應用層成熟順序(按可驗證性升序):程式碼→搜尋→金融→醫療法律→網路安全/生物/科學發現→品味
  • 財務任務例項:ARR waterfall reconciliation、LBO valuation memo、long-short pair trade
  • 模型對比:Opus 4.8自我反思過度工程化;GPT-4.5與Opus 4.8在同任務中精算vs方法論各自最佳化方向相反
  • 資料採購訊號示例:Anthropic 2024年1月專注網路安全資料→3-4月轉向生物資料→Claude Cyber/Claude Bio釋出
  • 基礎設施歷史規律:沒有基礎設施技術先驅長期佔有超過10%市場(鐵路→汽車、AWS/Google未壟斷應用層)
  • 新興企業基礎設施需求:小模型路由、RL資料集管理、跨模型自動再訓練

結論

結論

資料的最終價值不在規模,而在於能否持續連結真實工作流並自動最佳化企業模型——這要求資料業務演進為企業級RL平臺,而非永久的資料販賣者。

完整解析

詳細

資料市場正經歷從2023年垂直整合向專業化分工的根本轉變。曾經,Scale和CoreWeave這樣的巨頭壟斷了從人工採集到資料驗證的全鏈條,因為那是唯一讓經濟學成立的模式。但如今專業化廠商在採集、環境設計、獎勵機制、評估等各環節分別壓倒大廠,這種碎片化是永久的,而非過渡。

這個變化的根本原因是一個反直覺的發現:資料質量不隨數量線性增長。實驗室開始強制要求20-30家供應商多元化採購,本質上是對"規模化質量"這一承諾的集體不信任。這催生出"資料工業革命"的第二層結構——Type 1 vs Type 2資料的質量分層。Type 1是GitHub commits或會話回放這樣的真實工作流,最小化外部干預;Type 2是僱傭領域專家在人工設定中生成任務和解答。諷刺的是,大多數資料廠商都銷售Type 2並假裝是Type 1。

將模型效能從20%拉到80%的正是Type 1,因為現實性內嵌於工作本身,而非外部的獎勵標籤。這也解釋了為什麼可驗證性成為預測應用層成熟順序的關鍵指標。講者提出了驗證的三個軸線:(1)能否將任務分解為可檢查的步驟、(2)正確性定義的共識程度、(3)現實世界驗證例子的頻率。程式碼之所以成為第一個成熟的AI應用層市場,絕非偶然——GitHub同時在三個軸線上得分最高。單元測試提供了客觀的可分解正確性,社群對"程式碼可用"有明確共識,開源的無限commit提供了理由鏈。反觀金融、醫療、法律、安全,這些領域的驗證例子被鎖在企業工作流中,驗證共識模糊,任務分解困難。Anthropic的資料採購路線圖(2024年1月網路安全→3月生物)恰恰預示了後續產品釋出(Cyber、Bio),證明資料採購是應用層成熟的前置訊號。

現行基準測試體系本質上是虛假的。主流做法是:招聘專家→用聊天生成任務→讓模型解答→挑出模型失敗的案例→包裝成"硬核基準"→轉賣資料給實驗室最佳化這同一個基準。Goodhart定律在這裡呈現最壞形態:測量一旦成為目標,就停止衡量真實。單個基準數字只是從未被真正測量的分佈中抽取的一個樣本,而且充滿噪聲。講者用真實財務任務驗證發現,Opus 4.8在某些rubric上反而不如4.7,GPT-4.5與Opus 4.8在同一任務中精算vs方法論各自最佳化,說明跨框架差異掩蓋了模型設計方向。這種虛假基準的流行導致"基準精神分裂症":實驗室用同一個指標卻做出相反最佳化決策。

未來的資料業務不再是賣資料集本身。講者指出,成功的資料公司都在轉向企業級應用,成為"neo-labs"而非"資料工廠"。價值最終積累在服務層和應用層的真實工作。這要求建立一個新的抽象層:當企業停止租賃實驗室智慧、改為擁有自己的模型時,需要小模型路由、RL資料集管理、跨開源基座的自動再訓練等基礎設施。基礎設施技術歷史表明,沒有先驅能長期佔有超過10%市場份額——鐵路被汽車取代,AWS/Google壟斷了基礎層但未拿下應用層。Anthropic正在構建"fiefdoms",但這些壓力(蒸餾、出口限制、企業獨佔)本質上是"鐵路租賃",而開源模型(GLM-5.2)已證明應用層可以解耦模型層。資料公司的護城河不是資料本身,而是進入真實工作流的管道加保持再訓練的基礎設施。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。