KeyFrame內部研究專用

When Agents Meet Physical Data: The Other Physics of Agent Harnesses - Dmitry Petrov, DataChain

AI Engineer·7月20日週一·27 min英文

三句話摘要

編碼代理必須搭配專用數據框架才能有效處理視頻、傳感器等非結構化物理數據。 編碼代理只有通過專為物理數據設計的框架(Pydantic模型、執行引擎、增量更新、知識庫),而不是單靠提升模型強度,才能高效應對非結構化數據的指數級複雜性。 代理在非結構化物理數據上失效率高(Anthropic 21%準確度、OpenAI需6層上下文),單靠更強模型無解。問題根本上是結構化商業邏輯與物理二進制數據的架構差異。

重點整理

重點
  • 1

    代理在非結構化物理數據上失效率高(Anthropic 21%準確度、OpenAI需6層上下文),單靠更強模型無解。問題根本上是結構化商業邏輯與物理二進制數據的架構差異。

  • 2

    非結構化數據複雜度指數爆增。視頻內含片段→幀→物體→置信度→標籤的多層嵌套(「中子星效應」),90支影片產生100,000筆記錄,分析數千支影片輕易衝破百萬筆。傳統JSON+S3或單數據庫方案都引發一致性或系統複雜度問題。

  • 3

    統一架構層是突破口。用Pydantic定義數據模型,包含文件路徑、幀ID、時間戳、類別、置信度、邊界框及嵌套的元數據欄位,讓Python代碼、數據架構、查詢邏輯用同一語言表達,消除SQL孤島。

  • 4

    四層框架缺一不可:Pydantic數據模型、分布式執行引擎(支援40台機器平行處理)、增量更新機制(失敗後只補算新增)、多維元數據層(採星型架構,代理先檢查現成數據集,沒有才構建)。知識庫以Markdown檔案記錄每個數據集的創建理由、會話背景、源代碼、預覽、架構、統計,下次查詢可復用結果。

實用技巧與重點

乾貨
  • 測試結果
  • Anthropic無框架代理數據準確度:21%
  • OpenAI數據代理所需上下文層級:6層
  • 工具與框架
  • 模式定義:Pydantic
  • 分布式計算對比:Dask(推薦,整合計算+存儲)、Ray、Spark
  • 開源項目:DataChain(物理AI數據處理)
  • 案例數據
  • 資料集:行車記錄儀開源數據,1月份91個影片
  • 模型選擇:YOLO(最小版本)
  • 速度追蹤:簡單速度計算方式
  • 粒度:每幀檢測
  • 結果:90個視頻 → 100,000筆檢測記錄 → 24分鐘分析完成
  • 查詢例:92/91個視頻含人物檢測
  • 數據建模技術
  • 多維數據建模(Multidimensional Data Modeling)
  • 星型架構(Star Schemas)
  • 單大表方法(One Big Table)
  • 知識庫文件結構
  • 數據集描述
  • 會話上下文(為何建立此數據集)
  • 存儲依賴(指向原始檔案位置)
  • 數據預覽
  • 架構定義
  • 統計指標
  • 源代碼(最關鍵)
  • 數據譜系
  • 源數據(Object Storage)→ 計算引擎 → 數據集與元數據 → 數據倉庫 → 知識庫

結論

結論

編碼代理只有通過專為物理數據設計的框架(Pydantic模型、執行引擎、增量更新、知識庫),而不是單靠提升模型強度,才能高效應對非結構化數據的指數級複雜性。

完整解析

詳細

編碼代理在非結構化物理數據上表現不佳。Anthropic和OpenAI的研究發現,通用代理處理數據項目的準確度僅21%,OpenAI甚至需要6層專用上下文才能運作。這不是模型大小問題,而是結構化商業邏輯世界與非結構化物理數據世界的根本差異。

非結構化數據的複雜性呈指數增長,就像「中子星」—表面看起來只是幾個或幾千個視頻檔案,但內部包含片段、幀、物體、置信度分數、標籤等層層嵌套結構。演講者以實際案例說明:分析90個行車記錄儀視頻,光是人物檢測就產生100,000筆記錄。若擴大到數千個視頻,記錄數輕易破百萬;再細化到物體層級,規模可能增加10到100倍。

傳統的數據組織方式效率低下。許多團隊將元數據存為JSON檔案,放在S3旁邊,結果產生數百萬個JSON、高延遲和一致性問題。進階團隊改用集中式數據庫,卻引入了兩個系統、兩種編程語言和複雜的系統棧,研究人員往往不願處理這種複雜度。解決方案是統一使用Pydantic模式—用同一Python語言定義數據結構、架構和代碼,徹底消除代碼庫中的「SQL孤島」。

完整的數據框架由四層組件構成。第一層是基於Pydantic的數據模型,定義視頻檔案、幀ID、時間戳、類別ID(代表人物或車輛等)、置信度分數、邊界框坐標,以及嵌套的檔案元數據(路徑、版本控制ETag、文件大小)。第二層是執行引擎,負責高效的並行或分布式處理。研究人員只需指定所需資源數量(例如40台機器),引擎自動分配任務。第三層是增量更新和檢查點機制,如果處理失敗,修復後只需補算新增的檔案,無須從頭開始,大幅節省成本。第四層是元數據層組織,採用傳統數據倉庫的多維建模和星型架構等技術。關鍵創新是:代理在回答問題前,先自問「我是否已有適當的數據集能快速回答」,若無才構建新的元數據層,且構建時採取足夠通用的設計,以服務一類相關問題而非單次查詢。

知識共享機制防止重複計算。每個數據集應在知識庫(以Markdown檔案組織)中完整記錄:數據集創建的理由、會話背景、存儲依賴路徑、數據預覽、架構定義、統計指標和生成代碼。源代碼是最關鍵的部分,讓下次遇到類似問題的代理和團隊成員能直接理解和復用。整個系統形成完整的數據譜系:原始數據→計算引擎→數據集→數據倉庫→知識庫,每一層都相互連接,讓代理和人類都能看到全貌。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。