KeyFrame內部研究專用

Why AI Agents Need a Data Harness, Not Just a Lakehouse

Tessl AI·7月24日週五·37 min英文

三句話摘要

AI原生應用的數據架構——如何通過數據湖倉、開源標準與語義層實現亞秒級查詢和治理。 為AI應用構建可靠的數據基礎,關鍵不在於購買單一廠商平台,而在於通過開源標準(Iceberg、Arrow、Polaris)與統一的語義層創建靈活、高性能、供應商無關的架構,確保AI智能體能在亞秒級內準確、安全、高效地訪問治理過的數據。 亞秒級性能是AI的硬需求而非奢侈品。傳統分析採用email-pace(分鐘至小時級查詢),人可以離開座位等待,但AI代理無法忍受此延遲,否則工作流卡頓、tokens浪費、上下文丟失,因此現代數據平台必須在次秒內交付結果。

重點整理

重點
  • 1

    亞秒級性能是AI的硬需求而非奢侈品。傳統分析採用email-pace(分鐘至小時級查詢),人可以離開座位等待,但AI代理無法忍受此延遲,否則工作流卡頓、tokens浪費、上下文丟失,因此現代數據平台必須在次秒內交付結果。

  • 2

    語義層解決AI的上下文盲點。業務術語跨團隊定義不同(「客戶」「Q2」「收入」各有各的理解),AI在沒有統一定義層的情況下會隨意選擇,導致查詢錯誤且結果不可信;通過在平台內集中語義層,AI可靠地查找指標定義、理解表關係、執行正確操作。

  • 3

    開源標準比單一產品更關鍵。Apache Iceberg的REST規範讓任何查詢引擎(Spark、Trino、Snowflake、Athena)都能與任何目錄(Polaris、Nessie、Glue)互操作,避免廠商鎖定並降低遷移成本,使用者可按成本或性能自由選擇堆棧。

  • 4

    聯邦查詢加智能緩存取代集中化。避免將所有數據物理遷移到中央倉(高成本陷阱),改為在原地查詢異質數據源,同時通過反射(Reflections)自動檢測慢查詢並創建物化表加速,無需手動改寫SQL。

實用技巧與重點

乾貨
  • 開源項目與數字
  • PyArrow月下載量:超過1億次(僅Python實現)
  • Apache Arrow創建:2016年(與Dremio共同創辦人創立)
  • Apache Iceberg推出:2017年
  • Apache Polaris推出:2024年2月(Snowflake聯合啟動)
  • Dremio技術棧:Parquet(文件格式)+ Iceberg(表格式)+ Apache Polaris(開源目錄)+ Apache Arrow(查詢引擎)
  • 數據優化機制
  • 壓縮(Compaction):合併多個小文件為更大文件,提升性能與降低成本
  • 清理(Vacuuming):刪除未使用的元數據
  • 變體分片(Variant Shredding):從JSON單元提取嵌套結構,啟用謂詞下推
  • 雲緩存(C3):在計算節點本地存儲常訪問數據,某些客戶成本下降90%
  • 查詢計劃緩存:相同查詢復用執行計劃,減半工作量
  • 結果集緩存:相同查詢與數據時復用結果
  • 訪問控制
  • 粒度層級:存儲桶 → 表 → 行 → 列(包括掩碼與過濾)
  • 實現機制:用戶通過自己的憑證查詢,AI代理代理執行時自動繼承該用戶權限
  • AI集成方式
  • 內置智能體:UI中無需構建,直接使用
  • 模型上下文協議(MCP):開源標準,支持自定義工具與提示
  • 開發者CLI:程式化訪問,返回JSON結構便於AI解析
  • 聯邦查詢方案
  • 反射機制:Dremio自動檢測超時查詢,創建物化表,在執行時無縫替換(不需改SQL)
  • 鏈接複製表:在數據湖倉中創建外部系統的複製表,消除重複查詢負擔

結論

結論

為AI應用構建可靠的數據基礎,關鍵不在於購買單一廠商平台,而在於通過開源標準(Iceberg、Arrow、Polaris)與統一的語義層創建靈活、高性能、供應商無關的架構,確保AI智能體能在亞秒級內準確、安全、高效地訪問治理過的數據。

完整解析

詳細

AI原生應用對傳統數據架構提出了致命挑戰。過去的分析工作採用「email節奏」——提交查詢後等待數分鐘甚至數小時,這對靜態報告和特別分析而言是可接受的。用戶可以離開座位喝茶,傍晚時回到結果。但AI智能體不同。當代理需要在對話工作流中實時做決策、連鎖執行多步操作時,每次等待10分鐘就意味著管道崩潰——要麼超時失敗,要麼浪費計算tokens用於重試,要麼丟失上下文。這不是優化目標,而是系統能否運作的必要條件。因此,次秒級響應時間已經從奢侈品變成了AI應用的前置條件。

傳統數據堆棧的困境在於天平兩端。數據湖(通常基於S3等對象存儲)成本低廉且可無限擴展,但查詢能力有限、缺乏事務保障,一個誤操作可能破壞整個數據集。數據倉則提供了ACID事務與可靠的分析性能,但因為集中存儲數據,成本隨規模指數攀升。數據湖倉試圖結合兩者優勢:保持數據在S3等便宜存儲中(降低成本),同時引入元數據目錄與表格式來施加結構。元數據目錄(如Apache Polaris)充當用戶與底層存儲的中介,根據查詢需求只暴露相關數據子集;表格式(如Apache Iceberg)定義了模式、版本歷史、事務邊界。Dremio選擇Parquet作為列式文件格式(天生適合分析工作負載)、Iceberg作為表格式標準、Apache Polaris作為元數據目錄、Apache Arrow作為查詢引擎。這個架構的核心創新在於對開源標準的堅持:Iceberg的REST規範定義了引擎與目錄之間的通話協議,使得任何遵循規範的引擎(Spark、Trino、Snowflake、Athena等)都能與任何目錄無縫互操作。這打破了廠商鎖定,組織無需被某一家平台綁架,可根據成本、性能或現有投資自由選擇堆棧組件。

支持AI工作流的數據平台必須滿足三個基本需求:可訪問性、可理解性、高性能。可訪問性不只是「能看到數據」,而是「只看到應該看到的數據」——通過角色型訪問控制(RBAC)在表層控制,也可在行列層進行細粒度過濾和掩碼(特別重要的是,AI代理通過用戶憑證執行查詢,因此訪問控制自動應用,無需額外機制)。可理解性源自語義層——一個統一定義業務術語的地方。AI模型訓練在通用網路數據上,對特定公司的業務邏輯完全陌生。當「客戶」在銷售團隊和客服團隊有不同定義,或公司剛被SAP收購導致Q2計算方式改變時,AI在沒有統一定義的情況下會隨意選擇其中一個,導致查詢結果錯誤且不可信。通過在平台內將所有定義集中——無論是簡單的標籤、詳細的wiki還是複雜的知識圖——AI可以正確地將自然語言請求映射到正確的表與度量,大幅降低tokens浪費與錯誤風險。高性能通過兩個機制實現:其一,聯邦查詢引擎在原地訪問異質數據源(數據湖、Hadoop、其他倉),無需物理複製所有數據到中央系統(這是數據倉的致命陷阱);其二,Dremio的反射功能自動檢測哪些查詢執行緩慢,自動創建物化表,在查詢執行時無縫替換——用戶的SQL保持不變,但性能大幅提升,無需手動優化或代理干預。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。