KeyFrame內部研究專用

Why Can't Anyone Answer Questions About the Business? — Garrett Galow, WorkOS

AI Engineer·6月11日週四·19 min英文

三句話摘要

WorkOS 內部 AI 助手 Studio:用自然語言查詢和自動生成儀表板,讓業務人員自助獲取數據洞察。 WorkOS 通過 AI agent 的動態上下文管理和自動代碼生成,將複雜的數據查詢任務轉化為自服務工具,不僅提升全公司生產力,也直觀演示了 LLM 在企業內部系統的實戰價值——關鍵在於驗證層、上下文分層和生成代碼的獨立部署。 傳統數據查詢的瓶頸在於低效協作。業務人員無法自助回答數據問題,需要技術人員充當中介,每次詢問都要解釋背景、等待查詢、確認細節,查詢結果通常在 Slack 分享後就消失,無法重用和規模化。

重點整理

重點
  • 1

    傳統數據查詢的瓶頸在於低效協作。業務人員無法自助回答數據問題,需要技術人員充當中介,每次詢問都要解釋背景、等待查詢、確認細節,查詢結果通常在 Slack 分享後就消失,無法重用和規模化。

  • 2

    Studio 的核心創新是 Widget 概念。系統不只執行一次性查詢,而是生成包含前端 UI、後端 API 呼叫和查詢邏輯的完整 JavaScript 代碼。這個 widget 一旦部署就獨立運行,支持團隊可反覆使用而無需再次調用 LLM,確保可靠性和成本效率。

  • 3

    上下文管理決定 agent 的準確性。Snowflake 的 schema 複雜(如跨四張表的客戶關聯),Radar 的業務邏輯特殊(區分 attempts 和 detections),系統在調用工具時動態注入這些上下文,而非預加載所有內容以保護 context window。

  • 4

    驗證層確保生成查詢的正確性。系統執行查詢並檢查是否返回數據(許多 SQL 在語法上有效但返回零結果),還透過 context 指示 LLM 過濾已刪除實體和確認 status column,減少常見錯誤。

實用技巧與重點

乾貨
  • 架構與技術
  • LLM:Claude Opus
  • Agent 框架:LangGraph
  • 數據源:Snowflake(主數據庫)、Linear(issues)、Notion(文檔)
  • 狀態存儲:Convex
  • 部署方式:內部儀表板 + Slack bot
  • 輸出格式:Widget(包含 UI、API、query 的 JavaScript 代碼)
  • 三層保障機制
  • 序列化流程:前置檢查(工具連接?足夠上下文?)→ 澄清問題 → 決定工具清單 → 執行
  • 分層上下文
  • 基礎 prompt(agent 行為定義)
  • 組織規則(工具特定的 schema、join 邏輯)
  • 運行時注入(在調用工具時才加載該工具的完整上下文)
  • 驗證層
  • 執行查詢前驗證語法正確性
  • 檢查查詢是否返回有效數據
  • context 中明確指定 filter 條件(如非已刪除、active status 等)
  • Snowflake 上下文示例
  • 客戶實體表示方式
  • 表格間的正確 join 邏輯
  • Status column 過濾規則
  • 主鍵和外鍵關係
  • 實際應用案例
  • 內容效果分析:哪些部落格文章、文檔、變更日誌驅動最多新團隊註冊
  • Radar 查詢工具:支持團隊自助查詢特定用戶的登入嘗試和是否被系統封鎖
  • 可支援跨多個數據源混合查詢(如 Snowflake + Linear + Notion)
  • 權限與成本
  • 目前:用戶個別連接各工具(使用者自身權限)
  • 未來規劃:組織級連接(一人設定,其他人按角色繼承權限)
  • 產品依賴:WorkOS 自家的 Pipes 產品提供第三方整合
  • 成本策略:優先選擇 Opus(優於其他模型),不進行緩存優化

結論

結論

WorkOS 通過 AI agent 的動態上下文管理和自動代碼生成,將複雜的數據查詢任務轉化為自服務工具,不僅提升全公司生產力,也直觀演示了 LLM 在企業內部系統的實戰價值——關鍵在於驗證層、上下文分層和生成代碼的獨立部署。

完整解析

詳細

WorkOS 面臨的核心問題是業務人員頻繁需要數據洞察,但傳統流程極其低效。當有人想回答「什麼內容最能驅動新客戶」這類問題時,他們往往技術水平不足以自行查詢,必須向技術人員尋求幫助。技術人員需要理解背景、確認需求範圍、撰寫 SQL 查詢、驗證結果是否符合預期,然後將答案分享在 Slack 中。這個流程容易出現誤解,最終答案通常是一次性的,無法被其他團隊成員重用。

為了解決這個問題,WorkOS 構建了 Studio——一個智能化的內部工作空間。用戶可以在內部儀表板或 Slack bot 中用自然語言提出任何商業問題。系統首先進行序列化的前置檢查,確認所有工具是否正確連接、是否掌握足夠上下文來回答問題,然後通過 LangGraph agent 驅動 Claude Opus 模型開始工作流。

在執行階段,系統的關鍵創新在於分層上下文管理。不是預加載所有數據源的完整 schema(會爆表 context window),而是在 agent 決定調用特定工具時才動態注入該工具的上下文。舉例來說,Snowflake 的上下文包含該公司內部 database 的完整 schema——客戶、環境、資源的表示方式,以及複雜的 join 邏輯(某些關聯需要跨四張表)。同樣,Radar 安全產品的上下文定義了 attempts(登入嘗試)與 detections(偵測事件)的區別,以及如何正確過濾已刪除實體和確認 status column。

系統執行查詢後,進行驗證層檢查。許多 SQL 查詢在語法上完全有效,但返回零結果——這種情況下如果系統沒有察覺,答案對使用者毫無用處。因此 Studio 會實際執行查詢、檢查返回數據是否存在、驗證邏輯是否符合業務常識(如應該過濾已刪除的客戶、應該只計算 active status 的資源)。

當用戶滿足於初步答案後可以要求「幫我建立可重用的儀表板」。此時系統的行為升級為生成完整的 widget 代碼。Widget 包含三個部分:前端 UI(表格、圖表、篩選器)、後端 API 邏輯(呼叫各個工具提取數據)、以及底層 query。一旦 widget 生成並驗證通過,它就變成純 JavaScript 代碼運行——LLM 此後完全不參與。當用戶點擊「刷新」時,系統只是重新執行儲存的 query,無需再次調用 LLM,因此成本固定、性能可靠、結果完全一致。

支持團隊因此可以用 Slack bot 自助查詢特定客戶的問題。例如,Radar 用戶會問「為什麼我被這個系統封鎖了」,支持人員可以通過 Studio 的 widget 快速查詢該用戶的所有登入嘗試和封鎖歷史,無需轉向技術團隊。如果發現自己經常提出相同問題,支持人員甚至可以透過 Studio 自助構建新 widget,然後在團隊內共享。

當前的實裝方面,WorkOS 在連接層上使用用戶個別認證(每個人連接自己的 Snowflake、Linear、Notion 帳號),這在公司內部造成摩擦。公司正計畫透過自家產品 Pipes(第三方整合平台)實現組織級連接——一個人設定連接,其他人按照角色繼承權限(例如預設 Linear 為只讀,某些角色可編輯)。

成本考量上,WorkOS 明確選擇優先質量而非成本最優化。他們使用 Opus 而非更廉價的模型,因為性能差異足以正當化投資——Opus 在理解複雜 schema、處理動態 context 注入、驗證查詢結果上的卓越表現,使得一次性成本投入遠小於 bug 修復和人力投入的損耗。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。