KeyFrame內部研究專用

From Signal to PR: Anatomy of a Self-Improving Agent — Jason Lopatecki, Arize

AI Engineer·7月24日週五·20 min英文

三句話摘要

Arise 創始人分享如何用 AI 代理和可觀測性 2.0 構建自動化系統自我修復循環。 未來的系統可觀測性將從人工驅動的 UI 查詢演進為 AI 代理驅動的自動修復循環,關鍵在於設計高效的「技能」讓代理從海量數據中找到問題所在,並逐步向完全自動化靠近。 可觀測性範式轉變 — 傳統可觀測性為人類設計(點擊 UI、查看圖表),但 Observability 2.0 是為 AI 代理而生。代理需要從追蹤、日誌、程式碼庫獲取結構化數據,而非人類友善的視覺化。

重點整理

重點
  • 1

    可觀測性範式轉變 — 傳統可觀測性為人類設計(點擊 UI、查看圖表),但 Observability 2.0 是為 AI 代理而生。代理需要從追蹤、日誌、程式碼庫獲取結構化數據,而非人類友善的視覺化。

  • 2

    自動修復循環的三個階段 — 第一代是人看問題→代理修復。第二代是代理先看數據→人類審查修復方案。目標是第三代:代理自動提出假說→自動測試→自動修復,人類只做高級決策。

  • 3

    技能與上下文的關鍵性 — 不是簡單讓 Claude 讀日誌,而是精心設計「技能」(如 Pyroscope、Google Cloud 日誌工具),讓代理知道如何提取相關數據、按客戶分組、找出記憶體問題。技能幫助代理從海量數據中找到正確的信息。

  • 4

    冷啟動與本地-雲端協作 — 先在本地筆記本運行代理調試,再基於事件或週期性在雲端沙箱執行相同邏輯。支持多種沙箱(Arise、Daytona)和 VPC 部署,滿足不同安全需求。

實用技巧與重點

乾貨
  • 產品與平台
  • Arise 推出的 Signal 代理:定期運行、自動調試、生成修復建議
  • AX SAS 平台(當前 Signal 限於此)+ 開源 Phoenix
  • VPC 部署支持(Uber、Booking.com 等企業客戶)
  • 核心概念
  • 可觀測性 1.0 → 2.0:UI 點擊 → AI 代理可用
  • 三層自動化循環:事件/週期性觸發 → 代理蒐集上下文 → 人類審查 → 最終完全自動化
  • 需要記錄「10 倍信息」讓代理理解系統運行路徑
  • 技能與工具
  • 追蹤(Trace)+ 日誌 + 程式碼庫 + 上下文組合
  • 內建技能:Google Cloud 日誌、Pyroscope(記憶體分析)、客戶分組
  • 支持自訂技能,可連接 GitHub 倉庫
  • 評估(Eval)機制
  • 線上評估:疊加到生產追蹤上
  • 第一代評估用來判斷故障(如提示注入、歷史故障模式)
  • 可為常見故障預先構建評估器,大規模檢測
  • 現實案例
  • 直播取消問題:待辦事項更新方法呼叫失敗 → Signal 一行程式碼解決
  • 金融交易代理演示(說明代理系統現階段的局限)
  • 沙箱與部署
  • Arise 沙箱 vs. 雲端託管代理 vs. Daytona
  • 支持本地還原雲端會話(開發者可接管繼續調試)
  • 可設定提示、選擇沙箱、指定技能、連接程式碼庫

結論

結論

未來的系統可觀測性將從人工驅動的 UI 查詢演進為 AI 代理驅動的自動修復循環,關鍵在於設計高效的「技能」讓代理從海量數據中找到問題所在,並逐步向完全自動化靠近。

完整解析

詳細

Arise 的創始人從自身建立 AI 代理的經驗出發,闡述了可觀測性領域正在發生的根本性轉變。兩年前公司推出的第一代自研代理表現欠佳,但這段經歷催生了當今 Signal 產品的設計理念——將工程師日常除錯工作自動化為由 AI 代理驅動的持續循環。

傳統的可觀測性工具是為人類操作者設計的,核心是 UI 點擊和圖表查看。但進入 AI 代理時代,可觀測性需要重新定義。代理不需要美麗的圖表,而是結構化的可機讀數據。這帶來了第一個挑戰:如何高效地將追蹤、日誌、程式碼上下文組合起來,讓代理理解系統出了什麼問題?答案在於「技能」——精心設計的工具集,教會代理如何提取和利用不同來源的數據。例如,Pyroscope 技能讓代理識別記憶體瓶頸,Google Cloud 日誌技能讓它按客戶分組找出根本原因。關鍵不是讓代理看完整的原始數據,而是賦予它足夠聰慧的工具,知道該問什麼問題、看哪些數據。

自動修復循環正在三個階段進化。第一代是「人看→代理修」:工程師發現問題,代理執行修復。但這不夠快。第二代翻轉了這個循環:代理先在後台持續運行,看見問題時自動蒐集所有上下文(追蹤、日誌、程式碼),然後提醒人類「這是我看到的問題和我的修復建議」。這樣人類的角色從「響應者」變成「審查者」,工作量大幅下降。未來的第三代是完全自動化:代理自主決定、測試、修復,人類只在高風險決策時介入。

達到這一願景需要什麼?首先是更豐富的可觀測性數據。講者提出「記錄 10 倍的信息」概念——過去人類不可能讀完所有日誌,所以大部分被視為噪音。但現在 AI 代理可以在這些海量數據中找到模式,只要數據格式正確、索引得當。其次是從本地到雲端的執行環境轉變。工程師在筆記本上用代理本地調試,驗證可行後,相同的邏輯被部署到雲端可觀測性平台,由事件或週期性觸發自動執行。Arise 支持多種沙箱選項(自家沙盒、Daytona 或其他),開發者也可隨時在本地接管雲端會話繼續調試。

在實踐中,講者展示了一個真實案例:直播取消問題。代理 Alex 在系統中發現待辦事項更新失敗,自動收集追蹤和相關日誌,提出了一行程式碼的修復建議。雖然簡單問題可能只需一行修復,複雜問題往往需要人類參與,但代理的冷啟動能力——能先把所有相關信息擺出來——已經大幅降低了人類工程師的認知負荷。

評估(Eval)機制是系統的另一個重要層面。評估不是衡量系統性能的指標,而是代理判斷問題的工具。講者把評估分為兩類:一類是預先為已知故障設計的判斷準則(如檢測提示注入、過往失敗模式),另一類是實時評估,疊加到生產追蹤上,幫助代理理解當前狀態是否異常。評估可以大規模運作,覆蓋完整資料集。

最後,產品層面 Arise 提供了 AX SAS 平台和開源 Phoenix。為滿足 Uber、Booking.com 等企業客戶的隱私需求(不願將生產系統連接到第三方 AI 服務),公司還支持 VPC 部署。開發者可自訂提示、選擇沙箱、配置技能、連接程式碼庫,打造符合自身需求的自動化循環。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。