KeyFrame內部研究專用

SimulationMaxxing: How Nubank ships agents 20× faster with simulations — Shreya Rajpal, Snowglobe

AI Engineer·7月29日週三英文

三句話摘要

使用模擬生成評估數據,將 AI 代理的開發發佈周期縮短 20 倍。 建立可信的模擬評估數據機制,並整合自動化優化迴圈,是快速改進生產代理品質的關鍵,可將開發周期從數週縮短至數小時。 評估數據是代理開發的關鍵瓶頸:當前獲取評估數據主要靠手動製作或生產數據。手動製作耗時耗力,需要規劃狀態更新和執行軌跡;生產數據雖然免費,但代表在真實用戶上測試,難以並行實驗。多轉對話的代理數據尤其複雜,需要管理工具調用、狀態一致性等,導致每個數據點的生成和標註成本都很高。

重點整理

重點
  • 1

    評估數據是代理開發的關鍵瓶頸:當前獲取評估數據主要靠手動製作或生產數據。手動製作耗時耗力,需要規劃狀態更新和執行軌跡;生產數據雖然免費,但代表在真實用戶上測試,難以並行實驗。多轉對話的代理數據尤其複雜,需要管理工具調用、狀態一致性等,導致每個數據點的生成和標註成本都很高。

  • 2

    模擬消除了手工和生產數據的瓶頸:Snowglobe 透過 SDK 包裝代理,無需改動代碼,只需定義虛擬用戶角色(persona)和測試場景,即可自動生成包含完整上下文的多轉對話數據。這些數據已包含所有必要資訊(一致的狀態、模擬工具輸出、用戶角色描述等),無需等待生產或手工標註。

  • 3

    必須驗證模擬與生產數據的一致性:為信任模擬結果,需建立離線-在線對齐機制,用標準評估指標和人工審核驗證模擬數據與生產數據的相關性。該團隊達到 80% 的專家驗證率,既能用於改進現有代理,也能快速訓練新代理。

  • 4

    整合持續自我改進迴圈:將模擬數據和實際數據同步通過評估指標,使用自動化提示優化算法(如 JEPA)調整代理,經驗證後發佈。這樣每個代理可支撐多次 AB 測試,避免盲目發佈。

實用技巧與重點

乾貨
  • 公司背景:Nuvé Bank(拉丁美洲領先數字銀行),1.35 億用戶(巴西、墨西哥、哥倫比亞),2026 年 Q1 季度收入超 50 億
  • 主要工具:Snowglobe(模擬平台)、JEPA(自動提示優化算法)
  • 評估指標:TNPS(代理版淨推薦值)、SSR(自助服務率)、人工評審
  • 驗證數據:80% 專家標籤確認模擬數據可用、模擬與生產數據相關性高
  • 發佈周期改善
  • 改動代理架構:數小時(不變)
  • 離線評估:從數天 → 數小時(有模擬用戶)
  • AB 測試:從數周 → 數小時(不需等生產反饋)
  • 全流程:從數周 → 數小時至數分鐘
  • 具體成果
  • 單個代理 TNPS 提升 2 倍
  • 某代理 SSR 提升 4%
  • 檢出會洩漏至生產的迴歸 bug
  • 檢出會降低自助服務率的 bug
  • 應用場景:測試多個開源模型版本、對比邊界模型與開源模型、新代理快速訓練、現有代理改進

結論

結論

建立可信的模擬評估數據機制,並整合自動化優化迴圈,是快速改進生產代理品質的關鍵,可將開發周期從數週縮短至數小時。

完整解析

詳細

Nuvé Bank 面臨的核心問題是如何快速改進 AI 代理品質。當前代理開發流程存在明顯的時間瓶頸:改動代理架構、提示詞或工具需要數小時,隨後離線評估需要數天(等待手工標註或生產數據),最壞情況下 AB 測試需要數周才能看到統計顯著的用戶反饋。這種緩慢的反饋迴圈源於評估數據的獲取方式——手工製作成本高昂且容易出錯,生產數據雖免費但無法並行實驗。特別是多轉對話代理的數據複雜度遠超單輪 QA,每個數據點都需要維持虛擬用戶、工具狀態的一致性,導致獲取和標註成本呈指數增長。

Snowglobe 模擬平台的核心創新在於自動化生成結構完整的評估數據。系統透過 SDK 包裝現有代理(無需改動代碼),使用者定義虛擬用戶角色(如一位 34 歲的設計師首次申請信用卡)和測試場景,系統即可生成包含虛擬用戶傾向、虛擬狀態數據(地址、信用卡等)的多轉對話。這些對話已包含所有評估所需的上下文和工具模擬輸出,直接可用於評估指標計算,無需等待人工審核或生產用戶反饋。

為確保模擬結果的可信性,Nuvé Bank 建立了嚴格的離線-在線對齐機制。他們對比模擬數據和生產數據在評估指標上的相關性,並由領域專家進行人工審核。結果顯示 80% 的專家驗證了模擬數據的可用性,證明模擬不僅適用於改進現有代理,也適用於快速訓練新代理。有了這個信心,團隊整合出一個持續自我改進的迴圈:通過模擬和實際數據運行評估、用自動化提示優化算法調整代理配置、經驗證後才發佈。這樣團隊可以為每個代理運行多次 AB 測試,而無需盲目發佈或等待用戶反饋。

結果證明模擬的威力。該團隊將五個生產代理的 TNPS 指標大幅提升至接近或超越人類水平。某個代理的 TNPS 提升了 2 倍,同時自助服務率也提升 4%,證明不存在用戶滿意度與效率的權衡。此外,模擬還提前檢出了會洩漏至生產的迴歸 bug 和會降低自助服務率的問題。在開源模型爆發的時代,這套系統也成了快速篩選最優模型版本的利器,節省了多週的試驗成本。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。