Jeffrey Zhang & Siddh Shah - Guardrails beyond Vibes | [un]prompted 2026
三句話摘要
Stripe 如何在生產環境部署威脅建模和安全路由 AI 代理,以及透過評估流程和人機協作確保準確性的實戰經驗。 --- 生產環境中的 AI 安全代理成功的關鍵不在於追求 100% 自動化或精準度,而在於透過科學的語義評估、人機協作、分階段推廣和持續的真實用戶反饋,逐步構建可信且實用的安全輔助系統。 1. 架構選擇取決於任務特性
重點整理
重點- 1
1. 架構選擇取決於任務特性
- 2
威脅建模採用多步驟序列化架構(協調→輸入→安全專家並行→輸出)以確保可預測性和質量,因為需要必要信息完整性;安全路由則從簡單單步 LLM 進化到工具輔助自主結構,因為需要處理開放式問題但精準度要求有所不同。
- 3
2. 語義評估勝於形式匹配
- 4
威脅建模是藝術而非科學,無唯一正確答案,所以拋棄確定性匹配和關鍵詞匹配,改用「黃金標準測試用例 + LLM 語義等價性評判」,重點是風險背後的含義而非表面形式。
- 5
3. 人機協作是關鍵
- 6
不追求 100% 自動化,而是讓 AI 完成 80-90% 工作、安全工程師進行最終確認,這樣既降低 AI 準確率要求(初期目標 ~80%)又確保可信度,當信息缺失時代理應明確說「不知道」而非幻覺補充。
- 7
4. 分階段推廣降低風險
- 8
先選擇風險相似的子類別、在影子模式迭代、再依序透過網頁→Slack→內部 UI 推廣,每階段基於真實用戶反饋調整,避免一步到位導致的大規模失敗。
- 9
--
實用技巧與重點
乾貨- 代理架構
- 威脅建模:協調代理 → 輸入代理 → 多個專業安全代理(並行)→ 輸出代理
- 安全路由:初版單步 LLM(快但幻覺多)→ 工具輔助自主結構(精準但慢)
- 評估流程
- 黃金標準:根據歷史安全審查建立測試用例 + 預期輸出
- 評判標準:LLM 評估實際輸出與預期輸出的語義等價性
- 迭代指標:準確率(不使用單一指標,規劃擴展線上反饋機制)
- 準確率提升實績
- 優化基礎提示(加入授權、SSO 等特定安全域):+10%
- 選擇最優 LLM 模型:+10%
- 工具精簡(多個工具→2 個):運行時間 10 分鐘 → 30 秒
- 推廣階段
- 內部網頁版本(團隊成員試用)
- Slack 集成版本(測試上下文相依性)
- Stripe 內部客服 UI 版本(正式發佈)
- 工具與模型
- Alpha Evolve(Google DeepMind 提示優化工具):效果有限,語言任務中變體多為表面改寫
- 威脅建模工具:作為後續在線反饋循環的真理來源
- 評估數據集:透過複製黃金標準用例消除 AI 不確定性
- 質量門檻
- 初期目標:~80% 準確率
- 條件:由人工確認最後一步,無須達到 100% 自動化
- 例外處理:信息缺失時明確標註「信息不足」、「狀態未知」,而非幻覺
- --
結論
結論“生產環境中的 AI 安全代理成功的關鍵不在於追求 100% 自動化或精準度,而在於透過科學的語義評估、人機協作、分階段推廣和持續的真實用戶反饋,逐步構建可信且實用的安全輔助系統。”
完整解析
詳細Stripe 安全團隊面臨兩個關鍵瓶頸:安全審查工單不斷增加但人力投入有限,以及隨著 AI 在軟體開發中應用擴大,用戶對安全指導的需求激增。為此,他們開發了兩個 AI 代理來自動化和優化這些流程。
威脅建模代理採用多步驟序列化架構以確保質量。整個流程由協調代理統籌,接收安全審查表單中的參數(如審查類別)。輸入代理隨後提取補充信息,比如來自 Google 文檔或 Slack 討論串的上下文。隨後,多個專業安全代理並行運作,每個代理都限制在特定審查類別範圍內。雖然不同代理有不同專長,但他們都必須涵蓋所有必要問題——比如數據敏感性、傳輸協議等。最後,輸出代理根據不同受眾(人類、威脅建模工具等)的需求格式化結果。這種序列化設計看似低效,但實踐證明比給協調代理過多自主權更可靠,因為它確保了行為的可預測性。
安全路由代理走了一條不同的進化路徑。最初,他們採用簡單的單步 LLM 調用,不提供任何工具,只依賴預先寫入提示中的大量背景信息。這個方案執行快速,但很快暴露出問題:AI 對 Stripe 內部術語和工具一無所知,經常幻覺路由到錯誤的安全團隊。後來他們轉向工具輔助的自主結構,讓 AI 自行搜索相關信息。精準度明顯提升,但代價是執行時間暴增到 10 分鐘。為了平衡,他們透過逐步精簡工具集——從提供多個工具減少到只保留最必要的兩個——將運行時間壓低到 30 秒,同時維持足夠的精準度。
評估方法是整個系統的靈魂。威脅建模本質上是藝術而非科學,不存在唯一正確答案,因此簡單的確定性匹配和關鍵詞匹配都不適用。他們創新性地採用了結合人類專業判斷和 LLM 推理能力的方法。具體做法是:首先,由人類安全工程師根據過往完成的審查建立黃金標準測試用例集,每個用例包含預期的威脅和緩解措施。其次,用 LLM 作為評判者,評估代理實際輸出與預期輸出在語義層面的等價性——重點不在形式是否完全相同,而在於是否傳達了相同的風險內涵。這個方法巧妙地避免了循環依賴問題(不是讓 LLM 絕對判斷威脅建模是否正確,而是判斷語義一致性)。通過這套評估流程,他們可以科學地測試每一次提示改進。例如,當提示被改寫為強調 JSON 格式化時,表面上看起來無懈可擊(輸出結構清晰),但評估流程卻顯示準確率反而下降了 10%——因為代理將過多注意力分配給了格式,而疏忽了安全內容的準確性。這個發現避免了走進死胡同。
推廣策略採取謹慎的分階段模式。對於每個新的安全審查子類別,他們先在內部網頁發佈讓 Stripe 全體員工試用,根據反饋改進;接著集成到 Slack,測試在即時通訊場景中的上下文相依性表現;最後在 Stripe 內部客服 UI 中正式推廣給客服人員。整個過程中,他們從不追求 100% 自動化。相反,目標是讓 AI 代理完成 80-90% 的繁重工作,由安全工程師執行最後的人工確認步驟。這個決策對流程至關重要:既降低了對 AI 準確率的要求(初期目標約 80%),也確保了風險評估的最終可信度。當面臨信息缺失時,代理應該明確標註「信息不足」或「狀態未知」,指引工程師進一步調查,而非試圖透過幻覺補充缺失數據。
整個過程中積累了多個重要教訓。Alpha Evolve 這類自動提示進化工具雖然在數學優化中表現優異,但對開放式語言任務效果有限——產生的變體往往只是表面改寫,沒有語義改進。人類參與決策遠非可選項;即使代理生成的威脅模型看似完整,也需要安全工程師審視和批准。提前投入資源構建評估流程至關重要,否則模型可能因為過度適應個別特例而整體性能下滑。不同任務需要截然不同的架構——沒有萬能的解決方案。最後也最重要的是「垃圾進垃圾出」原則:必須教會代理像真正的安全工程師一樣誠實地承認知識邊界,這比追求看似完美的輸出更值得投入。
---
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


