Autonomous Guardians: The Future of Smart Contract Auditing - DeFi Security Summit 2025
三句話摘要
以 AI 安全審計代理(Audit Agent)對抗 Web3 智能合約漏洞,並透過 Agent Arena 平台整合多代理覆蓋率,取代傳統人工審計。 多個 AI 安全代理並用可達 92% 漏洞覆蓋率,搭配人工分類與 Agent Arena 平台的鏈上賞金機制,是目前最具成本效益、可規模化的 Web3 智能合約安全方案。 多代理協作大幅提升覆蓋率:單一 AI 工具覆蓋率約 53%,但不同代理發現的漏洞高度不重疊,兩個最佳工具合併可達 85%,三個達 92%,原因是各工具的漏洞識別路徑彼此獨立。
重點整理
重點- 1
多代理協作大幅提升覆蓋率:單一 AI 工具覆蓋率約 53%,但不同代理發現的漏洞高度不重疊,兩個最佳工具合併可達 85%,三個達 92%,原因是各工具的漏洞識別路徑彼此獨立。
- 2
AI 工具定位是輔助工具而非審計員:直接將輸出視為最終報告會有大量誤報;搭配 Cursor 對結果進行人工分類,多次重跑確認可重現性後,在競賽中提交 8 項發現有 7 項被接受,精準度顯著提升。
- 3
掃描品質取決於輸入品質:大型代碼庫需先用 Cursor 拆分成約 2,000 行的邏輯模組再分別掃描;文檔、問答(Q&A)欄位填越完整,LLM 的上下文越精準,誤報率越低。
- 4
Agent Arena 提供可信第三方仲裁:仲裁代理在可信執行環境(TE)中開源運行,去除明顯誤報後由人工審核員二次篩選,賞金分配邏輯鏈上透明,獨家發現(少數代理才找到的漏洞)獲得更高加權獎勵。
實用技巧與重點
乾貨- 主網被駭未審計比例:70%
- AI 工具基準覆蓋率:53%(vs. 前期目標 10%,講者預期 50%)
- 手動分類後覆蓋率:77%
- 兩個最佳代理合併:85%;加第三個:92%
- 最佳代碼庫分割大小:約 2,000 行 / 組件,上限 8,000 行
- 競賽提交窗口目標:2–4 小時;目前暫定 24 小時
- 代理構建者獎金:$2,500–$3,000(8 Global 贊助)
- 工具名稱:Audit Agent、Agent Arena、Cursor(用於分類與分割)
- 支援語言:Solidity、Ko(Move),Rust/Solana 即將支援
- 仲裁合作夥伴:Flala(提供 TE 環境)
- 競賽參考平台:Sherlock、Code Arena、Immunefi
- 開源模板:可 clone → 設定 API 金鑰 → 本地測試 → 接 webhook 上線
- 港口協議實測:82 項原始發現,人工篩選後剩 2 項關鍵漏洞
- 代理架構流程:取代碼 → 組裝提示 → 查詢 LLM → 格式化輸出 → 提交平台
結論
結論“多個 AI 安全代理並用可達 92% 漏洞覆蓋率,搭配人工分類與 Agent Arena 平台的鏈上賞金機制,是目前最具成本效益、可規模化的 Web3 智能合約安全方案。”
完整解析
詳細Web3 生態面臨一個根本矛盾:主網上 70% 被駭的協議從未經過安全審計,而根本原因不是輕忽,而是審計費用過高。這個觀察促使 Nethermind 開始嘗試用 AI 降低安全檢查的成本門檻。初期內部目標僅是 10% 的覆蓋率,講者認為 50% 才有實用意義,最終在兩年內實現了 53%,並在手動分類輔助下達到 77%。
Audit Agent 的評估框架圍繞三個維度:召回率(覆蓋率)、誤報率、以及速度與成本。團隊發現,AI 工具的覆蓋率本身並不是上限——關鍵在於不同代理的發現高度不相關,這意味著多代理並用可以互補。實測中,兩個性能最佳的代理合用覆蓋率從 54% 跳至 85%,三個達到 92%,已可比肩普通人工審計員的水準。
在實際使用技巧上,講者示範了幾個具體做法:首先,對於超過 8,000 行的大型代碼庫,先用 Cursor 提示 LLM 理解協議架構,再請它把代碼庫拆分成 2,000 行左右的邏輯模組,分批掃描以降低「大海撈針」問題。其次,掃描前應將問答欄位填寫完整——包括開發者預期哪些函數較脆弱、與哪些外部協議互動——這些隱性知識 LLM 無法從代碼自行推斷。最後,針對輸出結果的分類,可搭配 Cursor 搜尋 Sherlock 平台的評判規則,讓 AI 模擬資深評審的視角判斷每項發現是否可重現,再多次重跑確認結果一致性,有效過濾誤報。
Agent Arena 是這套邏輯的平台化延伸。它讓任何人——包括沒有安全背景的全棧工程師——都能以開源模板為基礎,開發並部署自己的安全代理。協議開發者作為「贊助商」提交代碼並質押賞金,競賽開始後所有接入的代理並行分析,提交結果由開源仲裁代理(在 TE 環境中透明運行)初步去重與篩選,再由人工審核員二次過濾,最終發現以加權方式鏈上分配賞金,獨家漏洞獲得更高比例。整個流程從提交到最終報告約需三至四天,目標是讓協議在發布前以接近人工審計的覆蓋率、遠低於人工審計的成本完成安全驗證。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

