AI-Powered Auditing: Hype, Reality, and the Future of Web3 Security
三句話摘要
AI 安全工具與 Web3 企業安全建設:兩組專家探討如何用混合式 AI 方法找漏洞、以及為何加密協議普遍缺乏安全團隊。 Web3 安全的最大結構性問題不是工具不夠強,而是「沒有人的地方沒有安全」——AI 工具再先進,也取代不了一個主動去找問題的安全團隊。 混合式 AI 安全是當前共識
重點整理
重點- 1
混合式 AI 安全是當前共識
- 2
與會者一致認為純推理模型或純工具調用都不夠,必須結合兩者。Expo 的做法是將攻擊面拆成獨立端點單元,讓 Agent 搭配 SQLmap 等工具或自生成 Python 腳本進行測試;推理愈強的模型能更快達到高覆蓋率、低誤報率。
- 3
LLM 對邏輯漏洞的優勢與驗證瓶頸
- 4
LLM 能輕易發現文件描述與實際程式碼的落差(邏輯漏洞),Kiel 表示其早期版本就曾找到頂級審計員漏掉的問題。然而真陽性/假陽性的區分仍困難,尤其是業務邏輯類漏洞,Jack 指出 Sherlock 為此付給人類專家數千美元/次,成本極高。
- 5
Web3 安全的不對稱威脅結構
- 6
協議團隊身兼募資、招募、行銷多職,安全只是其中一小部分;北韓等國家駭客組織的唯一目標就是攻擊該協議,且找到一個漏洞即可獲利百萬。這種激勵結構的不對稱,使防禦方天生處於劣勢。
- 7
多數加密新創沒有安全團隊卻持有巨額 TVL
- 8
現實中大量協議持有兩億美元 TVL 卻只有 10 名工程師兼任安全職責。建議:先做風險剖析(最壞情況是什麼),小型團隊可採 vCISO(虛擬資安長)外包模式,而非完全不投資。
實用技巧與重點
乾貨- 工具與平台
- Expo:Web2 AI 自主滲透測試工具,支援黑箱與白箱模式
- Sherlock:Web3 AI 審計平台,含 Bug Bounty 驗證機制
- Slither:常見靜態分析工具(被提及其 IR 基礎設施不足)
- SQLmap:開源滲透測試工具,可被 Agent 直接調用
- Cursor:被用於盲目分類漏洞,7/8 提交被接受
- Bitfinding.com:鏈上監控平台,從 Balancer 攻擊中搶救 $100 萬
- Tornado Cash:常作為合約惡意活動指標
- 模型排名與趨勢(Web2 角度)
- 六個月前:Groq 最擅長找 Bug
- 現在:GPT-5 大幅領先
- 推薦:每家 AI 安全公司應建立強基準測試(benchmark),持續與新模型比較
- 具體數據
- 新錢包入資 8 分鐘內收到第一封釣魚 Token
- 約 80% 協議無正式安全團隊
- Kiel 工具:找到約 70% 問題 → 審計員可多 3 倍時間找更深層漏洞
- Balancer 漏洞:程式碼 5 年未改、審計 11 次仍被攻擊
- Bybit 事件後:Blockade 推出多簽/MPC 錢包交易驗證產品
- 正式驗證
- 與 LLM 結合預計 6-9 個月內出現
- CVL、Lean 等形式語言被提及
- LLM 可協助生成 invariant,降低人工撰寫規格的門檻
- 瓶頸:複雜代碼庫計算時間過長;需要頂尖人才才能寫對規格
- 事件應變建議
- 提前與事件應變廠商(如 Mandiant)簽 SLA 保留合約
- Polygon 建議:部署合約時監控 Tornado Cash 資助地址
結論
結論“Web3 安全的最大結構性問題不是工具不夠強,而是「沒有人的地方沒有安全」——AI 工具再先進,也取代不了一個主動去找問題的安全團隊。”
完整解析
詳細這場發生於加密安全峰會的雙場座談,彙集了 Web2 與 Web3 安全工具開發者,以及協議安全負責人,聚焦兩個核心問題:AI 工具如何改變漏洞發現方式,以及加密新創的安全文化為何嚴重落後。
第一場座談由四位工具開發者討論 AI 找 Bug 的技術路線。主持人拋出一個核心問題:純推理模型(如 OpenAI 的 o 系列)與工具調用型 Agent,誰會贏?與會者一致傾向混合式答案,但理由各有側重。Expo 的 Nico 說明其系統將攻擊面拆成端點單元,讓 Agent 自由選擇呼叫 SQLmap 等現有工具,或是自行撰寫 Python 測試腳本,並為此開發了能導航網頁並執行攻擊的無頭瀏覽器。Sherlock 的 Jack 則指出,靜態分析器本身的 IR 基礎設施不夠深,若要讓推理模型「深度推理」,必須先有足夠豐富的上下文,而這需要多年打磨的底層工具。Olympics 工具套件的 Connie 則以最近一年的真實漏洞案例為證,說明單一工具無法防禦全部攻擊,只有分層安全(layered security)才是正確答案——這本質上也是一種混合。
邏輯漏洞(business logic bugs)是全場的焦點之一。Kiel 分享了一個驚人案例:他的早期系統發現了頂級審計員遺漏的問題,因為 LLM 天生善於比對「文件描述」與「實際程式碼」之間的落差。然而 Nico 點出真正的挑戰不在找到,而在驗證——資訊洩漏是否真的是漏洞,取決於公司的業務情境,即使是人類滲透測試員有時也難以判斷。Jack 坦承,Sherlock 透過競賽與 Bug Bounty 平台累積了數十萬筆人工驗證數據,代價是付給頂尖人類專家數千美元,這是目前 AI 邏輯漏洞驗證無法繞過的高牆。GPT-5 的出現讓情況有所改善,其高推理能力已能在業務邏輯驗證上交出「不錯的真陽性率」。
第二場座談轉向安全文化與組織建設。Ryan 和 Joe 揭示了一個令人不安的現實:許多持有龐大 TVL 的協議,其「安全負責人」搜尋結果是空的,或只是一名身兼多職的工程師。Christopher 指出,安全難賣的根本原因是「沒發生事故」就沒有可見的 ROI,CEO 看不到回報自然不願投入。但他也提出解法:先做風險剖析,釐清最壞情況(是智能合約被攻擊,還是員工筆電遭駭?),再按比例配置資源。Ido 進一步指出,Web3 的「皇冠珠寶」不是數據而是金錢,一筆不可逆的交易就能讓公司歸零,與 Web2 的數據外洩在損失速度與規模上截然不同,而且受害的往往是那些無法進入傳統金融體系、以 DeFi 作為唯一理財管道的普通用戶。
關於攻防不對稱,Connie 以北韓為例:協議創始人每天身兼十職,安全只是其中一小項;但坐在平壤的駭客,全年唯一任務就是攻破那個協議,成功一次就夠了。Joe 則呼籲業界多分享「我們如何阻止了這次攻擊」,而非只聚焦事後驗屍報告——好的安全行為需要成為值得慶祝的事,才能推動行業自律升級。最後,座談以 Polygon 的實踐為例,說明鏈上監控(如追蹤 Tornado Cash 資助地址、交易前簽名驗證)已是可行的主動防禦手段,而事件應變的關鍵是提前簽好 SLA,不能等到被打才打電話。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

