DeFi security Summit 2023 - Session 18: Focused Talks 4 - Antonio Viggiano
三句話摘要
模糊測試器有效性的衡量方法與實驗對比——以 Echidna 和 Foundry 在 Uniswap V2 中的應用為例。 模糊測試器的有效性因種子、環境、工具而異,必須採用科學的測量方法論(中位數、多種子、長運行、統計檢驗)和多工具並用才能可靠評估其真實性能。 模糊測試器性能本質隨機且高度波動——同一個漏洞的發現時間可能相差 100 到 1000 倍,從幾分鐘到一整天,種子選擇和運行環境(多核 vs 單核)都會影響結果。
重點整理
重點- 1
模糊測試器性能本質隨機且高度波動——同一個漏洞的發現時間可能相差 100 到 1000 倍,從幾分鐘到一整天,種子選擇和運行環境(多核 vs 單核)都會影響結果。
- 2
測量方法論至關重要——不能用平均時間衡量,應對比中位數與標準差、嘗試多個種子值、進行長時間運行、尋找獨特錯誤而非重複計算、最後用統計檢驗確保結果統計顯著。
- 3
Uniswap V2 實驗揭示漏洞難度差異——12 個注入漏洞中,漏洞 6、7、8、9 容易被發現,其他則困難,且不同漏洞的分布方差也不同,反映不同代碼結構對模糊測試的影響。
- 4
工具性能無絕對優劣——Foundry 在某些測試中更快破壞環境,但在其他測試上表現不佳,因此應多工具組合測試,只需稍作代碼修改即可。
實用技巧與重點
乾貨- 研究對象:Echidna 最新版本、Foundry
- 測試目標:Uniswap V2 合約
- 注入漏洞數量:12 個
- 種子值試驗數:30 個不同種子
- 超時設定:1 天、24 小時
- 性能波幅:100~1000 倍(同一漏洞)
- Uniswap V2 不變式數量:20~22 個
- 關鍵不變式:
- k 值增加(添加流動性時)
- LP 代幣總供應量增加
- 流動性添加激勵機制維持
- 測量指標:破壞規則所需時間的中位數
- 統計方法:置信水平檢驗
結論
結論“模糊測試器的有效性因種子、環境、工具而異,必須採用科學的測量方法論(中位數、多種子、長運行、統計檢驗)和多工具並用才能可靠評估其真實性能。”
完整解析
詳細模糊測試是一種通過向代碼輸入隨機值來發現漏洞的安全測試技術。講者 Antonio Viganò 首先說明了模糊測試器的運作原理:從隨機值和歷史輸入紀錄開始,不斷修改並測試,直到找到能破壞程式邏輯或導致崩潰的輸入。然而,雖然所有模糊測試器都基於隨機輸入原理,其核心函數的實現差異會大幅影響效能,這也是為什麼直觀認為「所有模糊測試器都差不多」是錯的。
衡量模糊測試器的有效性面臨多重挑戰。首先,隨機性導致同一漏洞的發現時間波動巨大——可能在開始就被發現,也可能需要數小時。其次,不同運行環境(多核實例 vs 單一工作節點)和種子值選擇都會改變結果。第三,難以比較不同工具,因為你需要明確定義「發現漏洞」的標準。針對這些問題,講者引用學術論文提出的解決方案:不使用平均時間(因隨機性致差異過大),而是比較不同運行的中位數和標準差;嘗試多個種子值;進行長時間運行而非短時測試;尋找獨特的錯誤而非重複計算;最後使用統計檢驗確保觀察結果在統計學上有效。
為驗證這套方法論,講者在 Uniswap V2 上進行了深入實驗。他們注入了 12 個不同的漏洞,使用 30 個種子值,設定 1 天和 24 小時的超時時間進行長時間運行。實驗定義了 20~22 個 Uniswap V2 的不變式(例如添加流動性時 k 值必須增加、LP 代幣總供應量增加),任何不變式被破壞都表示存在 bug。結果顯示差異巨大:某些漏洞(如 6、7、8、9)容易被發現,其他則困難;不同漏洞的分布方差也不同;且 Echidna 和 Foundry 的性能不一致——某工具在特定測試中更快,在其他測試上則較慢。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

