Black Hat USA 2025 | Protecting Small Organizations in the Era of AI Bots
三句話摘要
小型非營利組織如何用行為分析與分層 IP 封鎖,將 AI 爬蟲流量削減 94%。 對小型組織而言,AI 爬蟲的威脅不在於「惡意攻擊」,而在於「合規但巨量」的存取行為——用人類行為指標建立評分系統、搭配分層子網封鎖,比傳統速率限制多削減 3 倍以上的無效流量,且全程開源免費。 爬蟲故意遵守速率限制使傳統防禦失效:AI 爬蟲已聰明到刻意維持在每分鐘 20 頁以下,藉此繞過限速封鎖,使單純的 throttling 僅能攔截 33% 的異常請求。
重點整理
重點- 1
爬蟲故意遵守速率限制使傳統防禦失效:AI 爬蟲已聰明到刻意維持在每分鐘 20 頁以下,藉此繞過限速封鎖,使單純的 throttling 僅能攔截 33% 的異常請求。
- 2
人類行為模式是區分機器的關鍵指標:借用 HCI(人機互動)研究,人類不會連續 5 天、每天瀏覽超過 6 小時、或單日看超過 400 頁——這些門檻可量化為評分演算法,而非靠特徵碼比對。
- 3
視覺化時間 × IP 圖能直觀識別機械存取模式:以時間為橫軸、IP 為縱軸繪製存取日誌,機器行為呈現規律的點線紋路,人類行為則不規則;資料中心攻擊則呈現「垂直條帶」——大量不同 IP 在短時間集中打同一台伺服器。
- 4
分層子網段封鎖(Class C → Class B)才能清除數據中心集群攻擊:單獨針對個別 IP 評分無法應對同一子網段內多台機器輪流爬取的行為;將同一 /24 或 /16 子網段的流量聚合後統一評分,才能有效封鎖整個數據中心。
實用技巧與重點
乾貨- 非人類流量比例:51%(Imperva 2025 Bad Bot Report)
- 惡意爬蟲 IP 未列入公開黑名單比例:80%(Shiago 2021);LogRIP 作者實測達 87%
- 觀察案例:Community Science Institute,單台伺服器,20 天 150,000 次請求,約 7,500 次/天
- 速率限制效果:減少 33%
- 各階段削減累計:
- Throttling(速率限制):−33%
- 連續天數過濾:−9%
- 每日時間範圍:−9%
- 每日最大頁數:−3%
- Class C 子網封鎖:−14%
- Class B 子網封鎖:−26%
- 總計:−94%
- 人類行為閾值(評分參數):
- 每分鐘最多 20 頁
- 每日最多約 400 頁
- 每日最長連續瀏覽約 6 小時(360 分鐘範圍)
- 最多連續 5 天存取
- 工具名稱:LogRIP(開源,Apache 2.0)
- GitHub 組織:Quantasai
- 依賴套件:libmin、logrip
- 輸入:Access log(Apache/Rails 等格式)+ JSON config 設定檔
- 輸出:觀察流量 PNG、封鎖動作 PNG、過濾後流量 PNG、負載估算圖、IP 指標 CSV、子網段指標 CSV、頁面命中清單、IP/子網黑名單
- 處理速度:150,000 筆 log 不到 1 分鐘
- config 參數數量:約 12 個可調整參數
- 過濾後估算人類流量:約 500 次/天(原始數字 7,500 次,降幅 95%)
- 參考論文:Yungi Kim,"Web Server Log Visualization",2018
結論
結論“對小型組織而言,AI 爬蟲的威脅不在於「惡意攻擊」,而在於「合規但巨量」的存取行為——用人類行為指標建立評分系統、搭配分層子網封鎖,比傳統速率限制多削減 3 倍以上的無效流量,且全程開源免費。”
完整解析
詳細當今網路已有超過半數的流量來自非人類來源,AI 爬蟲正以前所未有的規模掃描各類公開伺服器。演講者 Dr. Mark Silber(Quant Sciences)以其服務的客戶 Community Science Institute(CSI)為案例:這是紐約中部一個提供水質監測數據的公益組織,資料完全免費開放,卻在 20 天內遭到 15 萬次的頁面請求,伺服器效能因此嚴重劣化,而流量來源遍布全球——完全不符合「只有紐約州居民會查在地水質」的常識。
傳統防禦工具一一告敗。速率限制之所以失效,是因為現代 AI 爬蟲已主動學會遵守速率上限(每分鐘 ≤20 頁),只要不踩線就不會觸發封鎖;公開黑名單覆蓋率不足,實測有高達 87% 的惡意 IP 根本不在名單上;GoAccess 等統計工具會把爬蟲流量混進摘要,看不出人機差異。演講者因此轉向一個更本質的問題:人類存取行為與機器存取行為,有哪些統計上可量化的差異?
借用 HCI 領域對人類使用電腦行為的研究,他們建立了一套行為評分系統。核心假設是:人類不會連續多天不間斷地長時間瀏覽同一網站,不會在深夜以固定頻率反覆存取,也不會在單日內翻閱數百頁。將這些限制轉化為四個維度的評分指標——「速率」、「每日頁數上限」、「每日時間跨度」、「連續存取天數」——就能為每個 IP 計算出一個「機器可能性分數」。視覺化輔助工具則讓這個分析更直觀:以時間為橫軸、IP 為縱軸繪製存取點陣圖,機器行為立刻呈現出等間距點線,DDoS 則呈現垂直的全頻段閃現,而人類的行為則雜亂無章。
但僅靠個別 IP 評分仍不夠,因為數據中心會調用同一 /24 子網段內的多個 IP 輪流爬取,單一 IP 的行為看起來頻率不高,但整體子網段的聚合行為卻相當規律。演講者因此加入分層子網段封鎖(Class C /24,再往上 Class B /16),對子網段整體進行相同的行為評分,最終使流量削減從 33% 跳升至 94%。過濾後的圖像從密集的機械紋路,轉為接近真實人類使用模式的稀疏散點。整套流程被包裝成命令列工具 LogRIP,僅需提供 access log 與 config 檔兩個輸入,即可在一分鐘內輸出封鎖清單與所有視覺化產物,並可直接匯入 iptables 執行實時封鎖。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

