KeyFrame內部研究專用

Black Hat USA 2025 | Protecting Small Organizations in the Era of AI Bots

Black Hat·4月5日週日·36 min英文

三句話摘要

小型非營利組織如何用行為分析與分層 IP 封鎖,將 AI 爬蟲流量削減 94%。 對小型組織而言,AI 爬蟲的威脅不在於「惡意攻擊」,而在於「合規但巨量」的存取行為——用人類行為指標建立評分系統、搭配分層子網封鎖,比傳統速率限制多削減 3 倍以上的無效流量,且全程開源免費。 爬蟲故意遵守速率限制使傳統防禦失效:AI 爬蟲已聰明到刻意維持在每分鐘 20 頁以下,藉此繞過限速封鎖,使單純的 throttling 僅能攔截 33% 的異常請求。

重點整理

重點
  • 1

    爬蟲故意遵守速率限制使傳統防禦失效:AI 爬蟲已聰明到刻意維持在每分鐘 20 頁以下,藉此繞過限速封鎖,使單純的 throttling 僅能攔截 33% 的異常請求。

  • 2

    人類行為模式是區分機器的關鍵指標:借用 HCI(人機互動)研究,人類不會連續 5 天、每天瀏覽超過 6 小時、或單日看超過 400 頁——這些門檻可量化為評分演算法,而非靠特徵碼比對。

  • 3

    視覺化時間 × IP 圖能直觀識別機械存取模式:以時間為橫軸、IP 為縱軸繪製存取日誌,機器行為呈現規律的點線紋路,人類行為則不規則;資料中心攻擊則呈現「垂直條帶」——大量不同 IP 在短時間集中打同一台伺服器。

  • 4

    分層子網段封鎖(Class C → Class B)才能清除數據中心集群攻擊:單獨針對個別 IP 評分無法應對同一子網段內多台機器輪流爬取的行為;將同一 /24 或 /16 子網段的流量聚合後統一評分,才能有效封鎖整個數據中心。

實用技巧與重點

乾貨
  • 非人類流量比例:51%(Imperva 2025 Bad Bot Report)
  • 惡意爬蟲 IP 未列入公開黑名單比例:80%(Shiago 2021);LogRIP 作者實測達 87%
  • 觀察案例:Community Science Institute,單台伺服器,20 天 150,000 次請求,約 7,500 次/天
  • 速率限制效果:減少 33%
  • 各階段削減累計
  • Throttling(速率限制):−33%
  • 連續天數過濾:−9%
  • 每日時間範圍:−9%
  • 每日最大頁數:−3%
  • Class C 子網封鎖:−14%
  • Class B 子網封鎖:−26%
  • 總計:−94%
  • 人類行為閾值(評分參數)
  • 每分鐘最多 20 頁
  • 每日最多約 400 頁
  • 每日最長連續瀏覽約 6 小時(360 分鐘範圍)
  • 最多連續 5 天存取
  • 工具名稱:LogRIP(開源,Apache 2.0)
  • GitHub 組織:Quantasai
  • 依賴套件:libmin、logrip
  • 輸入:Access log(Apache/Rails 等格式)+ JSON config 設定檔
  • 輸出:觀察流量 PNG、封鎖動作 PNG、過濾後流量 PNG、負載估算圖、IP 指標 CSV、子網段指標 CSV、頁面命中清單、IP/子網黑名單
  • 處理速度:150,000 筆 log 不到 1 分鐘
  • config 參數數量:約 12 個可調整參數
  • 過濾後估算人類流量:約 500 次/天(原始數字 7,500 次,降幅 95%)
  • 參考論文:Yungi Kim,"Web Server Log Visualization",2018

結論

結論

對小型組織而言,AI 爬蟲的威脅不在於「惡意攻擊」,而在於「合規但巨量」的存取行為——用人類行為指標建立評分系統、搭配分層子網封鎖,比傳統速率限制多削減 3 倍以上的無效流量,且全程開源免費。

完整解析

詳細

當今網路已有超過半數的流量來自非人類來源,AI 爬蟲正以前所未有的規模掃描各類公開伺服器。演講者 Dr. Mark Silber(Quant Sciences)以其服務的客戶 Community Science Institute(CSI)為案例:這是紐約中部一個提供水質監測數據的公益組織,資料完全免費開放,卻在 20 天內遭到 15 萬次的頁面請求,伺服器效能因此嚴重劣化,而流量來源遍布全球——完全不符合「只有紐約州居民會查在地水質」的常識。

傳統防禦工具一一告敗。速率限制之所以失效,是因為現代 AI 爬蟲已主動學會遵守速率上限(每分鐘 ≤20 頁),只要不踩線就不會觸發封鎖;公開黑名單覆蓋率不足,實測有高達 87% 的惡意 IP 根本不在名單上;GoAccess 等統計工具會把爬蟲流量混進摘要,看不出人機差異。演講者因此轉向一個更本質的問題:人類存取行為與機器存取行為,有哪些統計上可量化的差異?

借用 HCI 領域對人類使用電腦行為的研究,他們建立了一套行為評分系統。核心假設是:人類不會連續多天不間斷地長時間瀏覽同一網站,不會在深夜以固定頻率反覆存取,也不會在單日內翻閱數百頁。將這些限制轉化為四個維度的評分指標——「速率」、「每日頁數上限」、「每日時間跨度」、「連續存取天數」——就能為每個 IP 計算出一個「機器可能性分數」。視覺化輔助工具則讓這個分析更直觀:以時間為橫軸、IP 為縱軸繪製存取點陣圖,機器行為立刻呈現出等間距點線,DDoS 則呈現垂直的全頻段閃現,而人類的行為則雜亂無章。

但僅靠個別 IP 評分仍不夠,因為數據中心會調用同一 /24 子網段內的多個 IP 輪流爬取,單一 IP 的行為看起來頻率不高,但整體子網段的聚合行為卻相當規律。演講者因此加入分層子網段封鎖(Class C /24,再往上 Class B /16),對子網段整體進行相同的行為評分,最終使流量削減從 33% 跳升至 94%。過濾後的圖像從密集的機械紋路,轉為接近真實人類使用模式的稀疏散點。整套流程被包裝成命令列工具 LogRIP,僅需提供 access log 與 config 檔兩個輸入,即可在一分鐘內輸出封鎖清單與所有視覺化產物,並可直接匯入 iptables 執行實時封鎖。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「Web2 安全」的內容

SANS Stormcast Tuesday, August 25th, 2026: DOUBLECUP PNG; WebAudio Fingerprinting; Expired Domains; Android; Car
7 min
Web2 安全英文PODCAST8月25日

SANS Stormcast Tuesday, August 25th, 2026: DOUBLECUP PNG; WebAudio Fingerprinting; Expired Domains; Android; Car

SANS Stormcast

  • PNG 容器攻擊的簡易性設計:Double Cup 不依賴複雜的 Exif 或隱寫技術,只用 PNG 副檔名和檔頭來偽裝,核心是利用 findstr 指令的常見可用性讓執行變得無需額外工具。
  • Web Audio API 的隱密指紋識別:音訊於增益零的無聲狀態下播放,使用者完全無感,但錄製波形足以建立裝置特徵,在瀏覽器原生功能層面難以區分是反詐欺還是過度追蹤。
  • 域名過期引發的串聯漏洞:DMARC 報告端點使用過期域名是常見疏漏,允許攻擊者透過簡單的域名註冊取得他人的 SPF/DKIM 錯誤報告,進而收集目標系統配置情報。
Risky Bulletin: Expired credit cards can be used for malicious transactions
5 min
Web2 安全英文PODCAST8月24日

Risky Bulletin: Expired credit cards can be used for malicious transactions

Risky Business

  • 支付安全的非對稱風險:Visa卡利用未加密的卡片資料與NFC通訊,攻擊者可藉由中間人技術竄改過期日期進行交易,但MasterCard、美運卡與Discover的防護更完善,顯示不同發卡機構的安全架構存在明顯差異。
  • 國家級駭客活動的連鎖延伸:北韓Lazarus集團在2月單一事件已累積100名受害者,涵蓋大學、警察部門、媒體與醫療機構,伊朗駭客則針對基礎建設如電力系統發動破壞性攻擊,反映地緣政治在網路戰爭中的升溫。
  • AI加速漏洞生態的雙面刃:AI工具催生近2萬份漏洞概念驗證代碼發布,但同時也導致大量失效漏洞代碼氾濫,增加資安團隊甄別真實威脅的難度;Mayer Protocol遭攻擊事件中,駭客用AI鏈接六個無關的小漏洞完成盜竊170萬美元的攻擊。
SANS Stormcast Monday, August 24th, 2026: More Entra Powershell; Entra Vulnerability; GitLab Vuln (and PoC); GTA 6 Leak Malware
5 min
Web2 安全英文PODCAST8月24日

SANS Stormcast Monday, August 24th, 2026: More Entra Powershell; Entra Vulnerability; GitLab Vuln (and PoC); GTA 6 Leak Malware

SANS Stormcast

  • Microsoft EntraID 的遠端代碼執行漏洞已由微軟修補,初期報告顯示已遭利用但後來更正為未遭利用。這反映 Microsoft 在雲端軟體安全上的透明度提升,對漏洞採用與內部軟體相同的 CVE 編號和公告流程。
  • PowerShell 指令碼可用於驗證 MFA 部署完整性,特別是找出未啟用 MFA 的遺漏帳號。同時可以分析 EntraID 登入日誌中的異常行為,如風險係數評估和地理位置檢測,幫助組織快速識別可疑登入。
  • GitLab 的 GraphQL 代碼注入漏洞允許未認證攻擊者刪除或修改儲存庫,潛在導致供應鏈攻擊。已有公開概念驗證 (PoC) 存在,使用內部部署 GitLab 的組織必須立即修補。