DEF CON 33 Recon Village - Robin The Archaeologist of the Dark Web - Apurv Singh Gautam
三句話摘要
Robin工具:AI驅動的暗網研究自動化平臺,整合搜索、過濾、爬取和分析流程 通過分層LLM設計和索引過濾機制,Robin將數小時、多工具的暗網研究流程壓縮為45秒單工具全流程,同時保留分析師對結果的完全驗證權。 現有暗網研究工具「碎片化」問題嚴重:需依次使用鏈接收集、驗證、爬取、報告工具,跨語言跨架構導致低效。Robin透過整合功能並引入LLM,實現單一工具全流程研究。
重點整理
重點- 1
現有暗網研究工具「碎片化」問題嚴重:需依次使用鏈接收集、驗證、爬取、報告工具,跨語言跨架構導致低效。Robin透過整合功能並引入LLM,實現單一工具全流程研究。
- 2
LLM提示詞工程的精密度決定成效。初期嘗試讓LLM直接處理200條標題URL會產生幻覺,改為提供索引表建立後端表格格式後,準確度明顯提升。此方法論對處理大規模結構化資料特別重要。
- 3
三層LLM策略各司其職:第一層優化使用者查詢為精確搜索意圖;第二層從搜尋引擎結果篩選20條相關鏈接(從百條級縮減);第三層從爬取內容萃取工件(名字、郵箱、PII、加密地址)和洞察。分層設計降低單個LLM負擔,提高準確度。
- 4
輸出格式反映分析師實際工作流:優先呈現工件(最有價值)→關鍵洞察→示例查詢,Markdown格式便於驗證和進一步處理。強調「不盲目信任LLM」,報告始終包含源鏈接供獨立驗證。
實用技巧與重點
乾貨- 工具名稱與規格
- 名稱:Robin
- 支援暗網搜尋引擎:15個
- 執行時間:30-45秒
- 初始鏈接→精選鏈接:100-200條→20條
- LLM支援
- OpenAI(4.1版)
- Claude(4.1、4.0版)
- Sonnet(3.5版)
- Ollama(本地模型)
- 提示詞優化技巧
- 加入索引編號建立表格格式
- 明確定義術語(artifacts=名字、郵箱、PII、密碼地址、威脅行為體別稱)
- 限定輸出格式(僅輸出查詢、索引等)
- 多頁面規則定義細節
- 功能模塊
- 查詢最佳化(LLM優化搜索意圖)
- 鏈接搜索與驗證(15引擎搜索→驗證存活狀態)
- 網頁爬取(完整內容提取)
- AI分析報告生成(工件提取→洞察生成→後續步驟建議)
- 界面與輸出
- 界面:CLI、Web UI
- 輸出格式:Markdown
- GitHub倉庫:username/robin
- 講者身份:Cyber公司高級威脅研究分析員、SANS網路犯罪情報課程貢獻者、Georgia Tech校友
- 已規劃功能
- 搜尋歷史連貫性顯示
- 新LLM模型支援
- 搜尋結果保存功能
結論
結論“通過分層LLM設計和索引過濾機制,Robin將數小時、多工具的暗網研究流程壓縮為45秒單工具全流程,同時保留分析師對結果的完全驗證權。”
完整解析
詳細講者作為網路安全威脅研究分析員,每日工作涉及龐大的暗網情報收集。暗網上存在許多重要網路犯罪論壇和市場,儘管部分內容已轉向表網,但絕大多數仍在暗網(.onion域名)。這使得暗網研究成為現代網路犯罪分析的必要工作。
然而傳統研究流程存在根本性瓶頸。分析師需先在多個暗網搜尋引擎搜尋,收集初始鏈接;再驗證這些鏈接是否存活(暗網站點宕機頻繁);然後逐個爬取網站內容;最後花費4-5小時手工編寫報告。整個流程涉及至少5種不同工具,這些工具用不同編程語言(Python、Go)開發,架構迥異,導致數據交互困難、工作效率低下。
Robin的創新在於採用分層LLM策略完全重新架構這個流程。第一層查詢優化:使用者常輸入模糊查詢(如「勒索軟體」),LLM將其精化為具體搜尋意圖(「勒索軟體網站」或「勒索軟體威脅行為體」),確保後續搜尋精度。第二層是批量結果過濾:15個搜尋引擎會返回100-200條鏈接,其中大量不相關。講者透過提示詞工程讓LLM從中篩選20條最相關結果。這裡的關鍵突破是引入索引表方法——不直接饋入大量文本標題URL(導致LLM幻覺),而是建立編號表格讓LLM僅輸出索引號,準確度大幅提升。第三層是結構化報告生成:爬取20個網站內容後,LLM根據精細調教的提示詞規則提取工件(分析師最需要的名字、郵箱、PII、加密地址等),總結關鍵洞察,並建議後續搜尋查詢以支持迭代研究。
提示詞工程耗費講者大量試錯。初期LLM處理200個標題URL時嚴重幻覺,改用索引法後始見效。第二個難點是LLM不熟悉網路犯罪術語,故需在提示詞中明確定義「工件」概念。第三個挑戰是輸出格式設計——最終報告優先展示工件(分析師最關心),其次洞察摘要,最後示例查詢,反映真實分析師工作流。報告以Markdown格式存檔,便於進一步處理。講者特別強調一條原則:「絕不盲目信任LLM」。報告必須包含源鏈接和爬取內容摘錄,讓分析師獨立驗證LLM結論。
整個流程從輸入查詢到完整報告僅需30-45秒,相比原本數小時效率提升數倍。工具同時提供CLI(給習慣命令行的使用者)和Web UI(降低使用門檻),支援OpenAI、Gemini、Claude及本地Ollama模型,具高度通用性。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


