DEF CON 33 Recon Village - Autonomous Video Hunter AI Agents for Real Time OSINT - Kevin Dela Rosa
三句話摘要
以 AI 自主代理人(Agent)從海量影片中進行即時 OSINT 情報萃取的系統「Autonomous Video Hunter」實戰展示。 將影片資料流拆解為「監聽 → 處理 → 可查詢儲存 → 代理人編排」四層架構,並用 SIFT、DeepFace、OWL-ViT 等 CPU 友善工具賦予代理人視覺能力,任何人都能在自己的筆電上建立可規模化的影片 OSINT 系統。 影片是未被充分挖掘的情報來源。 從監視攝影機、衛星影像到 TikTok 社群貼文,影片中埋藏大量可萃取資訊(人臉、車牌、Logo、語音),傳統手動審閱根本無法規模化,因此需要自主代理人代勞。
重點整理
重點- 1
影片是未被充分挖掘的情報來源。 從監視攝影機、衛星影像到 TikTok 社群貼文,影片中埋藏大量可萃取資訊(人臉、車牌、Logo、語音),傳統手動審閱根本無法規模化,因此需要自主代理人代勞。
- 2
代理人架構的核心是「計畫 → 工具呼叫 → 記憶 → 報告」循環。 主代理人用 LangGraph 串接,先由 LLM 規劃行動步驟,再依序呼叫電腦視覺子工具(人臉比對、Logo 比對、零樣本物件偵測),結果寫入 Markdown 記憶檔後彙整輸出,整個過程不需人工介入。
- 3
三種視覺能力互補,覆蓋大多數 OSINT 需求。 人臉辨識(DeepFace/RetinaFace/VGGFace)解決「找人」,圖像特徵比對(OpenCV/SIFT/RANSAC)解決「找標誌或建築」,零樣本物件偵測(OWL-ViT v2)解決「找任意概念」,三者組合讓代理人能回答幾乎任何視覺查詢。
- 4
MCP 讓影片情報與 Claude 原生 UI 直接整合。 將螢幕錄影結果透過 Model Context Protocol 暴露給 Claude Desktop,Claude 可即時生成互動式視覺化(主題分布圖、知識圖譜),大幅降低從原始影片到可讀報告的操作門檻。
實用技巧與重點
乾貨- 影片數量:Demo 使用約 50 支 TikTok 影片(Zurich 場景)及 15 支(Starbucks 場景)
- Starbucks 結果:15 支影片中找到 4 支含 Logo(建築外牆、杯子、員工穿著)
- 螢幕錄影間隔:每 10 秒截段送入影片處理器
- 工具與平台:
- Gumloop(無程式碼 TikTok 爬蟲工作流)
- LangGraph(代理人編排框架)
- DeepFace(人臉分析函式庫)
- RetinaFace(人臉偵測模型,約 4-5 年前)
- VGGFace(人臉特徵比對模型)
- OpenCV + SIFT(圖像特徵萃取,128 維向量)
- RANSAC(圖像匹配演算法)
- OWL-ViT v2(零樣本物件偵測,Hugging Face)
- Model Context Protocol (MCP)(工具/資源暴露協議)
- Claude Desktop(前端 AI 聊天介面)
- CloudGlue API(公司自有影片理解 API,提供場景描述、語音轉文字、畫面文字)
- 三個子代理人:FacialAnalysisAgent、VisualAnalysisAgent、ContentAnalysisAgent
- 模型設計原則:偏向 CPU 可執行,降低硬體門檻
- 影片元數據過濾欄位:是否含人臉、Logo、語音、戶外/室內、文字
結論
結論“將影片資料流拆解為「監聽 → 處理 → 可查詢儲存 → 代理人編排」四層架構,並用 SIFT、DeepFace、OWL-ViT 等 CPU 友善工具賦予代理人視覺能力,任何人都能在自己的筆電上建立可規模化的影片 OSINT 系統。”
完整解析
詳細現代影片資料呈爆炸性成長,從城市監視器、衛星影像到 TikTok 社群貼文,每秒都有無數影格等待分析。傳統人工審閱完全無法應對這樣的規模,而 Kevin Delar Rosa 開發的「Autonomous Video Hunter」正是為了解決這個問題——用 AI 自主代理人將原始影片資料流轉化為可行動的 OSINT 情報。
系統架構分為四個層次。第一層是影片監聽,根據應用場景不同而變化——Demo 中使用 Gumloop 這個無程式碼平台爬取 TikTok 特定城市或話題的影片清單,並以 Email 通知觸發。第二層是影片處理,呼叫 CloudGlue API 對每部影片進行逐場景解析,輸出三種模態的密集描述:畫面視覺描述、語音自動轉錄、螢幕文字辨識,同時附帶結構化元數據(是否含人臉、Logo、語音等),讓代理人後續可快速篩選。第三層是可查詢上下文庫,將以上資訊持久化到可搜尋的文字資料庫,供代理人即時查詢。第四層是分析代理人,以 LangGraph 編排,包含一個主代理人與三個子代理人。
主代理人的運作邏輯是:收到使用者查詢(例如「哪些影片出現這張人臉?他在做什麼?」)後,先由 LLM 規劃行動步驟清單,再依序呼叫不同電腦視覺工具執行。人臉辨識方面使用 DeepFace 框架,搭配 RetinaFace 偵測人臉位置、VGGFace 做特徵向量比對。Logo 或任意圖像比對則透過 OpenCV 的 SIFT 演算法將圖像轉為 128 維描述子向量,再以 RANSAC 判斷兩張圖是否為同一目標。零樣本物件偵測使用 OWL-ViT v2,能在不事先訓練的前提下找出任意概念的空間位置。每個子代理人分析完成後將結果寫入共享 Markdown 記憶檔,最後彙整成含時間戳、情境描述、情緒分析的完整報告。
更進一步的應用是將整套系統連接到即時螢幕錄影與 Claude Desktop。Kevin 在一場 MCP 黑客松中,將每 10 秒的螢幕截錄送進影片處理器建立索引,再透過 Model Context Protocol 把工具能力暴露給 Claude Desktop,讓 Claude 能即時回答「Discord 上的人在討論什麼?」,並自動生成主題分布長條圖、關注點雷達圖、乃至互動式知識圖譜——整個流程從原始影片到視覺化儀表板,完全由 AI 自主完成。值得注意的是,所有選用模型都以能在 CPU 上運行為優先,讓一般筆記型電腦即可跑通完整管線,大幅降低實驗門檻。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

