KeyFrame內部研究專用

DEF CON 33 Recon Village - Autonomous Video Hunter AI Agents for Real Time OSINT - Kevin Dela Rosa

DEFCONConference·12月31日週三·23 min英文

三句話摘要

以 AI 自主代理人(Agent)從海量影片中進行即時 OSINT 情報萃取的系統「Autonomous Video Hunter」實戰展示。 將影片資料流拆解為「監聽 → 處理 → 可查詢儲存 → 代理人編排」四層架構,並用 SIFT、DeepFace、OWL-ViT 等 CPU 友善工具賦予代理人視覺能力,任何人都能在自己的筆電上建立可規模化的影片 OSINT 系統。 影片是未被充分挖掘的情報來源。 從監視攝影機、衛星影像到 TikTok 社群貼文,影片中埋藏大量可萃取資訊(人臉、車牌、Logo、語音),傳統手動審閱根本無法規模化,因此需要自主代理人代勞。

重點整理

重點
  • 1

    影片是未被充分挖掘的情報來源。 從監視攝影機、衛星影像到 TikTok 社群貼文,影片中埋藏大量可萃取資訊(人臉、車牌、Logo、語音),傳統手動審閱根本無法規模化,因此需要自主代理人代勞。

  • 2

    代理人架構的核心是「計畫 → 工具呼叫 → 記憶 → 報告」循環。 主代理人用 LangGraph 串接,先由 LLM 規劃行動步驟,再依序呼叫電腦視覺子工具(人臉比對、Logo 比對、零樣本物件偵測),結果寫入 Markdown 記憶檔後彙整輸出,整個過程不需人工介入。

  • 3

    三種視覺能力互補,覆蓋大多數 OSINT 需求。 人臉辨識(DeepFace/RetinaFace/VGGFace)解決「找人」,圖像特徵比對(OpenCV/SIFT/RANSAC)解決「找標誌或建築」,零樣本物件偵測(OWL-ViT v2)解決「找任意概念」,三者組合讓代理人能回答幾乎任何視覺查詢。

  • 4

    MCP 讓影片情報與 Claude 原生 UI 直接整合。 將螢幕錄影結果透過 Model Context Protocol 暴露給 Claude Desktop,Claude 可即時生成互動式視覺化(主題分布圖、知識圖譜),大幅降低從原始影片到可讀報告的操作門檻。

實用技巧與重點

乾貨
  • 影片數量:Demo 使用約 50 支 TikTok 影片(Zurich 場景)及 15 支(Starbucks 場景)
  • Starbucks 結果:15 支影片中找到 4 支含 Logo(建築外牆、杯子、員工穿著)
  • 螢幕錄影間隔:每 10 秒截段送入影片處理器
  • 工具與平台
  • Gumloop(無程式碼 TikTok 爬蟲工作流)
  • LangGraph(代理人編排框架)
  • DeepFace(人臉分析函式庫)
  • RetinaFace(人臉偵測模型,約 4-5 年前)
  • VGGFace(人臉特徵比對模型)
  • OpenCV + SIFT(圖像特徵萃取,128 維向量)
  • RANSAC(圖像匹配演算法)
  • OWL-ViT v2(零樣本物件偵測,Hugging Face)
  • Model Context Protocol (MCP)(工具/資源暴露協議)
  • Claude Desktop(前端 AI 聊天介面)
  • CloudGlue API(公司自有影片理解 API,提供場景描述、語音轉文字、畫面文字)
  • 三個子代理人:FacialAnalysisAgent、VisualAnalysisAgent、ContentAnalysisAgent
  • 模型設計原則:偏向 CPU 可執行,降低硬體門檻
  • 影片元數據過濾欄位:是否含人臉、Logo、語音、戶外/室內、文字

結論

結論

將影片資料流拆解為「監聽 → 處理 → 可查詢儲存 → 代理人編排」四層架構,並用 SIFT、DeepFace、OWL-ViT 等 CPU 友善工具賦予代理人視覺能力,任何人都能在自己的筆電上建立可規模化的影片 OSINT 系統。

完整解析

詳細

現代影片資料呈爆炸性成長,從城市監視器、衛星影像到 TikTok 社群貼文,每秒都有無數影格等待分析。傳統人工審閱完全無法應對這樣的規模,而 Kevin Delar Rosa 開發的「Autonomous Video Hunter」正是為了解決這個問題——用 AI 自主代理人將原始影片資料流轉化為可行動的 OSINT 情報。

系統架構分為四個層次。第一層是影片監聽,根據應用場景不同而變化——Demo 中使用 Gumloop 這個無程式碼平台爬取 TikTok 特定城市或話題的影片清單,並以 Email 通知觸發。第二層是影片處理,呼叫 CloudGlue API 對每部影片進行逐場景解析,輸出三種模態的密集描述:畫面視覺描述、語音自動轉錄、螢幕文字辨識,同時附帶結構化元數據(是否含人臉、Logo、語音等),讓代理人後續可快速篩選。第三層是可查詢上下文庫,將以上資訊持久化到可搜尋的文字資料庫,供代理人即時查詢。第四層是分析代理人,以 LangGraph 編排,包含一個主代理人與三個子代理人。

主代理人的運作邏輯是:收到使用者查詢(例如「哪些影片出現這張人臉?他在做什麼?」)後,先由 LLM 規劃行動步驟清單,再依序呼叫不同電腦視覺工具執行。人臉辨識方面使用 DeepFace 框架,搭配 RetinaFace 偵測人臉位置、VGGFace 做特徵向量比對。Logo 或任意圖像比對則透過 OpenCV 的 SIFT 演算法將圖像轉為 128 維描述子向量,再以 RANSAC 判斷兩張圖是否為同一目標。零樣本物件偵測使用 OWL-ViT v2,能在不事先訓練的前提下找出任意概念的空間位置。每個子代理人分析完成後將結果寫入共享 Markdown 記憶檔,最後彙整成含時間戳、情境描述、情緒分析的完整報告。

更進一步的應用是將整套系統連接到即時螢幕錄影與 Claude Desktop。Kevin 在一場 MCP 黑客松中,將每 10 秒的螢幕截錄送進影片處理器建立索引,再透過 Model Context Protocol 把工具能力暴露給 Claude Desktop,讓 Claude 能即時回答「Discord 上的人在討論什麼?」,並自動生成主題分布長條圖、關注點雷達圖、乃至互動式知識圖譜——整個流程從原始影片到視覺化儀表板,完全由 AI 自主完成。值得注意的是,所有選用模型都以能在 CPU 上運行為優先,讓一般筆記型電腦即可跑通完整管線,大幅降低實驗門檻。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「Web2 安全」的內容

SANS Stormcast Tuesday, August 25th, 2026: DOUBLECUP PNG; WebAudio Fingerprinting; Expired Domains; Android; Car
7 min
Web2 安全英文PODCAST8月25日

SANS Stormcast Tuesday, August 25th, 2026: DOUBLECUP PNG; WebAudio Fingerprinting; Expired Domains; Android; Car

SANS Stormcast

  • PNG 容器攻擊的簡易性設計:Double Cup 不依賴複雜的 Exif 或隱寫技術,只用 PNG 副檔名和檔頭來偽裝,核心是利用 findstr 指令的常見可用性讓執行變得無需額外工具。
  • Web Audio API 的隱密指紋識別:音訊於增益零的無聲狀態下播放,使用者完全無感,但錄製波形足以建立裝置特徵,在瀏覽器原生功能層面難以區分是反詐欺還是過度追蹤。
  • 域名過期引發的串聯漏洞:DMARC 報告端點使用過期域名是常見疏漏,允許攻擊者透過簡單的域名註冊取得他人的 SPF/DKIM 錯誤報告,進而收集目標系統配置情報。
Risky Bulletin: Expired credit cards can be used for malicious transactions
5 min
Web2 安全英文PODCAST8月24日

Risky Bulletin: Expired credit cards can be used for malicious transactions

Risky Business

  • 支付安全的非對稱風險:Visa卡利用未加密的卡片資料與NFC通訊,攻擊者可藉由中間人技術竄改過期日期進行交易,但MasterCard、美運卡與Discover的防護更完善,顯示不同發卡機構的安全架構存在明顯差異。
  • 國家級駭客活動的連鎖延伸:北韓Lazarus集團在2月單一事件已累積100名受害者,涵蓋大學、警察部門、媒體與醫療機構,伊朗駭客則針對基礎建設如電力系統發動破壞性攻擊,反映地緣政治在網路戰爭中的升溫。
  • AI加速漏洞生態的雙面刃:AI工具催生近2萬份漏洞概念驗證代碼發布,但同時也導致大量失效漏洞代碼氾濫,增加資安團隊甄別真實威脅的難度;Mayer Protocol遭攻擊事件中,駭客用AI鏈接六個無關的小漏洞完成盜竊170萬美元的攻擊。
SANS Stormcast Monday, August 24th, 2026: More Entra Powershell; Entra Vulnerability; GitLab Vuln (and PoC); GTA 6 Leak Malware
5 min
Web2 安全英文PODCAST8月24日

SANS Stormcast Monday, August 24th, 2026: More Entra Powershell; Entra Vulnerability; GitLab Vuln (and PoC); GTA 6 Leak Malware

SANS Stormcast

  • Microsoft EntraID 的遠端代碼執行漏洞已由微軟修補,初期報告顯示已遭利用但後來更正為未遭利用。這反映 Microsoft 在雲端軟體安全上的透明度提升,對漏洞採用與內部軟體相同的 CVE 編號和公告流程。
  • PowerShell 指令碼可用於驗證 MFA 部署完整性,特別是找出未啟用 MFA 的遺漏帳號。同時可以分析 EntraID 登入日誌中的異常行為,如風險係數評估和地理位置檢測,幫助組織快速識別可疑登入。
  • GitLab 的 GraphQL 代碼注入漏洞允許未認證攻擊者刪除或修改儲存庫,潛在導致供應鏈攻擊。已有公開概念驗證 (PoC) 存在,使用內部部署 GitLab 的組織必須立即修補。