KeyFrame內部研究專用

How Web Data Infrastructure Powers the Next Generation of AI — Patricija Žemaitytė, Oxylabs

AI Engineer·8月14日週五·19 min英文

三句話摘要

AI 時代真正的基礎設施瓶頸不是模型,而是能持續適應變化、快速交付實時數據的基礎設施層。 下一代 AI 不由更優秀的模型驅動,而由能將模型連接到現實、快速交付數據、持續適應變化的基礎設施驅動。 創新並非遵循預設方向,而是在高壓期限下的持續適應。第一個視頻 API 的故事展示了如何從簡單功能需求(下載視頻)演進為完整產品線(字幕、轉錄、元數據、搜尋),客戶的真實需求總是比初始需求更複雜,關鍵是快速理解並調整方向。

重點整理

重點
  • 1

    創新並非遵循預設方向,而是在高壓期限下的持續適應。第一個視頻 API 的故事展示了如何從簡單功能需求(下載視頻)演進為完整產品線(字幕、轉錄、元數據、搜尋),客戶的真實需求總是比初始需求更複雜,關鍵是快速理解並調整方向。

  • 2

    在 AI 時代,速度本身成為產品特性而非單純性能指標。4 秒延遲只能構建緩慢的管道,但 550 毫秒延遲能直接集成到 AI 工作流中,成為實際可用的能力。這個轉變改變了整個架構設計的優先級。

  • 3

    觀測和負載測試在超大規模下比簡單堆積服務器更重要。從 10,000 req/s 擴展到 60,000+ req/s 的真正瓶頸不在增加伺服器,而在於如何用有機數據測試驗證系統可靠性,生成合成流量容易但模擬真實客戶行為困難。

  • 4

    基礎設施的本質是「永遠適應」而非「一次性構建」。目標數字永遠會變,檢測系統會演變,客戶需求會轉變,因此能快速重設計架構比執行優化更關鍵。

實用技巧與重點

乾貨
  • 視頻 API 項目
  • 時間限制:2 週
  • 數據規模:每月 5 PB
  • 最終功能集:下載器、轉錄支援、字幕支援、通道信息、元數據
  • 開發周期:約 3 個月完成完整套件
  • SERP 數據傳遞
  • 初版延遲:4 秒平均
  • 目標延遲:550 毫秒平均、P90 約 650 毫秒
  • 技術限制:瀏覽器支援提高延遲,需要捨棄廣告、小工具、複雜佈局,只保留有機結果和新聞
  • 開發週期:2 週內達成
  • Venom 阻止器擴展
  • 初始規模:10,000 requests/second
  • 目標規模:60,000 requests/second(2 個月內)
  • 當前規模:100,000 requests/second(項目代號從 60 升級為 150)
  • 請求量增長:400 百萬日請求 → 60 億日請求
  • 端到端爬蟲作業涵蓋
  • 路由、渲染、代理處理、瀏覽器執行、解析、重試、規範化、交付
  • 負載測試關鍵數據
  • 瓶頸點:20,000 req/s 時系統不確定性出現
  • 最大收穫:接受生產流量測試是必經之路

結論

結論

下一代 AI 不由更優秀的模型驅動,而由能將模型連接到現實、快速交付數據、持續適應變化的基礎設施驅動。

完整解析

詳細

Oxelapse 是一個成立於 2015 年的網頁情報平台和代理服務提供商。演講者 Patricia 從技術團隊成長到產品經理,通過三個大規模項目的故事,闡述了 AI 時代基礎設施的本質。

第一個故事發生於銷售團隊從舊金山帶回的緊急需求:2 週內建立視頻 API,處理每月 5 PB 數據。這不只是下載功能,而是完整的管道系統——包括收集、傳輸、儲存、交付,需要達到 AI 訓練工作負載的可靠性標準。初版在截止日期前完成,但客戶的真實需求遠超預期。客戶先要求字幕而非轉錄,再要求特定語言的搜尋能力,然後要求元數據和頻道信息。每次迭代都打破初始的功能邊界,最終在三個月內演變成完整的視頻 API 套件。這個過程教會 Patricia 最重要的教訓:創新不是預設的路線圖,而是在高壓截止日期下持續適應客戶的實際需求。

第二個故事聚焦於搜尋引擎結果頁(SERP)數據在 AI 系統中的角色轉變。傳統上 SERP 用於分析和市場情報,但 AI 時代它成為實時檢索管道、助手系統和智能體與外部信息互動的核心。Google 的官方文檔明確指出搜尋是連接模型與實時公開知識的方式。2024 年客戶要求次秒級 SERP 交付,而既有爬蟲延遲為 4 秒。當時市場尚未準備好,需求被擱置。2025 年新客戶要求零數據保留、800 毫秒以內延遲、2 週內完成。從 4 秒到 800 毫秒不是優化,是完全重設計。首版在 2 週內達到 650 毫秒 P90,但正式測試時系統因檢測機制受阻。第二次迭代被迫依賴瀏覽器,這是個矛盾——客戶要次秒級,瀏覽器卻要 4 秒。解決方案是逐項獵取時間:優化佈局、解析器、會話、代理,每處削減幾百毫秒。最終達成 550 毫秒平均延遲,同時日請求量從 4 億增長到 60 億。這個轉變意味著速度本身變成了產品特性——4 秒只能做慢管道,次秒級才能直接集成到 AI 工作流中。

第三個故事講述可視化阻止器從 10,000 req/s 到 60,000 req/s 的擴展(2 個月內),現已升級至 100,000 req/s。這不是簡單的 HTTP 計數,而是端到端爬蟲作業——路由、渲染、代理、瀏覽器執行、解析、重試、規範化、交付。增加 2,000 台伺服器不足以解決問題,需要架構、可靠的中心組件和能反映現實的測試。最大瓶頸出現在負載測試中。生成合成流量容易,但有機數據測試(模擬真實客戶行為)困難。測試在 20,000 req/s 時碰到不確定性瓶頸。傳統觀測在超大規模下變成真實工作——收集日誌難,處理日誌更難,遙測本身成為負載的一部分。最終接受真相:生產流量測試是最佳測試,幸運的是一切順利,但基礎設施需求持續升級。

這些故事的共通點是:基礎設施的本質不是「構建一次」,而是「永遠適應」。目標數字會變、檢測機制會演變、市場需求會轉變。最有用的創新定義就是:足夠快地保持適應,使得變化的需求本身成為新基礎設施。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。