KeyFrame內部研究專用

Deterministic Infra for Non-Deterministic AI Agents - Nishant Gupta, Meta Superintelligence Labs

AI Engineer·6月29日週一·7 min英文

三句話摘要

AI 代理系統需要決定性的基礎設施支撐:從模型能力到生產可靠性的轉變。 未來 AI 的成敗由更好的系統而非更好的模型決定—基礎設施可靠性是下一個競爭前沿。 大錯配(Great Mismatch):現代雲基礎設施基於短生命週期、決定性服務、已知執行路徑的假設,而 AI 代理則是長運行、狀態依賴、動態決策的系統。生產系統的目標從展示能力轉變為證明 10 萬、百萬次級規模的可靠執行。

重點整理

重點
  • 1

    大錯配(Great Mismatch):現代雲基礎設施基於短生命週期、決定性服務、已知執行路徑的假設,而 AI 代理則是長運行、狀態依賴、動態決策的系統。生產系統的目標從展示能力轉變為證明 10 萬、百萬次級規模的可靠執行。

  • 2

    基礎設施失敗才是真正威脅:無控制的重試是最大風險,因為錯誤的代理建議導致重複失敗會造成指數級資源增長。失敗表現為遞迴推理迴圈、工作流死鎖、上下文崩壞、記憶污染,而非單純的模型幻覺。

  • 3

    分離式架構原則:模型只生成提議,基礎設施負責驗證、策略引擎改進、執行閘道強制執行。這種分層保證即使模型不可靠,系統仍能維持決定性行為。

  • 4

    代理控制平面(類似 OS)必要性:新的基礎設施層需擔負排程、記憶協調、策略執行、評估、監控、工作負載路由。這是組織獲得競爭優勢的關鍵差異化因素。

實用技巧與重點

乾貨
  • 基礎設施失敗類型:遞迴推理迴圈、工作流死鎖、重試擴大、上下文崩壞、記憶污染、資源爆炸
  • 無控制重試的連鎖反應:代理呼叫工具失敗 → 生成略有不同但仍無效的請求 → 重複失敗 → 計算成本指數增長 → 變成運行事件
  • 安全分層模型:提示詞層級控制 → 工具權限 → 策略驗證 → 人工審批 → 審計系統
  • 多維度可觀測性需求:需要追蹤規劃決策、工具呼叫、記憶查詢、狀態轉換(不只是最終輸出)
  • 記憶系統挑戰:多代理共享狀態產生陳舊讀取、衝突更新、上下文漂移、視圖不一致
  • 已驗證分散式系統模式的應用:斷路器 → 工具隔離、速率限制 → 代理限制、資源配額 → 成本治理、可觀測性 → 代理追蹤
  • 人類監督角色:異常處理器、模糊情況審查者、新場景處理者、提供校準信號

結論

結論

未來 AI 的成敗由更好的系統而非更好的模型決定—基礎設施可靠性是下一個競爭前沿。

完整解析

詳細

AI 系統從聊天機器人向自主代理的進化帶來了質的轉變。過去人們關注模型參數與推理能力,但組織在生產環境中部署代理後發現,真正的挑戰已從「能否解決問題」轉變為「能否可靠地大規模解決問題」。代理需要計畫任務、呼叫工具、協調工作流並做出影響生產系統的決策—這些需求與傳統雲基礎設施的設計假設產生了根本性衝突。

傳統雲基礎設施假設請求生命週期短、服務行為決定性、執行路徑已知、失敗邊界清晰。但 AI 代理系統恰恰相反:它們是有狀態的、長運行的、動態決策驅動的,相同輸入可能產生不同的執行路徑。這種「大錯配」意味著我們在為決定性工作流設計的基礎設施上運行非決定性系統。這不只是一個技術問題,而是一次思維轉變。當人們談論 AI 失敗時,直觀地認為源於模型幻覺,但實際上最常見的生產失敗來自基礎設施層面:無控制的重試放大、記憶污染、上下文崩壞、遞迴推理迴圈。一個經典場景是代理以略有不同但仍然無效的方式重複調用失敗的工具,每次失敗都消耗更多計算資源,最終導致指數級的資源增長。

解決方案的核心是建立分離式架構:模型只負責提出建議,而基礎設施層負責驗證、策略引擎改進請求、執行閘道強制執行。這種分層使系統即使在底層模型概率性的情況下也能維持決定性行為。同時需要構建一個新的層級—代理控制平面,類似於操作系統。它統一管理排程、記憶協調、策略執行、評估、監控和工作負載路由。這個層級變得至關重要,因為可觀測性從單維度的日誌轉變為多維度的追蹤系統,需要捕捉規劃決策、工具呼叫、記憶查詢和狀態轉換。另外,記憶管理被嚴重低估了。當多個代理共享狀態時,分散式系統中的經典問題浮現:陳舊讀取、衝突更新、視圖不一致。安全不能是單一組件,必須採用深度防禦策略,跨越提示詞層、工具權限、策略驗證、人工審批和審計系統。

有趣的是,許多已驗證的分散式系統模式可以直接應用:斷路器模式用於工具隔離、速率限制用於代理限制、資源配額用於成本治理。人類監督不是暫時必要,而是長期的系統設計。人類成為異常處理器,審查模糊情況、處理新場景、提供校準信號。最後,AI 工作負載日益表現為集群縮放問題—需求是正向的、深度不可預測、資源需求差異大。未來的競爭優勢不在更好的提示詞或模型,而在更可靠、更高效的系統設計。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。