KeyFrame內部研究專用

Every Harness Will Become A Claw — Sam Bhagwat, Mastra

AI Engineer·7月21日週二·15 min英文

三句話摘要

TypeScript 代理框架創始人預測:所有工作系統最終會進化成具有主動學習能力的自主代理。 AI 代理從被動工具到主動學習系統的演進中,未來的勝者不是功能最豐富的,而是最符合用戶高頻或高價值需求的。 代理技術的演進光譜:用自駕車自動化等級類比,LLM 只是基礎層。真正的代理需要 loop、工具調用、記憶、重試機制和狀態管理;而 Harness 層級則加入耐久性與執著性,能長時間持續運行。

重點整理

重點
  • 1

    代理技術的演進光譜:用自駕車自動化等級類比,LLM 只是基礎層。真正的代理需要 loop、工具調用、記憶、重試機制和狀態管理;而 Harness 層級則加入耐久性與執著性,能長時間持續運行。

  • 2

    Harness 的關鍵能力:包括斷線恢復(persist stream)、計畫模式、並行子代理、動態技能生成、自動上下文壓縮、會話級工具批准。這些讓系統不再被動等待指令,而能自主推進工作流。

  • 3

    從本地到雲端的建築轉變:過去三個月的觀察顯示 harness 從開發者本機工具演變到雲端常時運行系統。雲端架構支援跨團隊協作、多通訊平台整合(Slack、SMS、WhatsApp)、更大規模的並行處理,但代價是更複雜的分佈式架構。

  • 4

    Claw:具主動性和學習能力的下一階段:系統不再只被動應答,而是主動監聽外部信號、具備心跳機制定期喚醒執行任務、自動技能生成與代碼自我修改,實現真正的持續改進。

實用技巧與重點

乾貨
  • 講者身份:Sam,Mastra(TypeScript agent framework)共同創辦人兼 CEO
  • 著作:《Principles of Building AI Agents》
  • 觀察時間框架:過去 18 個月大量生產環境代理;最近 3 個月本地→雲端轉變
  • Claude Code 示例特性:Planning mode、並行子代理、斜槓命令、技能動態生成、自動上下文壓縮、線程持久化、中斷和排隊能力
  • Claw 功能清單:訊息監聽(Slack/SMS/WhatsApp/Telegram)、心跳機制、消息持久化到非文件儲存、daemon 進程、網關、連續學習、自動技能生成、代碼修改
  • 「Steinberger's Law」:每個 harness 都會擴展成為 claw
  • 應用存活法則:需要高頻率使用(Uber/DoorDash 日多次)或高經濟價值(Airbnb 偶爾但重要)才能在淘汰潮存活

結論

結論

AI 代理從被動工具到主動學習系統的演進中,未來的勝者不是功能最豐富的,而是最符合用戶高頻或高價值需求的。

完整解析

詳細

講者以自駕車的自動化等級作為開場的類比,說明代理技術的演進並非簡單線性,而是在不同維度不斷擴展。傳統 LLM 只是一次性調用,而代理通過 agent loop、工具調用、記憶和失敗重試等機制實現真正的自主能力。但在過去 18 個月的生產實踐中,講者觀察到一個更重要的現象——最成熟的系統根本不是「代理」,而應該被稱為「Harness」(治具/框架)。

Harness 的定義特徵是「耐久性和執著性」。它能運行數小時甚至數天,具備斷線自動恢復、計畫模式、並行化多個子代理、動態生成技能而無需預先定義、自動壓縮上下文、會話級工具權限批准等能力。Claude Code 就是這種 harness 的典型代表——它不是一個簡單的編碼助手,而是一個能夠長時間持續優化、自我管理資源、與開發工作流深度整合的系統。

過去三個月,講者觀察到一個關鍵轉變:系統開始從本地 harness(跑在開發者機器上的工具)演變到雲端 harness(常時運行、無處不在)。在這個新階段,harness 可能在 Slack 中運行供整個團隊使用、可能擁有移動應用或建立通道連接本地機器、可能生成拉取請求直接推送到 GitHub。這個轉變背後是分佈式系統的經典權衡:雲端提供更多資源和並行能力,但代價是架構複雜度大幅增加。

下一個演進階段是「Claw」——給 harness 注入主動性和學習能力。這意味著系統不再被動等待指令,而是主動監聽外部信號流(如郵件系統)、具備定期喚醒機制在設定時間自動執行任務、能與多個通訊平台無縫整合、具備持續學習能力通過自動技能生成或修改駅動代碼本身。

講者進一步提出了「Steinberger's Law」作為他對未來的預言:每個 harness 都會擴展到成為 claw。這個法則背後有技術、經濟和心理多個層面的原因。我們想要更多功能、更多通道、更多自主性——這是人類的天性,也是市場競爭的動力。

但講者的核心警示是:未來會出現一場大規模應用淘汰潮。他用 2010s 手機生態做對照——曾經有數百個應用種類蓬勃發展,但如今每個類別最多只有 1-2 個主導應用。原因在於人的注意力和使用習慣有限——一個應用必須要麼擁有極高的經濟價值讓人願意偶爾使用(如 Airbnb),要麼具備足夠的使用頻率讓人頻繁回訪(如 Uber)。低頻低價值的應用就像老友一樣被漸漸遺忘。講者預期類似的洗牌會在 2020 年代中期發生在 AI 代理生態。

對於正在構建代理系統的開發者,講者的建議很直接:確保你的系統具備用戶真正需要的核心能力,因為功能更強大的競爭者可能瞬間出現。同時要認識到,即使你現在佔據市場頂峰,下一波淘汰潮也會隨之而來,只有那些在市場競爭中不斷進化的系統才能存活。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。